服务器的 VAD 模型对所有音频块都识别为 idle 。但是,当使用 Paraformer ASR 模型直接识别整个音频文件时,它能够成功识别出人声。模型加载应该也没问题,请问之前有出现过这个问题不?
服务器的 VAD 模型对所有音频块都识别为 idle 。但是,当使用 Paraformer ASR 模型直接识别整个音频文件时,它能够成功识别出人声。模型加载应该也没问题,请问之前有出现过这个问题不?