非常感谢您开源如此优秀的工作! 有个疑问是 训练阶段,只需要160ms的chunk,不需要上下文就可以学会state预测嘛? 请问流式ASR适配阶段,训练数据是什么样子?是和流式推理一样?即1160ms的音频(960ms的左窗口+当前chunk+40ms的右窗口) 当前chunk的状态 1160ms的文本嘛?还是160ms当前chunk的音频,当前chunk的文本,当前chunk的状态
非常感谢您开源如此优秀的工作!
有个疑问是 训练阶段,只需要160ms的chunk,不需要上下文就可以学会state预测嘛?
请问流式ASR适配阶段,训练数据是什么样子?是和流式推理一样?即1160ms的音频(960ms的左窗口+当前chunk+40ms的右窗口) 当前chunk的状态 1160ms的文本嘛?还是160ms当前chunk的音频,当前chunk的文本,当前chunk的状态