回声与多人重叠讲话,是语音交互和实时通信中两类常见的信号干扰。扬声器回放进入麦克风会形成声学回声,多人同时发声则会产生语音混叠,直接影响语音识别、语音唤醒、对话系统和会议通话的输入质量。
Qwen Audio 团队开源两项语音增强成果:FLASepformer 面向 8 kHz 单声道双说话人分离,通过线性复杂度注意力提升长序列处理效率;JAEC 面向 16 kHz 实时声学回声消除,以 10 ms 为一帧处理音频,固定算法延迟为 22 ms,并提供可观察的时延估计与线性处理过程。
两项成果也可用于语音大模型的数据工程环节,在转写、切分、说话人标注和语音—文本对齐之前先处理重叠语音与回声,减少低质量信号向标注和训练数据传播。
在餐厅、会议室、访谈或多人通话中,不同说话人的声音经常同时出现。麦克风会把这些声音叠加成一条混合音频,而听者通常只想听清其中某个人的内容。人类可以凭借选择性听觉在嘈杂人群中关注特定说话人,这就是经典的“鸡尾酒会问题”;让自动系统获得类似的多说话人分离能力,则一直是语音处理领域的重要挑战。
语音分离(Speech Separation)的目标是把重叠在同一段录音中的多个说话人信号拆分为相互独立的语音流,为后续的收听、转写和分析提供更清晰的输入。它与主要去除环境噪声的语音降噪不同,也不要求像目标说话人提取那样预先提供某位说话人的参考语音;
本次发布模型面向干净条件下的双说话人分离,并输出两个说话人的语音。
FLASepformer 提出 Focused Linear Attention 和门控模块,将注意力计算复杂度从 O(N²) 降为 O(N),形成 FLA-SepReformer 与 FLA-TFLocoformer 两种结构。
时延估计 TDE 与线性处理 LP 均由神经网络实现:TDE 网络估计远端参考与麦克风信号的相对时延并完成对齐,LP 网络估计线性回声并完成抵消;可观察的时延与线性处理过程便于通信链路调试。
支持的平台
运行时性能
JAEC 部署
模型下载
FLASepformer 部署
模型下载
👇点击关注ModelScope公众号获取 更多技术信息~