引言
开放式耳夹耳机(Ear Clip)因其不入耳、佩戴稳固和感知通透等优势,在移动通话场景中迅速普及。然而,这一形态给语音降噪带来了极端挑战:主麦克风远离口唇,无法利用近讲效应获得高信噪比;耳廓与脸颊造成的衍射和阴影效应带来不规则的高频衰减;同时,由于耳夹结构暴露在外,风噪和瞬态环境噪声的干扰远强于入耳式方案。为此,双麦克风阵列结合深度神经网络成为实现高质量上行通话的唯一可行路径。本文将从声学架构、信号处理链路以及蓝牙芯片级工程实现三个维度,深入解析代号为DNS4.0的第四代深度降噪算法,完整展示其在耳夹双麦系统中的设计逻辑。
1. 耳夹双麦的声学布局与物理约束
在典型耳夹式ID中,两颗MEMS麦克风通常沿耳夹弯臂呈前后分布:前馈麦克风(FF MIC)置于耳夹靠近面颊的前端,开口朝向口唇方向,以采集语音直达波和部分面部反射声;反馈/参考麦克风(FB/REF MIC)则位于耳廓后侧或朝外,主要拾取环境噪声和混响。受限于耳夹弯臂尺寸,双麦间距一般在18–25 mm之间。根据声学差分波束形成理论,这一间距在语音基频(<500 Hz)处远小于半波长,导致基于相位差的波束成形在低频段几乎失效,需要依赖幅度遮蔽和神经网络的时间-频率域处理来弥补。
此外,耳夹佩戴位置因人耳廓形态、佩戴松紧会产生毫米级偏移,造成双麦相对增益和传递函数变化,这要求算法必须对佩戴鲁棒性做在线自适应,而不能仅依赖出厂固定校准。
2. DNS4.0核心算法架构
DNS4.0的整体信号链路由三个级联模块构成:双麦自适应空间预处理、深度神经网络复值时频掩蔽估计器、以及后处理动态控制器。三者协同工作,专门针对耳夹场景的低信噪比、高声学泄露和严重风噪进行了联合优化。
2.1 双麦自适应空间滤波与互参考生成
系统首先对两路麦克风信号进行子带分解,采用16 kHz采样率下512点短时傅里叶变换,帧移8 ms。预处理阶段包含一个在线更新的声学回波消除器(AEC),以抑制开放腔体结构下扬声器到前馈麦克风的线性泄露。随后,基于归一化最小均方(NLMS)的自适应滤波模块在主、辅麦之间构造两个正交信号流:一个是对准语音方向的主波束输出,利用前麦信号减去自适应消除环境分量的参考噪声估计,形成“语音参考”;另一个是利用辅助麦克风构造的“噪声参考”,其目的在于最大化保留非稳态背景噪声。
DNS4.0在此处引入了一个关键改进:基于互相关的动态语音活动检测(VAD)和增益补偿表。算法实时估计双麦间的相干系数,在频率轴上区分直达语音主导区(高相干)与扩散噪声主导区(低相干),并补偿因佩戴偏移引起的高低频灵敏度波动。这一前端处理为后续DNN提供了具有指向性倾向且校准一致的输入特征,极大缓解了网络对空间信息的学习负担。
2.2 深度神经网络噪声抑制器
DNS4.0的核心是一个实时卷积循环混合网络,专门针对复数域的理想比例掩模(cIRM)进行估计。网络结构融合了可分离时域卷积(Temporal Convolutional Network, TCN)和带注意力门控的频域循环层(Frequency-GRU with Attention Gate),输入为双麦的对数功率谱和相位差特征。与第三代方案仅处理主麦幅度谱不同,DNS4.0同时以双通道复频谱作为输入,并输出复掩模,从而能够同时修复语音的相位失真,这对耳夹麦克风在高频的梳状滤波效应有显著补偿作用。
损失函数设计采用了多目标联合优化:结合尺度不变信噪比(SI-SNR)损失、频域压缩均方误差以及面向听觉感知的STOI短时客观可懂度损失。训练数据涵盖超过一万小时的多语种语料、扩散场噪声、餐厅、交通噪声,并特别引入通过高仿真耳夹壳体采集的实录双麦数据,涵盖不同佩戴位置产生的传递函数变化,使模型具备对佩戴偏差的内隐泛化能力。
2.3 风噪与瞬态抑制专用链路
风噪在耳夹麦克风上表现为低频(<500 Hz)过载和湍流引起的高频不规则脉冲。DNS4.0设计了一条平行于主神经网络的低延迟风噪抑制通道。当双麦间的低频相关性骤降且单麦包络陡峭度超过阈值时,系统判定为风噪主导。此时,低频段信号被切换到基于谐波合成的语音重建模块,它从残留的语音谐波峰中推定基频并重建低频波形,而非试图从强风噪中提取语音,从而避免了传统维纳滤波导致的“水声”失真。该模块完全绕过主DNN的低频路径,以极低算力保障了大风噪场景下的语音清晰度。
3. 面向蓝牙SoC的工程实现与优化
在典型的双核异构蓝牙音频SoC上,DSP运行双麦预处理和AEC,神经网络推理则由硬件卷积加速器或NPU承担。DNS4.0的部署面临严格约束:整链路的端到端处理延迟不得超过3.5 ms,且需将整体算力控制在15 MIPS(DSP)加25 GOPS(NPU)以内,以保证混合ANC(若存在)和音频播放的并行处理余量。
为满足实时性,模型通过结构化稀疏、INT8量化以及时频分解的跳帧处理策略进行压缩。频域GRU被替换为高效的状态空间模块(Structured State Space, S4),将序列建模的计算量从每帧O(N²)压缩至O(N log N)。帧长和帧移经重新设计为16 ms/4 ms,使得网络在接收到新4 ms语音块时即可更新掩模,配合低延迟合成窗,最终实现从麦克风采集到蓝牙编码器输入的全链路3.2 ms延迟,完全满足蓝牙免提规范(HFP)上行通路的时间要求。算法状态与蓝牙通话链路管理深度融合,在来电接通瞬间可加载预训练的初始状态,消除开头数百毫秒的降噪盲区。
4. 客观性能与主观听感验证
在符合ITU-T P.835标准的第三方实验室测试中,DNS4.0耳夹双麦方案在粉红噪声、多人交谈噪声(Babble)及风噪等场景下均表现出色。在70 dBA背景噪声条件下,PESQ得分较上一代统计后滤波方案提升0.4分以上,大风噪场景(风速4 m/s)下的语音可懂度STOI保持在0.85以上。主观听感评估中,工程师特别关注降噪后“耳夹音色”的自然度,由于相位修复和低频频谱重建,语音的胸腔共鸣感和齿音清晰度均得到很好保留,无金属声或挤压感。
结语
DNS4.0耳夹双麦降噪算法是一次从声学物理建模到神经网络处理,再到芯片级部署的完整系统集成。它直面耳夹形态远离嘴部、声学泄露严重且佩戴多变的挑战,通过双麦空间预处理、复数域深度降噪以及风噪重建等技术创新,在严苛的蓝牙实时算力限制下,实现了逼近入耳式旗舰耳机的通话清晰度。这种声学与算法深度协同的设计思想,也为未来开放式可穿戴设备的语音交互能力划定了新的工程基准。