AR-1106麦距设计:TDOA量化下限与空间混叠上限
2026/8/9 20:16:36 网站建设 项目流程

一、问题的提出:角度误差究竟从哪里来

AR-1106 这类基于 TDOA(到达时间差)的声源定位模块,对外呈现的接口很简单:串口周期性吐出一个角度值,上位机或舵机据此转向。但工程落地时经常遇到两类抱怨——"角度跳"和"分不开两个方向相近的人"。把这两个现象拆到底层,会发现它们并不是算法调参的问题,而是被两个物理边界夹住的结果:下边界来自采样时钟对时延的量化,上边界来自麦克风间距引入的空间混叠。这两个边界同时由麦距 d 决定,而且方向相反,这就构成了阵列设计中最基础也最容易被忽略的一次取舍。

二、下限:采样时钟把时延切成了台阶

双麦阵列可测的最大时延由几何决定:τmax = d / c,c 取 343 m/s(20℃)。若 d = 60 mm,τmax ≈ 175 μs。在 16 kHz 采样下,一个采样周期是 62.5 μs,也就是说整个 ±175 μs 的动态范围只被切成了约 ±2.8 个整数样本台阶。

角度与时延的关系是 θ = arccos(cτ/d)。把整数样本代进去:τ = 0 对应 90°(正侧),τ = 1 样本(62.5 μs)对应 arccos(0.357) ≈ 69°,τ = 2 样本对应 arccos(0.715) ≈ 44°,τ = 3 样本已经超出几何可能。换句话说,不做任何插值时,16 kHz + 60 mm 的组合在正侧附近的角度台阶就有 20° 上下,端射方向更是几十度一跳。用户看到的"角度跳",很大一部分就是这个量化台阶,而不是噪声。

改善路径有两条:提高采样率(48 kHz 把台阶缩到 20.8 μs,样本数提升 3 倍),或者做亚样本插值。前者代价是 MIPS 与功耗,后者代价是对信噪比更敏感——下文再展开。

三、上限:麦距越大,空间混叠来得越早

直觉上把 d 拉大能改善量化,因为 τmax 随 d 线性增长。但相位域相关有一个硬约束:当声波半波长小于麦距时,互相关的相位差超过 ±π,出现缠绕,产生对称伪峰。混叠临界频率为 falias = c / (2d)。

  • d = 30 mm → falias ≈ 5.7 kHz,τmax ≈ 87 μs(16 kHz 下仅 ±1.4 样本)
  • d = 60 mm → falias ≈ 2.86 kHz,τmax ≈ 175 μs(±2.8 样本)
  • d = 100 mm → falias ≈ 1.72 kHz,τmax ≈ 292 μs(±4.7 样本)
  • d = 150 mm → falias ≈ 1.14 kHz,τmax ≈ 437 μs(±7.0 样本)

把电话带宽 300–3400 Hz 叠上去看:d = 60 mm 时,2.86 kHz 以上的分量已经进入混叠区,而语音辅音能量恰恰集中在 2–4 kHz;d = 150 mm 时,1.14 kHz 以上全部不可靠,可用的相干带宽只剩下基频与低次谐波这一小段。d 增大换来的时延分辨力,是用可用带宽换的。而估计方差又与有效带宽成反比,两者会部分抵消,这解释了为什么单纯拉大麦距往往达不到线性提升的预期。

四、亚样本插值:把台阶磨平的代价

工程上更常用的做法是在互相关峰附近做亚样本细分,典型两种:一是对 GCC 输出峰值及左右各一点做抛物线拟合,二是在频域对互谱相位做线性回归求斜率。两者在中高信噪比下都能把时延分辨推进到 0.1 个样本量级,等效于 16 kHz 下 6.25 μs,正侧角度台阶随之降到 2° 以内。

代价在于估计方差。TDOA 的克拉美罗下界大致满足 στ ∝ 1 / (Beff · √(T · SNR)),其中 Beff 是有效带宽、T 是积分时长。这意味着三件事:

  • 信噪比每降 6 dB,时延标准差约翻倍,角度抖动同步放大;
  • 把积分帧从 32 ms 拉到 128 ms 可换来约 2 倍的方差改善,但角度更新的时间分辨率同比变差,快速移动的声源会被拖尾;
  • 只用窄带(如仅取 300–1000 Hz 避混叠)会直接抬高下界,与"拉大麦距"的思路互相冲突。

PHAT 加权是混响场景的常规选择,它把互谱幅度白化、只保留相位信息,能显著压低反射声造成的次峰。但白化是无差别的:低信噪比频点的噪声相位会被同等放大。因此在安静会议室里 PHAT 表现很好,在风噪或空调低频噪声偏强的环境里,反而需要加一层信噪比加权或频点门控,否则伪峰概率上升。

五、输出侧:串口速率不是瓶颈

AR-1106 以 9600 bps 的串口输出角度。一帧角度报文按十来个字节计,理论上每秒可发数十帧,远高于任何机械执行机构的响应能力。所以限制"跟得快不快"的从来不是波特率,而是估计方差与平滑窗的耦合:为了压住抖动必须加中值或一阶低通,而滤波深度直接换成响应延迟。实际调试中比较务实的分工是——DSP 侧只做保守平滑,保留原始判决的快速性;上位机或舵机侧再叠加死区与速率限制,把机械抖动挡在执行层。

六、场景匹配与局限

这套边界分析可以直接转成选型判据。会议桌面拾音、展台互动这类目标距离 0.5–2 m、以电话带宽语音为主的场景,60–80 mm 麦距是折中区间:混叠临界落在 2.1–2.9 kHz,配合亚样本插值可获得个位数角度精度。若目标是远场(3 m 以上)且允许结构变大,可以考虑 100 mm 以上并主动做低通限带,用带宽换几何增益。

局限同样明确:双麦线阵存在前后镜像模糊,无法区分 θ 与 −θ,需要靠结构遮挡、方向性麦克风或增加第三只麦破除;仰角信息完全丢失,只有水平投影角;多声源同时说话时,单峰搜索只会给出能量占优的那一个,需要唤醒词或语音活动检测做时间上的门控。把这些前提写进需求评审,比事后调滤波参数有效得多。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询