陈孝良
面向 AI 时代的声学基础原理 精选
2026-9-7 13:52
阅读:1600

声学AI基础:从声波方程到声学智能

声波 · 分贝 · RMS · 频谱 · 传播 · 听觉 · 阵列 · 信号处理 · 机器学习

引言 声音首先是物理现象,其次才是数据;AI 首先要理解数据,而可靠的声学 AI 最终仍要回到物理。掌握基础声学,不是为了记住更多公式,而是为了知道每个数字、每张频谱图、每个模型输出究竟代表什么。

前言:AI 时代为什么更需要声学基础

去,声学工程师面对的是麦克风、扬声器、滤波器、混响室和示波器;今天,我们又多了神经网络、Transformer、扩散模型和大规模声学数据。工具变了,但声音的物理本质没有变。一个模型可以在海量数据上学习“什么声音像什么”,却不会因为参数更多,就自动获得“什么是声压、什么是声强、为什么近场和远场不同、为什么两个相同声源有时加 3 dB 有时加 6 dB”的物理常识。

真正可靠的声学智能系统,通常建立在三层基础之上:第一层是波动与能量的物理规律,第二层是采样、频谱、滤波、阵列等信号处理规律,第三层才是统计学习与人工智能。三层并不是互相替代,而是逐层抽象。

本文从最基础的“声音是什么”讲起,把前文已经讨论的 dB、RMS、能量、功率、SNR/SIR、距离衰减和声源叠加扩展到频谱、传播、房间声学、听觉、麦克风阵列、数字信号处理,并进一步说明这些概念如何进入现代 AI 声学系统。

内容导览

·       1. 声音的物理本质:压力扰动、波动方程、声速与波长

·       2. 三个描述声音的基本维度:幅度、频率与相位

·       3. 分贝世界:10log、20log、SPL、dBFS 与动态范围

·       4. RMS、能量与功率:如何定量描述一段声音

·       5. 时域到频域:傅里叶变换、频谱、STFT 与声谱图

·       6. 数字声音:采样、混叠、量化与 ADC/DAC

·       7. 声音如何传播:扩散、吸收、反射、折射、衍射与散射

·       8. 房间与环境:混响、脉冲响应、RT60 与多径

·       9. 声音如何叠加:相干、不相干、驻波与干涉

·       10. SNR、SIR、SINR 与常见算法指标

·       11. 人如何听声音:响度、音高、掩蔽与空间听觉

·       12. 麦克风与扬声器:从物理声场到电信号

·       13. 麦克风阵列与空间声学:延时、波束形成和阵列增益

·       14. 经典声学信号处理:滤波、卷积、相关、AEC、ANC、去混响

·       15. 声学如何进入 AI:表示、任务、模型与数据

·       16. 物理声学与 AI 融合:约束、先验、数字孪生与世界模型

·       17. 一个现代声学 AI 系统从声音到决策的完整链路

·       18. 常见误区与工程速查表

1. 声音的物理本质:声音不是文件,而是介质中的机械波

电脑里的 WAV/MP3/AAC/OGG 文件不是声音本身,它只是声音被传感器采样后的数字表示(比如MP3就是一种音频编码格式)。真正的声音,是空气、水、固体等介质中由机械振动引起的压力、密度和粒子速度扰动。没有介质,普通声波就无法像电磁波那样在真空中传播。

1.1 声压:最常测量的声学量

在空气静止时,大气压大约为 10⁵ Pa,而我们听到的声音通常只是叠加在这个静态压力上的微小变化。麦克风主要感知的就是这种随时间变化的声压 p(t)。

p_total(t) = p_static + p(t)

声学里真正关心的通常是交流声压 p(t),而不是巨大的静态大气压。人耳在 1 kHz 附近的听阈参考声压约为 20 μPa,这也是空气声学声压级的常用参考值。

1.2 波动方程:声音为什么能够传播

在线性、小扰动条件下,声压满足经典波动方程。它说明某一点的压力变化会通过介质的弹性和惯性向周围传播:

∂²p/∂t² = c² ∇²p

其中 c 是声速。这个方程的意义不在于要求每个工程师都去求解析解,而在于提醒我们:声音具有传播速度、相位、边界条件和空间结构。现代声场模拟、波束形成、房间声学乃至物理约束神经网络,本质上都没有离开这条基本方程。

1.3 声速与波长

λ = c / f

波长 λ、频率 f 与声速 c 三者相互制约。在常温空气中,声速大约 343 m/s;在海水中大约 1500 m/s,但会受温度、盐度和压力影响。

频率

空气中波长(约)

直观意义

100 Hz

3.43 m

低频波长很长,容易绕射,房间驻波明显

1 kHz

0.343 m

与人头、常见设备尺寸接近

10 kHz

0.0343 m

高频更容易被小物体遮挡、吸收和散射

 

注释     看到“频率”时,不要只想到音高。频率还决定波长,而波长决定声音如何与房间、阵列、障碍物和人体发生空间作用。

 

2. 描述一个声波,至少要理解幅度、频率和相位2.1 幅度:声音有多强

幅度可以指瞬时声压、峰值、峰峰值或 RMS。不同定义不能混用。对于同一个正弦波,峰值与 RMS 有固定关系;对于语音、音乐和噪声则没有一个固定的峰值/RMS 比。

正弦波:p_rms = p_peak / √2

2.2 频率:声音变化得有多快

频率单位是 Hz,表示每秒振动次数。单一正弦波只有一个频率,而真实世界的语音、机械噪声、音乐都是许多频率分量的叠加。

2.3 相位:声音在周期中的什么位置

相位经常被初学者忽略,但在阵列、干涉、主动降噪中,它与幅度同等重要。两个 1 kHz 声波即使幅度完全相同,只要相位不同,叠加结果就可能从增强变成相消。

x(t) = A cos(2πft + φ)

注释     AI 音频模型常以频谱幅度作为输入,但相位并不是“无关信息”。语音重建、声源分离、波束形成和空间音频中,相位往往决定最终波形能否物理一致。

 

3. 分贝世界:10log 20log是一套规则的两种写法

分贝的核心是对数比值。功率型量使用 10log;若一个幅度量的平方与功率成正比,则可等价写为 20log。

功率比:L = 10 log₁₀(P₂/P₁)

幅度比:L = 20 log₁₀(A₂/A₁)   (当 P ∝ A² 时)

3.1 为什么声压级用 20log

L_p = 20 log₁₀(p_rms / p_ref)

在空气中,p_ref 常取 20 μPa。声压之所以用 20log,是因为理想传播条件下声强 I 与 p_rms² 成正比。

3.2 常见 dB 量不要混在一起

名称

参考对象

典型公式/含义

dB SPL

物理声压

20log₁₀(p_rms/20 μPa)

dBFS

数字满量程

0 dBFS 是数字系统的最大可表示幅度,通常为负值

dBV / dBu

电压参考

相对于 1 V 或 0.775 V 的电平

增益 dB

比值

可以表示放大或衰减,不一定对应绝对声压

 

因此,“这个声音是 -12 dB”这句话本身是不完整的。必须问:相对于什么?是 dBFS、dB SPL,还是某个系统增益?

3.3 几个应该形成直觉的 dB 数字

变化

功率比

幅度比

dB

功率 ×2

2

√2

+3.01 dB

幅度 ×2

4

2

+6.02 dB

功率 ×10

10

√10

+10 dB

幅度 ×10

100

10

+20 dB

 

4. RMS、能量与功率:一段声音到底有多强”4.1 RMS 是有效幅度

x_rms = √[(1/N) Σ x[n]²]

RMS 的意义是:找到一个恒定幅度,使它在“平方意义”上与当前变化信号具有相同的平均强度。对随机噪声、语音、音乐而言,RMS 通常比峰值更能描述一段时间内的有效强弱。

4.2 离散信号的能量与平均功率

E = Σ |x[n]|²

P = (1/N) Σ |x[n]|² = x_rms²

E = N P = N x_rms²

如果两个信号长度相同,能量比和平均功率比得到相同的 SNR;如果长度不同,则必须明确你究竟是在比较“整段能量”还是“单位时间平均功率”。

4.3 数字信号功率不自动等于瓦特

在代码里,mean(x²) 常被称为 signal power,但如果 x 只是 -1 到 1 的归一化 PCM 样本,那么这个“功率”没有 W 的物理单位。只有经过麦克风灵敏度、前端增益和系统校准,x 才可能被换算为真实声压。

注释     AI 模型可以在归一化波形上达到很高的分类准确率,但如果任务需要判断真实声级、声功率或合规噪声指标,就必须保留传感器标定链路。数据归一化不能替代物理标定。

 

5. 从时域到频域:傅里叶变换是现代声学的第二种语言

时域波形告诉我们“什么时候发生了什么”;频域告诉我们“包含哪些频率、各有多强”。任何足够良好的复杂信号都可以视为不同频率正弦分量的叠加,这是傅里叶思想的核心。

5.1 傅里叶变换

X(f) = ∫ x(t) e^(-j2πft) dt

X(f) 是复数,包含幅度和相位。只看 |X(f)| 会丢掉相位;只看功率谱 |X(f)|² 则进一步强调能量分布。

5.2 为什么语音不能只做一次 FFT

语音是非平稳信号:不同音素在几十毫秒尺度上不断变化。一次长时间 FFT 会把时间信息平均掉。因此实际系统常使用短时傅里叶变换 STFT,把信号切成短帧并逐帧做频谱分析。

STFT{x}(m,f) = Σ x[n] w[n-m] e^(-j2πfn)

5.3 声谱图:把声音变成时间频率图像

声谱图横轴是时间,纵轴是频率,颜色或亮度表示幅度/功率。它是语音识别、声事件检测、机械故障诊断、动物声识别等任务最常见的输入表示之一。

5.4 Mel 频谱为什么常用于语音 AI

人耳对频率的分辨并不是线性的。Mel 尺度用非线性频率轴近似人类听觉分辨特性,因此 Mel 滤波器组、log-Mel spectrogram、MFCC 长期以来都是语音与音频机器学习的经典表示。现代端到端模型也可以直接从波形学习表示,但“从时频结构中提取规律”的思想仍然存在。

注释     把波形转换成频谱,并不是为了把声学“变成图像”,而是为了显式暴露周期性、谐波、带宽和噪声结构。AI 只是进一步学习这些结构之间更复杂的统计关系。

 

6. 数字声音:采样、混叠、量化与动态范围6.1 采样定理

如果一个连续信号的最高频率不超过 B Hz,理论上采样率应大于 2B 才能避免理想条件下的信息混叠。

f_s > 2B

44.1 kHz、48 kHz 等音频采样率并不是任意数字,而是与人类可听频段、滤波器过渡带和工程标准共同形成的结果。

6.2 混叠:高频伪装成低频

当采样率不足时,高于奈奎斯特频率的成分会折叠到低频,产生无法在数字域中事后完全恢复的失真。因此 ADC 前通常需要抗混叠低通滤波器。

6.3 量化与位深

ADC 将连续幅度映射为有限个数字等级。位深越高,可表示的幅度等级越多,理想量化噪声越低,系统可用动态范围越大。常见经验是理想 N 位均匀量化器的满幅正弦信号量化信噪比约为:

SNR_quant ≈ 6.02N + 1.76 dB

这条公式不是说 24 bit 录音在任何环境下都能获得 146 dB 的真实声学动态范围。真实系统还受麦克风自噪声、模拟前端、ADC 噪声、电源和环境噪声限制。

7. 声音如何传播:几何扩散只是第一层近似7.1 自由场点声源:1/r 1/r²

声压幅度:p(r) ∝ 1/r

声强:I(r) ∝ 1/r²

L_p(r₂)-L_p(r₁) = 20 log₁₀(r₁/r₂)

因此在理想自由场远场,距离翻倍,声压级下降约 6 dB。这来自球面面积随 r² 增长,而不是一条脱离物理背景的经验口诀。

7.2 介质吸收:高频通常更容易损失

TL ≈ 20 log₁₀(r/r₀) + α(f)(r-r₀)

α(f) 是频率相关吸收系数。空气湿度、温度以及水中的频率、温盐深条件都会影响吸收。

7.3 反射、折射、衍射、散射

现象

物理含义

工程影响

反射

遇到阻抗或边界变化返回

墙面反射、海面/海底反射、回声

折射

传播速度空间变化导致路径弯曲

大气声传播、海洋声速剖面

衍射

绕过障碍物或孔径继续传播

低频绕墙能力较强

散射

粗糙表面或小尺度结构向多方向散射

复杂环境杂波、混响尾部

 

7.4 近场与远场

“距离翻倍减 6 dB”主要是理想远场球面扩散的结论。靠近声源时,速度场、反应声场、辐射阻抗和声源几何都会使简单公式失效。阵列测量、扬声器测试、近场声全息中尤其要区分近场与远场。

8. 房间与复杂环境:真正的声音很少只走一条路径8.1 脉冲响应:一个环境的声学指纹

如果在房间中发出一个理想脉冲,麦克风接收到的不是单一脉冲,而是直达声、早期反射和长时间衰减的混响尾。这个响应 h(t) 就是房间脉冲响应。

y(t) = x(t) * h(t)

星号表示卷积。这个简单公式把“声源”和“传播环境”分开,是经典声学信号处理和现代神经去混响的重要基础。

8.2 RT60:混响时间

RT60 表示声能衰减 60 dB 所需的时间,是描述房间混响的重要指标。混响时间过长会降低语音清晰度,但音乐厅又需要适当混响形成空间感。

8.3 多径为什么会让 AI 变难

同一个说话人、同一句话,在不同房间、不同距离、不同朝向下,麦克风得到的波形可以差别很大。这就是声学模型常见的 domain shift。数据增强中使用 RIR 卷积,本质上是在模拟这种传播变化。

注释     AI 模型若只记住训练房间的混响特征,换一个房间就可能失效。把 RIR、距离、信噪比和空间位置显式纳入训练,是提高跨环境鲁棒性的常见方法。

 

9. 声音如何叠加:功率相加与波形相加是两个层次9.1 不相关声源:平均功率相加

L_total = 10 log₁₀(10^(L₁/10) + 10^(L₂/10) + …)

两个独立的 60 dB 声源,总声级约为 63 dB。N 个相同、不相关声源,总声级增加 10log₁₀N。

9.2 相干同相:幅度直接相加

两个完全相干、同频、同相且等幅的声压相加,幅度变为 2 倍,对应 +6.02 dB。若反相,则可能部分甚至理想完全相消。

A_total = 2A |cos(φ/2)|

9.3 驻波:空间中固定的增强和相消

当入射波和反射波具有稳定相位关系时,会形成驻波。房间低频驻波、管道共振、封闭腔体模态都属于这一类现象。某个位置很响、移动几十厘米却突然变弱,往往不是声源功率改变,而是声场空间结构改变。

注释     波束形成和主动降噪都在“利用相位”。前者希望目标方向相干叠加、其他方向抵消;后者希望生成与噪声幅度接近、相位相反的声波。

 

10. SNRSIRSINR:名称不同,底层仍是功率比

SNR = 10 log₁₀(P_s/P_n) = 20 log₁₀(s_rms/n_rms)

SIR = 10 log₁₀(P_s/P_i) = 20 log₁₀(s_rms/i_rms)

SINR = 10 log₁₀[P_s/(P_i+P_n)]

决定 10 还是 20 的不是指标名字,而是你放进 log 的是功率还是 RMS/幅度。

10.1 SNR 高,不一定听起来就好

一个系统可能具有较高全带宽 SNR,但关键频带被窄带干扰污染,语音仍然很难听清。感知质量与信息可懂度还受到频谱分布、混响、失真和掩蔽等因素影响。

10.2 AI 语音增强还常见哪些指标

指标

关注点

注意事项

SI-SDR / SDR

源分离/重建误差

更接近波形重建质量,但不等同听感

PESQ / POLQA

语音质量感知模型

有特定适用条件和标准边界

STOI / ESTOI

语音可懂度

强调能否听清,不等于音质

WER

自动语音识别错误率

系统任务指标,受 ASR 模型本身影响

 

工程上不要用一个指标代表全部。真正的系统评价常常需要物理指标、感知指标与任务指标共同验证。

11. 人如何听声音:声学量与听觉感受不是简单一一对应11.1 频率与音高

频率是物理量,音高是感知量。对单音二者高度相关,但复杂声音的基频、谐波结构和听觉整合会影响最终音高感受。

11.2 声压级与响度

声压级是测量量,响度是心理声学感受。人耳对不同频率敏感度不同,因此同样 60 dB SPL 的 100 Hz 与 1 kHz 纯音,主观响度可能不同。A 计权就是一种试图近似特定声级下人耳频率敏感特性的工程加权。

11.3 掩蔽效应

一个强声音可以让邻近频率或邻近时间的弱声音变得难以感知,这叫掩蔽。MP3/AAC 等感知编码、语音增强和听觉场景分析都利用或受到掩蔽影响。

11.4 空间听觉:ITDILD HRTF

人类判断声源方向主要依赖双耳时间差 ITD、双耳声级差 ILD,以及耳廓、头部和躯干造成的方向相关滤波 HRTF。

线索

主要机制

更显著的频段

ITD

声音到两耳的到达时间/相位差

通常对低频定位更重要

ILD

头部遮挡造成左右耳能量差

通常对高频更明显

HRTF

头、耳廓、躯干的方向滤波

用于三维空间听觉与耳机虚拟化

 

注释     AI 做“声音定位”时,并不是凭空学会方向。它最终利用的仍然是时间差、相位差、声级差、频谱形状等可由声学解释的空间线索。

 

12. 麦克风与扬声器:把声学世界和电子世界连接起来12.1 麦克风不是录音按钮,而是传感器

麦克风把声压或声压梯度转换为电信号。评价麦克风常看灵敏度、频率响应、指向性、自噪声、最大声压级、动态范围和失真。

12.2 灵敏度与标定

麦克风输出电压 V 与声压 p 之间存在灵敏度关系,例如 mV/Pa。再经过前置放大器增益、ADC 满量程与数字缩放,最终才得到 PCM 样本。

p  →  microphone sensitivity  →  voltage  →  preamp gain  →  ADC  →  PCM

如果这一整条链路未知,就不能仅凭数字幅值推断绝对 SPL。

12.3 扬声器是逆过程,但更复杂

扬声器把电信号转换为机械振动,再辐射为声场。频响、指向性、非线性失真、箱体和房间都会改变最终声压。对智能音箱而言,算法输出不是终点,电声系统才决定用户真正听到什么。

13. 麦克风阵列与空间声学:多个麦克风为什么能看见方向”13.1 到达时间差 TDOA

如果声源从某个方向到达阵列,不同麦克风接收到信号的时间会有微小差异。对两麦克风间距 d、入射角 θ 的简化远场模型:

τ ≈ (d sinθ) / c

估计 τ 就可以反推方向。GCC-PHAT 等方法就是经典 TDOA 估计技术。

13.2 延时求和波束形成

Delay-and-Sum 的思想很朴素:把目标方向在各通道的传播延迟补偿回来,再相加。目标方向会相干增强,其他方向通常不能完全对齐,因此相对被抑制。

y(t) = Σ_m x_m(t - τ_m)

13.3 阵列孔径、频率与空间混叠

阵列并不是“麦克风越多越好”。阵元间距、阵列孔径、声波波长决定空间采样能力。如果阵元间距相对于波长过大,会产生类似时间采样混叠的空间混叠和栅瓣。

注释     时间采样有 Nyquist 条件,空间采样同样有“不能采得太稀”的约束。AI 波束形成可以学习权重,但不能让违反空间采样规律的阵列凭空获得不存在的信息。

 

13.4 从传统波束形成到神经波束形成

传统方法如 Delay-and-Sum、MVDR、GEV 依赖明确的空间统计模型;神经波束形成则让网络估计时频掩码、空间协方差或直接预测滤波权重。两者并非对立:越来越多系统采用“神经网络估计 + 经典线性代数求解”的混合架构,以兼顾数据适应性和可解释性。

14. 经典声学信号处理:很多 AI 模块都有经典前身14.1 滤波

滤波器改变不同频率成分的幅度和相位。低通、高通、带通、均衡器、分频器以及许多噪声抑制模块都可以从滤波角度理解。

14.2 卷积

y[n] = x[n] * h[n]

卷积既描述线性时不变系统,也构成现代卷积神经网络的数学基础。CNN 中卷积核是学习出来的,而传统 FIR 滤波器系数由工程设计或系统辨识得到。

14.3 相关

相关用于判断两个信号有多相似以及最可能的时间偏移。回声时延估计、TDOA、同步和匹配滤波都依赖相关思想。

14.4 AEC:声学回声消除

视频会议和智能音箱中,扬声器播放的声音会通过房间传回麦克风。AEC 的任务是用已知播放参考信号估计回声路径并从麦克风信号中消除。

14.5 ANC:主动降噪

ANC 与 AEC 不同。ANC 在物理声场中生成反相信号,使耳边或指定区域的声压产生相消,尤其适合低频稳定噪声。它必须考虑传播延迟和闭环稳定性。

14.6 去混响与声源分离

去混响试图减弱房间长尾和多径影响;声源分离试图从混合信号中恢复多个独立声源。现代深度学习显著提高了这两类任务的能力,但目标依然可以用经典“源—通道—观测”模型理解。

15. 声学进入 AI:机器真正学的是什么

从机器学习角度看,声音首先被表示为波形、频谱、时频图、空间协方差或学习到的 embedding;随后模型建立这些表示与标签、文本、方向、事件或未来波形之间的映射。

15.1 常见声学 AI 任务

任务

输入

输出

背后的声学核心

自动语音识别 ASR

语音波形/频谱

文字

语音时频结构 + 语言模型

语音增强

含噪语音

干净语音

SNR、时频掩蔽、相位

声源分离

多源混合

各独立声源

叠加模型、统计独立性、空间线索

声事件检测

环境声音

事件类别/时间

频谱纹理与时序结构

声源定位

多通道音频

角度/位置

TDOA、相位差、ILD、阵列几何

说话人识别

语音

身份 embedding

声道特征、韵律、统计表示

生成式音频

文本/条件

声音波形

学习复杂声音分布与时序结构

 

15.2 “端到端不等于没有物理

端到端模型可以省去显式手工特征,但它处理的仍是采样后的声波。采样率、时延、混响、阵列几何、SNR、频带限制依然决定可用信息。模型只是把一部分人工设计的映射交给数据学习。

15.3 数据决定模型能学到什么

如果训练数据只有安静近讲语音,模型很难自动泛化到远场强混响;如果阵列训练只覆盖正前方,模型很难可靠定位背后;如果设备响应变化从未出现,模型就可能把设备频响误认为类别特征。声学 AI 的泛化问题,本质上经常是“训练声场是否覆盖真实声场”。

16. 物理声学与 AI 融合:不是让 AI 忘掉方程,而是让 AI 更懂方程16.1 三种融合层次

层次

做法

例子

数据层

用物理仿真扩展训练数据

RIR、噪声场、声传播仿真、阵列仿真

模型层

把物理结构写进网络

可微 STFT、卷积传播层、阵列几何编码

损失/约束层

让输出满足物理规律

波动方程残差、能量守恒、边界条件、因果性

 

16.2 Physics-Informed AI 的价值

在数据充足、分布稳定的问题上,纯数据驱动模型可能已经很好;但在数据稀缺、环境变化大、需要外推或要求可靠性的场景,物理先验可以显著减少不合理解空间。

例如,海洋声学中声速剖面控制声线弯曲和传播损失;室内声学中房间边界控制反射与混响;阵列声学中几何位置控制相位差。把这些已知规律完全交给网络“重新猜一遍”,往往既浪费数据,也降低可解释性。

16.3 声学数字孪生与世界模型

所谓声学数字孪生,可以理解为对“声源—介质—边界—传感器—接收端”的可计算映射。传统方法依靠数值 PDE、射线追踪、统计能量模型;AI 可以作为快速代理模型、参数反演器、环境估计器或潜在状态模型。

更进一步的声学世界模型,不只是预测下一帧频谱,而应当理解“环境状态改变后,声传播会怎样改变”。这要求模型把声学规律与环境动力学结合起来。

注释     对复杂声学 AI,最值得追求的不是“模型取代物理”,而是“物理提供边界,数据补足未知,AI 提高计算与感知效率”。

 

17. 一个现代声学 AI 系统,从声音到决策的完整链路

以一个远场智能语音终端为例,一条相对完整的处理链可能是:

·       ① 声源发声:语音产生真实声压波;

·       ② 环境传播:经历距离扩散、反射、混响、噪声和多径;

·       ③ 麦克风阵列:多个位置采样同一声场,形成通道间时间差和相位差;

·       ④ 模拟前端:麦克风、前置放大、抗混叠滤波;

·       ⑤ ADC:将连续电信号采样、量化为多通道 PCM;

·       ⑥ 前处理:增益控制、同步、AEC、降噪、波束形成;

·       ⑦ 特征或表示:波形、STFT、log-Mel 或神经 embedding;

·       ⑧ AI 模型:VAD、唤醒、ASR、声事件识别、说话人识别等;

·       ⑨ 任务决策:理解语义、执行指令或产生反馈;

·       ⑩ 扬声器播放:数字输出重新变为声场,又进入新的声学闭环。

这条链路说明,一个 AI 音频产品从来不只是一个神经网络。物理声场、模拟电路、数字信号处理和机器学习共同决定系统上限。任何一层出现动态范围不足、时钟不同步、阵列几何错误或标定失效,后面的模型都只能在错误数据上继续计算。

18. 常见误区:从基础声学到 AI 系统最容易犯的错误

误区 1:SNR 用 20log,SIR 用 10log。 错误。两者本质都是功率比;输入功率用 10log,输入 RMS/幅度比用 20log。

误区 2:两个 60 dB 就是 120 dB。 错误。dB 不能直接做普通加法;两个独立等声级源约为 63 dB。

误区 3:距离加倍永远减 6 dB。 只对理想自由场点声源远场近似成立。近场、波导、混响和边界条件会改变规律。

误区 4:频谱幅度够了,相位不重要。 在许多识别任务中幅度主导,但波形重建、阵列、空间音频、ANC、分离中相位非常关键。

误区 5:数字音频的 RMS 就是真实 Pa。 只有经过完整传感器与系统标定后,数字样本才可换算为物理声压。

误区 6:深度学习可以自动解决阵列设计问题。 模型无法补回没有被传感器采到的信息。阵元数、间距、孔径、同步和 SNR 仍决定可辨识性。

误区 7:模型指标高就代表声学系统好。 算法指标只是系统的一部分。真实体验还受到麦克风、扬声器、房间、时延、失真和人耳感知影响。

误区 8:端到端等于不需要 DSP。 很多成功系统仍包含采样、AEC、波束形成、滤波、动态范围管理等前后端 DSP,或把这些结构融入网络。

19. 一页公式与概念速查

主题

核心关系

一句话理解

波长

λ=c/f

频率越高,波长越短

RMS

√mean(x²)

有效幅度

能量

Σx²

整段信号累计平方量

平均功率

mean(x²)=RMS²

单位采样/时间的平均平方强度

功率 dB

10log(P₂/P₁)

功率、能量、声强比

幅度 dB

20log(A₂/A₁)

声压、RMS、电压等平方对应功率的幅度量

SPL

20log(p_rms/20 μPa)

空气中绝对声压级

自由场声压

p∝1/r

距离翻倍,幅度约减半

自由场声强

I∝1/r²

距离翻倍,声强约变 1/4

独立声源叠加

功率相加

两个等声级源约 +3 dB

相干同相叠加

幅度相加

两个等幅同相源约 +6 dB

SNR

10log(Ps/Pn)

或 20log(RMSs/RMSn)

采样定理

fs>2B

避免频谱混叠的基本条件

房间传播

y=x*h

观测声 = 声源与环境脉冲响应卷积

阵列时差

τ≈d sinθ/c

方向信息来自通道间传播差

 

20. 结语:声学智能的底座,仍然是对声音本身的理解

声学是一门很“诚实”的学科。声压不会因为模型参数更多就改变平方关系,声速不会因为算法更新就失去传播时延,阵列也不会因为用了 Transformer 就绕开波长和空间采样限制。人工智能真正带来的变化,是我们开始能够从更复杂、更高维、更大规模的声学数据中学习过去难以手工建模的规律。

因此,理解基础声学并不是回到旧技术,而是在为 AI 建立坐标系。只有知道什么是声压、功率、相位、频谱、传播、混响、阵列和听觉,才知道模型应该学什么、哪些量可以归一化、哪些约束不能丢、哪些结果具有物理意义。

未来的声学系统很可能越来越“智能”:它们能够听见、分离、定位、理解、预测甚至生成声音。但越是智能,越需要一个可靠的物理底座。好的声学 AI,最终应当同时做到三件事:在数据上有效,在物理上合理,在真实环境中可靠。

附录:推荐的学习路线

·       第一阶段——建立物理直觉:声压、声速、波长、声强、阻抗、传播、反射与干涉。

·       第二阶段——建立数字信号直觉:采样、FFT/STFT、滤波、卷积、相关、RMS、SNR。

·       第三阶段——建立空间声学直觉:TDOA、相位差、阵列几何、波束形成、房间脉冲响应。

·       第四阶段——建立听觉与评价直觉:响度、掩蔽、可懂度、音质、空间听觉。

·       第五阶段——进入 AI:语音识别、增强、分离、声事件检测、定位、生成式音频。

·       第六阶段——回到融合:把物理模型、信号处理与神经网络结合,用可解释约束提高泛化与可靠性。

转载本文请联系原作者获取授权,同时请注明本文来自陈孝良科学网博客。

链接地址:https://wap.sciencenet.cn/blog-1375795-1551376.html?mobile=1

收藏

下一篇
当前推荐数:2
推荐人:
推荐到博客首页
网友评论0 条评论
确定删除指定的回复吗?
确定删除本博文吗?