同一句话里,声音也在表达情绪。
研究目标是将一段中文语音识别为愤怒、悲伤、快乐、中性、恐惧或惊讶六种情绪之一。中文声调、韵律与说话方式包含丰富线索,单一特征或单一模型难以覆盖全部信息。
特征表达
从频谱、能量与和声等不同视角提取信息,减少单一表示遗漏情绪线索的可能。
模型适应性
结合擅长局部模式、时序关系与全局依赖的专家,依据输入动态调整各自贡献。
声学扰动
在训练中引入语速、音高和噪声变化,探索模型对声学变化的适应能力。
计算与效果的平衡
结合频域处理与 Mamba 序列建模探索效率;论文未报告实测推理延迟或吞吐量,因此不将效率优势写成已验证的部署结果。
让不同专家,读懂声音的不同侧面。
三种特征,补充不同的声音线索
| 特征 | 论文中的配置 | 表示侧重点 |
|---|---|---|
| MFCC | 40 维基础特征 + 一阶、二阶差分,共 120 维 | 刻画频谱包络及变化信息。 |
| Mel-spectrogram | 128 个 Mel 滤波器组 | 表示符合听觉感知的频带能量分布。 |
| Chroma | 12 维音高类别特征 | 补充和声与音高分布信息。 |
这里的多模态表示来自同一段语音的多种声学特征,不包含文本或视觉输入。特征配置来源:论文 §3.2。
异构专家与软路由
CNN 提取局部声学模式,LSTM 建模时序依赖,Transformer 捕捉更广范围的关系。路由网络使用 MLP 与 Softmax 生成非负、和为 1 的权重,对专家输出进行加权融合;不是固定平均,也不是只保留单个专家。
SiMBA:频域处理与序列建模
集成 SiMBA 架构,将 EinFFT 的频域通道处理与 Mamba 的序列建模结合,进一步提取与情绪相关的特征。SiMBA 与 Mamba 来自已有研究,这项工作的重点是面向中文语音情感识别的框架设计、组件组合与实验验证。
用统一评测口径,比较方法是否有效。
按情绪类别分布进行分层五折交叉验证,每轮使用四折训练、一折评估,报告各折平均表现。比较 Accuracy、Precision、Recall 与 F1-score,避免只用一个数字概括模型效果。
| 训练设置 | 论文 §4.1 配置 |
|---|---|
| 框架与硬件 | PyTorch · NVIDIA RTX 4090 |
| 特征提取 | Librosa · 16 kHz 采样率 |
| 优化器 | AdamW;初始学习率 1e−4;权重衰减 1e−5 |
| 训练过程 | Batch size 32;训练 100 epochs;每 10 epochs 学习率乘 0.9 |
在训练中引入声学变化
语速与音高
时间拉伸因子在 0.8—1.2 之间采样;音高在 −2、−1、0、+1、+2 半音之间选择,增加输入变化。
噪声扰动
加入高斯白噪声,信噪比在 10—25 dB 范围采样。论文的增强对比显示,组合增强配置表现最好。
92.2%,以及这个数字的比较对象。
论文 Table 2 中,HMoE-SiMBA 的整体准确率为 92.2%,最佳对比基线 CPAC 为 90.7%,差值为 1.5 个百分点。同时,Precision、Recall 与 F1-score 分别达到 92.0%、92.3% 和 92.1%。
| 方法 | Accuracy / % | Precision / % | Recall / % | F1 / % |
|---|---|---|---|---|
| SVM | 44.2 | 47.2 | 43.4 | 45.2 |
| RF | 50.0 | 50.7 | 48.8 | 49.8 |
| LR | 62.9 | 65.5 | 62.9 | 64.3 |
| LSTM | 75.2 | 74.8 | 75.0 | 74.9 |
| Transformer | 78.7 | 78.5 | 78.8 | 78.6 |
| DCNN + LSTM | 84.1 | 83.9 | 84.2 | 84.0 |
| TLFMRF(5-fold) | 85.8 | 85.6 | 85.9 | 85.7 |
| CNN + Bi-GRU | 89.2 | 89.0 | 89.3 | 89.1 |
| CPAC | 90.7 | 90.5 | 90.8 | 90.6 |
| HMoE-SiMBA | 92.2 | 92.0 | 92.3 | 92.1 |
来源:论文第 12 页 Table 2。以上为论文报告的实验结果,当前作品集没有重新运行模型。
拿掉一个模块,再看它贡献了什么。
完整模型的准确率为 92.2%。移除 SiMBA 后降至 89.5%,移除多专家路由后降至 90.1%;两者分别下降 2.7 和 2.1 个百分点,为组件有效性提供对照证据。
| 模型配置 | Accuracy / % | 相对完整模型变化 / 百分点 |
|---|---|---|
| 完整 HMoE-SiMBA | 92.2 | — |
| 移除 SiMBA | 89.5 | −2.7 |
| 移除多专家路由 | 90.1 | −2.1 |
| 移除 CNN 专家 | 91.3 | −0.9 |
| 移除 LSTM 专家 | 91.5 | −0.7 |
| 移除 Transformer 专家 | 91.0 | −1.2 |
| 移除 MFCC 特征 | 88.7 | −3.5 |
| 移除 Mel 频谱特征 | 89.1 | −3.1 |
| 移除 Chroma 特征 | 91.8 | −0.4 |
来源:论文第 13 页 Table 3;变化列由对应准确率减去 92.2 计算,表示百分点差。
不同特征的作用并不相同
在这组实验中,移除 MFCC 或 Mel 特征带来的降幅大于移除 Chroma。各组件消融变化不应直接相加,因为它们可能存在交互。
模型容量并非越大越好
论文敏感性分析中,Mamba 状态维度在 256、所选通道维度在 128 时达到较佳表现;继续增加后出现平台或轻微下降。
参数趋势来源:论文 §4.4、Fig. 2—3。结论限于论文所测试的参数范围。
从提出问题,到把证据组织完整。
论文作者为 Lu Wang、Xinyue Duan,我为第一作者。结合科研经历,工作涵盖核心方案设计、模型实现、基线对比与消融实验、实验分析及论文撰写。
方案与实现
围绕声学特征表达、异构专家融合和 SiMBA 集成设计研究方案,并实现模型与训练流程。
实验与表达
用基线对比回答整体效果,用消融与敏感性分析解释组件和参数的影响,再将问题、方法与证据组织为论文。
这段研究如何支持我的产品工作
研究让我更习惯先明确问题和评价标准,再做对照验证。面对 AI 产品,我会同时关注平均指标、失败场景、样本代表性和部署条件,区分“模型在测试集上有效”与“产品在真实场景里可用”。
HMoE-SiMBA
Heterogeneous Mixture-of-Experts with SiMBA Attention for Robust Chinese Speech Emotion Recognition
Lu Wang · Xinyue Duan / 17 页 PDF