← 返回科研经历
RESEARCH / FIRST AUTHOR

HMoE-SiMBA
从声音的细节,识别情绪。

面向中文语音情感识别,将多种声学特征、异构混合专家与 SiMBA 结合,用基线对比、消融实验和敏感性分析验证设计。

作者Lu Wang · Xinyue Duan
我的角色第一作者
论文录用ICIC
研究时间2024.11 — 2025.03
研究方向中文语音情感识别

原论文 Fig. 1 · 点击放大

01 / CASE STUDY

同一句话里,声音也在表达情绪。

研究目标是将一段中文语音识别为愤怒、悲伤、快乐、中性、恐惧或惊讶六种情绪之一。中文声调、韵律与说话方式包含丰富线索,单一特征或单一模型难以覆盖全部信息。

特征表达

从频谱、能量与和声等不同视角提取信息,减少单一表示遗漏情绪线索的可能。

模型适应性

结合擅长局部模式、时序关系与全局依赖的专家,依据输入动态调整各自贡献。

声学扰动

在训练中引入语速、音高和噪声变化,探索模型对声学变化的适应能力。

计算与效果的平衡

结合频域处理与 Mamba 序列建模探索效率;论文未报告实测推理延迟或吞吐量,因此不将效率优势写成已验证的部署结果。

02 / CASE STUDY

让不同专家,读懂声音的不同侧面。

HMoE-SiMBA 模型架构 · 原论文 Fig. 1,第 5 页 · 点击放大
语音与数据增强多种声学特征异构专家动态加权SiMBA 与情绪分类

三种特征,补充不同的声音线索

特征论文中的配置表示侧重点
MFCC40 维基础特征 + 一阶、二阶差分,共 120 维刻画频谱包络及变化信息。
Mel-spectrogram128 个 Mel 滤波器组表示符合听觉感知的频带能量分布。
Chroma12 维音高类别特征补充和声与音高分布信息。

这里的多模态表示来自同一段语音的多种声学特征,不包含文本或视觉输入。特征配置来源:论文 §3.2。

异构专家与软路由

CNN 提取局部声学模式,LSTM 建模时序依赖,Transformer 捕捉更广范围的关系。路由网络使用 MLP 与 Softmax 生成非负、和为 1 的权重,对专家输出进行加权融合;不是固定平均,也不是只保留单个专家。

SiMBA:频域处理与序列建模

集成 SiMBA 架构,将 EinFFT 的频域通道处理与 Mamba 的序列建模结合,进一步提取与情绪相关的特征。SiMBA 与 Mamba 来自已有研究,这项工作的重点是面向中文语音情感识别的框架设计、组件组合与实验验证。

03 / CASE STUDY

用统一评测口径,比较方法是否有效。

CASIA 语音样本1,200
论文 Table 1
说话人数4
六种情绪类别
评测方法5-fold
按类别分层交叉验证

按情绪类别分布进行分层五折交叉验证,每轮使用四折训练、一折评估,报告各折平均表现。比较 Accuracy、Precision、Recall 与 F1-score,避免只用一个数字概括模型效果。

训练设置论文 §4.1 配置
框架与硬件PyTorch · NVIDIA RTX 4090
特征提取Librosa · 16 kHz 采样率
优化器AdamW;初始学习率 1e−4;权重衰减 1e−5
训练过程Batch size 32;训练 100 epochs;每 10 epochs 学习率乘 0.9

在训练中引入声学变化

语速与音高

时间拉伸因子在 0.8—1.2 之间采样;音高在 −2、−1、0、+1、+2 半音之间选择,增加输入变化。

噪声扰动

加入高斯白噪声,信噪比在 10—25 dB 范围采样。论文的增强对比显示,组合增强配置表现最好。

04 / CASE STUDY

92.2%,以及这个数字的比较对象。

论文 Table 2 中,HMoE-SiMBA 的整体准确率为 92.2%,最佳对比基线 CPAC 为 90.7%,差值为 1.5 个百分点。同时,Precision、Recall 与 F1-score 分别达到 92.0%、92.3% 和 92.1%。

方法Accuracy / %Precision / %Recall / %F1 / %
SVM44.247.243.445.2
RF50.050.748.849.8
LR62.965.562.964.3
LSTM75.274.875.074.9
Transformer78.778.578.878.6
DCNN + LSTM84.183.984.284.0
TLFMRF(5-fold)85.885.685.985.7
CNN + Bi-GRU89.289.089.389.1
CPAC90.790.590.890.6
HMoE-SiMBA92.292.092.392.1

来源:论文第 12 页 Table 2。以上为论文报告的实验结果,当前作品集没有重新运行模型。

05 / CASE STUDY

拿掉一个模块,再看它贡献了什么。

完整模型的准确率为 92.2%。移除 SiMBA 后降至 89.5%,移除多专家路由后降至 90.1%;两者分别下降 2.7 和 2.1 个百分点,为组件有效性提供对照证据。

模型配置Accuracy / %相对完整模型变化 / 百分点
完整 HMoE-SiMBA92.2—
移除 SiMBA89.5−2.7
移除多专家路由90.1−2.1
移除 CNN 专家91.3−0.9
移除 LSTM 专家91.5−0.7
移除 Transformer 专家91.0−1.2
移除 MFCC 特征88.7−3.5
移除 Mel 频谱特征89.1−3.1
移除 Chroma 特征91.8−0.4

来源:论文第 13 页 Table 3;变化列由对应准确率减去 92.2 计算,表示百分点差。

不同特征的作用并不相同

在这组实验中,移除 MFCC 或 Mel 特征带来的降幅大于移除 Chroma。各组件消融变化不应直接相加,因为它们可能存在交互。

模型容量并非越大越好

论文敏感性分析中,Mamba 状态维度在 256、所选通道维度在 128 时达到较佳表现;继续增加后出现平台或轻微下降。

参数趋势来源:论文 §4.4、Fig. 2—3。结论限于论文所测试的参数范围。

06 / CASE STUDY

从提出问题,到把证据组织完整。

论文作者为 Lu Wang、Xinyue Duan,我为第一作者。结合科研经历,工作涵盖核心方案设计、模型实现、基线对比与消融实验、实验分析及论文撰写。

方案与实现

围绕声学特征表达、异构专家融合和 SiMBA 集成设计研究方案,并实现模型与训练流程。

实验与表达

用基线对比回答整体效果,用消融与敏感性分析解释组件和参数的影响,再将问题、方法与证据组织为论文。

这段研究如何支持我的产品工作

研究让我更习惯先明确问题和评价标准,再做对照验证。面对 AI 产品,我会同时关注平均指标、失败场景、样本代表性和部署条件,区分“模型在测试集上有效”与“产品在真实场景里可用”。

READ THE PAPER

HMoE-SiMBA

Heterogeneous Mixture-of-Experts with SiMBA Attention for Robust Chinese Speech Emotion Recognition

Lu Wang · Xinyue Duan / 17 页 PDF

查看论文原文 ↗
BACK TO PORTFOLIO

继续认识更多面的我。

看看社会实践 ↗