1. 项目概述

对话情感识别(Emotion Recognition in Conversation, ERC)是情感计算领域的一项核心技术,旨在通过分析多轮对话中的语音、文本等多模态信号,推断说话者的情感状态。这项技术在构建情感智能AI系统(如共情对话代理、客服机器人)以及心理健康评估等领域具有广泛应用前景。

传统ERC系统通常采用单一架构同时处理两个关键任务:对话上下文建模和多模态特征融合。这种设计存在明显缺陷——当训练数据不足时,模型容易过拟合到特定数据集的模式,而非学习通用的情感识别能力。此外,当语音和文本模态存在显著性能差距时,传统系统往往无法超越表现最好的单模态系统。

2. 核心架构设计

2.1 模块化设计理念

MiSTER-E框架的核心创新在于将ERC任务解耦为三个独立优化的专家分支:

  • 语音专家 :专注语音模态的时序特征提取
  • 文本专家 :处理文本语义和上下文关系
  • 多模态专家 :通过跨模态注意力机制融合语音和文本特征

这种模块化设计带来两个关键优势:

  1. 每个专家可以专注于特定任务,避免不同目标之间的相互干扰
  2. 通过动态门控机制,系统可以自适应地权衡各专家的贡献,在模态不平衡时自动依赖更可靠的信号源

2.2 特征提取层实现

2.2.1 文本特征提取

采用LLaMA-3.1-8B作为基础模型,通过LoRA(Low-Rank Adaptation)进行微调。具体实现步骤:

  1. 对每个话语文本进行tokenize处理
  2. 通过LLM获取token级别的隐藏状态
  3. 使用平均池化生成话语级表示
  4. 添加两层全连接分类器(隐藏层维度2048)

提示:LoRA的rank设为8,scale参数设为32,dropout率为0.1。这种参数高效的微调方式可以在保留预训练知识的同时适应情感识别任务。

2.2.2 语音特征提取

使用SALMONN-7B模型,同样采用LoRA微调策略。该模型包含:

  • 语音编码器
  • Q-former跨模态适配器
  • LLM骨干网络

语音特征的提取流程:

# 伪代码示例
audio_signal = load_wav(utterance_path)
mel_spec = compute_mel_spectrogram(audio_signal)
speech_embed = SALMONN_Qformer(mel_spec)
hidden_states = SALMONN_LLM(speech_embed)
pooled_embed = mean_pooling(hidden_states)

2.3 上下文建模网络

2.3.1 时序初始网络(TIN)

借鉴计算机视觉中的Inception架构,使用并行的一维卷积核(尺寸1/3/5)捕获不同时间尺度的局部模式:

输入特征 → [1x1卷积] → 特征A
         → [3x1卷积] → 特征B 
         → [5x1卷积] → 特征C
         → concat(A,B,C) → 输出
2.3.2 双向GRU层

在TIN之后添加双向GRU(隐藏单元512,2-3层),用于建模长距离对话依赖。关键配置:

  • 层间dropout=0.2
  • 残差连接保留原始特征
  • 对IEMOCAP使用3层,MELD使用2层

3. 多模态融合机制

3.1 跨模态注意力

采用双向交叉注意力实现语音-文本对齐:

  1. 将语音特征Es和文本特征Et分别投影到Q/K/V空间
  2. 计算文本到语音的注意力:
    Mt→s = LN(FC(Es) + MHA(Qs,Kt,Vt))
    
  3. 计算语音到文本的注意力:
    Ms→t = LN(FC(Et) + MHA(Qt,Ks,Vs))
    

其中MHA为4头注意力机制,隐藏维度120。

3.2 模态特定自注意力

对对齐后的表示分别应用自注意力,捕获对话级上下文:

Ms = MultiHeadAttention(Mt→s, Mt→s, Mt→s)
Mt = MultiHeadAttention(Ms→t, Ms→t, Ms→t)
final_embed = concat(Ms, Mt)  # 维度240

4. 专家混合与训练策略

4.1 动态门控机制

门控网络接收三个专家的logits输出,生成权重分布:

g = softmax(FC([ˆys; ˆyt; ˆym]))
final_logit = gs·ˆys + gt·ˆyt + gm·ˆym

4.2 损失函数设计

4.2.1 焦点损失(Focal Loss)

针对类别不平衡问题,γ=3:

FL = -(1-p)^γ * log(p)
4.2.2 对比损失

构建跨模态正样本对:

# 正样本:同话语的语音和文本嵌入
# 负样本:不同话语的嵌入
loss = -log(exp(sim(z_a,z_p)/τ) / ∑exp(sim(z_a,z_n)/τ))

温度参数τ:IEMOCAP/MOSI=1,MELD=0.05

4.2.3 KL一致性损失

约束多模态专家与单模态专家的输出分布:

L_KL = KL(pm||ps) + KL(pm||pt)

5. 实验与结果分析

5.1 数据集配置

数据集 对话数 话语数 情感类别 训练/验证/测试划分
IEMOCAP 151 7433 6类 92/28/31对话
MELD 1433 13708 7类 官方划分(1153/280)
MOSI 93 2199 2类 62/31独白

5.2 性能对比

方法 IEMOCAP MELD MOSI
HCAM 70.5% 65.8% 85.8%
MMGAT-EMO 65.5% 66.1% 84.3%
MiSTER-E 70.9% 69.5% 87.9%

关键发现:

  1. 在模态平衡的IEMOCAP上,多模态专家权重最高(约45%)
  2. 在文本主导的MELD上,文本专家权重达60%
  3. 使用wav2vec+RoBERTa的轻量版仍能达到71.1%的F1

6. 实践建议与优化方向

6.1 部署注意事项

  1. 计算资源需求:
    • LLM/SLLM微调需要24GB+显存
    • 推理阶段可冻结特征提取器
  2. 实时性优化:
    • 预提取对话历史特征
    • 使用量化后的LoRA适配器

6.2 领域适配建议

  1. 对于客服场景:
    • 增加"困惑"、"满意"等业务相关情感类别
    • 调整焦点损失的γ参数
  2. 对于心理健康监测:
    • 引入生理信号作为第三模态
    • 使用滑动窗口处理长对话

6.3 未来扩展方向

  1. 引入视觉模态的面部表情信息
  2. 探索参数高效的MoE扩展方法
  3. 开发面向低资源语言的轻量版模型

这个框架的核心价值在于其模块化设计理念——通过解耦不同功能模块,系统可以更灵活地适应各种应用场景和资源约束。在实际部署中,开发者可以根据具体需求选择启用哪些专家分支,实现精度和效率的最佳平衡。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐