CMDPAD:让 AI 预判你的情绪——首个中文动态人格与多模态情感预测数据集解析
CMDPAD: A Chinese multimodal dynamic personality and affect dataset for affect prediction in conversations $
本文提出了对话中情感预测(Affect Prediction in Conversations, APC)任务,并构建了首个中文多模态动态人格与情感数据集 CMDPAD。该数据集涵盖 180 个双人对话、3906 个话语,通过多模态注意力 Transformer(MAT)基准模型,实现了对情感和动态人格特质的 SOTA 预测表现。
TL;DR
传统的对话系统往往是“事后诸葛亮”,只能识别你刚才的情绪。本文提出的 CMDPAD 数据集将任务从“识别”推向了“预测(Affect Prediction)”,并创新性地引入了话语级(Utterance-level)的情感与动态人格标注。实验证明,结合人格特征与历史情感,AI 预测对方下一个情绪状态的准确率提升了 5%。
背景定位
在情感计算(Affective Computing)坐标系中,该工作属于**“从识别到预测”以及“从静态特质到动态状态”**的跨越式研究。它不仅提供了高质量的中文多模态语料(V/A/T 三模态),更通过心理学理论支撑,填补了主动式对话 AI 在情感调节评价方面的空白。
核心动机:为什么“人格”与“预测”如此重要?
现有的情感对话系统(ARC)大多在对齐“说话人”的情绪,但优秀的社交代理(Agent)应该对齐“听话人”的情绪。
- 路径依赖:情绪转换是有规律的(如积极情绪更易转向另一种积极情绪)。
- 人格调节:同样的建议,外向者可能感到兴奋(Positive Affect),而严谨者可能因计划被打乱感到不快。
- 人格动态性:人在对话中会表现出人格状态的波动(Personality States),而非一成不变。
方法论详解:从数据采集到模型架构
1. 数据采集与标注
作者从 60 部热门国产偶像剧中筛选出 180 个双人对话片段。
- 情感标注:采用 Dynamic Affect Grid (DAG) 交互式界面。
- 人格标注:对 Big Five(五大人格)进行连续滑动尺度的动态评分。

2. 基准模型:Multi-modal Attention Transformer (MAT)
模型通过以下组件实现特征聚合:
- 文本:BERT-Chinese 提取 [CLS] 特征。
- 音频:使用 Wav2Vec 2.0 (尤其是 W2V2-L-robust) 捕捉声学情感细节。
- 视觉:利用 ConvNeXt 处理面部表情特征。
- 融合:Transformer Encoder 作为全局聚合器,通过 Self-Attention 学习模态间的交叉依赖。

实验与结果分析
多模态的协同效应
实验显示,视觉模态(ConvNeXt)在识别和预测中表现最强(Acc-5 超过 50%),说明面具下的微表情依然是情感判断的核心。
预测性能的跨越
最关键的实验(Table 8)对比了仅使用当前话语(AP)与加入历史情感识别结果(AR)及人格(PR)的效果:
- AR + PR + AP:MAE 从 0.517 降至 0.440,F1 分数从 74.5 升至 80.0。 这证明了:知道你是谁(人格)以及你刚才的情绪(历史),是精准预测你未来反应的“银弹”。

深度洞察与总结
关键发现 (Takeaway)
- 人格的“变色龙”属性:人格在对话中并非静止,话语级的变动反映了交互风格的实时调整,这对建模 Agent 的“个性化”极具启发。
- 预测优于识别:APC 任务比 ARC 更接近人类真实的社交逻辑,未来 AI 若能提前预判用户可能会生气,就能主动调整话策略。
局限性与挑战
- 场景偏差:数据集高度集中在“浪漫剧”,这意味着样本中充满了高唤醒度(Arousal)和高亲密度,对于职场或冷淡社交场景的泛化能力有待验证。
- 数据规模:3906 个话语对于超大规模模型(LLMs)的 SFT 来说依然较小,未来需要结合合成数据或半监督学习来扩展。
结语
CMDPAD 不仅仅是一个数据集,它为中文情感计算领域划定了一个新的赛道——预测性交互。它提醒我们,真正的共情不仅是读懂此时此刻,更是通过理解对方的情绪底色,预见未来的心理震荡。
