[ICLR 2026] 语音图灵测试:为什么强如 GPT-4o 也无法像人类一样对话?
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
本文完成了针对语音到语音(S2S)交互系统的首次图灵测试,通过收集 2,968 项人类判断,评估了包括 GPT-4o 在内的 9 种顶尖 S2S 系统。研究发现目前没有任何系统能够通过测试,且作者提出了一种基于 18 维细粒度特征的解释性 AI 评判模型。
TL;DR
尽管大语言模型在文字交互上已经难辨雌雄,但在**语音到语音(Speech-to-Speech, S2S)**的赛道上,人类依然能敏锐地嗅出“机器味”。本文通过对 9 款顶尖 S2S 系统进行大规模图灵测试,证明了目前即便最先进的 AI 也无法通过测试。研究指出,瓶颈不在于“智商”(逻辑理解),而在于“情商”与“细节”(副语言特征与人格)。
1. 现状:智商满分,类人感“破功”
图灵去世 76 年后,我们终于迎来了一个能够实时语音对话的时代。然而,当我们将 GPT-4o、Gemini 2.5 Pro 等模型拉到裁判席前,结果却是惨烈的:没有任何一个系统能在盲测中表现得像个真正的正常人。
作者发现,现有 S2S 系统的失败呈现出一种奇特的规律:它们在语义一致性、逻辑连贯性上得分极高,甚至接近人类。但在以下三个维度上存在严重缺陷:
- 副语言特征 (Paralinguistics):缺乏自然的呼吸声、吞咽音或即时的语气波动。
- 机械人格 (Mechanical Persona):表现得过于礼貌、过于喜欢道歉或迎合(Sycophancy),丧失了人类对话中的独立性。
- 情感一致性 (Emotional Expression):语调变化与文本情感往往存在微妙的脱节。
2. 诊断架构:18 维细粒度评估体系
为了不再停留在简单的“像”或“不像”这种二进制判断,作者提出了一个深度诊断框架。

该体系将互动归纳为五大类 18 个维度,包括:
- 语义与实用习惯:是否会用模糊词(Probably)、是否会有犹豫(Filler words)。
- 声学特征:节律(Rhythm)、应力(Stress)。
- 生理特征:微生理噪声(呼吸、唾液声)。
- 对话态度:是否会有写作文一样的正式感(Written-style Expression)。
3. 实验发现:老司机的眼睛是雪亮的
实验中一个有趣的发现是,个体识别机器人的能力很大程度上取决于其对 AI 的熟悉程度。

- 经常接触 AI 的用户,检测准确率高达 78.8%,而小白用户仅为 64.2%。
- Pseudo Human (TTS):最具有迷惑性的是纯 TTS 合成的对话(基于人类脚本),这说明高质量的语音合成辅以人类特有的表达逻辑,比目前的端到端 S2S 模型更难分辨。
4. 自动化评判:打造“电子法官”
鉴于现成的音频模型(如语音版 Llama/Qwen)在图灵测试中由于自身偏见表现极差,作者开发了一套可解释的 AI Judge。
该模型采用 Ordinal Discretization Layer (ODL)。与传统的分类不同,它保留了人类评分的“分级”属性(1分到5分是有序的)。通过学习这 18 个维度的打分习惯,AI Judge 不仅能给出“它是机器”的结论,还能给出“为什么”——例如,因为它在“副语言噪声”维度得分过低。

5. 深度洞察:为什么 S2S 听起来假?
即使模型在 MMAU-Pro 等智力测试中表现优异,其图灵测试通过率与智力得分的皮尔逊相关系数仅为 0.0456。这意味着:更聪明的 AI 并不意味着更像人。
AI 的通病在于:
- 过于稳定:人类说话时会有发音不稳、口音微调,而 AI 的发音“精准得像剥皮后的手术刀”。
- 情绪单薄:声音的起伏往往是预设的几种模版,而非实时动态生成的复杂情绪。
6. 总结与启示
这项研究为语音 AI 指明了新的演进方向。如果我们希望 AI 成为真正的“社交伙伴”(Emotional Companions),开发者就不应再盲目追求更大的算力或逻辑深度,而应该去建模那些被忽略的“噪声”:那些不完美的停顿、细微的呼吸,甚至是偶尔的逻辑不耐烦。
真正的智能,或许正隐藏在这些“不完美”的声波之中。
