协调基准测试究竟遗漏了什么?
大多数协调性基准测试要么太短、结构太强,要么过于偏向单智能体,难以揭示大语言模型在长周期、开放式团队协作中的表现。2026年推出的一个名为alem的基准测试,正是为了同时检验这些挑战而设计——它包含长周期生存、探索、制作、交易和战斗等要素——结果发现,当前的大语言模型智能体平均标准化回报率仅约6%,也就是说,它们只完成了任务潜力的极小一部分[2]。这与典型的短周期协调博弈形成鲜明对比,在后者中,大语言模型往往能表现得颇为胜任[5]。
差距不仅仅在于任务难度,更在于基准测试衡量的是什么。在alem中,前沿模型(GPT-5.4-High)在基础任务上获得了较高的奖励,但在协调任务上的奖励却低得多,这表明一个模型可以具备出色的个人能力,却在协作上失败[2]。这直接反驳了“更强的单智能体能力会转化为更好的团队合作”这一假设——2023年的一项基准测试也印证了这一点,在该测试中,大语言模型在决策依赖环境变量时表现出色,但在需要推理合作伙伴的信念和意图时却力不从心[5]。
为何LLM在看似成功时仍会在协调任务中失败?
协调任务往往无法暴露底层推理的缺陷,因为大语言模型(LLM)可能通过匹配环境线索来表面地完成协调,而非真正建模他人的心智。在2023年的LLM协调基准测试中,LLM智能体在那些正确动作从环境中显而易见的纯协调博弈中表现良好,但在需要主动考虑伙伴信念和意图的场景中,其表现则有所下降[5]。这表明,那些未明确测试心智理论(ToM)推理——即推断他人所知与所计划的能力——的基准测试,会高估协调能力。
即使给大语言模型提供通信渠道,它们也可能无法在长期规划中有效利用这些渠道。在alem的消融实验中,通信是协调的最大贡献因素,但记忆和推理只有在用于维持多步计划时才发挥作用[2]。这表明,如果没有明确的机制来长期维护共享计划,大语言模型就会失去对协调的把握,而这种失败在短周期任务中根本不会显现出来。
更好的协调性基准测试应该是什么样?
要揭示真正的长时程协调能力,基准测试必须将开放性、长时程和明确的协调需求结合起来。alem基准通过将程序化生成的协调任务、软性专业化、沟通机制和可控难度嵌入到一个长时程生存世界中来实现这一点[2]。其结果表明——即使是前沿模型也会失败——这证明了此类基准对于识别协调作为一个独立瓶颈、与单智能体能力区分开来是必要的。
此外,基准测试应像alem那样,将协调性专属奖励与任务奖励分开,以将协调失败与一般任务失败区分开来[2]。这一点至关重要,因为正如2023年的基准测试所示,大语言模型在零样本协调中能对未见过的伙伴保持稳健,但这种稳健性可能无法延伸到需要动态更新计划的长期任务场景中[5]。若无此类区分,一个个体能力强但协调能力差的模型,其表现看起来会比实际更好。
关于这些来源
本回答基于5项研究(2项经同行评审,3项为预印本),发表于2023年至2026年间,其中3项为2024年或之后发表,1项发表于Q1期刊,合计被引用57次。这些研究是从7项通过质量筛选的研究中选出的最相关成果,而这7项研究又源自从超过5亿篇论文数据库中检索到的26篇文献。
本文引用的文献
SyncPlan:面向长时程LLM协作的显式同步与自适应校正机制
SyncPlan是一个“计划-执行-校正”框架,在Overcooked和《王者荣耀》上取得了最先进的成功率,同时其墙钟运行时间仅为现有LLM协调器的不到0.05%,这表明显式同步与自适应校正能够缓解长时程协调中的失败问题。
多智能体语言代理开放式协调的基准测试
在alem基准测试中,13个现代大语言模型在开放式长时程协调任务中的归一化回报平均仅为约6%,其中GPT-5.4-High在基础任务奖励上表现强劲,但协调奖励却低得多;消融实验表明,通信是影响协调效果的最大因素。
使用模块化开放策略实现多智能体系统的开放式协调
在开放环境中,当智能体和任务发生变化时,采用策略融合与目标推断的强化学习方法优于联合奖励基线,这凸显了自适应目标权重在开放式场景中实现协调的重要性。
长程抑制同步并更新前额叶任务活动
在小鼠中,选择性抑制表达小清蛋白的神经元胼胝体投射会损害规则转换学习,并使伽马频率活动失同步,这揭示了一种在维持与更新任务表征之间切换的神经机制——类似于协调可能需要灵活更新计划的情形。
LLM-Coordination:评估与分析大型语言模型中的多智能体协调能力
LLM协作基准研究发现,LLM智能体在依赖环境变量的协作游戏中表现出色,但在心智理论推理和联合规划方面存在困难,并且在零样本协作中对未见过的伙伴具有鲁棒性。
