为什么规模化会失败?联合行动的指数级爆炸
核心问题在于,随着智能体数量的增加,可能的联合行动数量呈指数级增长——每新增一个智能体,可能性就会成倍增加。那些将所有智能体一并考虑的朴素规划方法,在智能体数量超过几个之后便变得难以处理。一篇2022年关于多智能体规划的论文指出,由于联合行动空间的这种指数级增长,朴素方法会失效[5]。
为了解决这一问题,研究人员采用因子化表示——将问题分解为智能体之间的局部交互——并结合近似规划方法,如基于协调图的蒙特卡洛树搜索(MCTS)。同一篇论文表明,该方法在性能上与完整MCTS相当,但计算成本大幅降低,并且能够扩展到其他MCTS方法难以处理的问题规模[5]。其代价是以近似质量换取可解性。
智能体如何在不过载网络的情况下进行协调?
在大型系统中,智能体无法与所有其他智能体通信——那样会淹没网络。相反,它们需要局部通信,并学会与邻居协作。PowerNet是一种用于电网控制的多智能体深度强化学习算法,它采用空间折扣因子来降低远程智能体的影响,从而加快训练速度并提升可扩展性[3]。该算法还使用了一种学习得到的通信协议,使智能体仅与邻近同伴共享相关信息。
这种局部协调至关重要:在电网中,一台发电机的控制动作对远处的发电机影响有限,因此忽略远处的智能体不会损害性能。PowerNet在微电网测试中优于传统的基于模型的控制方法及其他最先进的MARL算法,表明结合局部通信的分散式学习可以扩展到大型电网[3]。
如何从模拟走向现实,而不至于全盘崩溃?
一个主要障碍在于,当前的仿真环境并非为大规模去中心化智能系统而设计——云计算虽能提供原始算力,却无法满足独立推理实体之间低延迟交互的需求[4]。一篇2021年关于军事应用建模与仿真的论文指出,我们需要新的方法来表征并降低复杂性,并建议构建一个框架,用于在系统之系统中调整模型的保真度[4]。
一个实用的解决方案是模块化:构建一个框架,让模拟仪器可以逐步替换为真实仪器。用于自主实验室的MULTITASK框架正是这样做的,允许设施分阶段上线[1]。这种渐进式方法降低了风险,让你在仍对其余部分使用模拟的同时,测试真实组件。
关于这些来源
本回答基于5项同行评审研究——发表于2021年至2025年间,其中1项为2024年或之后发表,2项发表于Q1期刊,合计被引用125次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的45篇文献。
本文引用的文献
可扩展的多智能体实验室框架,用于实验室优化
MULTITASK是一个模块化的多智能体实验室控制框架,支持设施级仿真,并允许真实仪器逐步替代模拟仪器,从而实现分阶段部署。
通过多智能体模拟为大型语言模型合成后训练数据
MATRIX是一个用于生成LLM训练数据的多智能体模拟器,它产出了2万条指令-响应对,在AlpacaEval 2和Arena-Hard基准测试上的表现超越了Meta的Llama-3-8B-Instruct(该模型基于超过1000万对数据进行训练)。
PowerNet:面向可扩展电网控制的多智能体深度强化学习
PowerNet是一种采用空间折扣与学习通信机制的在线策略多智能体强化学习算法,在微电网测试中表现优于传统基于模型的控制方法以及多种最先进的多智能体强化学习算法,其去中心化设计支持扩展到大型电力网络。
多智能体、人工智能和机器学习应用中建模与仿真系统的可扩展性
当前的建模与仿真环境并非为大规模、去中心化的智能系统而设计;本文建议构建一个框架,用于对保真度进行推理,并采用形式化方法来理解可扩展性的极限。
面向多智能体MDP的可扩展在线规划
FactoredValueMCTS将MCTS与协调图及Max-Plus相结合,在计算成本大幅降低的情况下取得了与MCTS基线相当的性能,并成功扩展到多无人机配送领域,而该领域对其他MCTS方法而言是难以处理的。
