[2026] ShareVerse: 分布式智能的基石,实现多智能体协同的共享世界建模
ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling
本文提出了 ShareVerse,一个旨在实现多智能体共享世界建模的视频生成框架。通过集成跨智能体注意力机制(Cross-Agent Attention)和四视图空间拼接策略,该框架在 CogVideoX 基础上实现了具备时空一致性的多视图、多方交互视频生成。
TL;DR
长期以来,AI 世界模型(World Models)大多是“孤独的探索者”,专注于单个视角下的物理规律模拟。近期由上海交通大学、复旦大学、清华大学联合团队发布的 ShareVerse 突破了这一局限。它通过创新的跨智能体注意力机制(Cross-Agent Attention),让多个独立 Agent 能够在同一个生成的视频世界中“看见”彼此,并保持全局时空的一致性。
01 痛点深挖:为什么“共享世界”如此困难?
在自动驾驶模拟或大型多人游戏中,我们不仅需要 Agent A 看到眼前的场景,还需要 Agent B 在同一时刻、不同地点看到的场景在物理逻辑上与 A 完全自洽。
目前的视频生成模型(如 Sora, CogVideoX)面临两大挑战:
- 数据缺失:现有的视频数据集(如 WebVid)缺乏精确的同步多视角数据,无法训练模型理解不同智能体之间的相对位置关系。
- 信息隔离:传统的 DiT(Diffusion Transformer)架构在生成不同 Agent 的视角时是独立的,无法实时交换潜在的特征信息,导致在区域重叠时出现“同一根电线杆在两个视角下长得不一样”的崩溃现象。
02 Methodology:ShareVerse 的核心架构
1. 数据先行:CARLA-based 交互数据集
研究团队首先在 CARLA 模拟平台上构建了一个包含 55,000 对 视频的基础设施。每个 Agent 搭载 4 个摄像头(前、后、左、右),形成 360° 全覆盖。这为模型学习多视角几何一致性(Internal Consistency)和跨智能体同步性(Global Consistency)提供了温床。
2. Raymap:将动作转化为几何直觉
为了让模型“听懂”相机的位姿指令,作者将相机内参和外参转换成了 Raymap(包含光线方向 rd 和原点 ro 的 6 通道张量)。通过 Raymap Encoder 处理后,这些空间信息被 element-wise 地加入到视频特征中,指导模型在正确的位置生成场景。
3. Cross-Agent Attention:跨越视角的“心灵感应”
这是 ShareVerse 的核心。团队修改了 CogVideoX 的 DiT 块,在其中插入了 Cross-Agent Attention 模块:
- 特征聚合:将 Agent 1 和 Agent 2 的特征图在时间维度上进行拼接。
- 全局感知:在 Attention 计算过程中,Agent 1 的每一个像素点都能“察觉”到来自 Agent 2 的视觉信息。
- 位置融合:配合 RoPE(旋转位置编码),模型能够精准判定对方在自己视野中的具体坐标,从而生成动态的、位置准确的对方车型。
图注:ShareVerse 整体流程图。左侧为四视图拼接策略,右侧展示了跨智能体特征通过 Attention 模块进行信息交换的过程。
03 实验战绩与视觉一致性
在验证集上,ShareVerse 展现出了极高的稳定性。由于 Agent 的视频输入是经过空间拼接的(前、后、左、右拼成一张大图),模型天然学会了在边界处维持连续性。
- 多视角几何对齐:当主车左转时,街道景观从“前视图”流畅地过渡到“侧视图”。
- 跨智能体同步:在“会车”场景中,Agent A 的前视记录下的红车位置,与 Agent B(即该红车)对应的轨迹完全吻合。
图注:可视化结果显示,即便是在转弯面相交的复杂地形下,两个 Agent 也能生成完全一致的建筑群和街道细节。
04 深度洞察:迈向“集体智能”的必经之路
ShareVerse 的意义不仅在于生成了漂亮的多视角视频,更在于它定义了一套 "Shared World Modeling" 的新范式。
其消融实验揭示了一个有趣的结论:多视角(Four-view)生成的效果显著优于单视角(Single-view)。这是因为多波束的覆盖提供了更丰富的空间先验,减小了模型在 Exchange 过程中的推测压力。
局限性与展望: 当前的 ShareVerse 主要针对双 Agent 交互。在未来,随着计算资源的提升,如何将 Cross-Agent Attention 扩展到类似群鸟绕飞或城市级交通流的庞大系统,将是这一领域最令人期待的挑战。
总结
ShareVerse 通过“拼接视角”解决个体一致性,通过“交叉注意力”解决群体一致性。这种架构上的优雅修补,为下一代高性能、可交互的游戏引擎和机器人仿真平台指明了方向。
