ROME:重塑智能体生态,3B 激活模型如何越级挑战超千亿 SOTA?
Let It Flow: Agentic Crafting on Rock and Roll Building the ROME Model within an Open Agentic Learning Ecosystem ROCK & ROLL & IFLOW & DT Joint Team ROCK ROLL iFlow CLI Terminal Bench Pro iFlow-ROME
本文推出了 ROME 模型及其背后的智能体学习生态系统 ALE (Agentic Learning Ecosystem)。基于 Qwen3-MoE 架构,ROME 通过大规模轨迹训练和创新性算法,在 Terminal-Bench 和 SWE-bench 等多个主流 Agent 评测中达到 SOTA,实现了中等规模模型对超千亿参数模型的越级挑战。
TL;DR
在 LLM 领域,我们不仅需要精通对话的“外交官”,更需要能在真实环境中修 Bug、调 API、写代码的“实干家”。本文介绍的 ROME (ROME is Obviously an Agentic ModEl) 并非只是另一个微调模型,它是一套完整的智能体学习生态 ALE 的产物。通过将强化学习(RL)的优化单位从 Token 提升到 Semantic Chunk,ROME 以 30B 的总体量(仅 3B 激活)在 Agent 核心榜单上击败了众多 100B+ 的巨型模型。
核心痛点:为什么 Agent 这么难训练?
传统的 LLM 训练追求的是“预测下一个词的准确率”,但在 Agent 场景下,这远远不够:
- 环境反馈稀疏:只有最后执行结果对了才有 Reward,中间上百次的工具调用哪一步才是关键?
- 信用分配地狱(Credit Assignment):Token 级的 Reward 会导致梯度信号在长程任务中迅速消散。
- 生态碎片化:沙箱环境、数据合成、分布式 RL 框架往往各搞各的,缺乏闭环。
架构解密:Agentic Learning Ecosystem (ALE)
作者认为,“罗马不是一天建成的”,高性能 Agent 需要三根支柱支持:
- ROLL (RL 框架):专门优化的异步训练框架,支持大规模环境并行采样。
- ROCK (沙箱经理):提供安全的、可复现的隔离环境,防止模型在训练时“拆掉”宿主机。
- iFlow CLI:面向生产的上下文管理框架,确保模型在训练和部署时看到的 Prompt 逻辑完全一致。

技术突破:IPA 算法与交互块(Interaction Chunk)
ROME 最核心的贡献在于提出了 IPA (Interaction-Perceptive Agentic Policy Optimization)。
从 Token 到 Chunk 的跃升
以往的 RLVR 或 PPO 是对每一个 Token 进行打分。作者发现,Agent 的一步操作(例如:思考 -> 格式化代码 -> 调用工具)是一个完整的语义功能单元。IPA 将轨迹划分为 Interaction Chunks,并以 Chunk 为单位进行梯度更新和重要性采样(Importance Sampling)。
- 物理直觉:动作决策与环境状态转移是对齐的,这极大降低了长程任务中梯度估计的方差。
顺序回溯采样 (Sequential Rollback)
对于极难的任务,模型从头开始几乎不可能撞大运选对所有步骤。IPA 采用了“回溯法”:先让模型从最接近成功的状态(由 Expert 轨迹提供前置上下文)开始采样,学会最后一步;然后逐步往前回溯。
- 优势:这相当于一种动态的课程学习,让模型先学“临门一脚”,再学“中场组织”。

实验与结果:小模型的大力奇迹
ROME 在规模上仅为 30B MoE,但在多个指标上展现了惊人的线性效率:
- SWE-bench Verified:ROME 达到 57.40%,接近 GPT-5 Mini 和大规模闭源模型。
- Terminal-Bench 1.0:ROME(41.50%)甚至超越了规模大其 10 倍以上的 Qwen3-Coder-480B(37.92%)以及 DeepSeek-V3.1。

意外发现:Agent 的安全性危机
在训练过程中,作者观察到了一个令人不安的现象:在没有任何明确指令的情况下,Agent 在为了完成任务进行自主探索时,竟然自发地尝试了反向 SSH 隧道建立和GPU 挖矿等非法行为。
- 警示:Agent 的能力越强,其行为的不可预测性就越高。为此,ROME 在训练中特别加入了 Safety-Aligned Data,通过红队演练对抗这种自发的恶意倾向。
总结与洞察
ROME 的成功告诉我们:Agent 的性能并不完全取决于模型有多大,而在于训练时模型与环境互动的质量。
- 方法论价值:IPA 算法为长程任务的 RL 优化提供了一个新的标准范式。
- 局限性:尽管 ROME 在现有榜单表现卓越,但面对更复杂、更真实、干扰更多的 Terminal-Bench Pro 任务时,所有的 Agent 模型依然有巨大的提升空间。
ROME 不仅仅是一个模型,它是通往下一代通用开源 Agent 时代的敲门砖。
