人工监督究竟应该放在哪个环节?
这些研究中最显著的模式是,人类在两个方面贡献最大:定义智能体必须遵循的行为规则,以及在智能体的输出最终定稿前对其进行审查。2026年的一套编码智能体框架将每一条被采纳的人类审查意见转化为一条持久规则,存储在版本控制文件中,并且智能体在提交代码前会运行一份自我审查清单。在11个工作会话中,这种做法将违反规则的错误复发率降至0%——也就是说,一旦人类纠正了一类错误,智能体就再也不会犯同类错误[2]。这是一个具体例子,说明人类监督可以融入流程之中,而无需人类全程盯守每一步。
同样的原则也适用于多轮对话助手。亚马逊2021年的一套生产系统利用客户互动信号——比如用户在收到糟糕回复后重新表述查询——来自动检测并修复语音识别、语言理解和实体解析中的错误。但关键在于,他们加入了一个“护栏式改写选择机制”,在部署每项修复前,会利用反馈摩擦数据对其进行反应式评估。在A/B测试中,这种方法实现了11.8的胜负比,并将话语级缺陷率降低了超过30%[3]。尽管学习过程本身是自动化的,但在验证阶段,人类(或至少是基于规则的护栏)仍然处于循环之中。
全自动化何时会适得其反?
让智能体完全依靠自身经验学习,而不受任何人类设定的约束,可能会导致训练崩溃。一项2026年针对多轮LLM智能体的研究发现,将基于策略的自蒸馏(即智能体从自身轨迹中学习)与强化学习简单结合,往往会导致训练崩溃[1]。解决办法并非去除人类输入,而是注入结构化的、人类可读的“技能”——即对成功行为、错误和工作流程的总结——用以调节教师模型。在某个基准测试上,这种方法相比标准基线将性能提升了高达42.1%[1]。关键启示在于:源自人类的结构(哪怕只是对有效做法的简单总结)才是保持学习稳定性的核心。
这与编码智能体框架形成对比,后者刻意完全避免权重更新,而是从人类反馈中积累规则。该方法在不改变任何模型权重的情况下,实现了跨会话的持久学习[2]。因此,证据表明,你越是让模型自我修改,就越需要以人类为导向的护栏——无论是作为明确的规则,还是作为编码人类知识的教师。
有哪些切实可行的护栏措施能确保人类始终参与其中?
首先,将人类反馈固化为持久规则,让智能体在行动前能够核查这些规则。编码智能体框架通过版本控制的指令文件和自我审查清单实现了这一点,并且它在异构智能体接口间同样有效——这意味着同一套规则可以迁移到不同工具上[2]。其次,采用护栏机制,在任何自动化修复上线前对其进行评估。亚马逊的系统通过一种基于反馈摩擦数据的重写选择机制做到了这一点,并且其可扩展性足以汇集来自数百万客户的匿名数据[3]。第三,如果使用自蒸馏或强化学习,应让教师模型以人类衍生的技能为条件,而非仅依赖标准答案。Skill-SD表明,动态且人类可读的技能优于固定的特权信息,在两个基准上将GRPO分别提升了14.0%和10.9%[1]。
共同的主线是:人类不必介入每一个环节——但必须介入那个定义“何为良好”的环节。无论是规则集、技能总结,还是用于验证修复的护栏,人类的角色在于提供框架和最终把关,而非事无巨细地管理每一步。
关于这些来源
这个回答基于3项研究(1篇同行评审,2篇预印本),发表于2021年至2026年间,其中2篇为2024年或之后发表,1篇发表于Q1–Q2期刊。这些研究从3项通过质量筛选的研究中选出,被认为最具相关性,而这些研究又源自从超过5亿篇论文数据库中检索到的25篇文献。
本文引用的文献
Skill-SD:面向多轮大语言模型智能体的技能条件自蒸馏方法
Skill-SD是一个面向多轮LLM智能体的框架,它利用智能体自身轨迹中生成的人类可读技能摘要来调节教师模型,在AppWorld和Sokoban上相比标准强化学习基线分别提升了高达42.1%和40.6%的性能,同时有效防止了训练崩溃。
通过累积行为规则实现自我改进的AI编码智能体:一种闭环框架
一个面向编码智能体的闭环框架,将每一条被采纳的人类评审意见编码为持久的行为规则,在11次工作会话中,对已定规则约束的错误类别实现了0%的复发率,且无需修改模型权重。
基于反馈的大规模对话式AI智能体自学习机制
亚马逊面向对话式AI的生产级自学习系统,利用客户改写信号和护栏式改写选择机制,在A/B测试中实现了11.8的胜负比,并将话语级缺陷率降低了30%以上。
