提升LLM智能体有哪些可选方案?
当你希望一个LLM智能体在某个任务上表现更好时,主要有四个可用的杠杆:微调(在任务特定数据上更新模型权重)、检索(在推理时让模型访问外部知识)、人工审核(让人检查或纠正输出),以及自适应环境(让智能体通过与模拟或真实环境互动来学习并获得反馈)。每个杠杆在成本、数据需求和泛化能力方面各有不同的权衡。
微调是经典做法:你拿一个预训练模型,在带标签的样本上继续训练。但它需要高质量数据,而这类数据往往稀缺,而且容易过拟合——一项研究发现,在合成数据上进行监督微调会导致模型在分布外任务上性能崩溃[2]。相比之下,检索不改变模型本身,而是在运行时从数据库中提取相关信息。2024年一项对比两者在知识密集型任务上表现的研究发现,检索始终优于微调,无论是针对模型已有的知识,还是全新的事实[3]。问题在于,检索只有在知识存在于数据库中时才有效——它并不能教会模型新技能。
人工审核最可靠,但成本也最高。在实际部署中,它往往是瓶颈所在。自适应环境旨在通过让智能体从自动化反馈中学习来降低这一成本,例如判断它是否完成了任务或获得了奖励信号。举例来说,一个用于内容合规审核的系统,在真实环境的A/B测试中,将人工审核成本降低了15.3%[1]。因此,选择并非非此即彼——关键在于你想达成什么目标:注入知识(检索)、教授技能(微调或自适应环境),还是确保质量(人工审核)。
为何自适应环境在泛化与数据效率上优于微调
自适应环境最大的优势在于,它们让智能体能够从交互中学习,而不仅仅是依赖静态示例。这意味着它们能更好地泛化到新情境,并且所需的数据量大大减少。在2025年的一项研究中,环境调优——即智能体通过探索动态环境并接收纠正性反馈来学习——仅使用了400个问题实例,就达到了具有竞争力的分布内性能,同时在分布外任务上超越了监督式微调[2]。相比之下,微调在新任务上表现崩溃,因为它过度拟合了训练数据。
另一种方法是基于记忆的在线强化学习,完全省去了微调环节。Memento系统将过往经验存入记忆库,并在需要时检索这些经验来指导行动,同时根据环境反馈更新记忆。该系统在GAIA基准测试(一套通用AI助手任务集)上取得了87.88%的成绩,全程无需任何梯度更新;与基于训练的方法相比,在分布外任务上还提升了4.7至9.6个百分点[5]。这表明,自适应环境既能更高效地利用数据,也能更稳健地应对分布偏移。
为什么这样有效?微调会调整模型的权重以适应特定的数据分布,这可能会损害模型在其他分布上的表现。相比之下,自适应环境训练智能体在动态情境中响应反馈,从而鼓励更灵活的策略。2023年关于交互式语言智能体的论文也发现,通过在文本类游戏中利用强化学习训练的智能体,能够泛化到包含新物体和新指令的游戏家族中[4]。因此,证据一致表明自适应环境在泛化能力上更胜一筹,尽管这需要设计良好的环境和奖励信号,而这并非易事。
当检索与人工审核仍是正确选择时
当你的目标是无需重新训练即可注入新的事实性知识时,检索显然是更优的选择。2024年的研究发现,检索增强生成(RAG)在知识密集型任务上始终优于微调,而微调在习得新事实方面表现吃力——即使针对同一事实提供多种变体也是如此[3]。因此,如果你需要用最新信息更新智能体,检索既更经济又更有效。
人工审核对于错误代价高昂的高风险决策仍然至关重要,但自适应环境可以减轻这一负担。MoE-CL系统采用混合专家架构并结合持续指令调优,在腾讯视频的实际部署中将人工审核成本降低了15.3%[1]。这是一笔可观的节省,但它并未消除人工审核——只是提高了效率。在医疗诊断或法律咨询等领域,你仍然需要人类参与其中。
还有一种混合方法:利用自适应环境中的合成数据来改进检索或微调。Learn-by-interact框架合成了智能体与环境的交互轨迹,并将其用于上下文学习和训练。在编码、网页和桌面任务中,该方法将Claude-3.5的上下文学习基线结果提升了最高12.2%,将Codestral-22B的训练基线结果提升了最高19.5%[6]。这表明自适应环境可以辅助其他方法,而不仅仅是取代它们。
关于这些来源
这个回答基于6项研究(2篇同行评审,4篇预印本),发表于2023年至2026年间,其中5篇为2024年或之后发表,合计被引用75次。这些研究是从7项通过质量筛选的研究中选出的最相关者,而这7项研究又源自从超过5亿篇论文的数据库中检索到的41篇文献。
本文引用的文献
通过持续指令微调实现大语言模型的自我进化
MoE-CL是一种采用双专家架构的持续指令微调框架,在腾讯视频的真实A/B测试中,将人工审核成本降低了15.3%,展示了其在自我进化的持续学习方面的工业应用价值。
不要只微调智能体,还要调优环境
环境调优是一种从带有纠正反馈的动态环境中学习的训练范式,仅使用400个问题实例,就在分布外泛化上超越了监督微调,避免了监督微调常见的性能崩溃。
微调还是检索?比较知识注入在大语言模型中的效果
在知识密集型任务的对比中,检索增强生成(RAG)在既有知识和新知识方面均稳定优于无监督微调,而微调在接触大量变体之前难以学习新事实。
基于语言的交互式智能体
通过强化学习训练出的交互式语言智能体,在基于文本的游戏中能够跨游戏家族泛化,适应新物体和指令;同时,一个查询重构智能体通过与信息检索系统的交互,提升了检索效果。
Memento:在不微调LLM的情况下微调LLM智能体
Memento,一种基于记忆的在线强化学习智能体,在不微调大语言模型的情况下,在GAIA验证集上达到了87.88%的准确率,在测试集上达到了79.40%的准确率,并通过基于案例的记忆在分布外任务上提升了4.7至9.6个百分点。
交互式学习:面向真实环境中自适应智能体的数据驱动框架
交互式学习综合了智能体与环境的交互轨迹,在Claude-3.5的上下文学习中将基线结果提升最多12.2%,在Codestral-22B的训练中,于编码、网页和桌面任务上提升最多19.5%,其中反向构建方法带来最多14.0%的提升。
