为什么人工检查点比最终审查更重要
实际部署中的核心洞察是,人类应在规划和编码阶段介入,而非仅在最后环节。在2025年一项关于Atlassian部署的基于LLM的人机协同代理框架(HULA)研究中,工程师报告称,该框架最大程度地减少了整体开发时间和精力,尤其是在启动编码计划以及为简单任务编写代码时[4]。这表明,早期的人类指导——例如优化代理的计划——比等到代码写完后再去捕捉错误更有价值。
同一项研究还发现,在某些情况下代码质量仍令人担忧,这提醒我们,仅靠检查点并不能保证完美的输出[4]。因此,实际的做法是在每个阶段——规划、编码和测试——都设置审查关卡,而不是依赖单一的最后检查。
根据任务的风险和复杂程度匹配相应水平的人类控制
人机协同机器学习并非放之四海而皆准。2022年的一项前沿综述指出了三种控制模式:主动学习(系统保持控制权)、交互式机器学习(人与系统更紧密协作)以及机器教学(人类专家掌控学习过程)[1]。就代码库而言,你可以将主动学习用于低风险重构,将交互式审查用于功能开发,而将机器教学用于关键架构决策。
另一项2022年的调查从数据角度印证了这一点,表明在数据处理、模型训练或通过保持人类独立性的系统设计等不同环节,人类参与都能提升模型性能[2]。关键在于根据错误成本和任务复杂度,事先决定哪个阶段需要人类介入。
建立反馈闭环,让智能体从人工纠正中学习
反馈不是一次性事件,而是一个循环。一本2026年出版的关于工程化智能体反馈循环的著作指出,智能体与人类一样,没有反馈就不会成长——它们只会不断重复自己[5]。在生产环境中,客户措辞、市场变化和政策都在不断调整,一个无法适应的智能体会随着时间推移变得脆弱不堪[5]。
这与Atlassian的部署方式一致,在该部署中,工程师在每个阶段的反馈都被整合到智能体的工作流程中,而不仅仅是用于修正当前输出[4]。因此,实用的建议是记录人工修正,并利用这些记录来重新训练或微调智能体,将每次审查都转化为学习机会。
关于这些来源
本回答基于5项同行评审研究——发表于2022年至2026年,其中2项为2024年或之后发表,3项发表于Q1期刊,合计被引用1312次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而该筛选源自从超过5亿篇论文数据库中检索到的45篇文献。
本文引用的文献
人机协同机器学习:最新技术综述
2022年的一篇综述定义了三种人在回路中的机器学习控制模型——主动学习(系统主导)、交互式机器学习(协作式)和机器教学(人类主导)——并厘清了课程学习、可解释人工智能等相关概念。
人机协同机器学习综述
2022年的一项调查从数据角度将人在回路工作分为三种递进类型:通过数据处理提升模型性能、通过干预式模型训练提升性能,以及通过保持人类独立性的系统设计来提升性能。
一种通过人在回路机器学习实现的统一微观结构分割方法
一项2023年的材料科学研究将弱监督学习与主动学习相结合,采用人机协同框架,以极低的标注成本实现了跨不同材料类别和成像模态的精确、可靠的微观结构分割。
人机协同软件开发智能体
Atlassian在2025年部署了一个基于人类参与式LLM代理框架(HULA),结果发现工程师认为开发时间和工作量有所减少,尤其是在规划和简单编码方面,但在某些情况下,他们对代码质量提出了担忧。
工程代理反馈回路
2026年出版的一本书章节指出,AI智能体与人类一样,需要反馈才能成长和适应;缺乏反馈时,它们在条件不断变化的生产环境中会变得脆弱不堪。
