[UC Berkeley] AdaEvolve: 像 Adam 一样进化,首个分层自适应 LLM 进化框架

ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport

总结
问题
方法
结果
要点

本文提出了 AdaEvolve,一种由大语言模型(LLM)驱动的分层自适应进化框架,旨在解决自动化程序生成中的资源分配与搜索停滞问题。该框架在 185 个复杂优化任务中表现卓越,在 Circle Packing 等挑战性任务上超越了人类 SOTA 与 AlphaEvolve。

TL;DR

随着 LLM 研究重心从“扩展训练规模”转向“扩展推理侧计算(Test-time Compute)”,如何高效地搜索最优解成为了核心挑战。UC Berkeley 提出的 AdaEvolve 彻底抛弃了传统进化算法中僵化的超参数配置,通过一种类似深度学习中 Adam 优化器的自适应机制,实现了搜索强度、资源分配和宏观策略的动态调整。它在 185 个任务中全面超越了现有的开源 Baseline 以及部分闭源 SOTA。

痛点深挖:静态策略的“资源陷阱”

当前的 LLM 进化框架(如 OpenEvolve, FunSearch)虽然利用 LLM 替代了传统的随机变异,但其“指挥系统”却是原始的:

  1. 策略刚性:无论搜索处于初期探索还是末期微调,变异率和采样温度通常保持不变。
  2. 资源浪费:计算资源被平均分配给所有种群(Islands),即使某些种群已经陷入局部最优(Stagnation)。
  3. 缺乏“灵感”:当代码微调无法提升性能时,现有系统无法停下来思考“是不是底层算法思路错了?”。

AdaEvolve 的核心直觉在于:搜索历史中的“适应度提升轨迹”就是离散空间的“梯度”。 通过监控这个信号,我们可以实时判断搜索的健康状况。

方法论详解:三层自适应架构

AdaEvolve 构建了一个纵向的分布式防御体系,将优化分为三个能级:

Level 1: 局部自适应 (Local Adaptation)

系统为每个岛屿维护一个 Accumulated Improvement Signal ()

  • 如果最近有大幅性能提升, 走高,系统会自动进入“收割模式(Exploitation)”,减小搜索半径。
  • 如果性能停滞, 衰减,系统则会增大“探索强度(Exploration Intensity)”,迫使 LLM 尝试更激进的变异。

Level 2: 全局自适应 (Global Adaptation)

AdaEvolve 将计算预算视为一个动态博弈过程。它使用改进版的 Multi-armed Bandit (UCB) 算法,但巧妙地解决了“贫困岛屿偏见”:

  • 全局归一化:奖励不是基于岛内的进步,而是基于岛屿对“全球最高分”的贡献。这确保了算力永远流向最有希望突破前沿(Frontier)的种群。

Level 3: 元引导 (Meta-Guidance)

这是 AdaEvolve 最具创新性的功能(System 2 思考)。当数值层面的微调全部失效时,它调动一个更高能力的 LLM 作为“战略家”,分析失败原因并生成 Solution Tactics(例如:“从贪心算法切换到动态规划”)。这些策略会被注入到下一轮的 Prompt 中,实现“降维打击”。

AdaEvolve 架构图 图1:AdaEvolve 概览。左侧为传统系统的死板路径,中间展示了 AdaEvolve 的分层动态调整。

实验与结果:超越人类极限

AdaEvolve 在包含数学、系统优化和算法设计的 185 个任务中进行了横向测评。

1. 突破数学瓶颈

在著名的 Circle Packing(圆堆积问题,N=26)中,AdaEvolve 跑出了 2.636 的高分,不仅超过了开源 Baseline,还打破了人类保持的最佳纪录(2.634)以及 DeepMind AlphaEvolve 的纪录(2.635)。

2. 系统优化 SOTA

在 ADRS 系统基准测试(如数据中心 TCP 拥塞控制、多云传输成本优化)中,AdaEvolve 在 GPT-5 和 Gemini-3-Pro 两种底座上均实现了全胜。尤其在 TXN(事务调度) 任务中,它在其他模型均陷入平台期时,凭借 Level 3 的元引导成功实现了二次突破。

实验结果对比 图2:ADRS 系统基准测试结果,展示了 AdaEvolve 在复杂工程问题中的鲁棒性。

3. 消融实验的可视化

研究发现,Meta-Guidance (Level 3) 是提升上限的关键。如果没有这一层,模型在处理 Circle Packing 等具有欺骗性地形(Deceptive Landscape)的问题时,性能会大幅跳水。

消融实验表

深度洞察:未来研究的启示

AdaEvolve 的成功传递了一个核心信号:LLM 的搜索逻辑需要从“被动变异”转向“主动干预”。

  • 自适应是工业化的前提:通过消除手动调参(只需提供模型名和迭代步数),AdaEvolve 将进化算法从“实验室的艺术”变成了“工厂的工具”。
  • 计算分配的艺术:在 Test-time Compute 昂贵的今天,如何把 Token 花在刀刃上,比单纯增加采样数更重要。

局限性:虽然 AdaEvolve 在推理侧表现惊人,但其对岛屿生成和元引导的判定依赖于固定的阈值(如 ),未来或许可以通过更高级的自省(Self-reflection)来进一步自动化这些元参数。

结论:AdaEvolve 为 LLM 驱动的自动程序发现树立了新的标杆,标志着 LLM 引导的零阶优化正式进入了“自适应时代”。

发现相似论文

试试这些示例

  • 查找最近其他将 Adaptive Gradient Methods 思想应用于离散空间或零阶寻优(Zeroth-Order Optimization)的 LLM 研究论文。
  • 哪篇论文最早提出了 LLM 作为进化算法中的语义变异算子(Semantic Mutation Operator),AdaEvolve 是如何在其基础上实现分层控制的?
  • 目前有哪些研究正在探讨将 AdaEvolve 这种多岛自适应进化框架应用到多模态模型架构搜索(NAS)或大规模强化学习训练流中?
目录
[UC Berkeley] AdaEvolve: 像 Adam 一样进化,首个分层自适应 LLM 进化框架
1. TL;DR
2. 痛点深挖:静态策略的“资源陷阱”
3. 方法论详解:三层自适应架构
3.1. Level 1: 局部自适应 (Local Adaptation)
3.2. Level 2: 全局自适应 (Global Adaptation)
3.3. Level 3: 元引导 (Meta-Guidance)
4. 实验与结果:超越人类极限
4.1. 1. 突破数学瓶颈
4.2. 2. 系统优化 SOTA
4.3. 3. 消融实验的可视化
5. 深度洞察:未来研究的启示