[GECCO 2026] 代码世界模型:让 LLM 成为进化算法的“上帝视角”控制器
Code World Models for Parameter Control in Evolutionary Algorithms
本文提出了针对进化算法参数控制的 CWM-greedy 方法。该方法利用大语言模型(LLM)将优化器的随机动力学合成为 Python 模拟器代码(即代码世界模型),并通过单步贪婪规划在 LeadingOnes、Jumpk 等基准测试中实现了接近理论最优的效果。
TL;DR
参数控制一直是进化计算中的核心挑战。本文提出了一种全新的范式:不再手动设计复杂的自适应规则,而是让 LLM 学习优化器的行为并将其写成一段 Python 代码模拟器(Code World Model)。通过这个模拟器进行单步规划,算法在各种复杂的适应度景观(Fitness Landscape)中表现惊人,尤其是在传统方法全军覆没的欺骗性景观 Jumpk 中,实现了 100% 的成功率。
背景:为什么自适应规则会“失灵”?
在进化算法(如 (1+1)-RLS)中,选择合适的变异强度 (翻转比特的数量)至关重要。
- 传统规则的局限:像 EAα 这样的方法通常遵循“改进则增大 ,停滞则减小 ”的逻辑。但在像
Jumpk这样的欺骗性景观中,当算法到达“谷地”边缘时,必须翻转多个比特才能跨越障碍。此时算法会进入长时间停滞,传统规则会不断减小 ,导致算法彻底锁死在局部最优。 - 强化学习的低效:DQN 等模型需要海量的在线试错,且在面对稀疏的成功信号时(如跨越谷地的那一瞬间),很难从噪声中学习到本质规律。
核心创新:用代码合成模拟动态
作者扩展了 Code World Models (CWMs) 框架。其核心直觉是:LLM 具备极强的代码生成能力和一定的数学理解能力,如果我们给它提供优化问题的数学描述和一些少量的随机采样轨迹,它就能抽象出该优化过程的“物理规律”。
CWM-greedy 的工作流:
- 轨迹收集:利用随机或简单的策略收集少量轨迹。注意:这些轨迹里不需要包含最优策略,LLM 任务是“推断”而非“模仿”。
- 代码合成:LLM 生成一个 Python 类,包含
predict_next_state(预测下一步适应度)和evaluate_state(评估状态价值)。 - 贪婪规划:在每一步,通过模拟器预测不同 值下的结果,选择期望收益最高的目标。
图 1:CWM 离线训练与在线规划流程
实验战绩:在“绝地”中生存
研究人员在四个基准测试上验证了 CWM 的威力:
1. 突破 Jumpk 谷地
这是本论文最亮的点。在 Jumpk 景观中,所有传统的自适应基准方法(EAα 等)成功率均为 0%。
- CWM 表现:100% 成功率。
- 原因分析:LLM 通过数学描述和经验统计表,准确识别出在谷地边缘需要增大 值,这一策略被硬编码进生成的 Python 模拟器中。
2. NK-Landscape:无闭式解的挑战
在极其崎岖且没有数学定义的 NK 景观中,作者引入了 经验转移统计表(Empirical Transition Statistics) 喂给 LLM。
- 结果:CWM 依然通过查表式的逻辑合成,在 15 个独立实例中全部排名第一,超越了所有静态和自适应基准。
表 1:Jumpk 任务上 CWM 与各基准方法的成功率对比
深度洞察:为什么比 DQN 强?
在对比实验中,CWM 仅需 200 条离线轨迹,而 DQN 即使经过 500 次在线迭代,成功率也仅有 58%。
- 归约能力:DQN 会对 ϵ-greedy 探索中的噪声产生过拟合,而 CWM 将知识表达为代码。代码具有天然的 结构归纳偏置(Inductive Bias),能够更好地捕获如超几何分布等数学关系。
- 零样本泛化:CWM 在训练时从未见过 的成功案例,但凭借对 参数化的数学理解,它在 的测试中依然保持了 78% 的成功率。
总结与展望
CWM-greedy 的成功标志着 LLM 在垂直技术领域的新用法:LLM 不仅是代码助手,更是复杂的动力学系统建模者。它将不可审计的神经网络权重变成了可审计、可解释的 Python 启发式脚本。
局限性:
- 目前高度依赖于提示词中提供的数学描述或预处理后的统计表。
- 对于超高维度的参数空间,合成代码的复杂度可能会面临挑战。
未来,这一方法有望扩展到连续空间优化(如 CMA-ES 的参数调节)以及更复杂的群体智能算法中。
