[GECCO 2026] 代码世界模型:让 LLM 成为进化算法的“上帝视角”控制器

Code World Models for Parameter Control in Evolutionary Algorithms

总结
问题
方法
结果
要点

本文提出了针对进化算法参数控制的 CWM-greedy 方法。该方法利用大语言模型(LLM)将优化器的随机动力学合成为 Python 模拟器代码(即代码世界模型),并通过单步贪婪规划在 LeadingOnes、Jumpk 等基准测试中实现了接近理论最优的效果。

TL;DR

参数控制一直是进化计算中的核心挑战。本文提出了一种全新的范式:不再手动设计复杂的自适应规则,而是让 LLM 学习优化器的行为并将其写成一段 Python 代码模拟器(Code World Model)。通过这个模拟器进行单步规划,算法在各种复杂的适应度景观(Fitness Landscape)中表现惊人,尤其是在传统方法全军覆没的欺骗性景观 Jumpk 中,实现了 100% 的成功率。

背景:为什么自适应规则会“失灵”?

在进化算法(如 (1+1)-RLS)中,选择合适的变异强度 (翻转比特的数量)至关重要。

  1. 传统规则的局限:像 EAα 这样的方法通常遵循“改进则增大 ,停滞则减小 ”的逻辑。但在像 Jumpk 这样的欺骗性景观中,当算法到达“谷地”边缘时,必须翻转多个比特才能跨越障碍。此时算法会进入长时间停滞,传统规则会不断减小 ,导致算法彻底锁死在局部最优。
  2. 强化学习的低效:DQN 等模型需要海量的在线试错,且在面对稀疏的成功信号时(如跨越谷地的那一瞬间),很难从噪声中学习到本质规律。

核心创新:用代码合成模拟动态

作者扩展了 Code World Models (CWMs) 框架。其核心直觉是:LLM 具备极强的代码生成能力和一定的数学理解能力,如果我们给它提供优化问题的数学描述和一些少量的随机采样轨迹,它就能抽象出该优化过程的“物理规律”。

CWM-greedy 的工作流:

  1. 轨迹收集:利用随机或简单的策略收集少量轨迹。注意:这些轨迹里不需要包含最优策略,LLM 任务是“推断”而非“模仿”。
  2. 代码合成:LLM 生成一个 Python 类,包含 predict_next_state(预测下一步适应度)和 evaluate_state(评估状态价值)。
  3. 贪婪规划:在每一步,通过模拟器预测不同 值下的结果,选择期望收益最高的目标。

模型架构图 图 1:CWM 离线训练与在线规划流程

实验战绩:在“绝地”中生存

研究人员在四个基准测试上验证了 CWM 的威力:

1. 突破 Jumpk 谷地

这是本论文最亮的点。在 Jumpk 景观中,所有传统的自适应基准方法(EAα 等)成功率均为 0%

  • CWM 表现:100% 成功率。
  • 原因分析:LLM 通过数学描述和经验统计表,准确识别出在谷地边缘需要增大 值,这一策略被硬编码进生成的 Python 模拟器中。

2. NK-Landscape:无闭式解的挑战

在极其崎岖且没有数学定义的 NK 景观中,作者引入了 经验转移统计表(Empirical Transition Statistics) 喂给 LLM。

  • 结果:CWM 依然通过查表式的逻辑合成,在 15 个独立实例中全部排名第一,超越了所有静态和自适应基准。

实验结果对比 表 1:Jumpk 任务上 CWM 与各基准方法的成功率对比

深度洞察:为什么比 DQN 强?

在对比实验中,CWM 仅需 200 条离线轨迹,而 DQN 即使经过 500 次在线迭代,成功率也仅有 58%。

  • 归约能力:DQN 会对 ϵ-greedy 探索中的噪声产生过拟合,而 CWM 将知识表达为代码。代码具有天然的 结构归纳偏置(Inductive Bias),能够更好地捕获如超几何分布等数学关系。
  • 零样本泛化:CWM 在训练时从未见过 的成功案例,但凭借对 参数化的数学理解,它在 的测试中依然保持了 78% 的成功率。

总结与展望

CWM-greedy 的成功标志着 LLM 在垂直技术领域的新用法:LLM 不仅是代码助手,更是复杂的动力学系统建模者。它将不可审计的神经网络权重变成了可审计、可解释的 Python 启发式脚本。

局限性

  • 目前高度依赖于提示词中提供的数学描述或预处理后的统计表。
  • 对于超高维度的参数空间,合成代码的复杂度可能会面临挑战。

未来,这一方法有望扩展到连续空间优化(如 CMA-ES 的参数调节)以及更复杂的群体智能算法中。

发现相似论文

试试这些示例

  • 查找最近其他利用大语言模型生成可执行代码来解决组合优化或强化学习环境建模的论文。
  • 哪篇论文最早提出了 Code World Models (CWMs) 框架,本文在处理随机性(Stochasticity)方面对其做了哪些核心改进?
  • 除了进化算法的参数控制,还有哪些研究将类似的代码合成模拟器应用到了连续空间优化或多模态控制任务中?
目录
[GECCO 2026] 代码世界模型:让 LLM 成为进化算法的“上帝视角”控制器
1. TL;DR
2. 背景:为什么自适应规则会“失灵”?
3. 核心创新:用代码合成模拟动态
3.1. CWM-greedy 的工作流:
4. 实验战绩:在“绝地”中生存
4.1. 1. 突破 `Jumpk` 谷地
4.2. 2. NK-Landscape:无闭式解的挑战
5. 深度洞察:为什么比 DQN 强?
6. 总结与展望