[arXiv 2026] COMIC:让 AI 真正拥有幽默感,全自动多智能体短剧生成新高度

COMIC: Agentic Sketch Comedy Generation

总结
问题
方法
结果
要点
摘要

本文提出了 COMIC,一个全自动的多智能体短剧 (Sketch Comedy) 生成系统。该系统模仿专业节目(如《周六夜现场》)的制作流程,通过多岛屿架构下的竞争、评价与迭代改进,实现了高质量、叙事连贯且具有幽默感的长视频生成。

TL;DR

让 AI 讲个笑话不难,但让它拍一段像《周六夜现场》(SNL) 那样有梗、有逻辑、画面还统一的短剧简直是灾难。华盛顿大学的研究团队推出的 COMIC 框架,通过模拟人类制片厂的角色分工(编剧、导演、评估员),利用多岛屿演化算法和人类偏好对齐的评论员,实现了从角色定义到 1-2 分钟幽默视频的全自动产出。

背景定位:从“泛泛生成”到“深度创作”

在 AI 视频领域,我们正处于从“生成 10 秒精美画面”向“讲述完整故事”跨越的节点。以往的 Agentic 视频生成方法大多是单向的(Plan-then-Generate),缺乏创意的碰撞与反复雕琢。COMIC 的核心贡献在于将 演化计算 (Evolutionary Computation)多智能体框架 (Multi-agent Systems) 结合,把幽默创作变成了一场不断优化的“生存竞赛”。

核心挑战:幽默的不可量化性

作者指出,幽默是主观的且具有“相对性”。一个笑话听多了就不搞笑了,且冷笑话和闹剧之间没有统一的衡量尺度。因此,COMIC 放弃了寻找一个固定的奖励函数(Reward Function),而是采用了“基于评价的演化”,认为一个剧本好不好,取决于它能否在与其他选手的对战中赢得多样化评论员的青睐。

方法论详解:演化竞赛与制作管道

1. 对齐现实观众的评价标准

研究者从 YouTube 收集了近 5000 个喜剧视频,利用播放量及其增长曲线建立模型,筛选出能代表不同频道风格(如 Key & Peele, SNL)的 LLM 评论员。这种“任务特定选择”确保了 Agent 不再是盲目给出反馈,而是带有明确审美偏好的“毒舌评委”。

2. 多岛屿剧本循环 (Script Writing Loop)

COMIC 将剧本种群分布在 K 个平行的“岛屿”上。

  • 两两对战 (Pairwise Tournament):岛屿内的剧本相互竞争。
  • 败者迭代:输掉的剧本必须根据评论员对胜者的反馈进行改写。这相当于在语义空间内进行了“交叉”与“变异”。
  • 发散性演化:不同岛屿由不同偏好的委员会管理,保证了产出既有冷幽默也有荒诞派,避免了审美的单一化。

模型架构图

3. 视觉渲染循环 (Video Rendering Loop)

剧本定型后,进入导演环节。系统通过“时空内存库”保持角色和背景的一致性,每个分镜头都要经过“渲染评论员”的挑刺:

  • 是否符合剧本节奏?
  • 角色表情是否到位?
  • 道具是否穿帮? 通过“深度”上的迭代改进和“广度”上的方案备份筛选,最终合成长视频。

实验与结果:AI 真的变好笑了

对比实验令人吃惊。COMIC 的视频在 受众喜爱度 (Watch More) 上不仅碾压了其他 Agent 智选方案,甚至超越了目前最强的黑盒模型 Sora 2。

  • SOTA 级性能:尽管在图像的绝对真实感(Realism)上稍逊于顶级生成模型,但在叙事连贯性和剧本幽默感上,人类评价分远高于基线模型。
  • 测试时缩放 (Test-time Scaling):COMIC 展示了类似于推理模型(如 o1)的特性——投入更多的计算资源(更多岛屿、更多渲染尝试),最终效果能呈对数增长。

实验结果对比

深度洞察

COMIC 的成功本质上验证了红皇后假说 (Red Queen Hypothesis):在创意领域,没有绝对的终点,只有在持续的竞争压力下不断进化的优胜者。它最迷人的地方在于,这种“进步”是通过 LLM 逻辑判断而非参数微调达成的。

局限性:目前的渲染成本仍然较高(单台 GPU 约需一天时间),且对音效、配乐的精细控制还有待加强。然而,COMIC 为我们勾勒了未来电影制作的一种可能:你只需要给出几个设定,AI 军团就会在你背后疯狂竞标、改稿,直到呈上一部让你忍俊不禁的成品。


总结 (Takeaway):COMIC 将创意生成从“概率抽样问题”转化为了“演化搜索问题”。它证明了在主观创意任务中,多元化的专业评论员反馈大数据暴力生成更有效。

发现相似论文

试试这些示例

  • 查找其他利用演化计算或多智能体竞争机制来优化大语言模型创意写作(如小说、剧本)的研究论文。
  • “红皇后假说”在机器学习和多智能体强化学习(MARL)中是如何被用来解释模型持续演化动力学的?
  • 针对长视频生成的视觉一致性(Visual Consistency),除了本文提到的存储最后一帧作为参考,还有哪些最新的显式时空控制技术?
目录
[arXiv 2026] COMIC:让 AI 真正拥有幽默感,全自动多智能体短剧生成新高度
1. TL;DR
2. 背景定位:从“泛泛生成”到“深度创作”
3. 核心挑战:幽默的不可量化性
4. 方法论详解:演化竞赛与制作管道
4.1. 1. 对齐现实观众的评价标准
4.2. 2. 多岛屿剧本循环 (Script Writing Loop)
4.3. 3. 视觉渲染循环 (Video Rendering Loop)
5. 实验与结果:AI 真的变好笑了
6. 深度洞察