[小米 AI] Any2Speech:从文本朗读到全场景“声态”合成,开启 Native Agentic TTS 时代

Borderless Long Speech Synthesis

总结
问题
方法
结果
要点
摘要

小米 MiLM Plus 团队提出 Any2Speech (ATS),一个面向智能体(Agent-centric)的无边界长音频合成框架。该框架采用“以标注代替过滤”的策略和 Global-Sentence-Token 三层分级标注模式,实现了从单纯的文本转语音(Text2Speech)向全场景、强语义控制的音效合成演进。

TL;DR

小米 MiLM Plus 团队发布的 Any2Speech (ATS) 标志着 TTS 技术进入了第四代:Native Agentic TTS。它不再只是把文字转成声音,而是通过一个三层的结构化语义接口(Global-Sentence-Token),让 LLM 能够像导演一样操控长音频的每一处情感起伏和环境声效。核心在于:不删除噪音而是标注噪音,不直接合成而是先“思考”再说话。

1. 背景定位:TTS 的四代进化

在学术坐标系中,ATS 被定义为一代跨越式的工作。

  • 第一、二代(HMM/End-to-End):解决了“说得出”和“说得像”的问题。
  • 第三代(Instruct TTS):引入 LLM 接口,能听懂“用开心的语气说”,但局限于单句。
  • 第四代(ATS):突破边界。解决长音频的全局连贯性(Global Coherence)和场景完整度(Scene Completeness)。

2. 痛点深挖:消失的灵感与狭窄的信道

传统 TTS 研发有两个致命伤:

  1. 数据洁癖:为了追求清晰度,开发者往往会剔除 70%-90% 的数据(如吵架、背景音乐、环境音)。但这导致模型变成了只会读课文的机器人,失去了真实世界的张力。
  2. 信息瓶颈<speaker>文本</speaker> 这种格式带宽太窄,LLM 脑子里宏大的场景描述根本传不给合成引擎。

3. 核心贡献:Any2Speech 的三根支柱

A. 以标注代替过滤 (Labeling over Filtering)

ATS 采取了极其激进的数据观:脏数据才是好数据

  • 逻辑:高表现力往往与杂乱的噪声正相关(如激烈的辩论必然伴随背景嘈杂和人声重叠)。
  • 做法:保留 90% 以上的原始数据,但不去噪,而是详细标注背景里有什么(如“远处有小孩哭声”、“轻微的钢琴背景”)。这使得噪声从干扰项变成了可控的参数维度

B. Global-Sentence-Token 分级标注架构

为了拓宽控制信道,作者设计了类似专业配音导演的协议栈:

  • Global 层:定义场景氛围、人物性格、长期的情绪弧度。
  • Sentence 层:定义单句的意图、语速、音量波动。
  • Token 层:细化到音素级的重音、连读和停顿。

这套 Schema 构成了 LLM 与合成引擎之间的结构化语义接口

三层标注示意架构图 (注:展示 Global-Sentence-Token 如何从宏观到微观控制音频)

C. CoT 推理:先思后言 (Think before Speak)

ATS 在模型内部引入了 Chain-of-Thought (CoT)。模型在生成波形前,会先在内部生成一段描述性的“思考轨迹”:

  • “这段文字是一个反派在威胁别人,语气应该先沉稳后突然爆发...” 这种显式的推理链条让复杂的韵律决策不再是黑盒,而是可解释、可编辑的过程。

4. 实验与结果:真实的复杂性

由于 ATS 挑战的是“无边界长音频”,传统的单句测试集(如 LibriSpeech)已不再适用。

  • SOTA 表现:ATS 在处理长达数分钟的音频时,能够保持极高的一致性。例如在模拟《告密的心》朗读中,模型能精准捕捉到从压抑的冷静到歇斯底里狂吠的情感演变。
  • 指令遵循:通过 Dimension Dropout 训练,即便用户只给出部分指令(比如只指定了情感没指定环境),模型依然能生成高质量结果。

实验结果对比图 (注:展示 ATS 在长音频情感演变和场景建模上优于基线模型的可视化分析)

5. 深度洞察:为什么这很重要?

ATS 的本质是将 TTS 引擎抽象为一个执行层协议。 以往的 TTS 是“给什么读什么”,而 ATS 是“要什么演什么”。当它与多模态模型结合时,你给它一段电影视频,前端 LLM 理解了画面后,通过这个宽带接口下达复杂的 GST 指令,ATS 就能完美复现那个环境下的对白与氛围。

总结与局限性

Any2Speech 成功证明了:环境音不是干扰,而是表达的一部分;长上下文不是负担,而是情感的载体。

局限性

  1. 实时性:目前优化侧重于内容创作(播客、有声书),在低延迟实时交互场景(如语音助手)仍有提升空间。
  2. 音效库:目前的音效生成更多是“涌现”出来的(从播客背景中学到),尚未集成专门的音效/音乐语料库。

未来展望: 从 Any2Speech 走向 Any2Sound。这套分级控制逻辑完全可以扩展到乐器合成和纯环境音效合成,实现真正意义上的全模态声学生成。


Takeaway: 小米 Any2Speech 不仅是在卷音质,更是在为 AI 智能体定义一套完整的“声音控制协议”。

发现相似论文

试试这些示例

  • 查找最近其他尝试解决长文档 TTS 中跨句子情感一致性和全局韵律建模的论文。
  • 哪篇论文最早引入了“由标注而非清理” (Labeling over cleaning) 的数据增强思路?本文在音频领域是如何具体落地的?
  • 有哪些研究正尝试将 Chain-of-Thought 推理机制引入到多模态音频生成任务中以提升韵律表现?
目录
[小米 AI] Any2Speech:从文本朗读到全场景“声态”合成,开启 Native Agentic TTS 时代
1. TL;DR
2. 1. 背景定位:TTS 的四代进化
3. 2. 痛点深挖:消失的灵感与狭窄的信道
4. 3. 核心贡献:Any2Speech 的三根支柱
4.1. A. 以标注代替过滤 (Labeling over Filtering)
4.2. B. Global-Sentence-Token 分级标注架构
4.3. C. CoT 推理:先思后言 (Think before Speak)
5. 4. 实验与结果:真实的复杂性
6. 5. 深度洞察:为什么这很重要?
7. 总结与局限性