[小米 AI] Any2Speech:从文本朗读到全场景“声态”合成,开启 Native Agentic TTS 时代
Borderless Long Speech Synthesis
小米 MiLM Plus 团队提出 Any2Speech (ATS),一个面向智能体(Agent-centric)的无边界长音频合成框架。该框架采用“以标注代替过滤”的策略和 Global-Sentence-Token 三层分级标注模式,实现了从单纯的文本转语音(Text2Speech)向全场景、强语义控制的音效合成演进。
TL;DR
小米 MiLM Plus 团队发布的 Any2Speech (ATS) 标志着 TTS 技术进入了第四代:Native Agentic TTS。它不再只是把文字转成声音,而是通过一个三层的结构化语义接口(Global-Sentence-Token),让 LLM 能够像导演一样操控长音频的每一处情感起伏和环境声效。核心在于:不删除噪音而是标注噪音,不直接合成而是先“思考”再说话。
1. 背景定位:TTS 的四代进化
在学术坐标系中,ATS 被定义为一代跨越式的工作。
- 第一、二代(HMM/End-to-End):解决了“说得出”和“说得像”的问题。
- 第三代(Instruct TTS):引入 LLM 接口,能听懂“用开心的语气说”,但局限于单句。
- 第四代(ATS):突破边界。解决长音频的全局连贯性(Global Coherence)和场景完整度(Scene Completeness)。
2. 痛点深挖:消失的灵感与狭窄的信道
传统 TTS 研发有两个致命伤:
- 数据洁癖:为了追求清晰度,开发者往往会剔除 70%-90% 的数据(如吵架、背景音乐、环境音)。但这导致模型变成了只会读课文的机器人,失去了真实世界的张力。
- 信息瓶颈:
<speaker>文本</speaker>这种格式带宽太窄,LLM 脑子里宏大的场景描述根本传不给合成引擎。
3. 核心贡献:Any2Speech 的三根支柱
A. 以标注代替过滤 (Labeling over Filtering)
ATS 采取了极其激进的数据观:脏数据才是好数据。
- 逻辑:高表现力往往与杂乱的噪声正相关(如激烈的辩论必然伴随背景嘈杂和人声重叠)。
- 做法:保留 90% 以上的原始数据,但不去噪,而是详细标注背景里有什么(如“远处有小孩哭声”、“轻微的钢琴背景”)。这使得噪声从干扰项变成了可控的参数维度。
B. Global-Sentence-Token 分级标注架构
为了拓宽控制信道,作者设计了类似专业配音导演的协议栈:
- Global 层:定义场景氛围、人物性格、长期的情绪弧度。
- Sentence 层:定义单句的意图、语速、音量波动。
- Token 层:细化到音素级的重音、连读和停顿。
这套 Schema 构成了 LLM 与合成引擎之间的结构化语义接口。
(注:展示 Global-Sentence-Token 如何从宏观到微观控制音频)
C. CoT 推理:先思后言 (Think before Speak)
ATS 在模型内部引入了 Chain-of-Thought (CoT)。模型在生成波形前,会先在内部生成一段描述性的“思考轨迹”:
- “这段文字是一个反派在威胁别人,语气应该先沉稳后突然爆发...” 这种显式的推理链条让复杂的韵律决策不再是黑盒,而是可解释、可编辑的过程。
4. 实验与结果:真实的复杂性
由于 ATS 挑战的是“无边界长音频”,传统的单句测试集(如 LibriSpeech)已不再适用。
- SOTA 表现:ATS 在处理长达数分钟的音频时,能够保持极高的一致性。例如在模拟《告密的心》朗读中,模型能精准捕捉到从压抑的冷静到歇斯底里狂吠的情感演变。
- 指令遵循:通过 Dimension Dropout 训练,即便用户只给出部分指令(比如只指定了情感没指定环境),模型依然能生成高质量结果。
(注:展示 ATS 在长音频情感演变和场景建模上优于基线模型的可视化分析)
5. 深度洞察:为什么这很重要?
ATS 的本质是将 TTS 引擎抽象为一个执行层协议。 以往的 TTS 是“给什么读什么”,而 ATS 是“要什么演什么”。当它与多模态模型结合时,你给它一段电影视频,前端 LLM 理解了画面后,通过这个宽带接口下达复杂的 GST 指令,ATS 就能完美复现那个环境下的对白与氛围。
总结与局限性
Any2Speech 成功证明了:环境音不是干扰,而是表达的一部分;长上下文不是负担,而是情感的载体。
局限性:
- 实时性:目前优化侧重于内容创作(播客、有声书),在低延迟实时交互场景(如语音助手)仍有提升空间。
- 音效库:目前的音效生成更多是“涌现”出来的(从播客背景中学到),尚未集成专门的音效/音乐语料库。
未来展望: 从 Any2Speech 走向 Any2Sound。这套分级控制逻辑完全可以扩展到乐器合成和纯环境音效合成,实现真正意义上的全模态声学生成。
Takeaway: 小米 Any2Speech 不仅是在卷音质,更是在为 AI 智能体定义一套完整的“声音控制协议”。
