[Tech Report] Fish Audio S2:深度对齐视角下的新一代开源语音基座模型

Fish Audio S2 Technical Report

总结
问题
方法
结果
要点
摘要

本文介绍了 Fish Audio S2,这是一个开源的文本转语音 (TTS) 系统,支持多说话人、多轮对话生成以及基于自然语言描述的指令遵循控制。该系统采用 Dual-AR 架构,并在推理阶段利用 SGLang 实现了低于 100ms 的首包延迟 (TTFA) 和 0.195 的实时率 (RTF)。

TL;DR

Fish Audio 团队发布的 Fish Audio S2 不仅仅是一个 TTS 模型的升级,它展示了如何通过 Dual-AR 架构RL 强化学习对齐,将语音合成推向“类人”对话的新高度。它支持多轮对话、多说话人自由切换,并能通过自然语言精准控制笑声、呼吸等副语言行为。

背景定位:这是目前开源界指令遵循能力最强、推理效率极高的 TTS 模型之一,在学术评估(WER/SIM)与人类感知评估(Audio Turing Test)中均表现优异。

1. 痛点:为什么语音合成的“灵气”很难捕捉?

目前的 TTS 系统虽然在音质(Fidelity)上已接近人类,但在可控性交互感上仍有三大瓶颈:

  1. 数据标注难:在大规模数据上自动标注“愤怒”、“喘气”或“重音”极度困难。
  2. 训练推理失配:RL 训练往往使用独立训练的奖励模型,与预训练阶段的分布不一致,导致效果打折。
  3. 推理开销大:高质量的自回归生成往往伴随着高延迟,难以满足实时直播或对话需求。

2. 核心架构:Dual-AR 的精妙设计

为了解决长序列建模的压力,Fish Audio S2 延续了 Dual-AR (双自回归) 架构。这一设计将任务拆解为两部分:

  • Slow AR (慢速语义主干):基于 Qwen3-4B。它负责处理文本和第一层 RVQ 标记,主要完成语义规划和粗略的韵律构建。
  • Fast AR (快速声学解码器):一个极轻量的 4 层 Transformer。它在 Slow AR 提供的隐状态下,瞬间“补全”剩余 9 层声学细节。

这种“大模型定航、小模型填色”的非对称设计,在保证表现力的同时,极大地压低了计算复杂度。

模型架构图

3. 技术突破:多维度 RL 奖励对齐

Fish Audio S2 最具创新性的地方在于引入了 GRPO (Group Relative Policy Optimization) 的变体。

不同于传统 PPO 需要维护沉重的价值网络(Value Network),S2 通过组内候选样本的相对表现来估计优势(Advantage)。其奖励系统由三个互补维度组成:

  • 语义准确性 (R_STT):使用 ASR 模型惩罚乱码、漏字和忽视指令的行为。
  • 声学偏好 (R_Pref):由语音质量模型评分,提升纯净度和听感。
  • 音色相似度 (R_SIM):通过声纹模型确保在长文本生成中音色不漂移。

4. 实验战绩与 SOTA 对比

Audio Turing Test (音频图灵测试) 中,Fish Audio S2 表现惊人。在引入指令重写(Instruction Rewriting)后,其得分达到了 0.515,显著超过了 GPT-4o 和 Seed-TTS 等闭源巨头。

实验结果对比

在多语言表现上,S2 在中文、英文、日语等 24 种语言中均展现了极强的稳健性。尤其是在 Seed-TTS-Eval 榜单上,其中文 WER 压低至 0.54%,展现了工业级的稳定性。

5. 推理引擎:SGLang 赋能生产力

为了解决部署问题,团队将 S2 深度集成到 SGLang 服务框架中。

  • RadixCache:通过缓存参考音频的 KV 状态,使得重复音色的推理几乎消除了 Prefill 耗时。
  • 超低延迟:首包延迟 (TTFA) < 100ms,这意味着该模型可以无缝接入实时语音助理。

6. 深度总结:通往 AGI 语音的路径

Fish Audio S2 的成功告诉我们:TTS 正在从“生成任务”转向“对齐任务”。通过将预训练阶段的过滤模型直接转化为 RL 阶段的奖励模型,不仅解决了数据一致性问题,更赋予了模型理解复杂自然语言指令的能力。

局限性:尽管 S2 在主流语言上表现优异,但在训练数据少于 1000 小时的极低资源语言上,其表现力仍有提升空间。

未来展望:随着 Fish Audio 开放其指令集基准(Instruction Benchmark),我们期待看到更多能够处理动态、非语言化情感交互的语音模型诞生。

发现相似论文

试试这些示例

  • 查找最近其他在语音合成中应用 GRPO 或 DPO 等强化学习对齐技术的 SOTA 论文。
  • 哪篇论文最早提出了 Dual-Autoregressive (Dual-AR) 语音建模架构,Fish Audio S2 在其基础上做了哪些优化?
  • 调研目前开源领域中除了 Fish Audio 系列外,还有哪些支持自然语言指令控制细粒度副语言特征(Paralinguistic features)的 TTS 模型?
目录
[Tech Report] Fish Audio S2:深度对齐视角下的新一代开源语音基座模型
1. TL;DR
2. 1. 痛点:为什么语音合成的“灵气”很难捕捉?
3. 2. 核心架构:Dual-AR 的精妙设计
4. 3. 技术突破:多维度 RL 奖励对齐
5. 4. 实验战绩与 SOTA 对比
6. 5. 推理引擎:SGLang 赋能生产力
7. 6. 深度总结:通往 AGI 语音的路径