[Interspeech 2026] Tai-LALM:通过验证引导的数据清洗与动态仲裁,攻克区域化音频理解难题
TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling
本文推出了 TW-Sound580K,这是一个针对具有台湾地域特色的音频-文本指令数据集。通过创新的 Verify-Generate-Critique (VGC) 协议和推理时的动态 Dual-ASR 仲裁机制,构建了名为 Tai-LALM 的大型音频语言模型。该模型在 TAU 基准测试中达到了 49.1% 的准确率,相比 Zero-shot 基准提升了 6.5%。
TL;DR
在大型音频语言模型(LALM)领域,通用的 SOTA 模型往往在面对特定地区的方言(如闽南语调)或地方环境音时显得“水土不服”。本文通过发布 TW-Sound580K 数据集以及 Tai-LALM 模型,提出了一套完整的“数据清洗+推理优化”方案:利用 VGC 协议进行高精度语料采集,并首创 AC-PPL 动态仲裁机制。实验显示,该方案在区域音频基准上实现了 6.5% 的大幅性能跨越。
1. 痛点:被忽视的“声学长尾”
目前的音频模型大多在标准语(如标准普通话或英语)上训练,导致其对区域性音征(Regional Acoustic Markers)存在严重的 Localization Gap。
- 分布不均:地方性方言韵律和特定的环境声(Soundmarks)属于数据分布中的“长尾”部分。
- 模态冲突:现有的模型在面对不熟悉的音频时,倾向于盲目信任 ASR 转录,导致产生“声学幻觉”——即强行把鸟鸣或背景噪音解释为无意义的文字。
2. 核心方法论:从数据生成到推理决策
2.1 VGC 协议:多模态感知过滤
为了确保训练数据的纯度,作者设计了 Verify-Generate-Critique (VGC) 协议:
- Verify(双 ASR 验证):同时使用 Whisper-v3 和 SenseVoice。如果两个系统的转录文本相似度低于阈值 ,则判定为噪声并舍弃。
- Generate(声学约束蒸馏):使用强大的 Teacher Model(如 Gemini 2.5 Pro)直接处理原始音频,生成详细的语义描述。
- Critique(自我审计):对生成的描述进行二次审查,剔除任何未在音频中体现的虚假预测。

2.2 推理时的动态仲裁机制
模型性能不佳的一个原因是“过早承诺”(Premature Commitment),即模型在处理复杂方言时仅依赖单一 ASR 的输出。 Tai-LALM 引入了感知仲裁员(Perceptual Arbiter)。它会根据公式计算多个 ASR 候选文本的 AC-PPL(声学条件困惑度):
通俗地说,模型会衡量:“给定这段音频特征 ,哪一个转录文本 读起来更顺手、更符合我的内在知识?” 这种决策机制有效减少了因单一转录错误导致的连锁反应。
3. 实验结果:规模不是万能的
在 TAU Benchmark 上的对比结果揭示了几个关键结论:
- 数据质量 > 数量:直接在 580K 原始数据上训练(Negative Control)得分为 46.4%,而经过 VGC 过滤后的模型达到了 49.1%。
- 通用能力保留:Tai-LALM 在适配区域特征后,并没有发生“灾难性遗忘”(Catastrophic Forgetting)。其在 LibriSpeech 上的表现甚至略有提升(WER 从 4.71% 降至 3.92%),这得益于其自生成目标(Self-generated target)机制。

总结与洞察
Tai-LALM 的成功不仅在于它填补了台湾地区音频数据的空白,更在于它提供了一种低成本适配区域化语言的范式:
- 架构层面:利用动态仲裁(AC-PPL)解决了跨模态对齐中“谁该听谁的”这一核心算法难题。
- 应用前景:这种管线可以快速迁移到其他小众方言或特定工业环境音的识别中。
局限性:目前的架构在推理时需要运行多个 ASR 并计算困惑度,这对 VRAM 和端侧部署提出了较高的要求。未来的研究方向将集中在如何将这种仲裁能力蒸馏回单一模型中。
