[Tech Report] Mi:dm K 2.5 Pro:32B 规模如何挑战企业级复杂推理与长文本极限?

Mi:dm K 2.5 Pro

总结
问题
方法
结果
要点
摘要

本文介绍了 KT 公司开发的 Mi:dm K 2.5 Pro,这是一个拥有 32B 参数的旗舰级大语言模型。该模型通过深度放大(DuS)、128K 长上下文扩展以及专门的“融合训练”(Fusion Training)策略,在复杂的步进式推理、代码生成和 Agent 工作流方面取得了显著成就,特别是在韩国语境下的多项基准测试中达到了 SOTA 水平。

TL;DR

KT 推出的 Mi:dm K 2.5 Pro 是一款 32B 参数的“小钢炮”型旗舰 LLM。它不盲目追求参数规模,而是通过 AST 代码精炼Layer Predictor 深度扩展 以及 128K 渐进式长文本训练,在推理、编程和 Agent 任务中表现惊人。它不仅刷新了韩语 SOTA,其 HumanEval+ (92.07%) 和科学推理表现甚至可以与参数量多出数倍的巨型模型(如 236B 的 K-EXAONE)正面硬刚。

背景定位:从“生成式对话”转向“企业级补完”

在大模型赛道进入下半场后,通用的问答已不再是重点。企业环境要求模型具备:

  1. 多步推理 (Reasoning):不仅给出答案,还要有逻辑链。
  2. 长上下文 (Long-context):处理 100K 以上的合同或技术文档。
  3. Agent 化工作流:精准调用外部 Tool(如 API 调用)。

Mi:dm K 2.5 Pro 便是为了填合这一缺口。它在 Mi:dm 2.0 的基础上,参数翻了 3 倍,上下文扩展了 4 倍,并针对韩国本土语境进行了深度重构。

痛点深挖:为何简单的缩放(Scaling)不再有效?

作者指出,在企业场景(尤其是特定语言环境)下,单纯堆算力会遇到两个壁垒:

  • 知识分布不均:数学、代码和特定法律领域的训练数据分布极其不均,导致模型在处理这些垂直任务时容易产生“推理幻觉”。
  • 效率瓶颈:同步强化学习(RL)在处理长推理链时,GPU 利用率极低(因为必须等待最慢的长序列完成),这限制了模型的训练广度。

核心方法论 (Methodology)

1. 深度放大 (Depth Upscaling, DuS) 与 Layer Predictor

为了快速从 10B 级别的基座扩展到 32B,KT 采用了 DuS 技术。不同于传统的重复层堆叠,他们使用了 Layer Predictor

  • 直觉:通过学习现有相邻层之间的参数关系(基于 SVD),预测出新层的参数,而不是随机初始化或简单复制。
  • 效果:这种初始化方式在未进行任何额外训练时,性能损耗远小于随机方法(如表 1 所示)。

模型架构与 DuS 对比

2. 代码与数学的结构化提纯

  • 代码 (AST 分析):不仅仅是清洗文本,模型预处理阶段会解析抽象语法树(AST),确保只有逻辑严密、可执行的代码(Score 4-5)进入训练集。
  • 数学 (Gap-filling Synthesis):针对几何、拓扑等稀缺领域,通过 LlM 生成具备控制深度的逻辑推理路劲(Reasoning Paths),弥补数据分布的“空洞”。

3. 后训练流水线:Fusion Training

这是 Mi:dm K 2.5 Pro 的杀手锏。它将训练分为两个专注点:

  • Reasoning SFT/RL:通过 packing 策略将长达 64K 的推理链打包训练,极大提升效率。
  • Fusion Stage:在推理能力达标后,重新混入创意写作、翻译和通用问答数据,通过模型合并(Model Merging)平衡逻辑与文采。

实验战绩与 SOTA 对比

HumanEval+ 测试中,该模型以 32B 的体量跑出了 92.07% 的高分。在更反映“真本事”的 LiveCodeBenchMATH-H 上,它也展现了与巨型 MoE 模型竞争的实力。

实验结果对比

值得关注的效率提升: 通过采用 完全异步的 GSPO 强化学习框架,KT 解决了长序列生成中的“短板效应”(Straggler Problem)。

  • 生成 (Rollout) 与训练 (Update) 解耦:GPU 不再闲置等待最长的回复。
  • 吞吐量提升 30%,使得在 128K 上下文下进行强化学习成为可能。

深度洞察:本土化 LLM 的参考范本

Mi:dm K 2.5 Pro 的成功给行业提供了一个启示:对于非英语大模型,精细化的数据治理比模型规模更重要。 他们通过建立“韩国敬语体系”、“行政区划逻辑”以及“法律术语库”的专用 SFT 数据,解决了全球模型在特定国家应用中的“水土不服”。

局限性 (Limitations): 虽然在推理和工具调用上极其出色,但 32B 的规模在处理多语言广度上仍受限(主要支持韩、英、中、日),且在复杂的跨任务联动中仍有优化空间。

总结

Mi:dm K 2.5 Pro 不仅仅是又一个 LLM,它是针对 企业级复杂性 构建的精密仪器。通过异步强化学习和结构化数据清洗,它在 32B 的尺寸下压榨出了极高的推理能量。

发现相似论文

试试这些示例

  • 查找最近其他针对非英语(如韩语、中文)利用深度放大(Depth Upscaling)技术提升模型推理性能的研究论文。
  • 哪篇论文最早提出了 Layer Predictor 这种初始化深度扩展模型参数的方法,本文在其实际应用中做了哪些优化?
  • 有哪些研究在讨论大语言模型中如何通过“融合训练(Fusion Training)”来缓解推理增强后带来的通用对话能力衰减(Catastrophic Forgetting)问题?
目录
[Tech Report] Mi:dm K 2.5 Pro:32B 规模如何挑战企业级复杂推理与长文本极限?
1. TL;DR
2. 背景定位:从“生成式对话”转向“企业级补完”
3. 痛点深挖:为何简单的缩放(Scaling)不再有效?
4. 核心方法论 (Methodology)
4.1. 1. 深度放大 (Depth Upscaling, DuS) 与 Layer Predictor
4.2. 2. 代码与数学的结构化提纯
4.3. 3. 后训练流水线:Fusion Training
5. 实验战绩与 SOTA 对比
6. 深度洞察:本土化 LLM 的参考范本
7. 总结