[2026] LaSER:让检索器“静默思考”,在潜空间内化 CoT 推理逻辑
LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval
本文提出了 LaSER,一种旨在将大语言模型(LLM)的显式推理能力内化到稠密检索器潜空间的自蒸馏框架。该方法通过在共享的 LLM 骨干网络中引入“潜空间思考 tokens”,在推理密集型检索任务(如 BRIGHT)上实现了与重型“重写-检索”管线相当的 SOTA 性能。
TL;DR
在稠密检索(Dense Retrieval)领域,单纯将 LLM 当作特征提取器已触及天花板。来自人大与阿里通义实验室的研究者提出了 LaSER,通过一种巧妙的自蒸馏机制,将长篇累牍的显式推理(Chain-of-Thought)内化为几个“潜思考 tokens”。实验证明,LaSER 在保持单阶段检索极高效率的同时,检索精度竟然能硬刚那些需要调用昂贵外部重写器的复杂管线。
背景定位:从“编码器”到“推理者”的跨越
随着 LLM 成为检索系统的主流 Backbone,我们面临一个尴尬的悖论:LLM 本身具备极强的逻辑推理能力,但在检索任务中,它们通常只被当作一个高级 BERT 来用。对于那些隐含意图、多跳逻辑的复杂查询(Query),这种“浅层匹配”往往力不从心。
现有的折中方案主要有两种:
- 显式重写(Rewrite-then-Retrieve):先让 LLM 写一段 CoT,再拿这段文字去检索。痛点:太慢了! 每次查询都要等它吐字,延迟高得离谱。
- 隐式思考(Implicit Thinking):在嵌入空间里增加几个可学习的 token。痛点:没逻辑。 缺少由于缺乏明确的语义引导,这些 token 往往变成了随机噪声。
左图显示了 LaSER 与传统管线的延迟/性能博弈,可见其在极低延迟下依然保持了极高性能。
核心动机:内化(Internalization)
LaSER 的核心 Insight 是:与其在推理阶段浪费时间生成文本,不如在训练阶段把文本里的“逻辑干货”蒸馏到模型的参数和潜空间里。作者认为,显式 CoT 路径是语义的“特权监督信息”。
方法论:LaSER 是如何“炼成”的?
LaSER 采用的是一种**双视图(Dual-View)**训练框架。
1. 潜视图 (Latent View) —— 检索时的“本体”
在处理 Query 时,模型不再直接输出 Embedding,而是先生成 个连续的潜思考向量。这些向量不是通过采样生成的词,而是基于加权 Embedding 的连续向量(Soft Tokens),保证了全程可微且语义丰富。
2. 显式视图 (Explicit View) —— 训练时的“导师”
训练时,模型会同时看一眼由 GPT-4o 生成的完整 CoT 推理路径。这个视图代表了该 Query 理解能力的上限。
3. 多粒度对齐 (Multi-grained Alignment)
这是 LaSER 成功的秘诀:
- 输出对齐(Output Alignment):让潜视图生成的搜索评分概率分布,模仿显式视图的分布。
- 轨迹对齐(Trajectory Alignment):作者提出了时间下采样(Temporal Downsampling)。既然 CoT 文字长,潜 tokens 短,那就把 CoT 切成段,让每一个潜 token 去对齐相应 CoT 片段的中间状态。这强制潜 tokens 必须捕获语义的逐步推进,而不是单纯的记忆。
LaSER 训练架构:左侧的 Latent View 模拟思考,由右侧的 Explicit View 进行实时辅导。
实验战绩:以小搏大
在 BRIGHT 等专注于推理的检索基准上,LaSER 的表现令人惊艳:
- 小模型也有大智慧:0.6B 规模的 LaSER 竟然在性能上超越了那些调用 3B/7B 重写器的高延迟管线。
- 泛化性强:在 FollowIR 和 BrowseComp-Plus 等域外(OOD)测试中,LaSER 的指令遵循能力和复杂查询理解能力远超标准对比学习训练出的基线。
详细的对比结果显示,LaSER 在多个维度上均稳健地优于传统的对比学习(Fair Baseline)和隐式推理模型(GIRCSE)。
深度洞察:为什么潜思考步数越多效果越好?
一个有趣的发现是(见 Figure 5):训练时增加步数收益不大(因为语义密度已经很高了),但在**推理阶段增加步数(Inference Scaling)**却能持续提升检索效果。这说明 LaSER 真正掌握了一种“迭代优化”的机制,模型可以通过更多的计算预算(Compute Budget)来反复打磨 Query 的最终表示。
总结与启示
LaSER 是一项极具工程价值的工作,它告诉我们:
- 显式数据,隐式使用:CoT 不一定非得吐出来给用户看,作为训练时的特权信号(Privileged Supervision)价值更高。
- 潜空间推理是趋势:在嵌入空间里模拟逻辑推理可以显著绕过解码延迟,是未来 Real-time AI 的核心方向。
未来的挑战在于:如何利用强化学习(RL)来进一步优化这些潜思考路径,让模型自主发现那些人类语言无法描述、但对检索最有帮助的“思维路径”。
