LatentRAG:将 Agentic RAG 推理速度提升 10 倍的隐空间革命

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG

总结
问题
方法
结果
要点
摘要

本文提出了 LatentRAG 框架,这是一种高效的 Agentic RAG(代理式检索增强生成)系统。该方法将传统的串行语言空间推理与检索转移到连续的隐空间(Latent Space),通过单次前向传播生成隐标记(Latent Tokens),在保持与主流 Agentic RAG(如 Search-R1)相当性能的同时,将推理延迟降低了约 90%。

1. TL;DR

传统的 Agentic RAG 虽然在处理复杂多步问题上表现卓越,但其“边想边搜”的机制导致了巨大的延迟,通常比普通 RAG 慢上十几倍。LatentRAG 彻底颠覆了这一现状:它通过在 连续隐空间(Latent Space) 中进行推理和检索,消除了冗长的逐字文本解码。实验表明,它在保持 SOTA 性能的同时,将推理延迟降低了足足 90%,让复杂推理任务也能拥有接近实时响应的速度。

2. 痛点深挖:为什么 Agentic RAG 这么慢?

在诸如 Search-R1AutoRefine 等先进框架中,LLM 扮演着“搜索代理”的角色。每一步它都要生成:

  1. Thinking (CoT): “我下一步应该搜什么?”
  2. Subquery: 实际发送给搜索引擎的字符串。

这种模式下,LLM 必须通过 Autoregressive Decoding(自回归解码) 逐字产生这些文本。研究发现,这两个阶段占用了总耗时的 90%。在多跳问答(Multi-hop QA)任务中,这种串行依赖导致的延迟让用户难以忍受。

Latency Bottlenecks 图 1:Agentic RAG 与 Naive RAG 的延迟对比,显示生成阶段是核心瓶颈。

3. 核心方案:从离散语言到连续隐空间

LatentRAG 的核心直觉是:既然中间思维和子查询只是给模型和检索器看的,为什么非要转换成自然语言不可?

3.1 隐标记生成 (Latent Generation)

LatentRAG 使用预定义的 [THINK][QUERY] 等特殊标记(Special Tokens)占位。LLM 只需进行一次前向传播(Forward Pass),直接提取最后一层隐藏状态(Hidden States)作为 Latent Tokens。这种方法利用了 Transformer 的计算并行性,彻底告别了慢速的自回归解码。

3.2 隐空间检索对齐 (Latent Retrieval Alignment)

如何让检索模型理解这些“隐藏状态”?作者引入了一个轻量级的 Projector,并提出了一种基于 KL 散度(KL Divergence) 的对齐目标:

  • 将 Latent Tokens 投影成检索向量。
  • 最小化 Latent 向量产生的检索分布与真实文本子查询产生的检索分布之间的差异。 这种端到端的联合优化,使得模型能够学习到比普通文本更高效的检索表示。

LatentRAG 架构图 图 2:LatentRAG 与传统 Agentic RAG 的架构对比。

3.3 可视化透明度:并行解码

为了解决隐空间不可解释的问题,LatentRAG 提供了一个可选的并行解码机制。它能将 Latent Tokens 瞬间还原为自然语言思维。由于各步骤的解码是独立的单次操作,它依然比传统的串行生成快得多。

4. 实验战绩:极致性能与速度

在 NQ、HotpotQA 等 7 个权威数据集上,LatentRAG 展示了恐怖的效率提升:

  • 性能持平:在 Qwen2.5-7B 骨干模型上,EM(精确匹配)分数与 Search-R1 几乎一致(甚至在部分任务上有 2%+ 的微增)。
  • 延迟剧降:平均运行时间从 5000ms+ 压缩到了 500-600ms 左右,加速约 9 倍。

实验结果对比 图 3:分阶段延迟对比,LatentRAG 在 Thought 和 Subquery 生成上几乎不耗时。

此外,通过 LogitLens 分析(见下图),我们发现即便不强制对齐词表,Latent Tokens 内部依然自发聚集了与任务高度相关的语义信息(如“Christianity Today”或“William Goldman”)。

LogitLens 分析 图 4:LogitLens 显示隐空间标记实际上精准捕捉了复杂的语义实体。

5. 深度洞察与总结

LatentRAG 的成功揭示了 LLM 代理的一个重要演进方向:从“以人为中心”的自然语言搜索,转向“以模型为中心”的向量化搜索。

优势:

  • 极速响应:为实时 Agent 应用扫清了障碍。
  • 端到端可导:解决了检索信号无法反向传播给 LLM 的痛点。
  • 灵活的透明度:开发阶段开启解码用于调试,生产环境关闭解码以保速度。

局限性:

  • 数据依赖:目前依赖于现有强大模型生成的轨迹(SFT)进行训练。未来的探索方向应该是利用强化学习(RL)让 Agent 在隐空间自主探索。

总结:LatentRAG 证明了“少说话、多思考”在连续向量空间中不仅可行,而且极其高效。它是连接单步检索与复杂代理推理之间那座缺失的桥梁。

发现相似论文

试试这些示例

  • 检索最近一年内其他探讨将 Transformer 中间推理过程(Chain-of-Thought)隐藏或压缩到隐空间的论文。
  • 哪篇论文最早提出了在 RAG 场景下对齐 LLM 隐藏状态与密集检索器向量空间的方法,本文的 KL 散度对齐与之有何差异?
  • 调研是否存在将隐空间检索(Latent Retrieval)技术应用于多模态智能体(如同时处理图像和文本检索)的相关研究。
目录
LatentRAG:将 Agentic RAG 推理速度提升 10 倍的隐空间革命
1. 1. TL;DR
2. 2. 痛点深挖:为什么 Agentic RAG 这么慢?
3. 3. 核心方案:从离散语言到连续隐空间
3.1. 3.1 隐标记生成 (Latent Generation)
3.2. 3.2 隐空间检索对齐 (Latent Retrieval Alignment)
3.3. 3.3 可视化透明度:并行解码
4. 4. 实验战绩:极致性能与速度
5. 5. 深度洞察与总结
5.1. 优势:
5.2. 局限性: