[arXiv 2026] LongNAP:告别被动指令,让 AI 预判你的下一步

Learning Next Action Predictors from Human-Computer Interaction

总结
问题
方法
结果
要点
摘要

本文提出了下一步动作预测(Next Action Prediction, NAP)任务,旨在通过多模态交互历史预测用户的后续行为。作者开发了数据标注流水线 NAPsack 和长上下文模型 LongNAP,基于 1,800 小时的真实手机使用数据,实现了对个人行为模式的高效建模与前瞻性预测。

TL;DR

现在的 AI 助手像是一个“管窥蠡测”的观察者,只能看到你发出的 Prompt,却不知道你为什么发。斯坦福大学等机构的研究者提出了 LongNAP,一个能够通过分析你过去一个月的屏幕截图和点击记录,预测你未来几分钟要干什么的系统。该模型通过一种类似于“头脑风暴”的内省检索机制,在单用户预测精度上比传统的微调方法提升了近 80%。

核心痛点:为什么 AI 总是“慢半拍”?

真正的主动 AI(Proactive AI)需要像人类助手一样,看到你正在浏览机票,就知道下一步该帮你打开日程表确认时间。然而,实现这一愿景面临两个重重障碍:

  1. 数据极度匮乏:没人能手动为数千小时的操作录屏做精细标注。
  2. “死记硬背”失效:单纯将用户习惯训练进模型权重(Parametric Learning)太慢了。比如你刚收到一封新邮件,这个信息应该是“即时生效”的,而不是等到下次模型微调后才被记住。

NAPsack:化碎片化截图为金子般的标注

为了解决数据问题,作者开发了 NAPsack。它不是粗暴地记录每一帧,而是通过 I/O 事件(如点击、滚动)作为触发机制,捕获交互前后的视觉上下文。接着,利用 VLM 将这些低层像素变化翻译成高层的自然语言描述(如:“用户在 Slack 中寻找特定同事并发送了修订请示”)。

NAPsack 架构图

事实证明,这种“分割 + 压缩 + IO 增强”的方法在标注准确度上达到了 0.7(LLM-judge 分数),极大地降低了存储压力(减小了 70% 以上)。

LongNAP 架构:思维触发检索

LongNAP 的核心秘密在于它不直接预测,而是采用 两阶段推理(Two-phase Reasoning):

  1. Reason to Retrieve(推理以检索):模型先看一眼当前的屏幕,心里想:“用户刚查完邮件里的实验评审意见,这让我想起了他以前习惯先去 W&B 看实验进度。”
  2. 检索与融合:利用上述推理产生的 Query,模型从存储在 BM25 库中的数十万条历史记录里提取最相关的“记忆”。
  3. Reason to Predict(推理以预测):结合历史记忆,模型修正预测思路:“既然他以前总是找同事甲讨论,那他接下来的动作大概率是去 Slack 私聊甲。”

这种架构通过 GRPO(群组相对策略优化) 算法进行端到端训练。模型不仅学习如何预测,还学习产生什么样的检索关键词能获得最高的回报。

模型架构与推理流程

实验结果:显著的性能跨越

LongNAP 的表现令人印象深刻。在对 20 位真实用户的测试中:

  • 单用户性能:LongNAP 达到了 0.38 的平均相似度分数。作为对比,最强的商业模型基准(Few-shot Gemini 3.0 Flash)仅为 0.27。
  • 泛化性:当把模型部署到完全没见过的用户身上时,它依然能够通过“边观察边检索”的方式,实现对新用户习惯的快速适配。

实验结果对比图

有趣的细节是,模型生成的推理轨迹(Reasoning Traces)会随着训练变短。在检索阶段,它学会了生成极其精练的关键词(如:message Michael Diyi reminder),就像人类在内部快速闪过一个念头一样。

深度洞察与总结

LongNAP 的价值在于它证明了 In-context Learning (ICL) 与检索机制结合后的巨大潜力,它规避了频繁模型权重更新带来的延迟和成本问题。

然而,该方法也面临着严峻的 隐私挑战:记录所有屏幕截图和交互轨迹意味着它成为了个人数据的“黑盒”。作者提出的端侧推理和受控隐私架构是未来的关键。

总的来说,该工作标志着 AI 从“工具”转向“伙伴”的重要一步。未来的电脑可能不再需要你输入“打开文档”,它会在你产生念头的那一刻,就已经把窗口为你准备好了。

Takeaway: 通过推理驱动的动态检索,长上下文行为建模可以显著提升 AI 对人类工作流的预测能力,但这需要我们在用户隐私与主动服务之间寻找新的平衡点。

发现相似论文

试试这些示例

  • 查找最近其他利用视觉语言模型(VLM)对人类计算机交互(HCI)轨迹进行自动标注或行为建模的论文。
  • 哪篇论文最早讨论了在大语言模型中通过 Policy Gradient 优化检索触发词的机制,LongNAP 在此基础上做了哪些针对个人数据的改进?
  • 有哪些研究探讨了将长期用户行为建模应用于隐私敏感的端侧设备(On-device AI)预测任务?
目录
[arXiv 2026] LongNAP:告别被动指令,让 AI 预判你的下一步
1. TL;DR
2. 核心痛点:为什么 AI 总是“慢半拍”?
3. NAPsack:化碎片化截图为金子般的标注
4. LongNAP 架构:思维触发检索
5. 实验结果:显著的性能跨越
6. 深度洞察与总结