[arXiv 2026] LongNAP:告别被动指令,让 AI 预判你的下一步
Learning Next Action Predictors from Human-Computer Interaction
本文提出了下一步动作预测(Next Action Prediction, NAP)任务,旨在通过多模态交互历史预测用户的后续行为。作者开发了数据标注流水线 NAPsack 和长上下文模型 LongNAP,基于 1,800 小时的真实手机使用数据,实现了对个人行为模式的高效建模与前瞻性预测。
TL;DR
现在的 AI 助手像是一个“管窥蠡测”的观察者,只能看到你发出的 Prompt,却不知道你为什么发。斯坦福大学等机构的研究者提出了 LongNAP,一个能够通过分析你过去一个月的屏幕截图和点击记录,预测你未来几分钟要干什么的系统。该模型通过一种类似于“头脑风暴”的内省检索机制,在单用户预测精度上比传统的微调方法提升了近 80%。
核心痛点:为什么 AI 总是“慢半拍”?
真正的主动 AI(Proactive AI)需要像人类助手一样,看到你正在浏览机票,就知道下一步该帮你打开日程表确认时间。然而,实现这一愿景面临两个重重障碍:
- 数据极度匮乏:没人能手动为数千小时的操作录屏做精细标注。
- “死记硬背”失效:单纯将用户习惯训练进模型权重(Parametric Learning)太慢了。比如你刚收到一封新邮件,这个信息应该是“即时生效”的,而不是等到下次模型微调后才被记住。
NAPsack:化碎片化截图为金子般的标注
为了解决数据问题,作者开发了 NAPsack。它不是粗暴地记录每一帧,而是通过 I/O 事件(如点击、滚动)作为触发机制,捕获交互前后的视觉上下文。接着,利用 VLM 将这些低层像素变化翻译成高层的自然语言描述(如:“用户在 Slack 中寻找特定同事并发送了修订请示”)。

事实证明,这种“分割 + 压缩 + IO 增强”的方法在标注准确度上达到了 0.7(LLM-judge 分数),极大地降低了存储压力(减小了 70% 以上)。
LongNAP 架构:思维触发检索
LongNAP 的核心秘密在于它不直接预测,而是采用 两阶段推理(Two-phase Reasoning):
- Reason to Retrieve(推理以检索):模型先看一眼当前的屏幕,心里想:“用户刚查完邮件里的实验评审意见,这让我想起了他以前习惯先去 W&B 看实验进度。”
- 检索与融合:利用上述推理产生的 Query,模型从存储在 BM25 库中的数十万条历史记录里提取最相关的“记忆”。
- Reason to Predict(推理以预测):结合历史记忆,模型修正预测思路:“既然他以前总是找同事甲讨论,那他接下来的动作大概率是去 Slack 私聊甲。”
这种架构通过 GRPO(群组相对策略优化) 算法进行端到端训练。模型不仅学习如何预测,还学习产生什么样的检索关键词能获得最高的回报。

实验结果:显著的性能跨越
LongNAP 的表现令人印象深刻。在对 20 位真实用户的测试中:
- 单用户性能:LongNAP 达到了 0.38 的平均相似度分数。作为对比,最强的商业模型基准(Few-shot Gemini 3.0 Flash)仅为 0.27。
- 泛化性:当把模型部署到完全没见过的用户身上时,它依然能够通过“边观察边检索”的方式,实现对新用户习惯的快速适配。

有趣的细节是,模型生成的推理轨迹(Reasoning Traces)会随着训练变短。在检索阶段,它学会了生成极其精练的关键词(如:message Michael Diyi reminder),就像人类在内部快速闪过一个念头一样。
深度洞察与总结
LongNAP 的价值在于它证明了 In-context Learning (ICL) 与检索机制结合后的巨大潜力,它规避了频繁模型权重更新带来的延迟和成本问题。
然而,该方法也面临着严峻的 隐私挑战:记录所有屏幕截图和交互轨迹意味着它成为了个人数据的“黑盒”。作者提出的端侧推理和受控隐私架构是未来的关键。
总的来说,该工作标志着 AI 从“工具”转向“伙伴”的重要一步。未来的电脑可能不再需要你输入“打开文档”,它会在你产生念头的那一刻,就已经把窗口为你准备好了。
Takeaway: 通过推理驱动的动态检索,长上下文行为建模可以显著提升 AI 对人类工作流的预测能力,但这需要我们在用户隐私与主动服务之间寻找新的平衡点。
