[CVPR 2026] KnowU-Bench:手机助手真的懂你吗?突破 GUI 导航,迈向主动个性化智能体
KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation
本文推出了 KnowU-Bench,一个针对移动端 Agent 的在线交互式基准测试。该框架支持在真实 Android 模拟器中评估 Agent 的个性化(Personalization)推理、主动性(Proactivity)决策及多轮偏好获取能力,填补了现有 Benchmark 仅关注静态指令遵循的空白。
TL;DR
如果你的 AI 助手只会机械地执行“打开微信”,那它还称不上一个称职的管家。浙江大学联合 Apple、腾讯提出的 KnowU-Bench 告诉我们:真正的移动端 Agent 必须学会在模糊指令下推理你的偏好(例如“订份午餐”时避开你不吃的花生),并在合适的时机主动出击(如发现诈骗短信时主动拦截)。即使是 Claude 4.6 这样顶尖的模型,在这一复杂赛道上的及格率也仅为 50% 左右。
背景:从“脚本执行员”到“数字私人管家”
目前的移动 Agent 基准测试(如 AndroidWorld)已经把“指令遵循”卷到了极致。然而,现实生活中的指令往往是 Vague(模糊) 的。用户会说“帮我买杯咖啡”,而不是“打开某 App -> 点击搜索 -> 输入拿铁 -> 选择无糖 -> 支付”。
更具挑战性的是 Proactive(主动性)。一个优秀的 Agent 应该能在你走进办公室时自动准备好早报,或者在你 Friday Night 关闭闹钟。KnowU-Bench 的出现,正是为了衡量 Agent 是否具备这种“眼力见儿”。
核心架构:KnowU-Bench 的三大杀手锏
为了模拟真实的交互过程,KnowU-Bench 引入了一个精巧的评估框架:
- 盲盒推理(Hidden Profile):系统为 Agent 提供一段历史交互日志(User Logs),但隐藏了最核心的结构化偏好(User Profile)。Agent 必须像侦探一样从碎片的历史行为中挖掘出用户的习惯。
- 交互式用户模拟器(LLM User Simulator):如果日志里没写用户的口味怎么办?Agent 必须调用
ask_user行动。KnowU-Bench 内置了一个由 GPT-4o 驱动的模拟器,它会根据设定的“奶奶”、“研究员”或“开发者”等不同人设,对 Agent 的询问给出真实反馈。 - 混合评估管道(Hybrid Evaluation):单纯看操作轨迹是不够的。该框架结合了 Rule-based(确定性规则) 和 LLM-as-a-Judge(语义评判)。例如,订餐任务不仅要看订单是否提交成功,还要看是否选对了用户喜欢的那个 App。

实验洞察:模型们在输在哪里?
研究团队系统评估了包括 Claude Sonnet 4.6、Gemini 3.1 Pro 及 Qwen 3.5 在内的 11 个模型。结果令人吃惊:
- 能力断层:在简单任务(Easy General)中,模型几乎能拿满分。但在需要偏好推理的困难任务(Hard Personalized)中,Claude 4.6 仅有 44.2% 的成功率。
- 无效的交互:有趣的是,提升性能靠的不是“多问问题”。实验发现某些模型虽然问得多,但并不能有效转化成正确的操作。这说明 Preference Acquisition(偏好获取) 和 Execution(执行) 之间存在严重的脱节。

深度典型错误分析
- Clarification Failure (66.7%):Agent 往往在信息不足时盲目自信地操作,而不是停下来问一句。
- Intervention Calibration (80%):在主动任务中,模型要么表现得太如“受气包”般被动(Passive),要么表现得过度干预(Over-acting),在用户明确拒绝后依然铁了心要执行。
案例演示:一次完美的“反诈”拦截
在 Proactive 任务中,一个成功的 Case 是:Agent 监测到一条疑似诈骗短信,它没有等待用户下令,而是主动进入短信 App,识别风险对话,并执行了“拉黑并举报”的一套组合拳。这种 Initiative Calibration 正是未来个人智能体的核心竞争力。

总结与未来启示
KnowU-Bench 的价值在于它将手机 Agent 的竞争从“点击精度”拉升到了“理解深度”。这篇论文给工业界和学术界敲响了警钟:单纯通过增加训练数据来提升 GUI 导航能力已经边际递减。
未来的突破口在于:
- 更强的检索增强生成(RAG):如何从海量用户日志中精准提取偏好?
- 拒识与对齐(Refusal & Alignment):Agent 必须学会什么时候说“我不确定,需要问一下”。
- 长期记忆架构:构建一个能够随着用户使用而不断进化的“动态画像”。
正如作者所言,我们正在见证移动智能体从“合格的操作员”向“值得信赖的助手”跨越。
