On-device Intent Extraction

On-device intent extraction 是讓個人裝置上的 ai-agent 從使用者的螢幕、操作與前後文推斷「使用者正在做什麼/想完成什麼」的工作流。google-research-blog 這篇研究的核心主張是:行動 agent 若每次都把 UI trajectory 送到大型雲端 LLM,會增加延遲、成本與隱私風險;更好的路線是把任務拆小,讓小型 multimodal model 在裝置端處理。

兩階段方法

  1. 單步摘要:對每個螢幕與使用者操作,用 sliding window 觀察 previous / current / next screens,回答螢幕重點、使用者剛做什麼、可能想完成什麼。
  2. 序列意圖抽取:把每一步摘要串成事件序列,再用 fine-tuned small model 產生一句整體 intent statement。

Google Research 特別指出,第二階段不直接吃 speculation,而是移除 speculation 並清理 training labels:如果摘要裡沒有出現某些 reference intent 細節,就不要訓練模型補上那些細節。這個設計把 hallucination 控制放進資料製作與中間表示,而不是只靠 prompt。

評估方式

文章用 Bi-Fact 把 reference intent 與 predicted intent 拆成 atomic facts,分別檢查「reference facts 是否被捕捉」與「predicted facts 是否被 reference 支持」。這讓錯誤可以被追到不同階段:是螢幕摘要漏掉細節、意圖抽取丟失細節,還是模型憑空補細節。

對 AI Ark 的意義

這個模式補上 personal-general-ai-assistant 的關鍵底層能力:個人助理要能行動,必須先能低成本、低延遲、低外洩風險地理解使用者當下意圖。它也延伸 edge-ai-harness:邊緣 AI 不只是模型跑在本機,而是要把任務拆解、中間表示、fine-tuning 與 fact-level eval 一起設計。

相關頁面