Agent Experience

Agent Experience(AX)指把 ai-agent 當成產品、平台、API、CLI 或文件的實際使用者來設計。aihao-blog 這篇文章的核心主張是:agent 已經會操作工具與服務,產品若只為人類 UX / 開發者 DX 設計,會讓 agent 花更多 token、走更多錯誤路徑,最後需要更多人工介入。

核心判準

AX 不看情緒滿意度,而看 agent 能否穩定完成任務:結構是否清楚、語意是否可預測、錯誤是否可恢復、輸出是否能被下一步工具直接使用。文章把 agent 可近用性類比成網頁無障礙:螢幕閱讀器需要語意結構,agent 也需要一致的介面、明確的狀態與可機器讀取的說明。

CLI / 工具設計原則

  • 工具輸出要有固定結構,避免只給人類看的漂亮文字。
  • 錯誤訊息要能指出下一步,而不只是描述失敗。
  • 文件、API、MCP、CLI 與權限邊界要讓 agent 能低成本探索。
  • 對高風險操作保留明確確認點,與 harness-engineering-for-ai-coding 的 guide / sensor 分工一致。
  • 先改善 agent 常用的最小介面,不要為假想場景建立大型框架。

和既有概念的關係

AX 是 agent-ready-data-governance 的產品介面版本:前者讓工具與服務可被 agent 操作,後者讓企業資料與流程可被 agent 理解。它也補強 loop-engineering:loop 不只需要觸發與驗證,還需要工具介面本身能回傳 agent 可行動的訊號。

generative-ui 則是 AX 的互補方向:AX 先把既有 CLI / API / 文件做成 agent 可穩定操作的介面,generative UI 讓模型依任務即時產生人類可互動的介面。兩者共同判準不是「介面看起來聰明」,而是任務狀態、工具邊界、錯誤修復與 fallback 是否能被 harness 管住。

natively-adaptive-interfaces 補上 accessibility-first 的介面判準:若 agent / multimodal UI 只是在固定產品外加輔助層,仍會留下 accessibility gap;更好的方向是把共設計、情境記憶、sub-agent 委派與即時 UI 調整做成原生 harness。

實體控制面:把 agent 狀態與核准動作放到手邊

BusinessNext 對 OpenAI 與 Work Louder 聯名 Codex Micro 的整理,提供 AX 的一個實體控制面案例:每個 Agent Key 以 RGB 顯示代理人的思考、執行、等待與完成狀態,按鍵、搖桿與旋鈕則分別對應 PR review、除錯、重構、接受/拒絕請求與 reasoning effort。這種設計把多代理的狀態投影和高頻操作移出聊天視窗,降低切換視窗的成本;它可視為 agent-event-streaming-format 中語意事件的硬體投影,而不是單純替聊天產品加一顆快捷鍵。

同一案例也暴露一條安全邊界:若「批准代理人存取權限」被綁在容易誤觸的實體按鍵上,AX 的低摩擦會反過來放大授權風險。因此 agent-facing control surface 應把狀態回饋、可逆操作與不可逆核准分開設計,並保留明確確認與可回查紀錄;實體介面不能取代 agent-trace-observability 或 harness-engineering-for-ai-coding 的驗證與權限 gate。這也是 model-harness-fit 的延伸:reasoning effort 這類模型旋鈕只有在任務級成本與完成率驗證後,才值得暴露成一個高頻控制項。

產品能力矩陣:先配對工作面,再選入口

BusinessNext 2026-07-21 整理 Anthropic 的 90 個使用情境,提供一個可重用的 AX 觀察表:跨工具與本機檔案的長鏈任務偏向 Cowork;既有 SaaS 資料與動作透過 Connectors;瀏覽器內的讀取、填寫與整理交給 Browser Use;固定領域規則放進 Skills;專案脈絡與審查標準集中在 Projects;需要讓使用者直接探索資料時再用 Custom visuals。這種分工比單純宣稱「支援 agent」更能檢查產品是否真的降低切換、探索與重複說明成本。

這份目錄同時暴露 AX 的驗收邊界:銷售 CRM、財務模型、法律文件、醫療研究與公司資料等案例,都需要人類審核、權限範圍、出處追蹤與不可逆動作的確認;官方/媒體列出的使用情境不是成功率、成本或安全性證據。對 AI Ark 而言,產品若要從 demo 進入 workflow,仍要接上 agent-ready-data-governance、agent-trace-observability 與 agent-skills 的資料、trace、skill 及核准 gate。

語音作為桌面 agent control plane

BusinessNext 2026-07-24 對 ChatGPT 桌面版語音的整理,補上 AX 的即時控制面案例:使用者用單一語音對話啟動、查詢與調整 ChatGPT Work 或 Codex 中背景執行的多個 agent,語音層負責低摩擦的即時互動,較重的推理與工具工作則在背景 thread 推進。這把 AX 從 CLI/API 的機器可讀介面延伸到「人用語音指揮、系統以事件回報狀態」的介面;設計上可連到 agent-event-streaming-format、loop-engineering 與 agent-trace-observability。

這個案例的可重用判準不是「有語音」本身,而是互動層與執行層是否分離、進度/卡關/結果是否能回到同一個控制面,以及權限是否仍受方案、工作區、作業系統與個別核准限制。macOS 的 Appshots 螢幕情境也提醒 agent-ready-data-governance:低摩擦的 context capture 可能帶出視窗中的機敏資訊,必須有明確啟用、組織停用與人工確認 gate;產品報導中的 GPT-Live 能力與 rollout 範圍則不能當成獨立的成功率或安全性 benchmark。

瀏覽器控制面與本機驗證

BusinessNext 2026-07-29 對 ChatGPT Chrome 擴充功能的整理,補上瀏覽器作為 agent control surface 的案例:Chrome extension 提供分頁、DOM、表單與登入狀態的操作面,桌面版負責連接 terminal 與本機檔案,Work / Codex 則分別承接研究整理與程式讀寫、測試、除錯。可重用的架構判準是把「人正在看的頁面」接到可驗證的執行環境,而不是把瀏覽器自動化誤當成獨立瀏覽器或萬能 agent。

跨分頁研究、新聞溯源、GitHub 專案檢查與 localhost UI 重現,都應保留來源、權限與執行結果,並在修改後重新跑 lint/test 或人工核對;這把 agentic-search-tool-curation 的來源策展接到 harness-engineering-for-ai-coding 的 sensor gate。陌生 repo 先檢查 License、README、安裝腳本與可疑遠端指令;涉及登入頁、表單、本機檔案或 CDP 時,仍需明確授權、可回查紀錄與人工確認。文章是產品教學與 AI 初稿整理,不是成功率、成本或安全性 benchmark。

長駐對話串作為 agent control surface

BusinessNext 整理 Jason Liu 的 Codex workshop,提供另一種 AX 控制面:把長駐 thread 釘選、命名並連到 memory、Skills、thread automation 與 Goal,讓人從逐次下 prompt 轉為管理可持續工作的 AI 隊友。語音輸入降低 context capture 摩擦,Appshots 則把視窗畫面與 accessibility 文字一起送入對話;可重用判準不是「功能越多越好」,而是人能否看懂目前狀態、讓 agent 接續工作,並在結果或卡關時回到同一個入口。

低摩擦控制面同時放大權限風險:文章中的 Slack、DocuSign、傳真與退款示範都取決於平台、登入狀態與管理設定,簽署文件、傳送敏感資料與付款仍應保留人工核准。Appshots 的 accessibility context、background automation 與 computer use 要和 agent-sandbox-architecture、agent-trace-observability 及 harness-engineering-for-ai-coding 的權限、trace 與 verification gate 一起設計,而不是把 AX 當成自動放行。

Computer-use agent:把工作交付放回原本的工具

BusinessNext 2026-08-12 對 Grok Bot 的整理補上另一種 AX 控制面:Bot 在雲端有自己的 computer,直接登入既有網站與工具,即使沒有好用 API 或 MCP,也能像真人一樣操作,並把 CRM 紀錄、發票處理或工程票單等成果落回實際工作系統。多個 Bot 可由幕僚長分派、互傳上下文,routine 則把示範過的步驟保存成下一次可重跑的流程。

可重用的驗收問題不是「能不能點擊畫面」,而是 agent 是否只在授權工具與帳號範圍內執行、狀態與中間產物是否可回查、不可逆動作是否仍有明確核准,以及失敗時能否交還人類。Computer-use 擴大了可操作的網站集合,也放大登入狀態、敏感資料、權限與 trace 風險;Grok Bot 仍是 early beta,產品能力與方案支援不能視為獨立成功率或安全性 benchmark。

Grok Bot:把 agent team 變成職務與權限契約

BusinessNext 的後續實測把 computer-use agent 的 AX 從「能不能操作網站」推進到「人能不能管理一支職務化團隊」:Bot 名稱應對應真人可擔任的職位,幕僚長負責分派,專責 Bot 依描述執行,研究、內容、工程、客戶與財務角色再各自定義輸出與停止條件。這種 role charter → delegation → review 讓人只需在一個控制面交代目標,但仍能知道誰負責什麼、何時回報、哪些動作必須拉人回來。

來源也把示範、排程與隔離邊界說得更具體:Teach a task 可把穩定步驟存成 routine,由時間或事件觸發背景執行;然而同一帳號下的 Bot 共用雲端電腦,拆成多個角色不代表有安全隔離。可重用的 AX gate 是 先限制工具/帳號與資料範圍 → 以低風險備稿或研究任務試跑 → 顯示中間產物與狀態 → 對外發送、付款、法律/合約與財務寫入停在人工核准,並接回 agent-skills、agent-sandbox-architecture 與 agent-trace-observability。

背景執行、工作面板與人工接手

BusinessNext 2026-07-30 整理 Gemini Spark,補上一個「個人代理控制面」案例:任務在背景持續執行,工作面板顯示進度、排程、檔案與技能/應用程式,使用者可以暫停、繼續,或打開遠端瀏覽器接手後再交還控制權。這種 AX 的核心不是讓 agent 永遠自動化,而是把長任務的狀態、卡點與可接管入口放在同一個地方。

可重用的驗收問題是:人是否知道 agent 讀了哪些資料、改了哪些檔案、下一步要做什麼,以及何時必須批准?Spark 可接 Workspace、搜尋與第三方服務,報導也提到共用文件編輯前要查看並確認;因此這個產品案例要和 agent-ready-data-governance、agent-sandbox-architecture、agent-trace-observability 一起看,而不是把 background execution 當成無條件授權。

BusinessNext 2026-08-05 的三個 Spark 實測把 AX 驗收具體化:啟用時先由 Workspace 工作痕跡建立 context 並提出任務建議;修改既有 Google Docs 時直接在原文件插入表格;整理電子報時則依重要性、時效性與風險做優先級判斷,而不是逐封壓縮摘要。這些案例顯示,長任務控制面除了顯示進度,還要讓人看懂 agent 使用的脈絡、改動的工件與判斷依據。

可重用的 AX gate 是先從低風險、可還原、規則明確的任務開始,確認資料範圍、輸出品質、排程結果與人工接手點,再擴大授權;產品實測仍是來源歸屬,不是獨立成功率或安全性 benchmark。

BusinessNext 2026-08-06 的 Gemini Spark 週報實測補上 AX 的「交付契約」:使用者要能知道 agent 讀取哪些 Gmail/Calendar/Drive 脈絡、產出的週報包含哪些欄位、何時執行,以及最後會寄給哪些人。這讓背景 agent 的控制面不只顯示進度,也要把輸入範圍、HTML 工件、排程與收件者做成可核對的狀態;可重用的驗收問題是「能否在寄出前發現錯誤並停止」,而不是只看產品是否支援自動寄信。

Claude Cowork:本機工作台與交付面

BusinessNext 2026-07-30 對 Claude Cowork 五種場景的整理,補上一個偏本機執行的 AX 案例:使用者在 Chat、Cowork、Code 三種模式間切換,先指定資料夾,再讓 Cowork 列出計畫、等待授權、在本機讀寫檔案並交付可開啟的報告、簡報、圖表或 Excel。可重用的判準不是「能做五種工作」,而是任務狀態、權限請求、進度回報與最終 artifact 是否都在同一個可檢查的工作面板裡。

這篇列出的資料夾整理、多份 PDF 綜合、報告轉簡報、CSV 清洗與收據轉 Excel,顯示 agent experience 的重點已從「回答得好」移到「能否在受限資料範圍內把事情做完」。本機檔案、刪除/移動權限與收據或產業報告等敏感資料仍需接上 agent-ready-data-governance、agent-sandbox-architecture 與 agent-skills 的資料邊界、變體測試與人工核對;產品功能與方案支援範圍是媒體/官方說法,不是成功率 benchmark。

回應介面:把下一步與狀態變成可讀訊號

BusinessNext 2026-08-03 對 i-have-adhd skill 的整理,補上一個比工具輸出更靠近對話層的 AX 判準:介面不只要回答內容,還要讓人第一眼知道下一步、每一步的時間與進度,以及卡住時的問題/原因/解法。這是把 agent-skills 的回應規則投影成使用者可操作的狀態介面;它降低理解與追蹤成本,但不等於所有任務都應只給單一路徑。

這種收斂式模式適合待辦、規劃與執行推進;創意發散時則應明確切回多選項與探索模式。可重用的驗收問題是:人是否看得懂目前狀態、下一步與預估成本?是否能暫停或切回發散?是否仍保留 ai-cognitive-offloading-and-agency 的目標、價值與高風險決策責任?來源的 ADHD 說明與 ChatGPT Skills 安裝行為仍需回查專業資料與官方文件。

可驗證 UX:讓人能快速校準信任

AIHAO 2026-08-05 整理 Hamel Husain 的案例,補上 AX 的另一個核心驗收面:使用者不只要看到答案,也要能用合理成本確認答案是否可信。若團隊覺得輸出「很難 eval」,應先把產品改成容易驗證,而不是只增加更強的 judge 或更長的 prompt;這與 eval-is-spec 的 application-specific criteria 互相約束。

可重用的介面 pattern 是 provenance → progressive disclosure → atomic review:每個主張連回來源或中間證據,初期展開假設與方法,之後可收合細節;輸出則拆成能個別接受、編輯、拒絕的單位。這種設計把資料分析的 notebook、課程計畫的 diff 與醫療報告的逐條 fact check 視為同一類控制面,也應接上 agent-ready-data-governance 的資料來源與 ai-cognitive-offloading-and-agency 的人類責任 gate。降低錯誤率不等於降低信任風險;AX 要量的是人發現錯誤、查回來源與做出是否採用決定的時間與可見性。

Hex 的資料 agent 案例補上一條邊界:notebook 的完整工作過程是技術使用者的驗證路徑,對不會 SQL/Python 的商業使用者卻不是充分證據。AX 因此要把「展示過程」和「可驗證信號」分開,讓 semantic model、受治理指標定義、可疑案例標記與資料團隊回饋形成較低認知負荷的 review surface;背景 ephemeral SQL 雖能減少雜訊,也可能讓 agent 口說無憑或在查證上失控。

無螢幕、環境式裝置的 AX

BusinessNext 2026-08-07 引述的 OpenAI 硬體曝光,將 AX 從 CLI、瀏覽器與桌面語音控制面推向沒有螢幕的環境式裝置:語音是主要輸入,麥克風、鏡頭與其他感測器提供 context,活動部件與收音燈則把回應/收音狀態變成可感知的實體訊號。這種介面可能降低 context capture 與日常操作摩擦,但也讓「我是否正在被收音、哪些資料被記住、agent 是否能看到周遭環境」成為 AX 的一級驗收項目;產品設計、價格、時程與能力仍屬報導歸屬。

可重用的 physical AX gate 是:狀態提示要比語音回覆更早且更清楚,記憶與感測器權限要能查閱/暫停/撤銷,不可逆外部行動不能因低摩擦而默認放行。這把 personal-general-ai-assistant 的個人化產品形態接到 personal-ai-agent-seven-layer-architecture 的多平台門面,也要求 agent-ready-data-governance 把 consent、retention、資料範圍與人工接管做成可驗證契約。

Cross-session messaging:把 session 狀態做成可操作介面

BusinessNext 2026-08-10 的 Claude Code cross-session messaging 把多 session 協作的 AX 問題縮成兩個控制面:ListAgents 讓 session 找到可聯絡的對象,SendMessage 讓 agent 代替使用者整理並傳送狀態摘要。可重用的 AX 判準是,訊息要能讓接收端在不取得完整歷史與檔案的情況下知道「誰通知了什麼、下一步可能是什麼」,同時讓人看得見收訊並保留 accept/hold/refuse。

這個案例也把低摩擦與權限分開:跨 session 訊息不能代替人類核准、不能修改 CLAUDE.md 或權限設定,重複訊息還要有節流與上限。若任務需要完整脈絡,產品應引導使用者改用 resume session 或可追蹤 artifact,而不是讓一段摘要偽裝成共享記憶;版本、平台與企業停用設定也應在介面上明確顯示。

Computer History:事件流記憶與可撤銷的 context capture

BusinessNext 2026-08-14 對 ChatGPT Computer History 的整理,補上一個以桌面活動建立個人 agent context 的案例:功能不錄螢幕或音訊,而是從 macOS 輔助使用事件取得點擊、打字、快捷鍵與應用程式切換,再整理成可查看、可修改的本機 Markdown 工作日誌,供 ChatGPT/Codex 跨對話找回檔案、進度與重複流程。這把 AX 的重點從「介面能不能被操作」推到「agent 取得的脈絡是否可見、可編輯、可限縮與可刪除」。

可重用的驗收 gate 是:先限定來源 → 顯示正在記錄什麼 → 可隨時暫停 → 可刪除既有記憶 → 再擴大範圍。不錄螢幕不等於資料只留在本機;來源同時列出明文記憶檔、互動事件上傳、網站 prompt injection、他人通訊同意與 token 成本等風險,因此要和 agent-ready-data-governance 的資料範圍、agent-sandbox-architecture 的不受信任輸入與 ai-cognitive-offloading-and-agency 的人類主導權一起驗收;這些產品功能與安全說明仍是 OpenAI/BusinessNext/外部媒體 attribution,不是獨立安全 benchmark。

ChatGPT Work:交付面與 cloud/local control plane

BusinessNext 2026-08-14 對 ChatGPT Work 的 14 個功能整理,補上 AX 從控制面到交付面的完整案例:Work 以雲端或本機電腦長時間執行任務,透過 Gmail、Calendar、Notion、Canva、GitHub 等 plugins 取得工具與資料,最後交付 PPTX、DOCX、PDF、HTML、試算表或可託管網站。Blocks、版本切換、/branch、語音、遠端語音、內建瀏覽器與多個 Work 視窗,則把同一個長任務的狀態、編修與接續入口放回工作面板;這是「goal → background execution → artifact → human review」的 AX pattern,而不是把聊天回答包裝成 agent。

這個案例最重要的 AX 判準是 先選執行環境,再授權工具:cloud 模式換來跨裝置接續與背景執行,但不應假設它能看到本機檔案;local 模式換來桌面軟體、本機檔案與瀏覽器操作,但電腦關閉就失去連續性。文章也把「多 agent 工作空間」限定為多個視窗並行,並承認信箱代操與 Notion 修改仍需低風險試跑;因此應讓人看得到執行位置、資料範圍、產物、失敗狀態與不可逆動作的核准點,接上 agent-sandbox-architecture、agent-ready-data-governance、agent-skills 與 cloud-agent-vs-localhost-agent,而不是只以功能數量評估 AX。

修訂版:功能清單不是採用順序

BusinessNext 2026-08-17 的同一篇文章修訂版,把 14 項功能明確拆成四類,並補上 Work/Codex 的入口差異、FAQ 與低風險採用順序:先做查信、擬稿、整理文件或公開資料研究,再逐步開放本機檔案、Skills、瀏覽器與外部動作。這個版本讓 AX 的驗收單位更具體:執行環境 → 工具與資料範圍 → artifact → 人工 review → 權限擴張,而不是以功能數量或「多 agent」標籤判斷產品成熟度;它也明確指出多視窗並行不等於官方 multi-agent 協作。

Gmail Connector:從草稿到可授權外部動作

BusinessNext 2026-08-19 報導 Claude 的 Gmail connector 從整理信箱、產生回覆草稿,延伸到直接寄送新郵件、回覆與轉寄。這是 AX 的重要邊界:agent 不只要能讀取 SaaS context,還要能在明確的工具、資料與收件者範圍內完成不可逆的外部 action。

來源描述的控制方式是預設逐次要求使用者同意;Team/Enterprise 管理者則可在組織層級決定是否讓特定帳號在特定情境關閉保護機制。可重用的 AX gate 是 限定資料與收件者範圍 → 產生草稿 → 預覽/人工核准 → 依組織政策送出 → 保留可回查結果,並接回 agent-ready-data-governance、ai-native-enterprise-governance 與 agent-sandbox-architecture;產品功能、方案資格與穩定性仍是 Anthropic/BusinessNext attribution,不是獨立成功率或安全 benchmark。

Design-first coding agent:把畫板變成實作前的控制面

BusinessNext 2026-08-19 報導 Claude Code /design 的早期預覽:開發者先用自然語言產生多張可編輯的介面畫板,挑選並修改其中一張,再讓 Claude 依畫板實作程式碼。這把 generative-ui 從「模型即時產生任務介面」接到 coding agent 的實作前階段,也把設計選擇變成可供人審查、編修與交接的 artifact,而不是一次性 prompt 結果。

可重用的 AX gate 是 產生候選 → 人選擇/編修 → 儲存設計 artifact → 實作 → 對照檢查。來源仍標示為 early preview,畫板是否能進入 repository/PR、既有 design system 能否載入,以及實作偏離後是否會自動修正,都尚未確定;因此不能把「設計稿看起來對」當成像素級或功能級驗證。這個 pattern 應和 loop-engineering、harness-engineering-for-ai-coding 的 artifact review、render/interaction check 與停止條件一起使用。

確定性指令與快捷鍵:把 agent 操作變成控制面

BusinessNext 2026-08-19 整理 Claude Code 官方文件,區分自然語言、斜線指令與快捷鍵的責任:自然語言適合表達目標與模糊意圖,/compact、/rewind、/context、/security-review 等指令則把壓縮上下文、回溯變更、檢查狀態與安全審查變成較確定的操作;Ctrl+C、Ctrl+R、Shift+Tab 等快捷鍵處理中斷、歷史搜尋與權限模式切換。這把 AX 具體化成「意圖用對話、可重複或高風險動作用明確控制面、狀態要可恢復」的選型規則,而不是把所有操作都塞進 prompt。

可重用的驗收問題是:控制面是否清楚顯示目前 context、權限與 checkpoint,是否能在失敗後回到可辨識狀態,以及多 agent/排程指令是否仍保留人類核准與 trace。這個來源的指令清單與 Claude Code 行為會隨版本變動,應和 context-engineering、dynamic-agent-workflows、agent-trace-observability 一起驗證,不能把媒體整理當成穩定 API 規格。

Codex adoption:能力存在,不等於產品化完成

BusinessNext 2026-08-24 整理 Sam Altman 對自己仍以舊方式使用電腦的反省:他手上已有 Codex,卻沒有把信件與待辦完整交出去。來源把這個落差解讀成產品化失敗,而非單純模型不夠聰明;人需要知道何時讓 agent 接手、它能看到哪些脈絡,以及結果如何回到原本的工作面。

這補上一條 AX 驗收規則:模型能力 → context acquisition → 可理解的控制面 → 可驗收的 artifact → 低風險採用順序 必須連成完整工作流。若 agent 只增加可用功能,卻沒有讓人看懂資料範圍、執行狀態、錯誤回復與人工接手點,使用者仍會回到舊方法;因此應和 context-engineering、agent-ready-data-governance、loop-engineering 一起驗證,而不是用模型 benchmark 或功能數量代替 adoption evidence。

AgentHands:把 agent 回應變成空間化、可驗證的動作

Google Research 2026-08-25 的 AgentHands XR prototype,把 AX 從文字、CLI 與平面 UI 推進到 spatially grounded embodied interaction:使用者以 eye gaze/scene reconstruction 建立 3D object registry,LLM 產生嵌在回應中的 GestureEvents,再由 headset 端 parser 依 word-level timestamps 同步語音、手勢與 visual effects。六維 taxonomy(handedness、gesture、spatiality、temporal dynamics、interactivity、visual effects)與 deictic/iconic/expression gesture library,提供比「模型輸出一段描述」更明確的 interface contract;這是 generative-ui 從畫面元件延伸到空間動作的案例,也和 agent-event-streaming-format 的 typed event/projection 思路相接。

來源報告 N = 12 的 within-subjects study,使用相同腳本比較 AgentHands 與 speech-only baseline;在物件定位、複雜動作理解、警告注意力與認知負荷指標上有顯著或正向結果。可重用的 AX 判準是:語言意圖 → 空間參照 → 同步動作 → 人能驗證的狀態訊號 必須形成閉環,否則 XR 只是把聊天搬進 3D;評估仍應接上 eval-is-spec 與 natively-adaptive-interfaces,並把小樣本、特定任務與 prototype 限制標出,不把 Google Research 報告當成通用 usability 或部署安全 benchmark。

Local-first agent:把資料外送做成可見的控制面

BusinessNext 2026-08-26 對 Perplexity Portable Computer 的整理,提供 AX 在 local-first agent 上的具體 gate:本地 runtime 先處理任務協調、規劃、工具呼叫、排程與搜尋索引;只有需要雲端資訊、瀏覽器、應用程式或前沿模型時才升級出去。升級前先由 PII classifier 列出哪些內容會離開裝置,再逐步請使用者同意,而不是用一次性的全域授權取代每一步的可見決策。

這把 AX 的驗收問題從「agent 能不能完成任務」擴成「人能不能看懂資料何時出門、為什麼出門、誰批准,以及失敗時是否停止」。若 OS-level sandbox 無法啟用,Portable Computer 會停用工具;這種 fail-closed 行為應和 agent-sandbox-architecture、agent-ready-data-governance 的權限、資料範圍與 trace 一起驗證。產品描述與 82.6%/85.4% harness 分數是 Perplexity/媒體來源歸屬,不是獨立 AX、隱私或效能 benchmark。

內建瀏覽器:從讀取到代辦的 browser-use control plane

BusinessNext 2026-08-27 整理 Paul J Lipsky 的 10 個 ChatGPT 內建瀏覽器示範,將 AX 從「讀取目前頁面」推進到「在授權範圍內替人完成多步驟工作」:摘要頁面、跑到卡住的線上流程、客服對話、跨分頁研究、瀏覽器與 connector 混用、跨 AI 查詢、沒有 connector 時的網站操作、完成通知、畫面元素修改,以及定時執行對外動作。可重用的 pattern 是 goal → browser observation → bounded action → human handoff → result,而不是把能點擊網站等同於可靠 autonomous agent。

來源同時區分三種 control surface:桌面 App 的內建瀏覽器在本機、雲端瀏覽器在 OpenAI 伺服器、Chrome extension 沿用既有 Chrome profile 與分頁。這條線會改變 context locality、登入狀態、background continuity 與人工接手方式;因此選型時應先問任務需要現有分頁與本機環境,還是需要電腦關閉後仍能執行,再接上 cloud-agent-vs-localhost-agent 與 agent-sandbox-architecture。

可重用的採用順序是先用 read-only 摘要與低風險流程試跑,再逐步授權登入網站、跨服務資料、排程與外部 action。明確指定 @Browser 可避免 agent 在瀏覽器與 connector 間選錯路徑;cookie/密碼匯入、網域白名單、服務條款、自動化阻擋、驗證碼與 prompt injection 則都要列入 permission gate。退款、寄送訊息、名單蒐集、訂位與下單等不可逆或高敏感行動不能因低摩擦而默認放行,仍應保留人工確認與可回查結果;產品教學與官方文件 attribution 不是成功率或安全性 benchmark。

Claude Cowork:獨立瀏覽器與網站任務委派

BusinessNext 2026-08-28 整理 Anthropic 的 Claude Cowork 內建瀏覽器:網站任務會在桌面 app 側邊欄開啟獨立瀏覽器,由 Claude 導航、閱讀、點擊與輸入,不必安裝 extension,也不會直接共享使用者原有瀏覽器的分頁、書籤與密碼。這補上 browser-use control surface 的另一種形狀:不是接管「人現在正在看的頁面」,而是把不依賴既有分頁的網站工作委派給一個獨立 browser identity。

內建瀏覽器與 Claude in Chrome 的分工可轉成 AX 的選型規則:前者適合報告研究、供應商入口與沒有 connector 的網站任務;後者適合使用既有登入狀態處理目前開啟的頁面。登入狀態採逐站轉移,銀行、電子郵件與 SSO 預設排除;因此「少裝一個外掛」不等於少一層權限設計,仍要檢查 identity scope、site allowlist、網站條款、不可逆 action 與人工接手。

這個案例也把 control surface 和 runtime 分開:內建瀏覽器位於 desktop app,web/手機端只有在桌面 app 開啟且連線時才能遠端驅動;它不是獨立的 cloud browser。官方同時承認瀏覽器內容仍可能帶入 prompt injection,雖有依使用者原始指令檢查動作的 safeguards,仍不能取代信任網站、低風險試跑、人工 review 與可回查 trace;產品能力與 rollout 是 Anthropic/BusinessNext attribution,不是獨立成功率或安全 benchmark。

ChatGPT Work:登入牆後的 cloud browser control surface

BusinessNext 2026-08-31 對 ChatGPT Work 的整理,補上 browser-use 從公開頁面到登入牆後網站的控制面:cloud browser 在遠端電腦執行,遇到登入時由使用者透過 secure sign-in form 輸入帳密與雙重驗證,模型看不到輸入內容;登入後 session 與本機瀏覽器分離,任務可在離開對話或關閉裝置後繼續,遇到需要輸入、登入或確認時則暫停。這些產品行為由 OpenAI Help Center 支持,BusinessNext 的 19 項範例是情境整理,不是完成率或效率 benchmark。

可重用的 AX gate 是 網站存取權限 → secure sign-in takeover → credentials 不進對話 → bounded task → consequential action confirmation → 結果/來源 review → 必要時清除 browser data。網站 access permission 不等於付款、預約或其他不可逆行動的授權;網站也可能封鎖自動化 agent,prompt injection 與 phishing safeguards 不能取代人工檢查。這把既有的 goal → browser observation → bounded action → human handoff → result 延伸到 authenticated workflow,但仍不能把產品方的隱私與安全聲明當成獨立稽核。

Memory as editable context control surface

BusinessNext 2026-08-31 整理 Claude Chat/Cowork 的 memory 更新:雲端 Cowork 與 Chat 使用同一套記憶,Topics 以個別短檔案列出保存內容,使用者可以閱讀、編輯、刪除、暫停或重設。這是 AX 從「agent 能否取得 context」延伸到「人能否看懂、修正與撤回 context」的控制面;產品示例的少重複說明不是成功率或生產力 benchmark。

可重用的 AX gate 是 顯示記憶範圍 → 逐項檢視/編輯/刪除 → 敏感主題明確 opt-in → 顯示 cloud/local runtime → 高風險任務前再確認。可見與可編輯降低了黑盒感,卻不保證記憶內容正確、最新或適合下一個任務;Team/Enterprise 的控制面也必須依當期 workspace 政策驗證。

OpenClaw 2.0:把 onboarding、對話與協作做成 control surface

BusinessNext 對 OpenClaw v2026.8.1 的整理,提供另一個 AX 案例:guided setup 先盤點電腦已有的 provider sign-in、API key 或 local model,驗證選定模型能回應後才保存;重寫後的 Control UI 則直接把第一次對話、持續設定與進行中的工作放在同一個入口。這個方向由 OpenClaw 官方 release notes 支持,但「降低門檻」仍是產品設計目標,不是新手完成時間或安裝成功率證據。

同一版本的 Cloud Session 把遠端執行與 Gateway-owned context 分開:使用者在一個 session 內追蹤工作,Gateway 保有 conversation、transcript、provider credentials 與已同步 workspace,遠端機器承接命令、檔案與工具工作。多人 ownership、presence 與權限角色能改善協作可見性,但官方明確把它們定位成 trusted-team guardrails,不是 hostile multi-tenant isolation;AX 驗收因此要同時看入口可見性、執行位置、context scope、權限與人工接手點。

Identity-aware connectivity:把 agent 的可達範圍做成 control surface

Network World 對 Tailscale 的整理補上一個 AX 的基礎設施版本:agent experience 不只在聊天介面、CLI 或 MCP schema,也取決於 agent 是否看得懂自己代表哪個 identity、可以到哪些 resource、權限何時生效,以及每次 tool/network action 如何留下 trace。Tailscale 的 Aperture、PAM、Control D、Tailcat 與 programmable tailnet 形成一組對照案例,但各產品的成熟度與安全效果仍是供應商/媒體 attribution。

可重用的 AX gate 是 identity → resource → policy/time → action → trace:先讓 agent-facing 介面顯示目前 identity、可達節點與工具,再把 JIT、approval、deny-by-default、credential injection、egress 與 audit 結果回傳成可行動訊號。這把 AX 接到 identity-aware-connectivity-platform、agent-ready-data-governance 與 agent-sandbox-architecture;網路可達不等於 agent 懂得如何安全完成任務,也不等於 output 已被驗證。

Agent as interface:軟體從固定 UI 變成可被 agent 呼叫的系統

BusinessNext 對 Salesforce/Anthropic Claudeforce 的整理,提供 AX 的企業系統案例:Salesforce in Claude 把銷售工作流帶入 Claude;Salesforce 官方則主張,資料、workflow、business logic、actions 與 governance 可經由 AIforce 的 MCP、API 與 CLI 供 agent 使用,且 action 仍透過 Salesforce 以協助套用規則。官方也列出 37 個預建 sales skills、select pilot 與預計 2026 年 9 月 open beta;這些是產品範圍與供應商控制主張,不是獨立完成率或安全 benchmark。

可重用的 AX pattern 是 user intent → agent reasoning → enterprise context → governed action → traceable result,而不是單純把畫面換成聊天視窗。驗收時要問:agent 是否看得見資料來源與權限、使用者是否知道它代表哪個 identity、不可逆 action 是否仍有確認點、結果是否回到原本的 system of record,以及入口或模型供應商變更時能否保留 context 與操作紀錄。BusinessNext 對 UI ownership、使用者行為資料與供應商議價風險的討論是觀察與推測,不能當作 Salesforce 已失去價值或 AI agent 已不可逆取代 UI 的證據。

這個案例也讓 AX 的選型不只看「介面是否低摩擦」,還要看 入口 ownership → context locality → permission/rule enforcement → action reversibility → audit/fallback → migration cost。MCP、plugin 或 headless API 能降低 agent 探索與串接成本,但若資料定義、規則執行、trace 或人工接手不透明,較順的入口反而可能放大平台依賴;因此應和 agent-ready-data-governance、ai-native-enterprise-governance 與 model-harness-fit 一起做任務級驗收。

對 AI Ark 的意義

這篇來源提供一個監測判準:當文章宣稱產品「支援 agent」時,應檢查它是否真的降低 agent 的探索、錯誤修復與工具串接成本,而不是只新增 API 或 MCP endpoint。對 wiki watch loop 來說,AX 可作為評估 agent 工具、CLI、平台與企業系統是否值得 ingest 的 reusable lens。

相關頁面