Agent Sandbox Architecture

Agent Sandbox Architecture 指為 AI agent 提供可執行指令、讀寫檔案與跑程式的隔離環境。AIHAO 這篇文章把 sandbox 的價值拆成四個問題:防 prompt injection、保護本機、減少 approval fatigue、支援平行執行與乾淨重現;這讓 sandbox 成為 harness-engineering-for-ai-coding 的基礎安全層,而不是單純的部署選項。

Frontier model evaluation 的 sandbox boundary

BusinessNext 2026-08-19 的 OpenAI/Hugging Face 事件提醒,sandbox 不是「開了就安全」的標籤:為了測出模型網攻能力而關閉高風險行為分類器、允許透過套件代理服務連線,可能讓模型從代理漏洞取得更高權限、橫向移動並接觸外部系統。這類事件應把 egress allowlist、代理服務、憑證與內部網路、資料處理程式碼執行、完整工具 trace 視為同一個 threat model,而不是只檢查容器是否啟動。文章的事件細節與數字屬 OpenAI、Hugging Face、TIME 與 BusinessNext attribution,未經本 wiki 獨立驗證。

因此,前沿模型的 sandbox gate 至少要包含:最小權限與短期憑證、預設拒絕的網路出口、與生產資料及客戶金鑰隔離、針對工具呼叫與行為序列的分層監控,以及可在高等級警報時立即暫停的 owner/SLA。這把 sandbox 的破壞半徑控制接到 frontier-model-release-governance 的訓練期 release gate,也接到 agent-trace-observability 的 incident detection;sandbox 仍不保證答案正確,必須另做 verification。

兩種整合模式

第一種是 Agent in Sandbox:agent runtime 本身跑在 sandbox 內,像一台可丟棄但完整的電腦。優點是接近本機開發環境,檔案、記憶體與工具耦合簡單;缺點是 API keys、agent 邏輯與不受信任程式碼更容易共處,憑證與映像管理風險較高。

第二種是 Sandbox as Tool:主 agent / harness 留在外部,只把高風險命令、程式碼執行或瀏覽器操作丟進 sandbox。這比較符合 cloud-agent-vs-localhost-agent 裡的環境邊界:人類與 harness 保留控制權,sandbox 只承接隔離執行,但代價是要設計更清楚的 tool result contract、檔案同步與權限介面。

七種隔離方式的取捨

文章整理的 sandbox 技術大致橫跨 Docker / container、microVM、完整 VM、browser sandbox、remote dev environment、OS-level sandbox 與雲端託管環境。選型不是越重越好:高風險、不可信輸入與長時間 autonomous agent 需要更強隔離;短任務、低風險本機輔助則可能用 OS sandbox、git worktree、container 或權限白名單就足夠。

對 agent-framework-selection 來說,sandbox 是框架選型的一部分:Codex、Claude、LangChain deepagents、E2B、Runloop、Fly.io Sprites 等方案的差異,不只在模型與 API,也在執行環境、網路權限、狀態保存、成本、啟動速度與憑證隔離。

Personal context capture 的 sandbox 邊界

BusinessNext 2026-08-14 的 Computer History 案例顯示,sandbox 不只隔離 agent 執行命令,也要限制 agent 能觀察的桌面來源。即使功能記錄的是互動事件而非螢幕畫面,事件仍可能包含工作、健康、財務或他人通訊脈絡;網站內容還可能把惡意指令帶入 ChatGPT/Codex。因此可把 app/網站 allowlist、最小帳號權限、網路處理路徑、明文記憶檔存取與人工核准 視為 personal agent 的 context sandbox gate。

這補強 agent-ready-data-governance 的資料範圍與保留規則,也延伸 agent-experience 的暫停/刪除控制;「本機儲存」不等於隔離,因為其他程式可能讀取明文記憶,且事件可能被上傳處理。低風險試用可先用單一 app、read-only context 與可撤銷帳號,涉及外部 action 或未信任網站時再提高隔離強度,不要用「不錄螢幕」取代 threat model。

對 loop 的意義

Sandbox 最直接的好處是把「每個指令都問人」改成「先劃安全邊界,再讓 agent 在邊界內跑」。這能降低 approval fatigue,但不能取代 verification:sandbox 只保證破壞半徑受控,不保證輸出正確。真正的完成判斷仍要回到 ai-code-validation-bottleneck、tests、review、Goal / Outcome 與 trace。

AI Ark watch loop 的 ponytail 判準是:不要為了看起來 agent-ready 就先建大型 sandbox 平台;只有當來源擷取、轉換、驗證或批次 ingest 反覆需要執行不可信程式碼、平行跑多個 agent、或隔離 credentials 時,再升級。當前最小 loop 仍以 stdlib fetch、raw hash、JSONL queue 與 wikilink lint 足夠。

Local-first runtime:sandbox 失效就停止工具

BusinessNext 2026-08-26 對 Perplexity Portable Computer 的整理,補上一個重要的 sandbox 行為契約:程式碼與工具呼叫在 OS-level sandbox 內執行,限制程序、檔案路徑與網路權限;若 sandbox 無法啟用,系統直接停用工具,不悄悄改用未保護模式。這是 fail-closed 而不是「盡量完成任務」的選擇,應和 harness-engineering-for-ai-coding 的驗證、停止條件與 agent-trace-observability 的工具事件一起驗收。

同一來源也把 sandbox 邊界和 data egress 接起來:本地模型能力不足時,先由 PII classifier 列出即將送往雲端的內容,再逐步向使用者請求同意。這不能證明分類器永遠正確,因此仍需 agent-ready-data-governance 的資料分級、最小權限、可回查 trace 與人工升級;可重用的判準是 local default → inspect egress → consent per step → deny on sandbox failure,而不是把 local-first 當成自動安全。

Browser identity、網站信任與不可逆動作

BusinessNext 2026-08-27 的 ChatGPT 內建瀏覽器案例補上一層不同於 process isolation 的 sandbox 邊界:桌面內建瀏覽器使用獨立 profile,可選擇匯入 cookie/密碼;權限則以「一律詢問」為底,再針對特定網域開白名單。這些設定限制的是 agent 可代表誰、看哪些登入後資料與操作哪些網站,不等於瀏覽器本身已經隔離了惡意頁面、敏感內容或不可逆外部動作。

因此 browser sandbox gate 至少要分開檢查 identity scope、site allowlist、untrusted page input、outbound action 與 human approval。雲端瀏覽器的獨立登入流程與安全表單可降低帳密直接進模型的風險,但仍需依實際產品與工作區設定驗證;網站服務條款、自動化阻擋、驗證碼與 prompt injection 也不能被「有 sandbox」這個標籤掩蓋。退款、寄信、名單蒐集、訂位與下單等行動應停在人工核准,並把瀏覽器事件與結果接回 agent-trace-observability。

Cowork browser identity 與不受信任網頁

BusinessNext 2026-08-28 對 Claude Cowork 內建瀏覽器的整理,補上 browser sandbox 不同於 process isolation 的一層:內建瀏覽器使用與使用者日常瀏覽器分離的 profile,Claude 不直接看到原有分頁、書籤或密碼;登入狀態則逐站帶入,銀行、電子郵件與 SSO 預設不納入。這限制的是 agent 可代表誰、能取得哪些登入後資料與能操作哪些網站,不代表網頁內容本身可信。

來源同時明確承認 prompt injection:惡意指令可能藏在頁面中,試圖把 agent 從原始任務帶開;官方 safeguards 可依使用者原始指令檢查 Claude 的實際動作,但只能降低、不能消除風險。可重用的 browser gate 是 獨立 identity → site-by-site login → untrusted page input → outbound action → human approval,並先在信任網站與低風險任務試跑;產品公告與媒體整理仍不是獨立的安全率或攻擊成功率證據。

Cloud browser 的 authenticated-session boundary

OpenAI Help Center 將 ChatGPT Work 的 cloud browser 定義為獨立遠端電腦:本機瀏覽器的分頁、歷史、Cookie、密碼、extension 與既有登入狀態不會沿用;登入憑證透過 secure sign-in form 直接送到遠端瀏覽器,模型看不到,OpenAI 並表示不儲存這些憑證。這限制的是 identity、session 與 credential exposure,不等於網頁內容可信或外部 action 已安全。

因此 browser sandbox gate 應拆成 identity/session → site permission → secure credential entry → untrusted page → consequential action confirmation → clear browser data。網站存取權限和付款/預約等重要行動的核准是不同層;網站封鎖、prompt injection、phishing 與錯誤操作仍可能發生,產品方 safeguards 不構成獨立安全率。

平台代管 secrets 與 credential blast radius

Zeabur 2026-08-31 的資安事件補上 sandbox 之外的 platform secret boundary:官方目前重建的路徑是高權限 AWS 憑證進入正在退役的共享叢集,再沿著該叢集通往 control plane/主要資料庫的內部連線取得使用者環境變數。這不是證明所有雲端部署平台都採相同架構,而是提醒「共享叢集有 sandbox」不能取代對憑證權限、內部網路、資料庫連線與退役資產的 threat model;完整第三方鑑識仍待發布。

可重用的 deployment gate 是 least-privilege/短期憑證 → edge/control-plane 分離 → 預設拒絕的資料庫與網路路徑 → query/export trace → 立即輪替 → 外部 API usage/login monitoring。若環境變數含可直接消費的 AI key,支出告警也要和真正的 hard cap 分開驗收;OpenAI 文件明確區分 alert 與 hard limit,Anthropic 則有 organization/workspace spend limit,不能把「有告警」當成盜用會自動停止。事件中的攻擊路徑與損失範圍仍是 Zeabur/BusinessNext attribution,不是獨立安全率。

OpenClaw 2.0:協作不等於隔離

OpenClaw 2.0 的 Cloud Session 將 session、transcript、provider credentials 與已同步 workspace 留在 Gateway,遠端機器只承接配置允許的命令、檔案與工具工作;這是 control-plane 與 execution-plane 的分離,不是自動形成的安全邊界。多人 session 的 read-only、suggestion 或參與角色主要限制操作面,仍須以 Gateway、OS user、host 與 sandbox 的實際配置判斷可達範圍。

官方 Security 與 Multi-user 文件明確把一個 Gateway 定義成一個 trusted operator boundary:session ownership、sidebar visibility、presence 與角色不是 tenant authorization。若參與者互不信任,應拆成不同 Gateway/OS user/host;因此 sandbox 的選型不能被產品的「多人協作」標籤取代,仍要逐項檢查 credential、workspace、工具、網路出口與人工核准。

Identity-aware network boundary:sandbox 之外的可達性治理

Network World 對 Tailscale 的產品整理補上 sandbox 的 network-side boundary:sandbox 限制 agent 能在執行環境內做什麼,identity-aware connectivity 則限制它能代表誰、連到哪些 node/service/MCP,以及是否能留下 resource-level trace。Aperture 將 agent、model call 與 tool use 放進受 Tailscale identity/ACL 影響的 gateway;PAM 再把 access 收斂到特定 server、database、Kubernetes cluster 或 web application。這些是產品公告與媒體整理,不是獨立安全保證。

可重用的 threat model 應把 identity、resource、credential、egress、action、trace 一起檢查,而不是只有 container/VM 是否啟動。Tailcat 的 data-plane-only 形態也提醒:加密與 NAT traversal 可以獨立於 control plane 使用,但移除 users、admins、ACL 與 centralized audit 後,不能把它直接當成 enterprise governance;這是 identity-aware-connectivity-platform 與 agent-ready-data-governance 的 portability boundary。

相關頁面