Personal AI Agent Seven-Layer Architecture
Personal AI Agent Seven-Layer Architecture 是 侯智薰(雷蒙) 在 雷蒙三十 文章中提出的個人 AI 助理骨架。它把 ai-agent 從「會呼叫工具的模型」推進到「有規則、技能、記憶、使用者理解、自動化與多平台入口的個人 harness」。
七層結構
| 層級 | 白話比喻 | 主要內容 | 對應既有 wiki cluster |
|---|---|---|---|
| 1. 核心規則 | 員工入職手冊 | 身分、語氣、行為邊界、破壞性操作規則 | agent-instruction-files |
| 2. 技能 | 部門 SOP | 可重複任務的流程、範例、腳本與驗收條件 | agent-skills |
| 3. 精煉記憶 | 便利貼牆 | 每次開工都應看到的高價值偏好與環境事實 | test-time-memorization / agent-ready-data-governance |
| 4. 使用者畫像 | 對人的認識 | 使用者偏好、工作風格、習慣、品味與限制 | personal-general-ai-assistant |
| 5. 對話歷史 | 工作日誌 | 可全文搜尋或回查的專案脈絡與過往互動 | agent-trace-observability |
| 6. 生命週期自動化 | 反射動作 | 開始/結束/週期性事件觸發的 hooks 與 workflow | loop-engineering |
| 7. 多平台門面 | 對外窗口 | Telegram、Discord、手機、CLI 等使用入口 | agent-experience |
核心判斷
這篇的重點不是證明某個框架一定最好,而是把「個人 AI 助理」的品質從模型能力轉到 harness 設計:同一個模型,只有在工具、技能、記憶、歷史、hooks 與入口都能接上時,才會從聊天機器人變成可靠助理。
它也補上 harness-engineering-for-ai-coding 在 coding 場景之外的個人助理版本:coding harness 強調 verification、scope、test、CI;個人助理 harness 則更強調長期偏好、可攜 SOP、生活/工作 API 與多平台接觸面。
對 AI Ark 的用法
對 AI Ark wiki / monitoring loop 來說,這個七層框架可用來檢查常駐助理是否真的可長期運作:
- 規則層:有沒有清楚的 wiki schema、寫入邊界與分類規則。
- 技能層:是否把 ingest、YouTube STT、lint/audit 等流程封裝成可重用 skill。
- 記憶層:是否只保存長期高價值偏好,不把短期任務進度塞進 memory。
- 歷史層:是否能回查過往 session / log / raw provenance。
- 自動化層:watch → review → ingest → verify 是否有 deterministic gate。
- 門面層:Telegram / local files / public Quartz site 是否分工清楚。
Codex 長駐團隊案例
BusinessNext 對 Jason Liu Codex workshop 的整理提供一個產品工作流對照:AGENTS.md 對應核心規則,Skills 對應可重複 SOP,personal monorepo 的 projects/ 與 people/ 對應工作/人物記憶,git diff 對應歷史驗收,thread automation 與 Goal 對應生命週期自動化,語音與 Appshots 則是多模態入口。這個案例把七層從靜態架構圖接到長駐 thread 的實際運作,但仍是 OpenAI 員工的 workshop 自述,不是通用成功率或成本 benchmark。
可重用的限制是:記憶、排程與入口越完整,權限與驗證越不能只靠 prompt;不可逆動作仍要由 agent-sandbox-architecture、agent-trace-observability 與人工核准 gate 控制。這補強本頁原本的 loop-engineering 與 agent-experience 對應,也說明「個人助理 harness」不是把七層全部打開,而是依任務風險逐層啟用。
Gemini Spark 對七層架構的映射
Gemini Spark 的產品說明可當作七層骨架的另一個對照:任務與排程對應生命週期自動化,技能對應可重複 SOP,Workspace/搜尋/第三方服務是工具與資料入口,工作面板則保存進度、檔案、排程與技能狀態。遠端瀏覽器與程式碼執行提供行動能力,但「接手任務」、共用文件編輯前確認,以及個人帳戶/活動記錄條件,說明入口與自動化不能脫離權限和人工 gate。
因此,個人 agent 的七層不是產品功能越多越好,而是每一層都要有可觀測狀態與停止條件:記憶與活動記錄要能管理,技能要能撤銷或重測,排程要能暫停,對外動作要能由人接手。這把 agent-ready-data-governance、agent-experience 與 loop-engineering 接成同一個 personal harness 判準。
2026-08-05:從功能清單到可驗收工作流
BusinessNext 的 Gemini Spark 後續實測提供七層骨架的操作證據:Spark 從 Gmail/Calendar 讀取工作脈絡建立 context,將任務、排程、技能與 Connected Apps 組成背景流程,並在既有 Google Docs 上直接修改、把電子報依優先級整理成可寄送晨報。這表示個人 agent 的品質不只在於「有沒有記憶或工具」,還在於每層是否留下可理解、可回查、可接手的狀態。
實務上可先用低風險、可還原、規則明確的任務驗收:確認讀取範圍、修改前後差異、排程是否可暫停,以及何時交還控制權。這個 gate 同時連到 agent-experience、agent-ready-data-governance 與 ai-cognitive-offloading-and-agency;媒體實測不等於跨帳戶、跨模型或企業環境的 benchmark。
2026-08-06 的週報實測再補上七層之間的交付連線:Workspace 資料與使用者畫像提供 context,任務與技能定義輸出,排程觸發背景執行,HTML 週報與指定收件者構成對外門面。這表示「自動化層」不能只記得何時跑,還要能回查資料、產物與寄送對象;高影響的外部寄送仍需 agent-experience 的可見狀態、agent-ready-data-governance 的權限範圍與人工核准。
環境式硬體作為第七層門面
BusinessNext 2026-08-07 對 OpenAI 無螢幕 AI 硬體的報導,提供個人 agent 從軟體入口走向環境式裝置的對照案例:語音、麥克風、鏡頭與其他感測器承接 context capture,活動部件與燈光讓狀態有實體回饋,持續個人化則把使用者畫像與記憶帶入日常空間。這表示「多平台門面」不只是一個手機/CLI 頻道,也可能是沒有螢幕、以聲音與環境感知為主的 physical control surface;產品規格與上市計畫仍是來源轉述,不是已驗證的產品能力。
七層架構在這種形態下要多一個驗收問題:記憶與畫像是否能被使用者查看、暫停、刪除,收音/影像是否有清楚的狀態提示,外部行動是否仍保留人工接手?因此 physical facade 應和 agent-experience、agent-ready-data-governance 及 agent-sandbox-architecture 一起設計,而不是把「更像伴侶」當成個人化品質的替代指標。
Computer History:把歷史層接到記憶、技能與權限
BusinessNext 2026-08-14 的 Computer History 案例可映射到七層骨架的第 3、5、6 層:互動事件被整理成本機 Markdown 記憶,跨對話提供工作歷史,並從重複活動建議 Skill 或定時自動化。這個映射補上「歷史不是無限收集」的限制:使用者要能指定 app/網站、暫停、查看與刪除,且知道哪些內容會被上傳處理或帶入後續對話。
因此個人 agent 的完整驗收不是多一層記憶就算升級,而是每層都具備 scope、state、stop、delete、handoff:先以單一來源與低風險任務試用,再驗證記憶摘要、Skill 建議、外部 action 與人工接手;這和 agent-experience、agent-ready-data-governance、ai-cognitive-offloading-and-agency 及 agent-sandbox-architecture 形成同一條 personal harness gate。