Agent Memory Reconstruction
Agent memory reconstruction 指 agent 取回歷史經驗後,先拿它和目前狀態比較,保留適用部分、改寫成當下可用的指引,或直接拒絕整段記憶,再產生行動。BusinessNext 對 MemHarness 論文的整理把這個原則濃縮成:memory is reconstructed, not replayed。來源是媒體對 arXiv:2607.28272 的二手整理,論文數字仍應回查原始 paper。
三階段工作流
- Retrieval:依目前狀態從記憶庫取回相關經驗;來源案例使用 BGE-M3 embedding 與 top-3 檢索。
- Reconstruction:同一個 policy model 同時查看歷史 source state 與 current state,判斷哪些步驟仍適用,產生重構後指引;差異過大時輸出
<EMPTY>,拒絕負遷移。 - Action generation:只根據重構後指引與目前狀態行動,不把原始 trajectory 直接塞回 context。
這個結構把記憶系統的控制點從「存多少、找得快不快」移到「取回後是否能判斷與改寫」。它也要求記憶項目保留產生當時的狀態脈絡,而不只保存成功的行動序列。
來源報告的實驗訊號
MemHarness 文章轉述的 Qwen2.5-7B + GRPO 結果如下;這些是論文/媒體歸屬,不是本 wiki 的獨立重跑:
- ALFWorld:純 GRPO、無記憶 76.4%;原始記憶直接注入 70.1%;MemHarness 完整版 85.2%。
- WebShop:MemHarness 75.6%;文章報告其高於 Gemini-2.5-Pro,但比較基準與數字應回查原論文。
- 消融:拿掉重構模組後 ALFWorld 79.6%;以重構訓練、測試時不提供記憶仍有 83.0%,暗示重構訓練可能同時提升一般推理能力。
- OOD:文章報告完整 MemHarness 85.9%、原始記憶 76.3%;把 source state 隨機化時,拒絕率由 8.7% 升到 13.3%,支持模型確實使用狀態差異做判斷的解釋。
最有用的 eval 不是問記憶庫有多大,而是比較 raw replay、重構、拒絕不適用記憶與沒有記憶時的任務完成率、負遷移和 OOD transfer。這和 model-harness-fit 的觀點一致:memory policy 是 harness 的一部分,不能脫離任務分布與驗收指標評估。
可重用設計判準
- 記憶要和產生它的環境狀態、前置條件與目的綁在一起。
- retrieval 後要有適用性判斷,不要把成功經驗視為無條件權威。
- 明確允許 agent 說「這段記憶不適用」,必要時輸出空結果。
- 以任務結果、負遷移、OOD 表現與失敗 trace 評估 memory policy,而不是以儲存量或命中率代替品質。
- 先用小型、可重播的 benchmark 驗證重構是否改善完整任務,再考慮更大的 memory store 或更複雜的 critic。
和其他 memory 層的邊界
- reasoningbank-agent-memory 是執行後把成功/失敗 trajectory 萃取成高階 reasoning strategy;Agent Memory Reconstruction 是執行前對取回經驗做狀態條件化改寫。
- test-time-memorization 是模型在推論期間更新內部記憶模組;本頁討論的是 agent harness 中的外部經驗使用策略。
- agent-trace-observability 提供失敗步驟、tool result 與 outcome,讓重構規則能被轉成 eval;它不是記憶本身。
- context-engineering 管理哪些資訊進入 context;本頁再加上取回後的適用性判斷與拒絕路徑。
限制與不確定性
MemHarness 的來源實驗主要在 ALFWorld 與 WebShop 等結構化環境,文章整理的設定包含 7B base model、小型記憶庫、top-3 retrieval 與 AgentGym 冷啟動資料。它是否能直接轉移到開放式 software engineering、research 或長期客服任務,我不確定;需要在各自任務分布上重跑 eval。不要把「7B 加 harness 勝過較大模型」的媒體敘事當成普遍模型選型定律。