ReasoningBank Agent Memory

ReasoningBank Agent Memory 是 Google Research 提出的一種 agent memory framework:把成功與失敗經驗都壓成可重用的 reasoning strategy,而不是只存完整 trajectory。它的重點不是「記錄更多」,而是「抽出更高階、可泛化的決策規則」。google-research-blog

核心結構

ReasoningBank 的記憶項目是高階、結構化的,重點欄位包含:

  • Title:策略名稱
  • Description:簡短摘要
  • Content:從過去經驗 distilled 出來的 reasoning、decision rationale、operational insight

這讓它更接近 agent-trace-observability 的用途:不是只留 debug log,而是把可回饋的失敗與成功訊號保留下來,供下一輪行動使用。

運作方式

ReasoningBank 的流程是一個 closed loop:retrieval → extraction → consolidation。

  1. 行動前先從 memory 取回相關經驗。
  2. 執行後用 LLM-as-a-judge 自我評估 trajectory。
  3. 從成功與失敗都抽取 insight。
  4. 把新的 memory 直接回填到 bank。

這個設計和 aiark-loop-engineering 的 watch / ingest / verify / synthesize 很像:都在強調可回溯、可重用、可迭代的 loop,而不是一次性輸出。

與記憶重構的邊界

BusinessNext 2026-08-04 對 MemHarness 的整理補上一個不同層次:agent-memory-reconstruction 不是把執行後經驗直接壓成 strategy,而是 agent 在行動前先把取回的 trajectory 和目前狀態比較,改寫成適用指引或輸出 <EMPTY>。ReasoningBank 解決的是「經驗如何被濃縮成可重用策略」;memory reconstruction 解決的是「這段策略現在是否適用,以及要怎麼改寫」。

兩者可以串成同一個 loop:先用 agent-trace-observability 保存 outcome 與 failure,將跨任務的高階規則沉澱到 ReasoningBank,再在下一次執行前用 current-state comparison 過濾、重構或拒絕取回的經驗。不要把 memory entry 數量或 retrieval 命中率當成 agent 變聰明的證據。

為什麼重要

這篇文章補了一個常被忽略的方向:agent 需要學的不只是「怎麼做對」,還要學「怎麼從失敗中萃取防呆規則」。它也把 test-time scaling 往 memory-aware 的方向推進,和 test-time-compute-evaluation 形成互補。

相關頁面