Nested Learning for Continual Learning

Nested Learning 是 Google Research 提出的 continual learning 設計觀:把一個模型看成多層、互相巢狀或並行的 optimization problems,而不是把 architecture 和 optimizer 當成兩件分離的事。每一層都有自己的 context flow、update frequency 與記憶目標;這讓模型可以在不同時間尺度上更新,降低新任務覆蓋舊能力的 catastrophic forgetting。

核心方法

文章把 optimizer、attention、memory modules 都重新解讀成 associative memory 的不同層級,並提出 continuum memory system:短期 attention、長期記憶、optimizer state 與 self-modifying loop 不是外掛功能,而是同一個巢狀學習系統中的不同更新頻率。proof-of-concept 架構 Hope 在 Titans / MIRAS 的 surprise-based memory 上再加深一層,讓模型可以透過 CMS blocks 與 self-modifying recurrent architecture 管理長上下文與知識整合。

和既有記憶頁面的邊界

這個概念補強 test-time-memorization:Titans / MIRAS 說明模型如何用 surprise metric 寫入長期記憶,Nested Learning 則把「哪些部件以什麼頻率更新」提升成統一設計框架。它也不同於 reasoningbank-agent-memory;ReasoningBank 是 agent 執行後把 traces 萃取成策略記憶,Nested Learning 是模型內部 architecture / optimizer / memory 的學習層級設計。

為什麼重要

對 AI Ark 的實務判準是:遇到「模型要越用越會」時,不要直接堆外部 agent memory。先判斷問題屬於 retrieval、trace distillation、test-time memory,還是模型架構的 continual learning;Nested Learning 提供的是最後一類的研究語言,適合連到 self-improving-harness 與 agent-post-training-workflow,但不應被過早產品化。

相關頁面