Bayesian Teaching for LLM Reasoning

Bayesian teaching for LLM reasoning 指的是:用明確的 Bayesian model 產生互動示範,讓 LLM 從 examples 中學會接近 optimal Bayesian inference 的信念更新,而不是只用 prompt 要模型「多推理」。google-research-blog 的文章用 flight recommendation 任務測試這件事:assistant 每輪要根據使用者選擇與回饋,逐步估計使用者對時間、航程、轉機與價格的偏好。

方法

研究先建立一個 Bayesian assistant 作為可計算的 optimal strategy:它維護使用者偏好的 probability distribution,並在每次使用者選擇後用 Bayes’ rule 更新。接著,研究把 LLM 的推薦行為和這個 Bayesian assistant 比較,觀察模型在 evidence update 上偏離 optimal posterior 的程度。

改善方法很小:用 1,000 個 simulated users,讓 Bayesian assistant 產生 recommendation traces,再用這些 traces 做 supervised fine-tuning。fine-tuned model 不只在原本 flight recommendation 任務更接近 Bayesian assistant,也能 generalize 到 wine recommendation 等新 domain。

為什麼重要

這補上 reasoning-for-factual-recall 與 test-time-compute-evaluation 沒有涵蓋的一段:reasoning 能力不只表現在多產生 tokens 或回想事實,也表現在模型是否能隨互動證據更新內部假設。對 agent 來說,這種能力直接影響 preference learning、decision support 與長任務中的策略校準。

它也和 user-simulator-evaluation 相鄰:如果 synthetic users 或 simulated environments 能提供可計算的 optimal policy,就能把 agent 評估從「像不像真人」推進到「偏離最優信念更新多少」。這比單點 accuracy 更適合觀察互動式 agent 是否真的從回饋中學到規則。

AI Ark 判準

  • 評估 agent decision harness 時,應分開看 final answer accuracy 與 belief update quality。
  • 若任務可建立簡化的 Bayesian / rule-based optimal assistant,可用它產生 traces 作為 SFT 或 regression baseline。
  • 不要把「模型有 chain-of-thought」等同於「模型會做 Bayesian update」;需要用互動回合、後驗估計與 domain transfer 驗證。

相關頁面