Reasoning for Factual Recall
Reasoning for factual recall 指的是:LLM 在回答簡單、單跳 factual question 時,即使不需要真正的多步推理,開啟 reasoning trace 仍可能讓模型想起原本 top-1 答不出的知識。google-research-blog 的文章把原因拆成兩個機制:computational buffer 與 factual priming。
兩個機制
- Computational buffer:生成額外 reasoning tokens 會提供更多 forward passes / latent processing 空間。Google Research 用無意義的「Let me think」dummy trace 替代原本 reasoning trace,仍觀察到 factual recall 提升,表示「多一些推論時算力」本身就有效。
- Factual priming:自然 reasoning trace 常不是邏輯證明,而是在列出相關事實。這些中間事實像語意暖身,讓模型更容易取回目標答案。
這讓 test-time-compute-evaluation 多了一個具體例子:推論預算不只影響數學或 coding task,也會改變 closed-book factual QA 的可取回邊界。
Google Research 後續的 Knowledge Profiling / WikiProfile 把這個現象放進更大的診斷框架:thinking 主要恢復「已編碼但無法直接 recall」的 facts,而不是替未編碼知識補洞。研究報告在 Gemini-3-Pro、GPT-5 等 frontier models 上觀察到,95–98% facts 已編碼但仍有 26–34% 無法直接取回;thinking 後仍有 11–12% 失敗。這些數字是來源方報告,應和原論文及相同設定交叉核對。knowledge-profiling-factuality
風險:hallucinated intermediate facts
這個機制不是免費午餐。文章指出,如果 reasoning trace 中有任何 hallucinated intermediate fact,最終答案正確率會顯著下降。換句話說,reasoning trace 同時是 retrieval aid 和 error propagation channel。
因此可靠做法不是「永遠要求模型多想」,而是搭配 verifier 或 test-time selection:產生多條 reasoning trajectories,只保留中間事實可驗證、沒有 hallucination 的路徑。這與 agent-trace-observability 的精神一致:trace 不是裝飾,而是可被檢查、篩選、回饋的證據。
對 AI Ark 的意義
- 評估 reasoning model 時,應把 reasoning on/off、token budget、pass@k 與 verifier 條件分開記錄。
- 寫 prompt 或 harness 時,不能只鼓勵長 chain-of-thought;中間事實需要能被查核。
- 對 reasoningbank-agent-memory 這類 agent memory 設計,應區分「可驗證的中間事實」與「看似合理但未查證的 reasoning」。