Knowledge Profiling for Parametric Factuality
Knowledge profiling 把 LLM factuality 的評測單位從「某一題答對或答錯」改成「某個事實目前處於什麼狀態」。Google Research 的 WikiProfile 用 encoding、knowledge、recall 與 recognition 行為測試,區分模型是沒有把事實編碼進參數、無法直接取回,還是能在選項中辨認但難以自行生成。
五種知識狀態
來源把每個 fact 分成五類:
- Encoding failure:在接近 pre-training context 的 proposition completion/contextual questioning 中無法重現,表示事實可能沒有被編碼。
- Recall failure:事實已編碼,但在沒有外部提示時無法回答語意等價問題。
- Direct recall:不需額外 thinking 就能取回已編碼事實。
- Recall with thinking:開啟 thinking 後才取回原本無法直接生成的事實。
- Inference without encoding:沒有顯示直接編碼,但透過其他已知事實與多步推理猜出答案。
這個拆分避免把「模型沒有學到」和「模型學到了但叫不出來」混成同一種錯誤。它也把 open-ended generation 的 recall,和多選題中辨認正確答案的 recognition 分開;若 reverse question 在 recognition 可答、在 generation 卻失敗,問題更接近存取路徑而非雙向知識完全缺失。
評測方法與主要觀察
WikiProfile 從 Wikipedia 抽取 2,150 個 facts,每個 fact 配十個 encoding、knowledge、recall 與 recognition 任務;研究評估 13 個 LLM,在 thinking on/off 下各取八次回答,約產生 450 萬個 response,再以 prompted LLM autorater 評分。這個設計的價值是把 fact、提問方向、thinking 條件與回答型態放在同一個可診斷矩陣,而不是只留下單一 accuracy。
Google Research 報告的 frontier-model 結果顯示,Gemini-3-Pro 與 GPT-5 約有 95–98% 的 facts 已編碼,但仍有 26–34% 無法直接 recall;即使開啟 thinking,仍有 11–12% 失敗。來源因此提出一個重要但需保持來源歸屬的判讀:前沿模型的 factuality 瓶頸正從 knowledge acquisition 移向 knowledge utilization。模型規模能明顯降低 encoding failure,卻沒有同等消除 recall failure。
Thinking 是 recovery mechanism,不是免費正確性
Thinking 對 rare facts 與 reverse questions 的幫助最大,並可在 thinking-optimized LLM 中恢復約 40–65% 的「已編碼但不能直接取回」facts;對未編碼 facts 的幫助只有約 5–15%。這表示額外推論多半是在改善已存在知識的可存取性,而不是取代資料覆蓋或憑空增加知識。
因此模型/agent eval 不應只記錄最終答案:至少要分開記錄 encoding proxy、direct recall、recognition、thinking budget 與題目方向。這延伸 reasoning-for-factual-recall 對 computational buffer、factual priming 與 hallucinated intermediate facts 的觀察,也補強 test-time-compute-evaluation 對推論預算與能力曲線的要求。
對 AI Ark 的用法
- 將 factual error 拆成 acquisition、access、generation 與 recognition failure,避免用單一 benchmark 分數決定修模、補資料或增加 inference budget。
- 對長尾與 reverse-query 題目建立獨立 slice,檢查模型是否「知道但叫不出來」。
- 把 thinking 當成有成本的 recovery policy:比較 recall gain、token/美元/時間與失敗率,而不是預設越長越好。
- 將 fact-level trace、提示條件與 verifier 結果寫入 eval,讓 eval-is-spec 能指出應改善的是資料、prompt、post-training 還是 retrieval/verification。