Chain-of-Evidence for Autonomous Research

Chain-of-Evidence(CoE) 是 Google Research 在 Science One Framework 文章中提出的 autonomous research verifiability framework。它不規定 agent 必須採用哪種架構,而是要求研究產物的每個 claim 都有完整 evidence chain,且證據確實支持該 claim:引用要能回到真實論文,報告分數要能回到實際重跑的程式,方法描述要和真正執行的 code 對齊。

核心原則

CoE 把可信研究產物拆成兩個條件:

  • Completeness:每個 reference、數字、方法描述與結論都要附帶可追溯的證據鏈。
  • Correctness:證據鏈不能只是存在,還要真的支持它所綁定的 claim。

文章用三種 failure 說明這個邊界:phantom reference、無法重現的 score,以及論文宣稱的演算法和實際 code 不一致。這讓研究 agent 的品質從「文字看起來像論文」轉成可檢查的 artifact integrity 問題,也和 eval-is-spec 把行為寫成可驗收規格的方向一致。

Science One 的建構式驗證

Science One Framework 不在論文生成後才補 citation,而是在流程中原生建立證據鏈:

  1. Problem investigator:透過 Semantic Scholar API 建 citation graph,閱讀每個主題最多 100 份全文 PDF,讓最終引用來自 grounded research brief,而非模型記憶。
  2. Discovery engine:在平行 explore-exploit branches 中讓 Solver agent 實作解法,由 task-specific evaluator 評分;高分分支持續迭代,原始 evaluator output 保存為 read-only record。
  3. Paper writer and claim verifier:把 factual claims 綁定到 workspace artifact,由 Claim Verifier 逐項比對;若 claim 超出證據,改寫得更保守而不是任意補述。

這是一種把 agent-trace-observability 往研究產物延伸的做法:citation graph、solver branch、evaluator output、workspace artifact 都成為日後可重播與稽核的 trace,而不是只保留最後一份文章。

CoE Audit

CoE Audit 是針對 paper、solution、code 與 references 的 post-hoc forensic reviewer,包含四項檢查:

  • Score verification:從論文擷取分數,和獨立重跑 submitted code 的結果比較。
  • Specification violation:檢查程式是否真的解題,而非利用 evaluator metric 或讀取 ground-truth answer files。
  • Reference verification:透過 academic APIs 交叉檢查 bibliography,抓 phantom references。
  • Method-code alignment:用 LLM judge 對照論文 method section 與 code,檢查文字是否忠實描述實作。

這四項檢查把研究 agent 的「可相信」拆成能被驗證的 criteria,並能把每個 fail 轉成新的 eval-is-spec case。和 academic-workflow-agents 中 PaperVizAgent / ScholarPeer 的迭代檢查相比,CoE 更聚焦於研究 artifact、程式與證據之間的完整性與可重現性。

報告結果與限制

Google Research 報告 CoE Audit 對 ADRS benchmark 的 75 篇論文進行檢查;Science One 在該報告中四項 integrity checks 均領先,沒有 phantom references,並達到 perfect score verification 與最高 method-code alignment。來源也報告它在 MLE-Bench 與 Parameter-Golf 等外部任務維持競爭力,但這些數字屬官方文章對研究 prototype 的結果敘述,wiki 不把它當成獨立重現的 benchmark 證據。

Science One Framework 明確被標為 experimental research prototype,不是 production-ready tool。因此可重用的重點是「把 verifiability 當成一級 architectural constraint」與「在 claim 產生時建立 evidence chain」,不是直接宣稱所有 autonomous research agent 都已可靠。

AI Ark 的用法

在 loop-engineering 中,CoE 可作為長時程 research loop 的停止條件:沒有 citation、code、score、method 與 artifact 的可追溯鏈,就不能只因輸出文字完整而判定任務完成。最小實作可以先要求每個重要 claim 指向一個 raw source、執行紀錄、測試結果或可重跑 artifact,再逐步加入獨立重跑與 method-code alignment gate。

相關頁面