Capture record

  • Canonical URI: https://research.google/blog/toolgrad-efficient-tool-use-dataset-generation-with-textual-gradients/
  • Source class: original research(Google Research 第一方研究說明,並以 arXiv/ACL Anthology 的同名論文頁與官方 GitHub repository 作來源核對)。本記錄保留來源陳述,維持 status: draft;本輪未重跑論文實驗或 BFCL 評測。
  • 原文標題: ToolGrad: Efficient tool-use dataset generation with textual “gradients”
  • 作者/出版者: Zhongyi Zhou、Ruofei Du/Google Research;同名論文作者另含 Kohei Uehara、Haoyu Zhang、Jingtao Zhou、Lin Gu、Zheng Xu、Tatsuya Harada。
  • 發布時間: Google Research 頁面標示 September 10, 2026;論文頁標示 ACL 2026 Findings。
  • 擷取時間: 2026-09-11T00:08:35+00:00
  • Retrieval method: 以 web_extract 讀取 Google Research canonical article、arXiv abstract/metadata、ACL Anthology abstract/metadata 與官方 GitHub README/repository metadata;以 Python urllib 直接 HTTP GET 核對四個來源的回應。未使用 browser。
  • HTTP metadata: Google Research direct HTTP status 200、Date: Thu, 10 Sep 2026 23:58:17 GMT、Content-Type: text/html; charset=utf-8、181,999 bytes。arXiv status 200、Date: Fri, 11 Sep 2026 00:07:22 GMT、Content-Type: text/html; charset=utf-8、41,445 bytes;ACL Anthology status 200、Date: Fri, 11 Sep 2026 00:07:23 GMT、Content-Type: text/html; charset=utf-8、43,601 bytes;GitHub status 200、Date: Fri, 11 Sep 2026 00:07:24 GMT、Content-Type: text/html; charset=utf-8、361,415 bytes。
  • Saved payloads and SHA-256: 無;僅保存本 wrapper。frontmatter 的 sha256 是本檔 frontmatter 結束後 body 的 SHA-256,不宣稱未保存的 HTML、論文全文、圖表、ToolBench 資料、BFCL payload、模型權重或執行環境可由此 hash 重建。

Faithful summary

Google Research 介紹 ToolGrad,一個用於生成 tool-use LLM dataset 的 agentic framework。它反轉常見的 query-first 流程:先建立可執行、有效的 tool-use chain,再為該 chain 標註對應的 user query;論文摘要將此稱為 answer-first approach。來源將傳統流程描述為先由 API pool 產生假設性 user instruction,再用 trial-and-error/depth-first search(DFS)尋找工具路徑,因而容易產生 annotation failure 與較高成本。123

ToolGrad 的迭代框架包含四個核心模組:API Proposer 從抽樣 API 集合提出可延伸目前 workflow 的候選;API Executors 平行測試候選並產生 execution reports;API Selector 依報告選出單一最佳 API call,作為提供方向的 textual gradient;LLM Updater 再修訂 synthetic user query 與 AI response,使其符合新的 API 集合。反覆執行後,樣本由 user query、已驗證 API workflow 與 final AI response 組成。1

在資料生成實驗中,來源以 ToolBench 的 16k+ real-world APIs 比較傳統 DFS query-first 生成與 ToolGrad answer-first 生成。Google Research 與論文摘要報告,ToolGrad 可生成更複雜的長時程 tool-use data、使用較低生成成本,並達到接近 100% 的 pass rate;這些數字是來源研究的 protocol-level 結果,本輪未取得完整實驗表格、統計區間或重現腳本執行結果。12

來源另建立 ToolGrad-500,使用 gemini-2.5-flash-lite 生成資料,並將其用於 Gemma-3 1B、4B、12B 模型的 fine-tuning,再以 Berkeley Function Calling Leaderboard(BFCL)評估不同工具集合上的 tool-use performance。Google Research 報告 ToolGrad-12B 得分 83.1,接近其列出的 gemini-2.5-pro 83.2 與 claude-4.5 Opus 82.8,且高於 gpt-5 74.4;來源也宣稱該模型優於未微調 baseline 與其他 open-source tool-use models。這些比較仍應讀作來源標示的 benchmark snapshot,不等於本輪獨立重跑或跨版本的通用排名。1

官方 GitHub repository 公開 ToolGrad 的 source code、dataset 與模型入口,README 標示 Apache License 2.0,並提供 MCP filesystem quick start;本輪只讀 repository metadata/README,未執行 demo、下載 dataset 或模型權重。4

Reusable extraction(raw-only;未升格 compiled)

這筆來源可保留一個 agent post-training 的 evidence boundary:把可驗證的工具路徑建構放在 user prompt 生成之前,可能比先生成 query 再搜尋路徑更適合擴展長時程 tool-use dataset;但訓練資料的 answer-first 偏差、API 執行環境依賴、工具集合變動與 unseen-tool generalization 必須分開評估。 實務上可把 workflow validity、query/workflow alignment、execution cost、long-horizon complexity 與 OOD tool performance 拆成不同評測欄位,再比較 query-first、answer-first 與人工資料。這是從來源研究整理出的 observational workflow guidance,不是已驗證的通用資料生成定律,也不更新既有 compiled concept。

Claim ledger

IDSource claimStatusOwning evidence and boundary
C01ToolGrad 採 answer-first:先生成有效 tool-use chain,再生成對應 user query。supportedGoogle Research、arXiv abstract 與 ACL Anthology abstract 明確描述此設計;本輪未重跑生成流程。123
C02ToolGrad 以 API Proposer、平行 API Executors、API Selector 與 LLM Updater 迭代建構 workflow,並以 textual gradients 提供方向性回饋。supportedGoogle Research 文章直接列出四模組與迭代步驟;本輪未取得完整論文方法章節或執行 trace。1
C03相較 ToolBench 上的 query-first/DFS baseline,ToolGrad 生成更複雜資料、成本較低且 pass rate 接近 100%。partially-supportedGoogle Research 與論文摘要支持來源研究的比較結論;ToolBench 16k+ API 規模、實驗設定、成本分母、pass-rate 定義與 confidence intervals 未在本輪完整核對或重現。12
C04ToolGrad-500 以 gemini-2.5-flash-lite 生成,並用於 Gemma-3 1B/4B/12B fine-tuning,再在 BFCL 的不同工具集合上評估。supportedGoogle Research 文章直接列出 teacher model、student sizes 與 BFCL 評測;本輪未取得訓練設定、data split 或 benchmark run artifacts。1
C05ToolGrad-12B 在來源列出的 BFCL snapshot 得分 83.1,接近 gemini-2.5-pro 83.2、claude-4.5 Opus 82.8,並高於 gpt-5 74.4。partially-supported數字由 Google Research 文章提供,屬特定 benchmark/模型版本的來源陳述;本輪未讀取 BFCL 原始結果頁、未確認 metric/版本與未重跑比較。1
C06在來源研究中,Gemma-3-12B 以 gemini-2.5-flash-lite 生成的資料 fine-tune 後可超過原 teacher model,呈現 self-evolving 敘事。partially-supportedGoogle Research 文章明確如此報告;尚無本輪獨立 reproduction,不能外推為一般 student-over-teacher 定律。1
C07ToolGrad 的 answer-first 框架已證明在所有 API 生態、OOD 工具與生產環境都優於 query-first 方法。unresolved來源只報告特定 ToolBench/BFCL 設定與其研究比較,未提供所有工具生態、production deployment 或廣泛外部 replication 證據。12
C08官方 GitHub repository 提供 ToolGrad source code、dataset 與模型入口,README 標示 Apache License 2.0。supported官方 repository metadata/README 可讀;本輪未下載或執行 code、dataset 與 model artifacts。4

Evidence boundary

本記錄支持的最小結論是:Google Research 於 2026-09-10 發布 ToolGrad 研究說明,提出 answer-first 的 tool-use dataset generation:先以 textual-gradient guided loop 建構並執行 API workflow,再生成相符的 user query;來源以 ToolBench 與 BFCL 報告資料生成效率、pass rate、tool-use complexity 與 fine-tuned model performance 的改善或競爭結果。arXiv/ACL Anthology 同名摘要支持 answer-first、接近 100% pass rate 與 ToolGrad-500 的研究摘要;官方 GitHub 支持 code/dataset/model 的公開入口。

本記錄不能證明 answer-first 對所有 API 生態、工具執行環境、模型家族或 production agent 都普遍優於 query-first;不能把 BFCL 83.1、83.2、82.8、74.4 直接視為跨版本、跨 harness 或跨 benchmark 的穩定模型排名;不能由來源文章補出完整成本分母、資料切分、超參數、失敗案例、statistical uncertainty、OOD 工具細節或安全性結果。論文全文、BFCL 原始 leaderboard/執行 artifacts、ToolBench data、ToolGrad-500 dataset、模型權重與 MCP demo 本輪未下載或執行。未加入 verified;本次只有 process-level source checks,沒有獨立 human verification。

Rights boundary

Google Research、arXiv、ACL Anthology 與 GitHub pages 是外部來源。本次只保存 metadata、繁中 faithful summary、claim ledger、必要的證據核對連結與 evidence boundary;未保存 Google Research 文章全文、論文 PDF、完整論文內容、圖表、ToolBench API database、ToolGrad-500 dataset、BFCL payload、模型權重或 MCP 執行資產。GitHub README 所述 Apache License 2.0 僅適用於 repository 授權範圍;各來源的網站內容、論文、資料集與模型仍受其各自版權、授權、資料使用條款與服務限制約束。canonical links 是後續查核入口,來源讀取不等於取得重製、下載或商業使用授權。

Footnotes

  1. Google Research,〈ToolGrad: Efficient tool-use dataset generation with textual “gradients”〉,2026-09-10;https://research.google/blog/toolgrad-efficient-tool-use-dataset-generation-with-textual-gradients/。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11

  2. Zhongyi Zhou et al.,〈ToolGrad: Efficient Tool-use Dataset Generation with Textual “Gradients”〉,arXiv:2508.04086;本次讀取 abstract/metadata 於 2026-09-11;https://arxiv.org/abs/2508.04086。 ↩ ↩2 ↩3 ↩4 ↩5

  3. Zhongyi Zhou et al.,〈ToolGrad: Efficient Tool-use Dataset Generation with Textual “Gradients”〉,ACL Anthology,Findings of ACL 2026;本次讀取 abstract/metadata 於 2026-09-11;https://aclanthology.org/2026.findings-acl.950/。 ↩ ↩2

  4. Zhongyi Zhou,〈zhongyi-zhou/toolgrad〉,GitHub repository;本次讀取 repository metadata/README 於 2026-09-11;https://github.com/zhongyi-zhou/toolgrad。 ↩ ↩2