Data Science Agents
Data science agents 指能把自然語言資料分析需求轉成可執行程式、跑資料處理 / ML / visualization,並回傳模型、資料庫、圖表或文字答案的 agent。Google Research 的 DS-STAR 案例指出,這類 agent 的難點不只是會寫 code,而是要能理解異質資料格式、在開放式問題中建立可檢查的中間步驟,並用驗證迴圈避免錯誤計畫一路執行到底。
DS-STAR 的方法
- Data File Analyzer:先從 CSV、JSON、文字、Markdown 等資料檔抽取任務脈絡,避免 planner 只看檔名或乾淨表格。
- Planner / Coder / Verifier / Router loop:Planner 產生高階計畫,Coder 實作成程式,Verifier 用 LLM judge 檢查目前計畫是否足夠,Router 決定要新增步驟或修正錯誤。
- Sequential planning:模仿資料分析師在 Colab 逐步看中間結果再往下做,而不是一次生成完整 pipeline。
- Stop condition:迴圈直到 Verifier 認可或達到最多 10 輪,讓任務有明確停止條件。
Hex:資料 agent 的驗證與 context 迴路
AIHAO 整理 Hex AI 工程師 Izzy Miller 的分享,補上商業資料 agent 與 coding agent 的關鍵差異:資料分析的決策點是探索性的,答案也缺乏像測試或編譯器那樣明確的可驗證獎勵。Hex 因此從 single-shot text-to-SQL 轉向能產生一整本 notebook 的長時程 agent,但 notebook 展示過程只對會 SQL/Python 的技術使用者有效;商業使用者仍需要受治理的 semantic model、資產背書與更強的信心訊號。
Hex 的 reusable pattern 是 capability modules → context collection → tool / query execution → user or LLM feedback → context repair:Notebook Agent、Threads 與語意模型 agent 共享工具、靜態 context、prompt 片段與行為設定,Context Studio 再把可疑答案分群交回資料團隊修 guide、語意模型與 warehouse 說明。這把 data science agent 從「會產生程式」推進到「能在受治理資料上持續修正」,但 semantic model 不是 ground truth 的替代品;fan-out 等數字不合理的錯誤仍可能要由人先提出疑問才會被發現。
資料分析的三段驗證 gate
BusinessNext 2026-08-10 的資料分析案例補上一個更小、可直接放進 prompt 與 verifier 的 gate:先做資料健檢 → 確認比較基準 → 分開事實、推測與未知。文章用成交率 30% 的例子說明,AI 可能正確計算數字,卻因不知道母體、篩選條件與其他團隊的基準,做出沒有根據的「表現優秀」解讀;因此數字正確不等於分析結論正確。
可重用的 prompt contract 是:第一步要求程式實算缺失值、重複值、異常值、母體、納入對象、篩選方式與可能偏誤;第二步先問 KPI、歷史、公司平均、同業或其他團隊中哪一個才是可比基準;第三步明確標記資料直接顯示的事實、合理推測與目前無法判斷的部分,禁止把相關性直接寫成因果。這和 eval-is-spec 的 application-specific criteria、agent-ready-data-governance 的語意與資料 owner,以及 ai-cognitive-offloading-and-agency 的人類最後確認相連。
這個 gate 不能補回資料裡不存在的背景:有效商機定義、被排除的客戶、名單品質與公平比較仍須由資料 owner 或領域專家確認。對 data science agent 而言,最小可靠流程不是一次產生漂亮報告,而是把分析計算、比較條件、未知事項與人工核准保留在可回查的中間結果中。
長時程資料 eval
Hex 的目標型 eval 不只問自然語言能否翻成 SQL,而是在半完成 notebook 中埋入連鎖資料 bug,要求 agent 逐步排查;較長期的 Metric City 則讓倉儲每天變化、ticket 帶入新事實,觀察 agent 是否會整理可跨回合取回的 wiki。這類評測應同時看失敗模式、context 累積、回饋後修正與成本,而不是只看第零天 pass rate;來源中的模型數字與 benchmark 設計仍屬受訪者/媒體歸屬,不視為獨立 benchmark。
評估訊號
Google Research 用 DABStep、KramaBench、DA-Code 比較 DS-STAR、AutoGen、DA-Agent。DS-STAR 在 DABStep 從最佳替代方案的 41.0% 提升到 45.2%,KramaBench 從 39.8% 到 44.7%,DA-Code 從 37.0% 到 38.5%;優勢尤其出現在多檔案、異質資料的 hard tasks。
Foundation model adaptation 的 agentic classroom
SensorFM 提供另一種資料科學 agent 形態:先固定一個跨任務的 sensor foundation model representation,再讓協作與競爭的 LLM agents 反覆產生、執行、測試與修正 prediction-head code。Google Research 報告這個 classroom 探索超過 30,000 個候選解,agent-designed heads 在 20 個 classification tasks 中有 16 個、15 個 regression tasks 中有 12 個勝過簡單 linear probe。這把資料科學 agent 從「回答一次分析問題」延伸到「以任務指標搜尋可執行的 adaptation」,可與 wearable-health-foundation-models 一起閱讀。
Planetary Prediction Engine:地理空間資料科學 agent
Google Research 的 planetary-prediction-engine(PPE)把 data science agent 從異質檔案與 notebook 分析推進到 planetary-scale geospatial modeling:由 LLM 分階段編排 intelligent data selection、dataset curation,以及 AutoML & prediction。各階段以 well-defined inputs/outputs 與 opaque handles 交接大型資料 artifact,避免把中間資料序列化進 prompt;這是對 context window 與資料瓶頸的直接工程處理。來源在美國公共衛生、奈及利亞 food security 與 DRC Ebola nowcasting 報告不同任務的改善,但數字仍是來源 attribution,不等於獨立 benchmark。
PPE 補上本頁的另一個判準:資料科學 agent 不只要會執行分析程式,還要能在空間資料選擇、特徵工程、時間/地理泛化與高風險結果驗證上留下可回查的中間 artifact。它與 world-models 的 physical-world representation、eval-is-spec 的任務級驗收,以及 agent-ready-data-governance 的資料語意與權限邊界相連。
對 AI Ark 的意義
這個概念把 agent-ready-data-governance 往下接到實際分析任務:企業若希望 agent 做資料科學,資料不能只「人類看得懂」,還要讓 agent 能取得 schema、檔案語意、權限與可驗證中間結果。它也補強 loop-engineering 與 eval-is-spec:data science agent 的可靠性來自可執行程式、任務級 benchmark、Verifier / Router 回饋,而不是一次 prompt 產生漂亮結論。
風險與檢核
- LLM judge 不是 ground truth;開放式資料問題仍需要人類或外部指標驗證。
- 迭代輪數提升代表任務較難,也代表成本、延遲與 trace 量增加,應接到 agent-trace-observability。
- 異質資料格式支援會放大資料外洩與權限問題,應先定義 sandbox、讀取邊界與輸出審查。