Coding Agent as Optimizer
Coding Agent as Optimizer 指的是:把 coding agent 當成一個外層優化器,讓它反覆「改程式 → 跑評測 → 比較指標 → 保留變好版本」,而不是只把它當成一次性產碼工具。aihao-blog 的文章把這個模式從 Karpathy 的 autoresearch 延伸到 Learning Beyond Gradients,核心都是同一件事:不更新權重,也能靠可編輯程式碼與明確回饋把系統越養越強。
2026-06-05 的 bnext 文章把這個模式推到更直接的現場證據:Anthropic 自述 Claude 已貢獻逾 8 成 production code,並把這種「AI 反過來幫 AI 開發」的趨勢稱為遞迴自我改進。這讓 loop-engineering 不只是 workflow 設計,也是一個能把模型輸出重新送回研發迴路的優化器問題。
AlphaEvolve:搜尋可驗證的結構,而不是直接生成答案
Google Research 對 AlphaEvolve 的案例補上一個高風險領域的邊界:coding agent 不直接生成完整數學證明,而是維護一群候選程式,評估它們產生的有限結構,再讓 LLM 把表現較好的候選往前演化。透過既有 proof framework 的「lifting」,有限結構的改進可以轉成複雜度理論中的普遍定理;這是 loop-engineering 的 search → execute → evaluate 迴圈在研究工作的具體例子。
這個案例的關鍵不是單次模型能力,而是可驗證的中間產物:AlphaEvolve 找到 MAX-4-CUT 的新 gadget 與更大規模的 Ramanujan graphs,最後仍用原始 brute-force 演算法確認正確性。研究團隊表示,branch-and-bound 與系統最佳化讓驗證速度提升 10,000 倍,但「驗證」仍是不可省略的瓶頸;這讓它和 empirical-research-assistance、agent-trace-observability 共享同一個判準:agent 的探索只有在成功指標、可追溯紀錄與獨立 verifier 都存在時,才算是可交付的改進。
Discovery Loop:從 coding optimization 到 scientific automation
BusinessNext 對 discovery-loop 的報導,把同一個 optimizer pattern 從 coding agent 推到科學研發:模型以「實驗、觀察、修正」循環探索更大的問題空間,先自動化機器學習研究,再考慮硬體、藥物與能源。這是產品與公司方向的來源歸屬,不是已驗證的通用科學發現能力。
可重用的邊界仍與 AlphaEvolve 相同:人類提供問題、限制與成功指標;agent 修改或產生可執行的研究產物;系統執行實驗並保留可比較結果;只有通過獨立 verifier 或可重跑檢查,改進才算交付。這也說明為什麼 loop-engineering 與 chain-of-evidence-autonomous-research 必須一起看:前者定義回饋閉環,後者約束研究聲稱不能脫離證據。
2026-08-21 的後續報導再補一道人類選題 gate:Jeff Dean 用 back-of-the-envelope calculation 先估問題的數量級,偏好相對既有路線有約 10 倍改善潛力、且大約落在「兩年可完成、二十年仍可想像解法」之間的研究窗口。對 optimizer 而言,這代表目標函數與實驗預算不能由 agent 自行決定;人類要先判斷問題是否值得解,再讓系統用 search → execute → evaluate 加速。
Jeff Dean:優化器的長任務與產品邊界
BusinessNext 2026-08-07 對 Jeff Dean 訪談的整理,補上 coding agent 作為 optimizer 的兩個限制。第一,代理在約十次工具使用後可能開始失準,所以不能只在終點驗收;要把 agent-skills、多個候選路徑、另一個模型的評估,以及持續測試放進每輪執行。第二,AI 新創的切入點不應只是通用模型已能完成約 20% 的任務,而是通用模型幾乎失敗、團隊卻能用專有資料、領域知識或可靠 eval 把成功率逐步推高的問題。這些是訪談與媒體整理的來源歸屬,不是獨立成功率 benchmark。
因此,optimizer 的目標函數不能由 agent 自行決定:人類仍要先定義問題價值、規格、錯誤代價與通過條件,再讓系統在可觀測的 search → execute → evaluate loop 中加速。這與 code-abundance-product-taste 的產品判斷、model-harness-fit 的模型周邊配對及 test-time-compute-evaluation 的任務級評估相連。
核心機制
- 人類提供高層目標與邊界。
- agent 修改可追蹤的程式碼或設定。
- 每輪都跑固定成本的 eval / test / simulation。
- 只有指標變好時才 commit 或保留。
- 失敗版本直接丟棄,避免把壞路徑累積成技術債。
這個模式跟 loop-engineering 很接近,但重點更偏向「優化器」而不是「流程封裝」:loop-engineering 關心如何設計閉環;這個概念關心閉環在做什麼計算。
AIHAO 駕馭工程第 7 篇把這個模式延伸到 self-improving-harness:如果 prompt、tool contract、schema 與 skill 都是可版本化的文字或程式碼,coding agent 就可以在固定 eval / regression gate 下提出 harness 改動。限制是 eval 必須可信,且每個改動都要能 diff、promotion、rollback,否則只是把 Goodhart 與過擬合自動化。
文章中的兩個極端案例
-
autoresearch:
program.md由人寫,train.py交給 agent 改。- 固定 5 分鐘訓練預算。
- 用驗證集分數決定是否留下改動。
-
Learning Beyond Gradients:
- 不訓練神經網路,改用 Codex 反覆改純規則程式。
- 在 Atari、MuJoCo、VizDoom 等任務上證明 heuristic learning 也能產生實際效果。
為什麼重要
這個概念補強了 agent-trace-observability 與 test-time-compute-evaluation 的一條共同主線:agent 不只是生成內容,而是藉由可觀測的回饋循環做優化。當 replit-agent-eval-scale 這類 eval 系統存在時,coding agent 才有機會從「產碼器」升級成「改進器」。