Agent Post-Training Workflow
Hugging Face 的 Training Agents 直播示範的一條實作路線:先用 coding agent traces 做 SFT baseline,再把訓練、紀錄與評估變成可重複的流程,而不是只停留在 prompt engineering。
核心步驟
- 先從 public coding traces 或自家 agent traces 產生訓練資料
- 用
apply_chat_template把 trace 轉成可訓練格式 - 在 completion-only loss 下 mask 掉 user tokens,只學 assistant 回應
- 先做 SFT baseline,再往 basic RL / environment RL 前進
- 用 HF Jobs 跑訓練,用 TrackIO 記錄每次 run
- 把 adapters / weights push 到 Hugging Face repository,最後用 held-out eval loss 挑 best run
為什麼重要
- 把 agent 改進從「一次性調 prompt」變成「可追蹤、可回放、可比較」的訓練流程
- 讓模型的改善有實驗紀錄,不只是主觀感覺
- 把 post-training 的基線先立起來,再決定要不要往更複雜的 RL 方案走
相關連結
- ai-agent — 這條流程的對象是 agent,而不是純聊天模型
- coding-agent-as-optimizer — 可以對照 agent traces 與優化迴圈的關係
- harness-engineering-for-ai-coding — 同樣關注訓練 / 執行 / 回饋的 harness 設計
- loop-engineering — 把改進、驗證、記錄串成閉環的更大框架