Agent Post-Training Workflow

Hugging Face 的 Training Agents 直播示範的一條實作路線:先用 coding agent traces 做 SFT baseline,再把訓練、紀錄與評估變成可重複的流程,而不是只停留在 prompt engineering。

核心步驟

  • 先從 public coding traces 或自家 agent traces 產生訓練資料
  • 用 apply_chat_template 把 trace 轉成可訓練格式
  • 在 completion-only loss 下 mask 掉 user tokens,只學 assistant 回應
  • 先做 SFT baseline,再往 basic RL / environment RL 前進
  • 用 HF Jobs 跑訓練,用 TrackIO 記錄每次 run
  • 把 adapters / weights push 到 Hugging Face repository,最後用 held-out eval loss 挑 best run

為什麼重要

  • 把 agent 改進從「一次性調 prompt」變成「可追蹤、可回放、可比較」的訓練流程
  • 讓模型的改善有實驗紀錄,不只是主觀感覺
  • 把 post-training 的基線先立起來,再決定要不要往更複雜的 RL 方案走

相關連結