模型特化系統指令

這個概念指的是:不同模型需要不同的 system prompt / system instructions,不能把一套通用指令原封不動套到所有模型上。這支影片用 Hermes 原始碼與三篇研究/實驗做例子,強調模型差異會直接影響工具使用、指令接受度與整體效能。

核心觀點

  • Hermes 會針對部分模型額外注入不同系統指令,因為同一組工具設定在不同模型上,效果可能差很多。
  • 影片主張:對特定模型做精準調整,往往比冗長、通用、一次套用所有模型的指令更有效。
  • 影片提到的研究也支持這點:跨模型直接搬移已調好的 system prompt,效能可能下降約三成。
  • 對弱模型來說,好的指令與清楚的工具約束帶來的收益更大;但自動生成的指令不一定比人工整理更好。

設計含意

  • 做 agent / tool use 時,應該把「模型能力」視為 prompt 設計的一部分,而不是假設所有模型共享相同的最佳指令。
  • 指令不只要寫得對,還要考慮可遷移性、可維護性與 token 成本。這和 agentic-ai-cost-management 的上下文重送問題直接相關。
  • 這種「為模型量身調整」的思路,也呼應 build-for-next-model:prompt 與 scaffolding 需要隨模型演進持續修正,而不是永久固定。

Fable 5 的刪減型提示詞遷移

AIHAO 對 Claude Fable 5 官方 prompting guide 的整理,補上一個模型特化指令的反例:模型換代時,最佳 prompt update 可能是刪除,而不是新增。為舊模型規劃能力不足而寫的細步驟、強制 step-by-step、要求展示內部推理、以及過度大寫強調,在 Fable 5 上可能造成 overtrigger、fallback 或 refusal;應改成交代目標、理由、邊界、驗收標準與可驗證的停止條件。

這讓 model-harness-fit 更具體:system prompt 應和模型的 post-training 行為、API 參數與安全分類器一起測。Fable 5 的長時程 agent 指令重點是證據式進度回報、不可逆動作才停下來問、最終摘要寫給沒看過過程的人、不要讓 context 倒數誤導模型、以及用乾淨 context subagent 驗證成果;這些都應由任務級 eval 驗證,而不是假設舊 prompt 可直接搬移。

BusinessNext 對 Anthropic 工程師 Thariq Shihipar 的整理把這件事講得更狠:Claude Code 團隊直接把 system prompt 砍掉約八成,從規定它不能做什麼改成提供足夠背景與工具,避免範例和禁令綁住模型。這是 model-harness-fit 的刪減版實作,也說明 agent-instruction-files 與 harness-engineering-for-ai-coding 的 prompt/scaffold 應和模型一起演進,而不是越堆越長。

互動風格也是模型/harness 選型變數

BusinessNext 整理 Anthropic 對 309,815 則 Claude.ai 真實對話的分析:研究先把 3,307 種價值聚合,再降維成「依從/謹慎、溫暖/嚴謹、深度/簡潔、坦率/執行」四條行為軸線。不同模型與語言的回話風格確實有系統性差異,但四軸只解釋約 15% 的變異,不能把它誤讀成固定人格或能力排名。這補充 model-harness-fit:模型選型與 system prompt 不只要測準確率和成本,也要依任務定義想要的互動傾向,再用 eval 驗證。

GPT-5.6 Sol:從微管理轉向四要素

BusinessNext 2026-07-16 整理 OpenAI 提示詞指南的模型遷移訊號:GPT-5.6 Sol 可自行追蹤線索、比對與查證,因此把舊模型的逐步微管理原封不動搬過來,可能限制模型尋找更好路徑。文章將有效提示拆成 Goal、Context、Output、Boundaries 四個可按需填寫的模組,並建議只保留少數關鍵安全底線,把中間步驟交給模型,再以人工覆核重要結論。

這不是另一套固定 prompt template,而是 model-harness-fit 的遷移檢查:換模型時,重新用任務級 eval 測試「結果先行、少量邊界」是否比舊 scaffold 更可靠;涉及預算、法務、資安或對外發布時,仍要保留明確 approval gate。這也補強 prompt-debugging-eval-checklist 的版本化與 failure-case 修復流程。

相關頁面