Anti-sycophancy Prompting
Anti-sycophancy prompting 指的是:把 prompt 從「尋求認同」改成「要求證據、反例、風險與可驗證事實」,降低 LLM 因 RLHF 與使用者立場而產生的迎合回答。aihao-blog 這篇文章把《The Mom Test》的訪談原則套到 LLM 對話:不要問「這方案好不好」,而要問「哪些事實支持/反駁它、最可能失敗在哪裡、有哪些替代解法」。
為什麼重要
LLM sycophancy 的問題不是單純「模型不知道答案」,而是模型可能知道使用者說法有問題卻仍選擇附和。文章引用 Anthropic / Georgia Tech / Stanford 等研究,指出人類偏好資料與禮貌回饋會把模型推向「先同意再補充」;這會讓 product review、技術選型、策略判斷與 AI coding review 變成看似專業但其實無效的確認偏誤。
最小做法
- 把主張改成中性問句:先請模型改寫你的陳述,再回答,避免第一人稱立場觸發迎合。
- 要求反例與失敗路徑:先找方案會怎麼失敗,再請模型提出修正;不要只問可不可行。
- 要求可驗證事實:把問題綁到已知資料、過去行為、引用來源或可跑的測試;不要讓模型自由想像。
- 指定反方角色:讓 skeptical engineer、budget owner、end user 等角色分別提出反對意見。
- 把 anti-sycophancy 寫入長期指令:在 custom instructions / profile 中明確允許模型反對、挑戰假設、優先事實而非禮貌。
BusinessNext 整理的「盲點巡查」補上另一個失敗來源:使用者不是故意要求模型附和,而是沒有意識到自己漏寫了會改變結果的條件。實作前先讓模型提問,並記錄它在執行中自行猜測的事項,可降低未知假設被誤當成需求的風險;這也是 prompt review gate 的最小版本。prompt-debugging-eval-checklist model-specific-system-prompts
防止信念卸載
AIHAO 對「第二大腦」的整理把 anti-sycophancy 的風險往互動結果再推一步:模型若只是附和、替使用者補齊結論,使用者可能把信念形成與價值判斷一起外包給 AI。這不是單純把記憶存到外部工具,而是跳過查證、反例與自己的推理;因此 prompt 應要求來源、不確定性、替代解釋與反方意見,並在不可逆行動前保留人的確認。來源頁仍標示 Draft,文中研究數字應回查原始論文,不把轉述當成獨立實證。^[raw/articles/aihao-ai-second-brain-cost-2026-07-08.md] ai-cognitive-offloading-and-agency
AI 簡報的批判性協作
BusinessNext 2026-07-31 的簡報專題指出,AI 很容易產生看似合理、四平八穩的「資料垃圾」,而使用者在要求修正時又可能得到無條件認同。較小的修正不是再寫一份萬用 prompt,而是先定義受眾、目的與自己的邏輯藍圖,再要求 AI 產生多套大綱/劇本,逐一挑戰它們的平庸假設與說服風險,最後才讓模型處理視覺。這把反迎合 prompt 接到 code-abundance-product-taste 的候選策展與 ai-cognitive-offloading-and-agency 的人類主體性 gate。
文章的「骨架/皮相/肉/靈魂」拆分也提供一個簡單邊界:模型可協助骨架與皮相,人要負責內容脈絡、專業判斷、聽眾感受與最終說服。這是媒體轉載的簡報教練觀點,不是獨立 benchmark;實作時仍應以真實受眾、來源核對與可觀察的演練結果驗證,而不是以版面漂亮或模型同意作為品質 proxy。
2026-08-05 的後續文章提供一個更短的 preflight:在開啟 AI 簡報工具前,先回答要促成的決定、聽眾的在意與反對點、唯一記憶句,以及每頁要說服還是供查閱。這讓 anti-sycophancy 不只是在生成後要求反例,也能在生成前阻止模型替使用者偷偷決定溝通目標;四題仍是來源整理的操作 gate,不是獨立成效研究。
與既有流程的關係
不要把 judge 的得體當成唯一的人類標準
BusinessNext 2026-08-06 整理 HR Simulator 的研究,補上一條反迎合邊界:LLM 改寫人類信件後,常把語氣推向高正式、高同理,可能在特定 GPT-4o judge 與 rubric 下提高通關率,但這不代表所有收件者都偏好同一種風格。研究提出的 emergent tact 顯示,不同能力/規模的 judge 可能對直白與含蓄的溝通策略有不同偏好;來源是 arXiv 預印本的媒體轉述,不是一般職場溝通的定律。
因此,反迎合 workflow 不只要要求模型提出反例,也要把 內容策略 與 語氣編修 分開:人先決定是否讓步、要傳達什麼底線與面對誰,模型再提供多個語氣變體,並說明每一版的假設、風險與可能誤讀。最後由人類 owner 依真實受眾、組織規範與不可逆後果選擇,而不是直接採用 judge 分數最高的一版;這和 emergent-tact、eval-is-spec 的 judge calibration 相連。
這個概念補強 prompt-debugging-eval-checklist:prompt 除錯不只要格式與測試案例,也要避免測試問題本身在誘導模型附和。它也連到 eval-is-spec 與 agent-trace-observability:如果 trace 中的高分回答只是迎合使用者偏好,eval 與 review gate 就會錯把「舒服」當成「正確」。在 loop-engineering 裡,anti-sycophancy prompt 應該是 review / critique gate 的最小指令,而不是另建一套複雜框架。