Emergent Tact(浮現的得體)

Emergent tact 是《Moral Mazes in the Era of LLMs》提出的現象名稱:不同能力/規模的 LLM judge 對職場信件的「得體」偏好會分化。BusinessNext 對該預印本的整理指出,小模型較偏好直白、不那麼含蓄的訊息,大模型則較偏好更間接、更有策略餘地的訊息;這不是「越大越正確」的定律,而是特定 HR Simulator 任務與 judge 設定下的整體趨勢。

研究情境

HR Simulator 讓使用者扮演虛構公司的 HR,在五種棘手職場情境中寫信;收信者、後續互動與評分由 GPT-4o 依情境 rubric 模擬。研究分析超過 600 封人類與 LLM 信件,報導的 GPT-4o judge 條件下,人類跨關卡平均通關率為 23.5%,Kimi K2 與 Qwen 3 分別為 54% 與 48%;但這些數字是媒體對 arXiv 預印本的轉述,不是獨立 benchmark,也不能直接解讀成人類溝通能力低於模型。

研究把信件風格拆成「同理」與「正式」兩個軸,並另標註 tact,也就是是否掌握溝通策略、避免把話說過頭或留下後患。來源整理的主要差異是:LLM 生成的信較集中在高正式、高同理;人類信件分布較分散。這種風格分布會影響 judge 的 pass rate,但不等於所有真實收信者都偏好同一種語氣。

Judge 偏好不是中性的 ground truth

研究的 10 個 judge 模型分析顯示,模型參數量或 Elo 越高,judge 彼此對信件排名的共識傾向越高;大、小模型之間的分歧,則多半與 tact 有關。來源也明確保留限制:差異在第 1、3、4 關較明顯,第 2、5 關未能同樣由 tact 解釋。

因此,eval-is-spec 應把 judge 偏好視為待校準的評測分布,而不是自動等同於人類標準。至少要記錄:

  • judge model、版本與 rubric;
  • 受評任務的場景、受眾與不可妥協的內容;
  • judge 之間的分歧,以及人類收件者是否同意該偏好;
  • 改寫前後的任務結果、語氣變化與可能的過度修飾。

單一 judge 的高分可能只代表更會迎合該 judge 的品味;若要把評測結果用於產品決策,應加入人類校準、跨 judge 比較與真實情境 outcome。

人機混合的寫作分工

來源最穩定的可重用結論不是「AI 比人會做人」,而是 人先決定策略,AI 再協助調整語氣。人類保留是否讓步、是否提出薪資等說服牌、要不要強硬投訴,以及想守住的關係與價值;LLM 則可協助把過於尖銳、混亂或不正式的草稿改成更清楚、較不刺人的版本。

這個分工要和 ai-cognitive-offloading-and-agency 一起看:把句子潤飾交給模型,不代表把溝通目的、倫理取捨或對外承諾交給模型。若使用者為了通過 LLM judge 而全面採用高正式、高同理的語氣,可能得到更高分,卻不一定更符合真實組織文化、收件者需求或投訴情境。

低同理、低正式的長尾

Qwen 3 30B 3A Instruct 在只收到「同理與正式都給 1 分」的指令時,難以生成低同理、低正式的咆哮信;加入人類低分信作為範例後才較能往該區間移動。這個結果提示模型的預設溝通分布可能排除某些人類會使用、但在特定情境仍有功能的表達方式。

因此,不能把「模型不常生成」當成「該表達永遠不應存在」。比較好的 workflow 是讓人先指出情境、目標與不可退讓點,再由模型提出數個語氣變體,最後由人依真實受眾與風險選擇;這也延伸 anti-sycophancy-prompting 的要求:不要只問哪一版最得體,要要求模型說明各版的假設、代價與可能誤讀。

對 AI Ark 的用法

  • 把 LLM-as-judge 的分數當作特定 judge/rubric 下的訊號,不當成人類溝通能力的總量測。
  • 在 prompt、skill 或寫作 workflow 中分開記錄 content strategy 與 tone editing,避免改寫偷偷改變原意。
  • 對涉及人事、投訴、談判或不可逆承諾的內容,保留人類 owner、收件者檢查與明確核准點。
  • 把 judge 分歧、人工退回理由與真實 outcome 回收進 ai-collaboration-compounding-workflow 或產品 eval,而不是只累積「高分範例」。

相關頁面