AI寫信比人類更得體?研究揭「扮演HR」實測:AI比人類更懂溝通藝術,但寫不出超派咆哮信
AI寫信比人類更得體?研究揭「扮演HR」實測:AI比人類更懂溝通藝術,但寫不出超派咆哮信

請先想像以下的情境:

一名剛到職、公司很想留住的 L3 軟體工程師寫信來,要一間個人辦公室。公司規定個人辦公室只開放給 L4 以上主管,這件事沒得談。你是人資,必須回信拒絕,而且不能澆熄他剛進公司的熱情。

以上情境,是芝加哥大學團隊設計的遊戲「HR Simulator™」的第一關。研究者 Dang Nguyen、Harvey Yiyun Fu、Ari Holtzman、Chenhao Tan(皆任職芝加哥大學)與英屬哥倫比亞大學的 Peter West,在 2026 年 3 月 6 日把論文《Moral Mazes in the Era of LLMs》掛上 arXiv,並於同年 4 月 6 日更新第二版(狀態標示為預印本、尚未通過同行審查)。

遊戲介面刻意模仿 Gmail,玩家扮演虛構公司 NeuroGrid 的人資,在五種棘手情境中撰寫回信:拒絕要求、化解創意衝突、推翻先前給出的遠端工作承諾、問出資深工程師自己都說不清的不滿,以及讓一名被裁掉、卻因投資人父親出面而可能復職的年輕工程師願意自省。其中第 4 關可以是多輪往返,不是一封信就結束。

收信的角色、模擬後續發展、以及最後判定你過不過關的裁判,全部由 GPT-4o(2024-11-20 版本)扮演,依每一關專屬的評分標準表(研究上稱 rubric)判定成敗。

研究者分析超過 600 封人類與 LLM 寫的信,得到一個對人類不太體面的數字:在 GPT-4o 擔任裁判的條件下,人類寫的信跨五個關卡平均通關率 23.5%,Kimi K2 是 54%、Qwen 3 是 48%。中段模型 Gemini 2.5 Flash 與 GPT-4o 各 22%、Claude 3.5 Haiku 28%,與人類在同一個水準。

實驗設計
HR Simulator 的分工:人類玩家只負責寫信,收信、模擬後續、評分全由 AI 包辦,主要裁判是 GPT-4o。
圖/ Arxiv

這場考試真正在考什麼

論文標題借自社會學家 Robert Jackall 在 1988 年的著作《Moral Mazes》,那本書記錄的是企業裡不成文的溝通規則:說什麼不重要,怎麼說、何時說才重要。 書裡的主管發現嚴重問題時不能直接往上報,那等於讓老闆顯得失職,於是他們學會把消息橫向放流給非正式管道,等到要做決定時該知道的人都知道了,卻沒有人正式當過報壞消息的那個人。

對此論文寫得很直接:這種迂迴不是溝通失敗,這就是溝通本身。 可以說,人跟人溝通從來就是這麼內耗的事情。

換言之,職場書信的難處在於同一句話裡要同時做到互相拉扯的幾件事,溫暖但保持距離、明確但留有餘地。研究者把信的語氣拆成兩個軸線量化:同理(這封信多想理解、多想幫收信人解決顧慮)與正式(語氣偏隨性還是偏公事公辦),由 Gemini 3 Flash 逐段給 1 到 7 分再取平均。

結果是,LLM 寫的信高度集中在「高正式、高同理」那一格,人類的信則散得多。幾乎沒有信落在「高正式、低同理」的區間,論文推測模型本來就不太寫低同理的信,而人類玩家則可能缺乏「既不讓步又保持專業」的技巧。人類寫的低同理信通常同時也低正式,因為內容常常很衝、很敷衍,有時還帶著反覆失敗後的火氣。

但如果讓 LLM 改寫人類的信,整體上會把信推向高正式高同理那一格,原本離得越遠的,改動幅度越大。

人加 AI 常勝過人類,但不一定勝過純 AI

論文最容易被引用的結論是混合優勢:用 LLM 改寫人類寫的信,多數情況勝過人類自己寫。 至於能不能進一步勝過模型自己寫,論文在附錄講得保守得多:這件事確實會發生,但並非普遍成立,成不成立會隨著寫信的模型、關卡與裁判而變。

增益最大的是「人類搭配中段模型」,第 1 關裡,GPT-4o 與 Claude 3.5 Haiku 的通關率從 40% 一路拉到接近 100%。前段模型的增益比較溫和,Kimi K2 加上人類在第 2 關多了 25 個百分點,Qwen 3 加上人類在第 4 關多了 55 個百分點。論文把這個規律歸給「餘裕」:模型單獨寫就已經接近天花板時,改寫很難再往上疊。

更有意思的是研究者給出的解釋。他們另外標註了第三個維度「得體」(tact),它衡量的是溝通策略:這封信有沒有把話說過頭、留下後患。以第 1 關為例,得體的信會把重點放在開放式辦公的好處,不得體的信則想用降噪耳機這類表面福利補償對方。

把裁判 GPT-4o 最偏好的信抓出來看,它在第 1 關的得體區間落在 3.17 到 3.83 之間。人類的信平均 3.04,太不得體;Claude 是 4.28、Gemini 是 4.79,兩者都太得體。經 LLM 改寫後,Claude 版變成 3.89、Gemini 版變成 4.01,剛好落回區間附近,通關率也跟著跳升。反過來看,Qwen 的 3.28 與 Kimi 的 3.50 本來就在區間內,改寫就沒有額外好處。

大模型與小模型的分水嶺,是一句「你薪水比上一份高」

論文更值得拉出來的一段,是它換了裁判。emergent tact 這部分的分析共動用 10 個不同家族、不同規模的模型當裁判,GPT-4o 本身也是其中一員,強弱跨度從小型開源模型一路到當前第一梯隊。

第一個發現是,模型參數量越大或 Elo 分數越高(Elo 是借自西洋棋的排名方法,讓信兩兩比較、贏的加分),兩兩裁判之間對「這封信過不過關」的判斷就越一致,最強的一批達到約 0.5 的 Krippendorff's α,也就是校正過猜對機率之後的一致程度達到中等水準。

第二個發現才是關鍵。研究者把「兩個裁判給同一封信的排名相差 20 名以上」定義為分歧,發現絕大多數分歧發生在大模型與小模型之間,而非同級模型之間,而分歧的性質就是得體:小模型偏好直白、不那麼得體的信,大模型偏好含蓄、更得體的信。

這個現象論文命名為 emergent tact,直譯是浮現的得體。不過這是整體趨勢,不是普遍定律:落差在第 1、3、4 關比較明顯,論文附錄自承,得體定義在第 2、5 關沒能同樣解釋分歧。

具體是什麼樣的分歧?回到第 1 關那封拒絕信。玩家手上其實有一張說服牌,可以提到這位新人在新職位的薪水比前一份工作高,藉此喚起對方的感激,先一步堵住後續議價。但論文作者判定這個策略非常不得體、而且帶有被動攻擊性,而這正是大小模型的分水嶺:小模型偏好用了這招的信,大模型反感。

為確認這條線真的是「得體」,研究者另外用相近的「禮貌」標註同一批信,發現「禮貌」無法像「得體」那樣把大小模型分開。

AI難以寫出來的信:咆哮信

研究者還反過來問了一個問題:有沒有 LLM 寫不出來的信? 這個問題的測試對象只有一個模型,Qwen 3 30B 3A Instruct,目標是看它能不能寫出「低同理、低正式」的信(可以想像成投訴性質的咆哮信)。只下指令要求同理與正式都給 1 分時,這個模型改寫失敗,信仍落不進左下角;加入人類寫的低分信當範例之後,才有較多信件往那個區間移動。

但模型對人類寫的低分信困惑度(perplexity,大致是「模型看到這種寫法有多意外」,數字越高代表越不像它會產出的東西)極高,無範例時 38.96,有範例時仍有 10.80,而它對自己生成的低分信只有 2.38。範例大幅降低了困惑度,模型仍然很難模仿這種寫法。

論文為這一格說了句公道話:低同理低正式的信在企業裡看似不得體,換到別的情境卻有必要,例如投訴一間官僚積習很深的公司,可能只有把話說得很重才傳得進去。這種信人類自己也難拿捏,反而適合靠 LLM 協助編修,形成另一種人機互補。

結論:棘手信件怕失禮,給AI順一順沒壞處

總結來說,這篇論文真正的價值不在人類與 AI 的高下,而在它記錄了一件正在發生的事:讀信、篩信、判斷信寫得好不好的角色,正在換人。 研究者在結論寫道,若模型成為職場書信往來的核心,理解這個新地景很重要,才能確保職場溝通規範是被刻意選擇的結果,而不是被 LLM 的天性推著走。

23.5% 這個數字量到的,比較接近「人類多不擅長討好 GPT-4o」,未必是「人類多不會做人」。而當裁判換成能力較強的模型後,信件偏好可能從偏直白轉向偏含蓄,這意味著寫信的人如果開始為模型的品味調整寫法,很難保證讀信的人類感受真的會比較好。

那到底怎麼寫信最得體?論文給的路已經算務實:人先寫,AI 再改。人決定要不要打出那張說服牌,AI 把語氣調到不刺人。

延伸閱讀:黃仁勳兆元宴永遠站最後一排!最低調的二代鄭平,憑什麼讓台達電被市場重新定價?

本文初稿為AI編撰,整理.編輯/ 李先泰

關鍵字: #ai人工智慧
往下滑看下一篇文章
數聚集團首創「聲量、流量、存量」行銷飛輪,打造企業專屬 AI 成長引擎
數聚集團首創「聲量、流量、存量」行銷飛輪,打造企業專屬 AI 成長引擎

在高度碎片化的年代,企業行銷,不該是短跑,而是一場需要團隊默契的接力賽。

從社群平台、通訊軟體、搜尋引擎,再到網紅、短影音等,消費者與品牌的接觸點愈來愈碎片化。為了追求更好的行銷成效,企業陸續導入口碑行銷、廣告投放、會員經營等不同策略,並搭配各式各樣的 MarTech 工具,希望精準掌握每一次與消費者互動的機會。

然而,這些行銷策略就如同接力賽的跑者,雖然每一棒都努力衝刺,卻常常無法將成果順利交給下一棒,口碑、廣告與會員經營往往分屬不同負責人、使用不同平台,不僅數據散落在不同系統、跨部門協作成本高昂,一旦負責人員異動,累積多年的實戰經驗也容易隨之流失,使企業難以將每一次投入轉化為長期成長動能。

擁有 20 年行銷實戰經驗的數聚集團創辦人張元溢(Mars),看見許多企業投入愈來愈多工具與預算,卻始終無法累積真正的成長資產。他直言:「工具越多,不表示結果越好。」真正的競爭力,在於建立一套能整合數據、沉澱經驗並持續優化的成長機制,讓每一次行銷投入都成為下一次決策的養分,形成能不斷學習、自我進化的成長閉環。

基於這樣的理念,他整合旗下 Reddoor 紅門互動、Justar 數聚國際與 INLY 影領三大品牌,成立「數聚集團」,並提出全台首創的「聲量、流量、存量」行銷飛輪,串聯品牌曝光、流量轉換與會員經營三大階段。並整合第一方、第二方、第三方數據與生成式 AI,協助企業打造能自主學習、持續優化的 AI 成長引擎,讓品牌成長不再仰賴一次次重新開始,而是形成能持續累積價值的商業飛輪。

#2數聚集團首創「聲量、流量、存量」行銷飛輪,打造企業專屬 AI 成長引擎
數聚集團創辦人 張元溢
圖/ 數位時代

從聲量、流量到存量,打造會持續成長的品牌飛輪

達摩媒體暨影領國際執行長林合政(Adam)指出,企業在不同成長階段都有明確的經營目標,例如建立品牌聲量、透過廣告帶動流量,或深化會員經營、提升顧客價值。然而,任何一項策略都不可能無限放大成效,當成長逐漸趨於飽和,就需要下一個階段接力,才能持續創造新的成長動能。

林合政表示,真正重要的,不是哪一個環節最成功,而是每一個環節都能為下一個階段創造價值。 當品牌聲量帶動流量、流量沉澱為會員資產,再透過會員口碑與數據反哺品牌影響力,便能形成持續運轉的品牌飛輪,而不是依賴一次次的廣告投入。

#3 數聚集團首創「聲量、流量、存量」行銷飛輪,打造企業專屬 AI 成長引擎
達摩媒體暨影領國際執行長 林合政
圖/ 數位時代

數聚集團品牌長蔡雅藍(Blue)進一步拆解品牌飛輪的運作架構。第一步,由 INLY AI 網紅媒合平台快速媒合適合的創作者,以內容建立品牌信任與市場討論度,為品牌累積第一波成長動能。

#4 數聚集團首創「聲量、流量、存量」行銷飛輪,打造企業專屬 AI 成長引擎
數聚集團品牌長 蔡雅藍
圖/ 數位時代

接著,由 Justar 數聚國際接力擴大市場觸及,透過數位廣告、線下媒體與多元渠道整合,精準接觸潛在受眾,將品牌關注轉化為實際流量與訂單。

當新客成功導入後,再由 Reddoor 紅門互動透過會員經營、數據分析與自動化行銷,提升顧客黏著度、回購率與終身價值,將一次性的流量沉澱為可持續經營的品牌資產。

最後,再透過 MGM(Member Get Member)會員推薦機制,讓忠誠會員主動分享使用體驗、推薦親友,進一步帶動品牌討論與新客加入,形成「聲量 → 流量 → 存量 → 聲量」持續循環的品牌飛輪。 張元溢表示,這套飛輪並非一開始就規劃好的商業模式,而是數聚集團二十多年來陪伴品牌成長、持續驗證與優化後逐步發展出的成果。

「我們最早做的是廣告,後來客戶開始需要口碑;當口碑做好了,又開始思考如何留下會員、提升回購。」他回憶,團隊每一次拓展服務,都不是為了增加產品線,而是在陪伴客戶成長的過程中,看見下一個真正需要解決的問題,也因此逐步收斂出如今的「聲量、流量、存量」品牌飛輪。

從 Data Lake 到 Vibe Marketing,AI 開始接手整個行銷流程

飛輪要能持續運轉,關鍵不只是串聯聲量、流量與存量,更在於每個階段產生的數據能否真正累積。為此,數聚集團打造 Data Lake(數據中台),整合會員、廣告等第一方數據,並串接第二方、第三方資料,將原本分散於不同系統的資訊,匯聚成企業專屬的數據底座。

「現在大家都在談第一方數據,但企業真正缺的,其實是把不同來源的數據整合起來。」張元溢表示,除了企業自身累積的會員資料,數聚集團也串接發票數據、線下渠道等外部資訊,協助品牌從更完整的消費旅程理解市場,而不是只看見自己的會員輪廓。

當數據基礎建立完成後,AI 才真正開始發揮價值。過去,AI 多半停留在生成文案、圖片等單點應用;如今,數聚集團希望讓 AI 直接參與整個行銷流程。品牌只需提供活動網址(URL)、預算與行銷目標,AI 即可根據品牌歷史數據與過往成效,自動完成創作者媒合、媒體投放與策略配置,並在執行過程中持續學習與優化。

蔡雅藍表示,這也是數聚集團提出 Vibe Marketing 的核心概念。「就像 Vibe Coding 讓開發者透過自然語言完成程式開發,Vibe Marketing 則希望讓企業只需描述商業目標,AI 就能完成大部分的行銷規劃與執行。」她認為,AI 的角色不只是生成內容,而是逐步接手重複且仰賴經驗的工作,讓行銷人員能將更多時間投入品牌策略、產品創新與顧客經營。

林合政補充,真正的競爭優勢,不是使用同一套 AI 模型,而是企業是否擁有屬於自己的數據與經驗資產。當品牌知識、行銷策略與營運經驗,都能透過 Data Lake 持續沉澱並回饋 AI,每一次決策都將成為下一次成長的基礎,形成企業專屬的 AI 成長引擎。

展望未來,張元溢表示,數聚集團將持續整合 AI、Data Lake 與生態系夥伴資源,將這套品牌成長模式從線上延伸至線下,並逐步拓展海外市場。他認為,當品牌能讓每一次聲量、每一筆流量、每一位會員都成為下一次成長的起點,AI 才真正從工具,進化為企業的成長引擎。

為了進一步分享這套方法論與最新產品布局,數聚集團將於 8 月 12 日舉辦「數聚・領航 2026 產品發表會」,首度完整公開以 AI 為核心的品牌成長飛輪,並攜手聯合線上、傑思・愛德威、SHOPLINE 等合作夥伴,從媒體、代理商到電商生態,共同探討 AI 時代品牌經營的新策略與成長機會。活動將於 8 月 12 日(三)14:00–16:30 舉行,品牌可透過報名頁(https://reurl.cc/KEAYOe)報名參與。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
台達電全解讀
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓