AI寫信比人類更得體?研究揭「扮演HR」實測:AI比人類更懂溝通藝術,但寫不出超派咆哮信
AI寫信比人類更得體?研究揭「扮演HR」實測:AI比人類更懂溝通藝術,但寫不出超派咆哮信

請先想像以下的情境:

一名剛到職、公司很想留住的 L3 軟體工程師寫信來,要一間個人辦公室。公司規定個人辦公室只開放給 L4 以上主管,這件事沒得談。你是人資,必須回信拒絕,而且不能澆熄他剛進公司的熱情。

以上情境,是芝加哥大學團隊設計的遊戲「HR Simulator™」的第一關。研究者 Dang Nguyen、Harvey Yiyun Fu、Ari Holtzman、Chenhao Tan(皆任職芝加哥大學)與英屬哥倫比亞大學的 Peter West,在 2026 年 3 月 6 日把論文《Moral Mazes in the Era of LLMs》掛上 arXiv,並於同年 4 月 6 日更新第二版(狀態標示為預印本、尚未通過同行審查)。

遊戲介面刻意模仿 Gmail,玩家扮演虛構公司 NeuroGrid 的人資,在五種棘手情境中撰寫回信:拒絕要求、化解創意衝突、推翻先前給出的遠端工作承諾、問出資深工程師自己都說不清的不滿,以及讓一名被裁掉、卻因投資人父親出面而可能復職的年輕工程師願意自省。其中第 4 關可以是多輪往返,不是一封信就結束。

收信的角色、模擬後續發展、以及最後判定你過不過關的裁判,全部由 GPT-4o(2024-11-20 版本)扮演,依每一關專屬的評分標準表(研究上稱 rubric)判定成敗。

研究者分析超過 600 封人類與 LLM 寫的信,得到一個對人類不太體面的數字:在 GPT-4o 擔任裁判的條件下,人類寫的信跨五個關卡平均通關率 23.5%,Kimi K2 是 54%、Qwen 3 是 48%。中段模型 Gemini 2.5 Flash 與 GPT-4o 各 22%、Claude 3.5 Haiku 28%,與人類在同一個水準。

實驗設計
HR Simulator 的分工:人類玩家只負責寫信,收信、模擬後續、評分全由 AI 包辦,主要裁判是 GPT-4o。
圖/ Arxiv

這場考試真正在考什麼

論文標題借自社會學家 Robert Jackall 在 1988 年的著作《Moral Mazes》,那本書記錄的是企業裡不成文的溝通規則:說什麼不重要,怎麼說、何時說才重要。 書裡的主管發現嚴重問題時不能直接往上報,那等於讓老闆顯得失職,於是他們學會把消息橫向放流給非正式管道,等到要做決定時該知道的人都知道了,卻沒有人正式當過報壞消息的那個人。

對此論文寫得很直接:這種迂迴不是溝通失敗,這就是溝通本身。 可以說,人跟人溝通從來就是這麼內耗的事情。

換言之,職場書信的難處在於同一句話裡要同時做到互相拉扯的幾件事,溫暖但保持距離、明確但留有餘地。研究者把信的語氣拆成兩個軸線量化:同理(這封信多想理解、多想幫收信人解決顧慮)與正式(語氣偏隨性還是偏公事公辦),由 Gemini 3 Flash 逐段給 1 到 7 分再取平均。

結果是,LLM 寫的信高度集中在「高正式、高同理」那一格,人類的信則散得多。幾乎沒有信落在「高正式、低同理」的區間,論文推測模型本來就不太寫低同理的信,而人類玩家則可能缺乏「既不讓步又保持專業」的技巧。人類寫的低同理信通常同時也低正式,因為內容常常很衝、很敷衍,有時還帶著反覆失敗後的火氣。

但如果讓 LLM 改寫人類的信,整體上會把信推向高正式高同理那一格,原本離得越遠的,改動幅度越大。

人加 AI 常勝過人類,但不一定勝過純 AI

論文最容易被引用的結論是混合優勢:用 LLM 改寫人類寫的信,多數情況勝過人類自己寫。 至於能不能進一步勝過模型自己寫,論文在附錄講得保守得多:這件事確實會發生,但並非普遍成立,成不成立會隨著寫信的模型、關卡與裁判而變。

增益最大的是「人類搭配中段模型」,第 1 關裡,GPT-4o 與 Claude 3.5 Haiku 的通關率從 40% 一路拉到接近 100%。前段模型的增益比較溫和,Kimi K2 加上人類在第 2 關多了 25 個百分點,Qwen 3 加上人類在第 4 關多了 55 個百分點。論文把這個規律歸給「餘裕」:模型單獨寫就已經接近天花板時,改寫很難再往上疊。

更有意思的是研究者給出的解釋。他們另外標註了第三個維度「得體」(tact),它衡量的是溝通策略:這封信有沒有把話說過頭、留下後患。以第 1 關為例,得體的信會把重點放在開放式辦公的好處,不得體的信則想用降噪耳機這類表面福利補償對方。

把裁判 GPT-4o 最偏好的信抓出來看,它在第 1 關的得體區間落在 3.17 到 3.83 之間。人類的信平均 3.04,太不得體;Claude 是 4.28、Gemini 是 4.79,兩者都太得體。經 LLM 改寫後,Claude 版變成 3.89、Gemini 版變成 4.01,剛好落回區間附近,通關率也跟著跳升。反過來看,Qwen 的 3.28 與 Kimi 的 3.50 本來就在區間內,改寫就沒有額外好處。

大模型與小模型的分水嶺,是一句「你薪水比上一份高」

論文更值得拉出來的一段,是它換了裁判。emergent tact 這部分的分析共動用 10 個不同家族、不同規模的模型當裁判,GPT-4o 本身也是其中一員,強弱跨度從小型開源模型一路到當前第一梯隊。

第一個發現是,模型參數量越大或 Elo 分數越高(Elo 是借自西洋棋的排名方法,讓信兩兩比較、贏的加分),兩兩裁判之間對「這封信過不過關」的判斷就越一致,最強的一批達到約 0.5 的 Krippendorff's α,也就是校正過猜對機率之後的一致程度達到中等水準。

第二個發現才是關鍵。研究者把「兩個裁判給同一封信的排名相差 20 名以上」定義為分歧,發現絕大多數分歧發生在大模型與小模型之間,而非同級模型之間,而分歧的性質就是得體:小模型偏好直白、不那麼得體的信,大模型偏好含蓄、更得體的信。

這個現象論文命名為 emergent tact,直譯是浮現的得體。不過這是整體趨勢,不是普遍定律:落差在第 1、3、4 關比較明顯,論文附錄自承,得體定義在第 2、5 關沒能同樣解釋分歧。

具體是什麼樣的分歧?回到第 1 關那封拒絕信。玩家手上其實有一張說服牌,可以提到這位新人在新職位的薪水比前一份工作高,藉此喚起對方的感激,先一步堵住後續議價。但論文作者判定這個策略非常不得體、而且帶有被動攻擊性,而這正是大小模型的分水嶺:小模型偏好用了這招的信,大模型反感。

為確認這條線真的是「得體」,研究者另外用相近的「禮貌」標註同一批信,發現「禮貌」無法像「得體」那樣把大小模型分開。

AI難以寫出來的信:咆哮信

研究者還反過來問了一個問題:有沒有 LLM 寫不出來的信? 這個問題的測試對象只有一個模型,Qwen 3 30B 3A Instruct,目標是看它能不能寫出「低同理、低正式」的信(可以想像成投訴性質的咆哮信)。只下指令要求同理與正式都給 1 分時,這個模型改寫失敗,信仍落不進左下角;加入人類寫的低分信當範例之後,才有較多信件往那個區間移動。

但模型對人類寫的低分信困惑度(perplexity,大致是「模型看到這種寫法有多意外」,數字越高代表越不像它會產出的東西)極高,無範例時 38.96,有範例時仍有 10.80,而它對自己生成的低分信只有 2.38。範例大幅降低了困惑度,模型仍然很難模仿這種寫法。

論文為這一格說了句公道話:低同理低正式的信在企業裡看似不得體,換到別的情境卻有必要,例如投訴一間官僚積習很深的公司,可能只有把話說得很重才傳得進去。這種信人類自己也難拿捏,反而適合靠 LLM 協助編修,形成另一種人機互補。

結論:棘手信件怕失禮,給AI順一順沒壞處

總結來說,這篇論文真正的價值不在人類與 AI 的高下,而在它記錄了一件正在發生的事:讀信、篩信、判斷信寫得好不好的角色,正在換人。 研究者在結論寫道,若模型成為職場書信往來的核心,理解這個新地景很重要,才能確保職場溝通規範是被刻意選擇的結果,而不是被 LLM 的天性推著走。

23.5% 這個數字量到的,比較接近「人類多不擅長討好 GPT-4o」,未必是「人類多不會做人」。而當裁判換成能力較強的模型後,信件偏好可能從偏直白轉向偏含蓄,這意味著寫信的人如果開始為模型的品味調整寫法,很難保證讀信的人類感受真的會比較好。

那到底怎麼寫信最得體?論文給的路已經算務實:人先寫,AI 再改。人決定要不要打出那張說服牌,AI 把語氣調到不刺人。

延伸閱讀:黃仁勳兆元宴永遠站最後一排!最低調的二代鄭平,憑什麼讓台達電被市場重新定價?

本文初稿為AI編撰,整理.編輯/ 李先泰

關鍵字: #ai人工智慧
往下滑看下一篇文章
不只給場域、更助攻海外!桃園如何助思納捷做大智慧能源管理版圖?
不只給場域、更助攻海外!桃園如何助思納捷做大智慧能源管理版圖?

隨著全球淨零轉型浪潮持續推進,企業不僅要許下減碳承諾,更得拿出可以被量測、驗證的實際成果,這也驅使企業加速導入智慧能源管理系統。早在 2017 年便投入此領域的思納捷,從桃園出發,透過工業園區與公共建築等在地場域的部署經驗,持續打磨技術與解決方案,隨後更在桃園市政府青年事務局「桃園天際線加速器」協助下,逐步將市場版圖延伸至海外。如今,思納捷全球累積超過 1,000 個應用實績,不僅成功將台灣智慧能源解方推向海外,更成為全球企業推動綠色轉型不可或缺的關鍵夥伴。

從桃園場域開始淬鍊:思納捷把「失敗經驗」變成難以複製的競爭力

思納捷總經理莊棨椉原先在資策會從事能源與物聯網相關研究,當時,他從歐美市場發展看見智慧能源管理的趨勢,於是,團隊從資策會獨立出來、成立思納捷,將過去累積的研發能量帶向市場。而技術落地第一站,就是從工業聚落密集的桃園開始,思納捷運用 IoT 技術管理工業園區的路燈、空氣品質、排水與交通等公共設施與環境,也進一步走進園區工廠,協助企業掌握與管理用電。

然而,從研究機構走向市場後,莊棨椉很快發現,「做得出來」與「真的能用」之間,還隔著一段不小的距離。許多從技術角度來看完全可行的做法,在進入真實場域後,反而出現各種從未想過的問題。

舉例來說,在幼獅工業園區部署智慧路燈時,思納捷原本採用 Mesh Wi-Fi 網狀網路,讓路燈彼此串聯、逐站傳遞訊號,沒想到實際上線後,路樹上的枝葉竟然擋住了訊號,造成通訊不穩定。為此,團隊重新調整架構,採用 NB-IoT 方式,讓每支路燈直接透過電信網路傳輸資料,降低環境遮蔽物對通訊的影響。

類似的「踩坑」經驗也發生在澎湖馬公港。思納捷與合作夥伴共同佈建智慧路燈,採用 PLC 電力線通訊技術,明明在實驗室與一般道路測試都沒有問題,到了港區卻完全無法傳輸訊號。團隊一路追查才發現,原來地下線路早已受到鹽害侵蝕,為此重新抽換線材,才讓系統得以正常運作。

串設備、整數據、AI 自主管理:思納捷打造 24 小時能源總管

「每一次踩坑,都讓團隊更清楚不同技術的適用邊界,也讓下一次部署少走一段彎路,」莊棨椉說,思納捷運用近十年來走進不同場域、解決各種意外狀況所累積的實戰經驗,形塑出 3 大產品特色。

第一,是物聯網裝置串接能力。
目前思納捷已能串接超過 1,000 種設備,涵蓋電表、水表、空調、冰水主機等不同類型,支援數量為全台最多。無論企業使用何種廠牌的設備,都能快速介接至思納捷的平台,降低設備整合門檻。

第二,是將數據與場域 Know-how 轉化為管理模組,讓企業可以「隨選即用」。
思納捷將多年累積的數據與經驗,轉化為超過 20 種應用模組,企業可以依需求持續擴充功能,一改過去可能要導入多套解決方案,才能管理不同設備的系統孤島問題。

舉例來說,某電子元件代理商在導入思納捷解決方案後,管理人員只要透過一支手機,就能掌握辦公大樓各樓層的設備運轉狀況,包括用電、用水、會議室、電動車充電樁到空調系統。不僅大幅提升管理效率,也能進一步掌握實際用電需求、降低能源耗用,並據此調降契約容量,每月節省約百萬元的電費成本。

第三,是讓能源與設備管理從人工管理走向 AI 自主管理。
思納捷以自家大數據為基礎,結合 AI 提升系統自主判斷與調控能力,持續優化能源管理的成效。「我們的目標,就是打造 24 小時雲端 AI 總管,讓系統可以自己判斷和調整,讓設備隨時維持在最佳運轉狀態,避免造成不必要的能源浪費,」莊棨椉強調。

出海前先看懂市場:桃園天際線加速器降低新創試錯成本

隨著產品逐漸成熟,思納捷也開始把目光投向海外,而進駐桃園天際線加速器,則為團隊提供一個以更低成本探索海外市場、驗證發展方向的機會。

莊棨椉表示,透過加速器安排的韓國、新加坡等國際交流,思納捷得以接觸不同市場的潛在客戶、創投與投資者,了解當地產業環境與實際需求,也能與在地新創交流創業與市場拓展經驗;國際經驗的獲取與海外拓點,都是成本極高的決策,藉由這些機會,思納捷得以用較低成本,去了解國際市場的可能性與風險。

此外,加速器也會安排專業業師分享國際市場經驗,從不同角度刺激團隊思考,重新檢視既有商業模式與海外布局策略。例如,曾經有業師與莊棨椉逐項分析海外上市必須具備的條件,讓他重新盤點公司現階段的優勢與不足,也進一步思考什麼才是最適合思納捷的成長路徑。

「加速器讓我們有機會多看、多聽、多接觸。」莊棨椉說。這些交流的價值,不只是認識多少潛在客戶,而是讓團隊在真正投入大量人力與資金以前,先釐清當地究竟有沒有市場、客戶需求是否成熟,以及既有產品與商業模式能不能直接複製。過去許多只能透過資料或想像判斷的問題,如今都能透過實際走進市場、接觸第一線業者取得更多資訊,降低走錯路的風險與試錯成本。

對思納捷而言,加速器帶來最關鍵的幫助是,透過市場探索、業師輔導與資源媒合,讓團隊在真正投入之前,有更多機會看懂市場、驗證方向,再決定下一步怎麼走。對資源有限的新創而言,這種「先驗證、再投入」的過程,反而能降低海外布局的機會成本,讓每一步走得更精準。

展望下一階段,思納捷團隊將持續聚焦校園、園區、建築與工廠四大場域,持續深化應用,讓「24 小時能源與機電設備雲端 AI 總管」的概念在更多場景落地,同時,當既有台商客戶前往海外設廠、有智慧能源管理需求時,思納捷也會跟隨客戶腳步提供服務。莊棨椉認為,唯有先把技術與服務做深,建立可複製的成熟模式,未來才有機會將台灣累積的智慧能源管理經驗帶向更大的國際市場。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
一次搞懂工業AI
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓