近期一場重量級國際機器學習研討會 ICML 在送出審稿的論文中嵌入了「提示注入(prompt injection)」指令,藉此識別出哪些審稿人違反承諾、擅自使用 AI 撰寫審查意見。遭查獲的審稿人,其在同屆研討會中投稿的論文一律遭到直接拒絕,不予審查。此事在學術界引發論戰。
幾乎所有人都同意,既然承諾不用 AI,就應信守承諾。但爭議的焦點是:主辦方採用提示注入的手段是否恰當?是否構成「誘捕(entrapment)」?令人玩味的諷刺是,長期深耕AI研究的學者,竟對日常中的提示注入攻擊渾然不覺。
更該重質不重量,防「空燒token」鬥法
AI的廣泛應用也帶來學術社群借助AI的後遺症,研究人員得以更輕鬆地大量產出論文投稿,龐大投稿量正讓審稿工作不堪重負。以ICML為例,投稿量從2022年的5,630篇,暴增至2026年的23,918篇。
類似情況也在大學上演,過去,學術誠信問題主要是逐字抄襲,如今教授須判斷學生交的文章是否為AI代勞。更有甚者,有人毫無核查就繳出顯而易見的AI生成內容。美國近期便發生一起案例:法官發現訴訟雙方提交的法律摘要均引用不存在的先例,這正是AI幻覺(hallucination)典型症狀。律師們誤信所使用的模型足夠可靠,根本未加複核。最終案件遭撤銷,律師被裁定罰款並禁於法庭上代理當事人2年。
過去,一份長篇文件往往象徵著投入與用心;如今,它卻可能被視為借助AI應付差事的痕跡。原有的生產力衡量標準亟需與時俱進,既要納入AI的能力維度,也要回歸真正重要的事物。
今年曾有一段時間,部分大型科技公司將工程師使用的token數量列為績效指標,結果可想而知:token用量節節攀升,公司AI預算迅速燒光,但生產力與客戶服務品質卻未見提升。
這種以token 用量當標準的做法,不禁聯想到一個笑話:下屬為了向主管展示自己努力程度,用AI將簡潔的周報擴寫成3頁備忘錄,而主管則被如山的報告淹沒,只好再用AI將文件壓縮成幾條重點,雙方都用了寶貴的AI資源,而形式喧囂,意義全無。
AI的影響正全面滲透社會,而社會對AI的觀感也悄然轉變。近期多場畢業典禮上,演講者一提及AI便遭全場噓聲。蓋洛普(Gallup)針對美國Z世代對AI看法的最新調查顯示,2025至2026年間,受訪的Z世代對AI感到興奮的比率從36%降至22%,抱有期待的比率從27%降至18%,感到憤怒的比率則從22%攀升至31%。
憤怒與不滿,部分源於AI使用標準不一致。當學生眼見同學以AI生成的作業蒙混過關、取得好成績,對整體制度的信任便會動搖,不公平感也加深。同一份調查也顯示:AI使用頻率愈低的受訪者,對AI感到憤怒的比率愈高。
眼見恐不為憑,須劃清規範、普及識讀
針對上述趨勢,對學校、企業與個人提出建議:
明確訂定AI使用規範。組織內部應清楚界定何時、如何使用AI,建立共同遵循的準則,讓所有成員得以在透明的框架下善用AI。NeurIPS研討會便是一個範例,該會議針對語言模型在研究與發表流程中的使用時機與方式,制定了清晰的揭露規範。
落實AI濫用的教育訓練。對AI的盲目依賴可能導致錯誤結論、損害聲譽,乃至對社會造成傷害。應確保學生學習正確使用AI,並養成主動查核的習慣。
與時俱進,更新評量指標。AI時代更看重產出的質,而非量。學術界已出現值得關注的轉變趨勢:在一些一流大學評估新進教職候選人時,不再單純以論文數量論英雄,而是更重視研究的影響力。例如,當候選人被要求聚焦於最具代表性的5篇論文進行報告時,傳達的訊息已然明確:每篇研究的質量與影響力,遠比論文總數更重要。
提升全民AI素養。社會大眾,尤其年長族群,仍有相當比例對AI的實際能力缺乏認識。AI可以生成假亂真的圖像與影片、模仿他人聲音及形象,成為詐騙溫床。即使個人並未主動使用AI,在當前環境下也難以置身事外,因此教育大眾很重要。
AI帶來的挑戰,正重塑社會的運作方式。普林斯頓大學日前宣布,將廢除沿用超過130年的無監考榮譽考試制度。這項延續超過一世紀的傳統,最終敵不過時代的巨變:生成式AI結合行動裝置,讓作弊行為更難察覺;而社群媒體的盛行,則令學生因擔憂遭到「肉搜」(doxxing)而不敢檢舉他人,使榮譽制度賴以運作的相互監督機制形同瓦解。
對AI使用者而言,真正的生產力指標不是能產出多少文章,而在於能為個人、組織、品牌或社群創造多少信任。唯有將重心放在質量與信任的積累上,才能避免陷入AI垃圾內容(AI-slop)的泥淖,跳脫大量產出卻毫無價值的內卷(involution)循環。
責任編輯:陳祈安
