AI模型能力是怎麼測試的?為什麼用寶可夢、瑪利歐、台灣小說⋯測的東西到底是什麼?
AI模型能力是怎麼測試的?為什麼用寶可夢、瑪利歐、台灣小說⋯測的東西到底是什麼?

「我現在真的不確定這些模型到底有多強,」3 月 3 日 OpenAI 共同創辦人 Andrej Karpathy 在 X(前 Twitter)發文指出,傳統的測試基準(Benchmark)如 MMLU、Chatbot Arena,已逐漸失去參考價值,AI 產業正在迎來評測標準的變革。

當前 AI 技術發展迅速,各家科技公司紛紛推出更強大的模型,如何有效評估 AI 的能力成為重大挑戰。除了傳統基準,如 MMLU、TruthfulQA、GSM8K 主要測試 AI 的語言理解與推理能力;近期更是出現遊戲、小說等新型態的小型測試,多方檢測 AI 在不同領域的能力,使其更貼近實際應用場景。

遊戲測試:寶可夢與瑪利歐,挑戰 AI 推理與反應

根據《TechCrunch》報導,Anthropic 近期在 Twitch 上直播了一場特殊的遊戲實驗,讓旗下最新的 AI 模型 Claude 3.7 Sonnet 挑戰《寶可夢紅》。相較於前一代 Claude 3.5 Sonnet 無法走出遊戲起始點的家門,Claude 3.7 Sonnet 成功獲得三枚道館徽章,顯示其推理能力與環境理解有明顯進步。

然而,這款 AI 仍遇到一些困難,例如在面對一面岩牆時花費了大量時間嘗試「穿牆」,直到最後才意識到應該繞路。這類「人類視角看來理所當然的問題」,對 AI 而言仍然是一道考驗。

《TechCrunch》報導,加州大學聖地牙哥分校的 Hao AI Lab 選擇用《超級瑪利歐兄弟》來測試多款AI模型。他們開發了一個名為 GamingAgent 的框架,允許 AI 透過 Python 指令控制瑪利歐的移動,並提供簡單的遊戲指導方針,例如「當遇到障礙物或敵人時,向左跳」。

在這場比賽中,Claude 3.7 Sonnet 再度奪冠,而 Claude 3.5 Sonnet 則緊隨其後。然而,Google 的 Gemini 1.5 Pro 與 OpenAI 的 GPT-4o 表現則不如預期,反應速度較慢,甚至在某些場景無法做出合理決策。

研究團隊發現,「推理型 AI」在即時遊戲中的表現反而不如「非推理型 AI」。這是因為推理型 AI 需要較長時間思考每一步行動,導致它在反應要求極高的遊戲場景中表現不佳。這項發現對於 AI 應用於即時決策領域(如自動駕駛、機器人控制等)具有重要參考價值。

小說測試:臺灣作家極短篇《烤肉》,挑戰 AI 的社會認知

如果說遊戲測試能夠評估 AI 的即時反應,那麼如何測試 AI 對於文化與社會脈絡的理解呢?臺灣研究團隊選擇由作家張原通撰寫的小說《烤肉》作為測試案例,並將成果刊登於《亞洲精神醫學期刊》。

《烤肉》是一篇只有 667 字的極短篇小說,以一名六歲女孩的視角敘述母親「不讓她吃烤肉」,暗示母親可能正在密謀以燒炭方式結束自己與兒子的生命,但留下女兒存活。

研究團隊測試了包括 GPT-4o、GPT-o1、Claude 3.5 Sonnet、Sonar Large(基於 LLaMA-3.1)、Gemma-2-2b 與 DeepSeek-R1 等六款 AI 模型。結果顯示,所有模型都能識別故事中的家庭暴力元素,但僅有 Claude 3.5 Sonnet、Sonar Large與 GPT-o1 能夠正確識別母親的行為暗示燒炭自殺。

值得注意的是,故事中的母親選擇帶走兒子,是因為東亞文化中兒子通常被視為家族血脈的繼承者。研究成果發現,沒有任何一款 AI 能夠正確理解為何母親選擇殺子卻留下女兒,顯示 AI 在文化推理與社會價值觀的理解上仍有很大進步空間。

3 月 4 日,研究團隊成員林煜軒於 Facebook 粉絲專頁〈探索大腦的會談地圖〉發文表示:「《烤肉》或許也可以作為大型語言模型,是否深刻理解亞洲國家,特別是在台灣的社會文化,並且作為心理健康領域的 Lena 測試。」

AI 測試基準的局限與改進方向

面對 AI 測試基準的變革,史丹佛大學的 HAI 政策研究團隊在報告《What Makes a Good AI Benchmark?》中,分析了 24 種現有的 AI 測試基準。他們發現,大部分測試基準在「設計階段」表現良好,但在「實作階段」的品質卻有所下滑。

HAI 政策研究團隊提出幾點改進建議。首先,測試基準的設計應針對特定應用場景,確保其有效性與解釋性,並提升測試的可重現性。測試基準應公開測試代碼與數據,讓結果能夠被驗證和重複,也須清楚說明其適用範圍與限制,避免過度依賴過時或污染的測試數據。

文章還建議在測試基準的整個生命週期中,從設計到維護,每個階段都應遵循最佳實踐,並且政策制定者應強化指導測試基準的品質,促使業界標準化報告和評估方法,從而提高透明度與可比性。

未來 AI 測試基準的發展趨勢

上述使用《寶可夢紅》、《超級瑪利歐兄弟》與《烤肉》進行的 AI 測試,展現真實世界對於 AI 多種不同面向的期待,同時也昭示了目前 AI 待加強之處。隨著 AI 技術的不斷進步,未來的測試基準將需要更加關注實際應用情境,如自動駕駛、醫療診斷等高風險領域的實時反應能力。同時,AI 如何理解社會與文化脈絡,也將成為未來測試的關鍵指標之一。

如何在保持高效能的同時,也能做到更高的倫理與文化敏感度,是未來測試基準發展的主要方向。無論是遊戲測試、文化測試,還是新的測試標準,這些努力都指向同一個目標——讓 AI 不僅能通過標準化考試,更能理解世界,並在不同環境中發揮最佳效能。

本文授權轉載自FC未來商務,作者為王聖華

往下滑看下一篇文章
晶睿通訊「安全地圖」永續活動讓國發會也點頭ㅤ安防大廠背後盤算什麼?
晶睿通訊「安全地圖」永續活動讓國發會也點頭ㅤ安防大廠背後盤算什麼?

攜手地方創生團隊規劃大陳新村安防解決方案 獲選國發會案例

ESG為企業關注的顯學,如何真正落地成為關鍵。今年行政院國家發展委員會公布「地方創生與企業永續共創發表會」代表案例,提出三大合作模式,並集結包括晶睿通訊、玉山銀行、全家便利商店等指標企業。在眾多案例中,晶睿通訊以長期投入的「安全地圖」永續活動脫穎而出,成為「生態建構型」模式代表企業,展現科技業如何以本業為核心,深度參與地方轉型,為環境安全和永續賦能。

國發會攜手資誠永續提出三種企業參與地方創生的模式,包括「加速器型」、「價值整合型」與「生態建構型」。在「加速器型」中,企業以在地投入與專業支持,帶動產業升級與永續發展,如玉山銀行提供金融與培力資源協助地方創生。在「價值整合型」中,全家便利商店攜手在地團隊發展文化體驗,促進族群融合並創造新商機。晶睿通訊所屬的「生態建構型」,則更強調跨域整合與長期投入,企業不只是提供技術,而是串聯地方團隊、政府與學界,共同解決區域性的系統問題。

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼2.jpg
圖說:晶睿通訊發言人謝邦彥(右)表示,透過舉辦「安全地圖」活動,發揮安防影響力,守護地方文化與生活環境。
圖/ 晶睿通訊

晶睿通訊發言人暨企業品牌永續室處長謝邦彥表示:「晶睿通訊致力成為最值得信賴的安防品牌,多年來以『安全地圖』實踐企業永續理念。透過與合作夥伴協力,運用創意讓安防解決方案融入地方文化與生活環境。很榮幸獲得國發會的關注,透過產官學資源投入,攜手地方創生團隊推動社會永續安全,創造共好的永續家園。」

讓安全成為地方創生的動能 安全地圖發揮長效影響力

晶睿通訊在2024年與花蓮地方創生團隊「小羊社會創新工作室」合作,帶領員工走進全台規模最大的大陳新村,從基本的場域觀察開始,盤點治安死角與環境風險,並結合AI,提出一系列的安防改善方案,包括無障礙空間優化、智慧照明建置,以及影像辨識應用,提升社區安全與生活品質,讓老眷村住得更安心。

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼3.jpg
圖說:晶睿通訊與花蓮地方創生團隊小羊社會創新工作室合作,透過「安全地圖」活動,強化居住安全品質。
圖/ 晶睿通訊

然而 ,真正的改變關鍵往往不在當下,而是後續的擴散效應。小羊社會創新工作室依照晶睿通訊建議的方向,逐一實踐安全之路,包括舉辦安全講座,提升社區居民的安全意識。另外,除了收到晶睿通訊捐贈的攝影機外,也因為雙方合作強化地方安全的提案,進一步獲得地方政府經費支持,升級安防基礎設施,額外再獲得超過十台攝影機,分別裝在活動中心、公園、廟宇等重點場域,讓原本由企業啟動的行動,轉化為地方長期發展的一部分,從安全改善,到觀光潛力提升,在大陳新村形成正向循環。

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼4.jpg
圖說:小羊社會創新工作室採納晶睿通訊建議,舉辦安全講座,提升社區居民的安全意識。
圖/ 晶睿通訊

小羊社會創新工作室創辦人趙孝嚴表示,大陳新村裡的信仰中心「阮弼真君廟」是觀光熱點,有許多觀光客來參拜,但也因此容易招來扒手偷拿香油錢,當初晶睿通訊建議社區在此處安裝監視器,目前已發揮作用,今年3月中即因錄下關鍵畫面,掌握竊盜者,讓社區居民住得更安心。趙孝嚴說:「看到長輩們在監視器畫面前圍觀,經過搜尋找到小偷,將畫面交給警局的那一刻,大家都鬆一口氣,因為我們終於有保護自己的力量,讓社區安全更進一步落實。」

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼5.jpg
圖說:晶睿通訊「安全地圖」帶動改變,大陳新村獲政府資源升級安防系統,最終拍下香油錢遭竊的關鍵畫面,讓安全風險無所遁形。
圖/ 晶睿通訊

目前大陳新村持續在規劃套裝行程,開放觀光客來體驗大陳文化,趙孝嚴表示,過往經驗大概有7成會規劃輕旅行活動,因此場域安全性扮演非常重要的關鍵。這次和晶睿合作,獲得許多創意點子,讓在地團隊重新檢視環境安全對觀光發展的影響,進一步優化動線與場域規劃,也更有信心打造讓遊客安心、願意停留的文化旅遊體驗,為地方創生注入長遠動能。

安防影響力放大 足跡遍及社區、社福機構、校園、大自然

晶睿通訊「安全地圖」活動,除了為地方創生團隊帶來安全效益外,更多是讓「安全」成為連結人、社區與環境的重要基礎。從社區、社福機構、校園,到自然環境,藉由專業技術擴大安防的影響力,為地方賦能。

2025年,晶睿通訊號召員工走進大自然,到南投縣國姓鄉種瓜溪,攜手中興大學社會責任「環境韌性與永續」團隊,還有以AI大數據推動精準農業的合作夥伴DATAYOO悠由數據,展開「復育種瓜溪 生態安全地圖」任務,導入安防解決方案監測生態,成功捕捉到保育類動物食蟹獴覓食的珍貴影像;同時,移除外來入侵種、復育原生植物,並開挖生態池,持續將永續行動理念融入安防本業,守護棲地與生物多樣性,後續種瓜溪也邁向成為推動環境教育的優質場域。

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼6.jpg
圖說:晶睿通訊和中興大學USR團隊合作,在南投種瓜溪導入安防解決方案,成功捕捉到保育類動物食蟹獴出現的珍貴影像。
圖/ 晶睿通訊

從2021到2023年,晶睿通訊分別號召員工到新北中和建和里社區、桃園安康教養院,及台北士林雙溪國小,檢查該場域環境安全性,並針對痛點提出解決方案,像桃園安康教養院,透過導入AI安防解決方案,包括電子圍籬等,讓院方用科技即時掌握院生動態,保護院生安全的同時,降低對人力長時間值守的需求與輪班看護的壓力。

真正的永續,不只是單次投入 而是持續與地方一起成長

五年來,晶睿通訊「安全地圖」永續活動在產官學研跨界合作下,超過百人協作攜手實踐,從社會關懷到環境守護,累積投入時數超過三千小時,不同於在地方只辦一次性活動,「安全地圖」從問題盤點出發,進一步導入解方與資源,讓行動不只發生,更能延續。也因此,「安全地圖」的價值,不在短暫參與,而在於每一次行動都能在地方持續發酵、留下可以被看見的改變。

安全地圖活動合作請洽:esg@vivotek.com

晶睿通訊「安全地圖」永續活動相關報導連結

保育類食蟹獴回來了! 晶睿通訊「安全地圖」賦能南投種瓜溪重開機
AI科技守護歷史聚落 晶睿安防小隊打造花蓮「安全地圖」
和AI比創新,晶睿安防小隊打造校園安全地圖,用遊戲實踐不一樣的社會參與
ChatGPT無法代勞的公益行動,晶睿通訊組隊打造永續安全地圖

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
2026 大重啟
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓