哪一款AI最可靠?研究揭Claude家族最老實:為何對LLM來說,坦承無知比「已讀亂回」更難?
哪一款AI最可靠?研究揭Claude家族最老實:為何對LLM來說,坦承無知比「已讀亂回」更難?

重點一:依據 AA‑Omniscience 顯示,多數大型語言模型在高難度知識題上「猜錯比答對多」,僅三款例外;核心指標 Omniscience Index 以懲罰幻覺衡量可靠度。

重點二:在全知指數上,Claude 4.1 Opus因較低幻覺率領先;GPT‑5.1Grok 4則多靠較高準確率。

重點三:各模型在不同領域表現不一,沒有「一款通吃」。例如 Claude 4.1 Opus在法律、軟體工程、人文社科較穩

先進 AI 大模型雖然越來越強,但近期一份報告指出,在「少幻覺、敢承認不知道」這件事上,仍然是不及格。

第三方 AI 模型評比平台 Artificial Analysis 於 11 月 18 日公布全新基準「AA‑Omniscience(全知指標)」指出,在面對高難度知識題時,當前主流大型語言模型(LLMs)「猜錯比答對多」,僅有三款模型例外。

該評測以「Omniscience Index(全知指數)」為核心,採用加權懲罰幻覺(錯誤作答)的方法:答對加一分、錯誤且有作答扣一分、選擇不作答記零分,從而衡量「知識可靠度」,而非僅看正確率。

團隊強調,模型的嵌入知識對真實世界應用至關重要;在知識不足時,模型易做出錯誤假設。且即便有工具如網路搜尋輔助,模型也須「先知道該搜什麼」。例如,遇到「MCP」查詢時,不應錯把「Multi Client Persistence」當答案,而應辨識為「Model Context Protocol(模型上下文協定)」。

低幻覺的 Claude vs. 高正確率的 Grok/GPT

Artificial Analysis 指出,在整體「事實可靠度」(Omniscience Index)排名上,Anthropic 的 Claude 4.1 Opus 居首,其優勢主要來自「低幻覺率」。相較之下,OpenAI 與 xAI 的模型則以較高「正確率」拉升名次,但因更傾向在不確定時「冒險作答」,而非「不懂就閉嘴」,因此可靠度未達頂尖水準。

純以「正確率」衡量時,xAI 的 Grok 4 居首,OpenAI 的 GPT‑5 與 Google 的 Gemini 2.5 Pro 緊隨。Artificial Analysis 也提及伊隆·馬斯克近期披露 Grok 4「總參數達 3 兆」,暗示大模型規模與前訓練算力或許是支撐其正確率表現的因素。

最可靠AI有哪些?
這張圖把每個 AI 放在一個座標上。橫軸是「Omniscience Index」,越往右代表越可靠、越少幻覺;縱軸是「Accuracy」(準確率),越往上代表越常答對。
圖/ Artificial Analysis

值得注意的是,在「幻覺率」榜單上,Anthropic 三款機型包辦最低幻覺率前段班:Claude 4.5 Haiku 以約 26% 領先,Claude 4.5 Sonnet 與 Claude 4.1 Opus 分列其後。這也呼應評測核心觀點:高知識並不必然等於低幻覺;能否在不確定時「選擇不作答」是可靠度的關鍵。

知識量不等於可靠度!AI 懂更多,卻未必說得對

Artificial Analysis 團隊在報告中指出,AA‑Omniscience 涵蓋 6,000 題、42 主題、6 大領域(商業、人文與社會科學、健康、法律、軟體工程、工程與數學),並細分 89 子題(如 Python 資料函式庫、公共政策、稅務等),更細緻地刻畫各模型的強弱。

結果顯示: 各模型在不同領域輪流領先,並無「全能王」。 例如,Claude 4.1 Opus 在法律、軟體工程、人文社科領先;OpenAI 的 GPT‑5.1 在商業題表現最可靠;xAI 的 Grok 4 則在健康與「科學、工程與數學」領域居前。

AI 在六個領域的「可靠度分數」
這張熱力圖把各個 AI 在六個領域的「可靠度分數」做橫向比較。每一列是領域(法律、健康、商業、軟體工程、人文社科、理工),每一欄是一個模型。顏色已做「該領域內」的標準化:在同一列裡,最好的模型顯示為綠色,最差的是紅色,中間就落在黃橘色。
圖/ Artificial Analysis

另一個發現是,模型規模與正確率正相關,但不必然提升可靠度。

白話說,模型越大,代表知識量越多,所以在「正確率」排行榜表現亮眼;但由於「可靠度」看的是遇到不確定時會不會硬答、造成幻覺。因此,像 Kimi K2 ThinkingDeepSeek R1(0528) 雖然答對比例高,遇到不熟的題目仍可能胡亂作答,拉低了「全知指數」。

反過來說,Llama 3.1 405B 雖然不是最大的,但更懂得在不確定時不作答,幻覺率較低,整體「可靠度」因此勝過規模更大的 Kimi K2 款式。

結論:選用 AI 的建議,也是「誠實為上」

總結來說,AA‑Omniscience 的證據顯示:能在不確定時停手、降低幻覺的模型,才在真實場景更可靠;僅看準確率,會把「會猜」誤認為「會答」。因此,選擇模型時,應以事實可靠度、幻覺率與拒答行為為核心準則,並依領域差異做選擇。

最後,模型規模與準確率雖有正相關,但並不直接降低幻覺;縮減幻覺更依賴訓練與校準機制。基於此,企業在落地知識密集型任務時,應優先採用「校準佳、願意在不確定時拒答」的模型。

延伸閱讀:ChatGPT濫用破折號怎麼改?如何避免飄出超油膩「AI味」?實用指令教學快收藏!
「這是地表最強編碼模型!」Claude Sonnet 4.5上線:更快更穩不加價,它是GPT‑5 Codex最大剋星?

資料來源:AA‑OmniscienceArtificial Analysis

本文初稿為AI編撰,整理.編輯/ 李先泰

關鍵字: #Anthropic #Claude
往下滑看下一篇文章
TWNIC歡慶25周年加碼挺新創 ,52168免費域名方案!從創業第一天開始就打造新創數位競爭力、強化數位資產
TWNIC歡慶25周年加碼挺新創 ,52168免費域名方案!從創業第一天開始就打造新創數位競爭力、強化數位資產

每年在台灣約有超過8萬家新設公司商號的誕生,然而根據台灣網路資訊中心(TWNIC)內部統計數據顯示,真正完成網站架設、踏上數位轉型起點的新設立公司卻不到一成。這意味著絕大多數的新創團隊或微型企業,雖然正式登記成立,卻仍缺乏最基本的「數位門牌」,也就是企業的專屬域名名稱。

TWNIC 執行長余若凡指出,這看似是台灣新創團隊在數位轉型上的一個缺口,實際上卻是關鍵成長與強化自身數位資產的關鍵。「域名其實是數位轉型的起點,如果沒有自己的域名,基本上就還沒真正開始。」她強調,數位轉型已經不只是上雲端或導入 IT 設備,更進一步的是「建立數位信任」;但眼下許多新創連第一步都還沒跨出。

三大現實痛點突顯,域名是新創跨出數位轉型第一步的關鍵

余若凡觀察,許多新創公司之所以未能及早佈局域名與數位資產,主要來自三個現實因素。首先是資金有限。對於初創立的新創團隊來說,創業初期事務繁雜、資金有限,許多團隊會優先把錢投入營運,對域名或網站架設常抱持「之後再說」的心態。其次,則是缺乏整體數位策略的構想。余若凡表示,許多新設企業或新創團隊少有在成立之初就規劃品牌的數位溝通路徑,更遑論導入數位品牌策略。

最後是對「數位信任」的認知不足。余若凡提到,許多企業直到品牌被仿冒、消費者受詐騙波及時,才意識到域名的重要性。「你等到有名氣後再來搶域名就太晚了。」她特別提醒。一旦品牌名稱被他人搶先註冊,甚至被詐騙集團利用,損失往往難以挽回。

而看在余若凡的眼裏,域名對於新創企業其實有三重意義。第一,它是企業的「數位門牌」。清楚、好記的域名能讓消費者快速找到企業,也代表著品牌在網路上的官方身分。第二,它是品牌行銷的起點。她指出,你必須要有自己的家,然後再去連結各種社群平台與通路。擁有域名,可以將社群經營、搜尋流量與品牌曝光整合在一起,累積成企業的長期數位資產。第三,它也是防禦性的工具。許多企業認為「不架網站就不需要域名」,但實際上,單純註冊域名就能防止他人搶註或利用相似網址詐騙,成本只要幾百元,卻能省下未來更多麻煩。

台灣網路資訊中心 余若凡執行長
圖/ 數位時代

從「免費申請」到「快速架站」,52168為新創打造快速數位起步

為協助更多新創企業補上這一塊關鍵拼圖,TWNIC 為歡慶25周年,今年特別規劃「52168 Go! 免費域名註冊方案」,更首度針對自112年起的新設公司與商號,加碼免費提供含「com.tw 或 .tw」及「.台灣」等兩筆域名的註冊。這不僅讓新設公司能以0元自選擁有自己的域名,及低成本建置國際品牌識別,中文域名更能讓以在地化為優先的新設公司、新創團隊或是擁有創意諧音名稱的店家,直接使用最具代表性的中文作為數位門牌。

「我們希望透過免費的方式,讓企業更容易跨出第一步,養成擁有自己數位門牌的習慣,無論是用來建品牌、做轉址,或先作為防禦性註冊,都可以開始累積數位資產。」余若凡表示。今年TWNIC方案不僅延長了申請對象的年限,也在免費之餘特別簡化申請流程,讓新創團隊輕鬆完成。余若凡說,企業只要備妥公司或商號設立證明,線上填寫資料、選好想要的域名並上傳文件,最快一個工作天內即可生效。

「我們希望讓這件事情的流程簡化到創業家們用幾分鐘就能完成申請,」余若凡笑說。不僅如此,TWNIC 也希望讓這項服務的效益極大化,不只是積極推動域名的申請,更同步規劃了後續的配套措施。申請完成後,企業可以透過「轉址教學」將域名直接連結至現有的社群媒體等平台,不需額外調整營運模式,就能立即擁有屬於自己的專屬門牌;同時,TWNIC也提供大型雲服務供應商的免費空間作為範例,提供清楚的「架站」教學,協助企業快速打造基本網站。這樣的設計,讓資源有限的新創企業不僅能輕鬆取得域名,還能在最短時間內建立屬於自己的數位家園,為品牌發展打下穩固基礎。

從「數位門牌」出發,為新創奠下品牌與信任的起跑線

對於許多初創企業而言,品牌的第一張名片,可能不是實體名片,而是域名名稱。余若凡強調,數位轉型的時代已經不是「要不要做」的問題,而是「非做不可」的基本條件。

「我們希望 52168 能成為新創的堅強後盾,從最簡單、最基本的地方,幫助他們在數位化的道路上打好地基。當企業開始累積數位資產,品牌信任也會逐步建立,整體產業生態才能變得更安全、更有韌性。」余若凡說。透過52168方案,TWNIC 不僅提供免費資源,更試圖翻轉企業對「數位門牌」的認知。對於正處於創業起跑線上的新創來說,這或許是一個最簡單,也最值得立即行動的關鍵步驟。

請上「52168 Go! 新設立公司/商號免費域名註冊」活動網站 https://52168.tw/

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
一次搞懂Vibe Coding
© 2025 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓