Anthropic 於美國時間 9 月 1 日發表新一代旗艦模型 Claude Fable 5.1 與 Claude Mythos 5.1。兩者是同一個模型,差別在防護等級:Fable 5.1 全面開放,Mythos 5.1 僅提供給通過審核的資安與生命科學專業人士及機構。
新模型在第三方評測機構 Artificial Analysis 的智慧指數拿下 66 分,是該機構測過的最高分;Anthropic 同步把快取讀取價格調降 75%,但同一份評測的試算顯示,實際跑完一項任務的成本反而比前代貴 2 成。
同一個模型、兩種門檻:Mythos 為何要審核?
目前,開放給大眾使用的 Fable 5.1 已經在各大雲端平台(如微軟、Google)全面上線,所有人都能用;至於開放給專家使用的 Mythos 5.1,這次「安全限制」大幅放寬,以支援那些因為工作需求(如病毒研究、找漏洞),卻老是被 AI 防護機制拒絕回答的資安與生科專家。目前只開放給美國機構(資安或生科領域),未來會逐步擴大。
以前 AI 常因為「太過小心」而誤擋正常指令,這次 Fable 5.1 將這種「誤殺率」大幅降低了 60%。它可以幫你找出軟體漏洞,但依然嚴格禁止幫忙寫駭客攻擊程式。
Anthropic 這次也推出了新機制(EFS),讓企業可以直接把資料存放在自己的雲端裡,不需要傳到 Anthropic 的伺服器,做到完全不留痕跡。這項新功能預計 2026 年秋季分批上線。
而為了避免 AI 生成內容遭濫用,Fable 5.1 寫出來的所有文字都會加上隱形浮水印。不過,目前只有特定機構才有專屬工具能偵測出這個浮水印。
跑分登頂,單一任務成本卻反升 2 成
Artificial Analysis 參與了 Fable 5.1 的發布前評測。在該機構整合多項基準測試的智慧指數(Intelligence Index)上,Fable 5.1 以最高推理強度拿下 66 分,超越 Claude Opus 5 的 63 分、前代 Fable 5 的 62 分,以及 GPT-5.6 Sol 與 Grok 4.6 的 61 分。
官方測試的落差更大。在 Terminal-Bench-Science(讓模型自主操作電腦完成科學研究任務的實測)上,Fable 5.1 拿下 52.6%,是前代 24.7% 的兩倍以上。Anthropic 也舉了實例:投資公司 Millennium 在測試中讓 Fable 5.1 找出內部系統一個罕見當機的原因,這個問題該公司工程師和其他模型追了數年都無法解釋。
價格方面,輸入與輸出單價不變(每百萬 token 各為 10 美元與 50 美元),但快取讀取費用從每百萬 token 1 美元降到 0.25 美元。快取讀取指模型重複讀取先前已處理過的內容,在長時間、多步驟的 AI 代理任務中占成本大宗。Anthropic 估計,典型工作負載的總成本可因此降約 25%,高度代理型任務最多省 45%。
不過 Artificial Analysis 的試算給出另一面:以最高推理強度跑完智慧指數的一項任務,Fable 5.1 平均花 3.76 美元(約新台幣 119 元),比前代的 3.14 美元貴 20%。原因是新模型完成同樣任務的輸出 token 用量約是前代的 1.7 倍。換句話說,快取降價省下的錢,追不上輸出量的增加;該機構估算,若沒有這波降價,單一任務成本還會來到約 5.16 美元。
要留意的是,Anthropic 的「典型工作負載省約 25%」與第三方的「單項任務貴 20%」並不直接矛盾,兩者採用的工作負載組合與推理強度不同,前者是一般使用情境的平均帳單,後者是最高推理強度下的基準測試單題成本。
該評測也點出跑分之外的代價:Fable 5.1 答題更敢出手,在沒答對的題目中選擇硬答(而非承認不知道)的比例,從前代的 63.6% 升到 72.6%,幻覺因此變多。
AI 開始做科學:重繪金星地圖、設計蛋白質
這次公告最不像「模型發布」的部分,是 Anthropic 用大量篇幅展示 AI 做科學研究的實例,並稱這些成果是「AI 模型將對科學發現做出重要貢獻」的早期證據。
Fable 5.1 以 NASA 麥哲倫號(Magellan)探測器 30 多年前拍攝的雷達影像,加上既有涵蓋金星五分之一表面的地圖,訓練神經網路重建出金星約三分之一表面的高程地圖:地形細節從過去 10 至 20 公里的解析度提升到 2 至 3 公里,高度精確度最多改善 25%。這份地圖已以創用 CC 授權公開,趕在 NASA 的 VERITAS 與歐洲太空總署的 EnVision 兩項金星任務之前,供未來觀測選點參考。
生物領域的成果來自 Mythos 5.1。在蛋白質結合體設計(許多新藥開發的第一步,目標是設計出能緊咬病灶標靶的蛋白質)上,12 個標靶的實驗驗證命中率接近 50%,遠高於業界典型的 10% 到 15%。它也替 7 個開源生物運算模型手寫 GPU 加速程式,最高讓推論速度快 2.5 倍,估計可省下 30% 到 60% 的 GPU 運算成本;這類最佳化過去要一組效能工程師花數週,模型幾天內完成。
本文初稿為AI編撰,整理.編輯/ 李先泰
