Meta 於美國時間 9 月 2 日(台灣時間 9 月 3 日)發布新一代旗艦模型 Muse Spark 1.3,既有推理模式當日起可透過 Muse Code 與 Meta Model API 付費使用。官方表示,max reasoning 模式需完成額外安全測試後才會推出;後續也將逐步擴大到 Instagram、Facebook 等社群平台與 Meta AI。
Meta 首席人工智慧官 Alexandr Wang(汪滔)接受《彭博社》訪問時表示,這是公司「有史以來最大的一次效能躍進」,並指出新模型在程式撰寫與代理型任務(agentic task,即能自主規劃並執行多步驟工作的能力)上,已經追上 OpenAI 與 Anthropic 近期發布的模型。
Wang 表示,Muse Spark 1.3 可與 Anthropic 的 Claude Fable 5.1 競爭,並且「優於」OpenAI 的 GPT-5.6 Sol,尤其在程式撰寫上表現突出;他也認為 Meta 這款新模型「贏過所有中國模型」。
不過他也提到,OpenAI 已預告代號「Astra」的下一代更先進模型,但尚未公布明確發布時間,並坦言 AI 模型之間的比較本來就不容易:各家模型擅長的任務不同,基準測試(benchmark)分數也可能被針對性優化,不必然反映真實使用情境下的表現。
針對同日發表的Google Gemini 3.8模型,Wang甚至還在X上表示:「我真的很不想說,但…Gemini 誰啊?」
獨立評測:進步在代理型任務,退步在少數幾項
根據獨立評測機構 Artificial Analysis 的測試,Muse Spark 1.3 的一般版本(xhigh)在其「智慧指數」(Artificial Analysis Intelligence Index,一項綜合多項測試後給出的模型排名分數)拿下 61 分,與 GPT-5.6 Sol、Grok 4.6 等模型打平,落後於 Claude Fable 5.1、Claude Opus 5 等分數更高的模型;Meta 合作夥伴限量預覽中的進階版本(max)則拿下 62 分,同樣落後於 Claude Fable 5.1 與 Claude Opus 5 的最高階版本。
進步幅度最大的是代理型任務,在模擬銀行客服情境、需要連續多步驟處理的測試 Tau3-Bench Banking 上,Muse Spark 1.3(xhigh)成績從上一版的 35% 大幅提升到 47%,進階版(max)更達到 52%,是所有受測模型中的最高分。在模擬真實有經濟產值任務的測試 GDPval-AA v2 中,Elo 分數(一種常用於比較相對實力的積分制)也較上一版明顯提升。
Artificial Analysis 指出,這些進步是靠模型「更努力思考」換來的:處理同類任務時,Muse Spark 1.3 用掉的推理步驟與 token 數都比上一版多出許多。
成本效益是這次評測另一項亮點。以 Meta 每百萬輸入 token 1.25 美元(約合新台幣 39.7 元)、輸出 token 4.25 美元(約合新台幣 134.8 元)的定價計算,Artificial Analysis 估算 Muse Spark 1.3(xhigh)在「智慧指數」的每項評測任務成本只要 0.55 美元(約合新台幣 17.5 元),是 59 分以上所有機型中最低;相近分數的 Grok 4.6 與 GPT-5.6 Sol,每項任務估算成本都要 0.9 美元以上。
不過測試也發現兩項小幅退步:一項考驗長文本理解的測試 AA-LCR 分數下滑,另一項評估模型是否「知道自己不知道」的測試 AA-Omniscience 準確率也略降,Artificial Analysis 解釋,這主要是因為新模型遇到不確定的問題時更常選擇不作答,而不是答錯的比例真的變高。
產品面更懂得踩煞車,安全脈絡也是升級重點
在常見的程式開發工作流程中,Meta 官方部落格指出,工程師比較 Muse Spark 1.3 與上一版 1.2 後發現,1.3 版平均少用約 20% 的工具呼叫、25% 的 token,執行起來更精簡。
除了程式撰寫效率提升,這款模型在其他使用情境的表現也有進步,能同時處理多個任務,不必開新對話重新交代一次需求;對自己能力的邊界有更清楚的認知,較少出現「不會做卻硬做」的情況;面對可能無法復原的動作,會先徵求使用者確認才執行,遇到指令模糊時也會主動提問而非自行腦補。
安全脈絡也是這次升級的重點。8 月初曾有一款 Meta AI 模型在資安測試過程中意外連上網路、入侵了一家外部業者的系統,Wang 表示這起事件促成了 Meta 這次針對 Muse Spark 1.3 加強的安全測試與訓練。
至於備受關注的模型權重是否開源,Wang 表示公司尚未拍板,但先前已規劃開源的上一版 Muse Spark 1.2 仍會依原計畫釋出;被問到更大型的新模型「Watermelon」,Wang 只透露開發持續進行中,未鬆口確切發布時間。
延伸閱讀:僅隔三週再升級!Google釋出Gemini 3.8 Flash與Cyber資安模型,搶攻「最聰明工作馬」定位
資料來源:Meta 官方部落格、《彭博社》、Artificial Analysis、OpenAI Astra 說明、中央銀行新臺幣/美元銀行間收盤匯率
本文初稿為AI編撰,整理.編輯/ 李先泰
