Anthropic推出Claude Sonnet 5:效能逼近旗艦Opus4.8,定價卻更低的中階模型有多強?
Anthropic推出Claude Sonnet 5:效能逼近旗艦Opus4.8,定價卻更低的中階模型有多強?

重點一:Anthropic 發布中階模型 Claude Sonnet 5,效能逼近旗艦 Opus 4.8 但更便宜,即日起為免費版與 Pro 版預設模型。

重點二:較前代 Sonnet 4.6 多項評估提升,SWE-bench Pro(agentic 程式撰寫)由 58.1% 升至 63.2%;Anthropic 部署前評估顯示安全亦改善。

重點三:介紹價每百萬 token 輸入 2、輸出 10 美元(至 8 月 31 日),9 月起調為 3、15 美元,低於數款旗艦模型。

Anthropic 在 6 月 30 日發布新一代中階模型 Claude Sonnet 5,主打「史上最會做 agentic(自主代理)任務的 Sonnet」。

所謂 agentic,指模型能自己擬定計畫、操作瀏覽器與終端機等工具、在無人盯著的情況下自主完成一連串工作。官方部落格指出,Sonnet 5 能達到的自主程度,「幾個月前還得動用更大、更貴的模型才辦得到。」

上線範圍分層開放:Free 與 Pro 版即日起以 Sonnet 5 為預設模型;Max、Team、Enterprise 版可選用;開發端則提供於 Claude Code 與 Claude 開發平台(Claude Platform)。

定價方面,即日起至 8 月 31 日採介紹價,每百萬輸入 token 2 美元、每百萬輸出 token 10 美元(token 是模型計費的文字單位,約略對應字數);9 月起轉為正式價,輸入 3 美元、輸出 15 美元。

這組正式價雖與前代 Sonnet 4.6 的原牌價相同,但由於 Sonnet 5 換了一套處理文字的方式(業界稱為 tokenizer),同樣一段文字可能產生約 1 到 1.35 倍的 token,因此單次任務的實際花費未必和舊版相同。

據科技媒體《TechCrunch》報導,Sonnet 5 的定位本身就是一個訊號:agentic 能力已成各價位帶的基本盤,競爭的分水嶺不再是「誰做得最好」,而是「誰能用更低成本、在越少人為監督下越可靠地完成」。

這與 OpenAI 上週預覽的 GPT-5.6 Sol、Google 5 月推出的 Gemini 3.5 Flash 的訴求如出一轍。

和前代 Sonnet 4.6 差在哪?

對照今年 2 月發布的前代 Sonnet 4.6,Anthropic 表示,Sonnet 5 在推理、工具使用、程式撰寫與知識工作等多項重要評估中都有所提升,而非在所有測試上全面勝出。

幾個關鍵測試成績

以下為 Anthropic 公布的 SWE-bench Pro(軟體工程實測,衡量模型自主寫程式的能力)測試結果:

測驗 Sonnet 4.6 Sonnet 5 Opus 4.8
SWE-bench Pro(agentic 程式撰寫) 58.1% 63.2% 69.2%

在這項測試上,Sonnet 5 從前代的 58.1% 提升到 63.2%;旗艦 Opus 4.8 則以 69.2% 仍居領先(上述分數與各測驗的 effort、測試設定,可查 Claude Sonnet 5 System Card 與 SWE-bench Pro 榜單)。使用者可在模型的「effort(思考力度)」設定間調整,於成本與效能間取得平衡。

和旗艦 Opus 4.8 差在哪?

Anthropic 的定調很清楚:Opus 4.8 依舊是高準確度、高難度任務的首選;Sonnet 5 則提供「品質遠優於過往、但價格更低」的中階選項。兩者可透過 effort 等級切換,讓使用者依任務難度在成本與效能間找平衡。

安全評估與限制

在安全性方面,Anthropic 的部署前評估顯示,Sonnet 5 出現「不良行為」(例如配合濫用、欺瞞)的比率低於前代,更擅長拒絕惡意請求,也更能抵禦「prompt injection」(在指令中夾帶惡意內容以劫持模型)的攻擊;產生幻覺(一本正經地捏造事實)與諂媚附和的機率也比 Sonnet 4.6 低。

要注意的是,Anthropic 也指出,Sonnet 5 在「錯位行為」上的表現仍不及 Opus 4.8 與 Claude Mythos Preview。

早期測試夥伴的回饋,大致指向「更會做事、也更知道何時該拒絕」。例如自動化工具商 Zapier 資深工程師 Daniel Shepard舉例,團隊把一件兩段式任務(更新 Salesforce 帳戶分級、再對企業客戶發出上線通知)交給 Sonnet 5,它一次做完,「這種事以前做到一半就會卡住」;AI 應用開發平台 Lovable 共同創辦人 Fabian Hedin則強調,它拒絕不安全請求「乾淨又一致」。

定價低於數款旗艦模型,但高於 Gemini 3.5 Flash

若把各家模型的 API 每百萬 token 公告牌價擺在一起,《TechCrunch》整理指出,Sonnet 5 的介紹價低於旗艦 Opus 4.8(輸入 5 美元、輸出 25 美元)、OpenAI 的 GPT-5.5與 Google 的 Gemini 3.1 Pro,但仍高於主打低價的 Gemini 3.5 Flash。

要留意的是,不同模型的 tokenizer 不同,同一段文字換算出的 token 數有落差,因此牌價高低不等於單次任務成本的高低。

延伸閱讀:Fable 5要解禁了!Anthropic三周攻防懶人包:從模型停用到秘密談判,時間線一次看懂

資料來源:Anthropic 官方公告、《TechCrunch》、Anthropic 系統卡、Morph SWE-bench Pro 榜單、Anthropic 定價、OpenAI 定價、Gemini 定價

本文初稿為AI編撰,整理.編輯/ 李先泰

關鍵字: #Anthropic #Claude
往下滑看下一篇文章
青年如何跨出改變社會的第一步?Impact Star 3 組首獎團隊從教育到減塑,把想法帶進真實現場
青年如何跨出改變社會的第一步?Impact Star 3 組首獎團隊從教育到減塑,把想法帶進真實現場

許多年輕人懷抱熱忱,期盼透過行動讓社會變得更好,卻在起步時感到茫然,不知道該從何著手,也難以確認自己的想法是否回應真實需求。為了接住這份想要改變社會的熱情,「2026 Impact Star 青年影響力啟動賽」為青年搭起一個動手實作的舞台。

Impact Star 由新北市政府青年局主辦、社企流共同推動,邀請 5 個社會創新組織提出第一線問題,並安排專業導師陪伴 10 組青年團隊展開兩個月的實作,從訪談、理解需求開始,把點子一步步做成能進入現場測試的方案。

新北市政府青年局
圖說:新北市青年局 邱兆梅 局長分享「Impact Star 青年影響力啟動賽」的辦理初衷
圖/ 新北市政府青年局

把科學教材放進 LINE,協助老師更快完成備課

「LIS 情境科學教材」長期製作國中小科學影片與教學資源,這次競賽以「跨科教學減壓」為題,希望青年找出方法,協助非自然科背景的老師更容易使用這些教材準備科學課程。

本次獲獎團隊「EDU」成員劉子瑤、梁秭萁訪談一名剛進入教育現場的老師後,發現對方同時教授近 9 個科目,還要兼顧行政工作與班級經營,備課時間格外珍貴。因此決定把解決方案聚焦在備課流程最佳化,協助教師更快找到適合的教材。

「EDU」 決定利用教師們最熟悉的 LINE 官方帳號,整合 LIS 影片、投影片與教案,再把教材內容製作成視覺化備課卡。使用者只要透過手機,就能簡單掌握教學重點、課程流程及所需材料,直接放進既有的備課流程。

透過吸收教師的回饋,「EDU」 在競賽過程中持續調整,讓操作方式更貼近實際使用情境。最終作品在 3 名教師參與的初步測試中,於系統易用性方面獲得 82.5 分,反映受測教師對操作體驗的正面評價。

新北市政府青年局
圖說:劉子瑤、梁秭萁分享,未來也期待相同架構能延伸至其他科目,讓更多教學資源被帶進課堂。
圖/ 新北市政府青年局

把教育平權做成手機遊戲,讓青年找到參與方式

「TFT 為台灣而教」長期關注教育不平等,這次活動希望促進青年思考,如何讓高中生與大學生理解教育平權,並找到適合自己的參與方式。本次獲獎團隊「星築美少女」因此決定製作手機沉浸式遊戲《鐘響以前》,並將這些因素融入故事中。遊戲以一場為期 3 天的營隊為背景,玩家能在 15 至 30 分鐘內探索場景、與角色對話並蒐集線索。

遊玩過程中,玩家會發現一名叫做阿龍的孩子沒有出現在正式名單上;而阿龍未能參加營隊,背後牽涉交通、家庭照顧責任與行政程序等因素。玩家必須在有限的人力、時間與預算中作出選擇,透過安排阿龍的行程,切身理解教育不平等如何出現在孩子的日常生活中。

遊戲結束後,系統會依照過程中的選擇提供「行動者分類」,協助玩家了解自己適合投入陪伴、資訊整理或跨域解題,並附上 TFT 相關計畫與參與連結。在 67 名完成前後測的玩家中,認為自身專業難以對教育平權發揮作用的比例,由約 4 成降至約 2 成,顯示更多玩家在體驗後,看見參與教育平權的可能。

新北市政府青年局
圖說:星築美少女成員分享,自己曾在教育社會學課程中接觸相關議題,理解家庭、交通與經濟條件都可能影響一名孩子的求學歷程。
圖/ 新北市政府青年局

減塑求籤機走進飲料店,環保成為日常選擇

「海湧工作室」長期投入環境教育與廢棄物源頭減量,這次競賽希望讓民眾理解海洋廢棄物治理,並在日常生活中實際參與減塑。本次獲獎團隊「塑 per NOVA」從淨灘資料中注意到塑膠吸管造成的海洋廢棄物問題,也觀察到消費者即使知道減塑的重要,仍習慣於購買飲料時拿取塑膠吸管。

「塑 per NOVA」成員王姸儒、郭書睿,因此把實作場域選在手搖飲店,設計「減塑求籤機」。裝置設在消費者購買飲料的動線上,當消費者準備拿取吸管時,即提供可替代選項,讓減塑融入消費流程。

顧客投入 1 元後,可取得一支可自然分解的蒲草吸管,透過掃描 QR Code,可抽取線上環保籤詩。此求籤的趣味設計有效提升消費者嘗試意願,透過線上籤詩更進一步提供日常減塑方法介紹。

「塑 per NOVA」在 3 間飲料店測試兩週,累積約 150 次蒲草吸管取用。這段經驗讓他們直接觀察顧客如何操作裝置,也了解方案能否融入店家的營運流程,為後續拓展更多場域累積經驗。

新北市政府青年局
圖說:成員王姸儒、郭書睿設計「減塑求籤機」,讓減塑融入原本的消費過程。
圖/ 新北市政府青年局

前進新加坡,青年行動的下一步

獲得首獎的 3 組團隊,預計於 9 月底前往新加坡和南洋理工大學,與當地社會創新組織交流。團隊將延續這次實作累積的經驗,觀察新加坡如何回應相近議題,再思考哪些做法適合帶回台灣。

「EDU」希望了解新加坡如何支持非本科教師授課,以及當地社創組織有哪些能夠立即實踐的做法;「星築美少女」則將觀察教育政策的實際運作,及新加坡如何理解與推動教育平權。「塑 per NOVA」關注當地如何讓環保意識融入民眾生活,並希望從永續措施中找到減塑求籤機後續發展的方向。

頒獎典禮上,「星築美少女」成員王品然坦言:「一開始覺得社會影響力很遙遠,自己做不了什麼東西。」但參加完比賽後發現,踏出第一步就可能帶來改變,她說:「其實做一小步,你就可以改變一些東西。」

從起步時不知道該從何著手,到把方案帶進真實場域,3 組團隊在兩個月的實作中找到答案:青年不必等到有完整的解法才開始,只要先走近一個真實需求,並根據回饋持續調整,對社會的關心就能逐漸成為具體行動。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
一次搞懂工業AI
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓