AI新創Anthropic於9月28日推出Claude Sonnet 5.5,主打比前代Sonnet 5更快、更省,也更擅長寫程式與製作文件。官方宣稱,新模型輸出速度提升超過30%,完成相同任務所需的Token更少,單次任務成本最多可降低30%。
Sonnet 5.5是Claude 5.5系列第二款模型,定位介於旗艦級Opus 5.5與即將推出的Haiku 5.5之間。相較於專攻複雜問題的Opus,Sonnet主要處理範圍明確的日常工作,例如修正程式錯誤、編輯文件,以及製作簡報與試算表。
Sonnet 5.5兩大亮點:程式設計能力大幅提升,文件、簡報也更成熟
程式設計是Sonnet 5.5升級幅度最明顯的領域。根據Anthropic公布的結果,新模型在衡量AI代理操作終端機能力的Terminal-Bench 4.0中取得70.6%,前代Sonnet 5僅有10.3%。
Claude Sonnet 5.5主要能力測試比較
| 測試項目 | 評估能力 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 | AI代理程式設計 | 70.6% | 10.3% | 66.4% |
| CursorBench 4.0 | 真實程式開發任務 | 55.5% | 34.1% | 57.8% |
| GDPval-AA v2.1 | 跨產業知識工作 | 1,844 | 1,449 | 1,846 |
| OSWorld 2.1 | 電腦操作 | 80.1% | 57.0% | 81.8% |
註:粗體為各項最高成績。Terminal-Bench中的Opus 5.5採Xhigh推理強度;OSWorld為部分測試結果。不同模型的測試條件與推理強度可能不完全相同。
在模擬真實程式開發工作的CursorBench 4.0中,Sonnet 5.5得到55.5%,與Opus 5.5的57.8%只差約2個百分點。Anthropic指出,新模型能更快理解大型程式碼庫,也更常合併執行多個工具呼叫,因此可用較少步驟與Token完成任務。
除了寫程式,Sonnet 5.5也強化知識工作、圖表辨識及電腦操作能力,能依照既有範本製作簡報、整理文件和試算表,也更懂得替使用者介面加入視覺細節。
為了驗證實際應用能力,Anthropic曾提供一家上市公司的季度財報、法說會逐字稿及簡報範本,要求Sonnet 5.5製作10頁營運回顧;經兩名專家評估,其第一版成果已達到可直接寄出的水準。
API單價不變,為何能省30%?
Sonnet 5.5的API單價與Sonnet 5相同,但由於完成相同任務所需的Token較少,Anthropic宣稱,換算後的單次任務成本最多可降低約30%。
| API項目 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 輸入Token | 每百萬個2美元 | 每百萬個4美元 |
| 輸出Token | 每百萬個10美元 | 每百萬個20美元 |
| 快取寫入 | 每百萬個2.5美元 | 每百萬個5美元 |
| 快取讀取 | 每百萬個0.2美元 | 每百萬個0.2美元 |
官方文件顯示,Sonnet 5.5支援100萬Token上下文窗口,單次最多輸出12.8萬Token,並可接收文字與圖片。使用者也能調整推理強度,在速度、成本和回答品質之間取捨。
Claude 5.5家族如何分工?
Claude 5.5系列的定位可簡單分為:Opus負責複雜、需要策略判斷的工作;Sonnet處理日常程式開發與文件製作;即將推出的Haiku則鎖定大量、即時且重視成本的應用。
Sonnet 5.5目前已在Claude各平台、AWS、Google Cloud及Microsoft Azure上線,開發者可透過模型名稱 claude-sonnet-5-5 呼叫。
