OpenAI於美國時間9月22日(台灣時間9月23日)推出GPT-6 Sol與GPT-6 Luna兩款模型,定位在9月3日發表的旗艦模型GPT-6 Astra之下,以與Astra相近的方法訓練,主打更快、更便宜。API價格約降一半:Sol每百萬token輸入2美元、輸出10美元,Luna輸入0.1美元、輸出0.5美元。
獨立評測機構Artificial Analysis實測後指出,兩款模型跑完同一套測驗的成本約省下一半到六成,綜合智力分數則與前代GPT-5.6持平,進步與退步的項目互見。
價格腰斬,Sol與Luna在GPT-6家族怎麼分工?
OpenAI把GPT-6家族分成三層。Astra仍是官方認定「全面最強」的模型,適合要求最高品質的專案;Sol可承擔困難的工作任務,並以更高的使用額度與更低成本,讓用戶有更多空間反覆修改;Luna則是三款中最便宜的一款。OpenAI表示,快取與推論效率改善讓服務成本下降,省下的費用直接反映在售價上。
以每百萬token(AI處理文字的計價單位)計,GPT-6 Sol輸入價格從GPT-5.6 Sol的4美元降至2美元(約合新台幣64元),輸出從20美元降至10美元(約合新台幣319元)。
GPT-6 Luna輸入從0.2美元降至0.1美元(約合新台幣3元),輸出從1.2美元降至0.5美元(約合新台幣16元)。要留意的是,OpenAI所說的「便宜50%」是對比GPT-5.6的促銷價,而非原價。
除了降價,OpenAI也改善GPT-6的提示快取(prompt caching,把重複使用的內容暫存起來,不必每次重新計算),預設命中率更高,快取讀取的輸入token可省下90%費用。例如近日GitHub曾表示,過去幾個月這些改進讓Copilot在數十億次請求中,需要重新處理的prompt token比例減少逾50%,回應也跟著變快。
開放範圍方面,Plus、Pro、Business、Enterprise與Edu用戶自9月22日起可在ChatGPT Work與Codex使用兩款新模型,Free與Go用戶則可在桌面版App使用GPT-6 Luna;兩款模型尚未開放於一般Chat介面,OpenAI表示將在當天分批上線。開發者可透過API以gpt-6-sol、gpt-6-luna呼叫。
官方跑分:成本少六成以上,分數對打Claude
OpenAI在公告中,將新模型與對手Anthropic的Claude系列進行對比(皆採最高推理強度設定):
商業與專業任務:GPT-6 Sol表現超越Claude Opus 5,且每道任務成本大省60%到91%。
程式開發與電腦操作:Sol表現逼近甚至追平高階Claude,成本省約80%;平價版Luna則與中階Claude持平,成本大幅節省超過90%。
正確率與風格:內部實測顯示,Sol在易錯情境的犯錯率只剩前代的一半。回答風格也變得更精簡,減少了艱澀術語與冗長細節。
不過,這份比較數據有個「時間差」。《TechCrunch》指出,Anthropic剛好在OpenAI發表前90分鐘推出新一代Claude Opus 5.5,因此OpenAI比較的對象僅為前代模型(Opus 5與Fable 5系列),並未納入對手的最新戰力。
第三方實測:成本真的省一半,智力與前代持平
第三方機構Artificial Analysis的實測也印證了這次的降幅。雖然新模型每題用掉的token變多,但在綜合智力與前代(GPT-5.6)持平的情況下,成本確實大幅降低。實測重點如下:
實測成本大減:Sol每題成本約省50%(降至1.06美元),Luna省約60%(降至0.07美元)。
幻覺減少,但更常「拒答」:兩款模型不懂裝懂的「幻覺率」顯著降低。不過,Sol主要是靠「更常拒絕回答」換來的,這也導致它雖然答錯變少,但整體正確率卻從59%微降至54%。
寫程式與知識工作表現:程式能力上Sol小幅進步、Luna略微退步。而在複雜的「知識工作」評測中,兩者分數皆有下滑,主因是排版呈現變差、容易遺漏指令要求。
總結來說,雖然部分能力有捨有得,但兩款新模型仍讓OpenAI 在「成本效率」上佔據極大優勢,讓用戶能以同樣的花費換取更高的整體成效。
延伸閱讀:Anthropic推出Claude Opus 5.5!評測效能媲美Fable 5.1,運行成本大降40%成高CP值選項
資料來源:OpenAI官方公告、Artificial Analysis評測、《TechCrunch》、《Decrypt》
本文初稿為AI編撰,整理.編輯/ 李先泰
