輝達投資的美國AI新創Reflection AI在2026年10月5日公布首款開放權重模型Beam的預覽版,總參數5,010億,每處理一個token約啟用230億參數,主打寫程式與AI代理任務。
官方稱,Beam的推理測試成績與中國智譜的GLM 5.2相當,所需運算量卻只有對方的4分之1到3分之1。在DeepSeek、Qwen、Kimi等中國模型領跑開源前沿之際,這家以成為「美國的開放前沿AI實驗室」為目標的新創終於交出第一張牌,模型權重預計於2026年10月以Apache 2.0授權釋出。
Beam是什麼?
Beam採用「混合專家」(Mixture-of-Experts,MoE)架構。白話說,模型像一間養了大批專科廚師的廚房,每道菜只叫需要的幾位上場,因此總參數雖達5,010億,每處理一個token約啟用230億參數,運算負擔小得多。
訓練規模是這次公告的重點。Beam先用23.8兆個token(AI處理文字的基本單位)的資料預訓練,在6,144顆輝達GB300 GPU上花不到4周完成。
接著的強化學習(讓模型反覆試做任務、依結果給獎懲來學習)更大手筆:1.05萬顆GB300連跑4周,累積超過1億次試做,動用約13億個沙盒環境,練習題涵蓋近100萬個寫程式、AI代理與理工科任務。
Reflection AI稱,這是開源實驗室迄今規模最大的強化學習訓練之一,且能力隨投入的運算量持續上升,「沒有停滯跡象」。
官方另指出,在一段未納入瀏覽任務的強化學習訓練階段,Beam的瀏覽能力仍有提升;拿到網路權限後,它還會自己去詢問其他大型語言模型、呼叫文字辨識(OCR)服務讀文件。
值得注意的是,這次公布的只是預覽版。 官方表示模型仍在進行最後的紅隊測試(模擬攻擊找出安全弱點)與評估,先開放候補名單申請搶先使用;權重、技術報告與模型卡(說明模型能力與限制的文件)預計於2026年10月釋出,採Apache 2.0授權,企業可免費商用與修改。Beam只處理文字,有效上下文長度延伸到100萬個token。
跑分贏了誰、輸給誰?
Reflection AI公布的成績中,Beam在SWE-bench Verified(以真實軟體專案的程式錯誤測試修復能力)拿下80.9分;在Terminal Bench 2.1(測試AI用電腦終端機完成任務)拿下80.1分,與GLM 5.2的81.0分相當。
比起其他中國開源模型,Beam仍有差距。同樣在Terminal Bench 2.1,月之暗面的Kimi K3拿88.3分、阿里巴巴的Qwen 3.8 Max拿86.6分,DeepSeek V4.1 Flash更達90.6分。
在測試長時間軟體工程任務的DeepSWE v1.1,Beam只有44.4分,DeepSeek V4.1 Flash則是74.2分。官方也承認,Kimi K3等前沿開源模型在原始能力上仍然領先。
Beam要拚的是效率。官方稱,Beam在進階推理測試的成績與GLM 5.2相當,推論所需運算量卻少3到4倍;和Qwen 3.8 Max這類參數超過2兆的模型相比,運算量差距更大。
依官方推估,Beam在部分測試中能以較少運算量達到相近表現,Reflection AI也因此把Beam定位為企業寫程式與AI代理工作的「主力模型」。不過,上述跑分皆由官方自行公布,效率比較也是依啟用參數與生成token數推估,官方註明並非實測的推論成本。
輝達為何押注?美國開源陣營的反擊
Reflection AI在2024年3月成立,創辦人是兩名Google DeepMind前研究員:執行長Misha Laskin曾主導Gemini的獎勵模型(教AI分辨答案好壞的機制)開發,Ioannis Antonoglou則是圍棋AI AlphaGo的共同開發者。
公司原本做自動寫程式的AI代理,2025年10月宣布募得20億美元(約新台幣636億元),估值80億美元(約新台幣2,543億元),7個月內翻了約15倍,投資人包括輝達、紅杉資本、花旗與Google前執行長施密特(Eric Schmidt)等。據《36氪》報導,輝達在這輪出資約8億美元(約新台幣254億元)。
Reflection AI押注的,是一個「開源前沿不能只有中國模型」的市場缺口。 Laskin在2025年10月接受《TechCrunch》專訪時直言:「DeepSeek、Qwen這些模型是我們的警鐘,如果我們什麼都不做,全球的智慧標準就會由別人建立,而不是美國。」
Laskin也指出,企業與各國政府常因可能的法律後果而不採用中國模型,讓美國與盟友處於劣勢。《Wccftech》則評論,西方AI實驗室「終於」試著在高效率開放權重模型上,與DeepSeek、智譜等中國業者一較高下。
Beam是Reflection AI系列的第一款模型,官方表示下一代已在訓練中。下一個觀察點落在10月內:權重與技術報告釋出後,外界能否重現官方的跑分與效率數字,以及承諾一併公開的安全評測結果。
資料來源:Reflection AI官方部落格、《Wccftech》、《TechCrunch》、《36氪》、《路透》
本文初稿為AI編撰,整理.編輯/ 李先泰
