‌
‌
‌
‌
‌
美股

美國AI反攻中國開放模型!Reflection AI背靠輝達 推首款模型Beam 迎戰DeepSeek、Kimi

鉅亨網編譯許家華

AI gen LogoAI新聞摘要
  • 1.Reflection AI推出首款開放權重模型Beam,瞄準DeepSeek、Kimi等中國模型。
  • 2.Beam總參數5010億個,每次僅啟用230億個,主攻程式設計、推理及代理型AI。
  • 3.模型以1.05萬張GB300 GPU訓練4周,預計10月稍後開放模型權重及技術資料。

輝達(NVDA-US)支持的美國人工智慧新創Reflection AI周一(5日)正式推出首款開放權重模型Beam,瞄準中國目前在開放權重人工智慧模型領域的領先地位,直接挑戰DeepSeek、Kimi等低成本模型,主攻程式設計、推理及代理型AI(agentic AI)任務。

cover image of news article
(圖:REUTERS/TPG)

Reflection表示,Beam在程式設計及代理型任務上的表現已可與中國AI新創Z.ai的GLM-5.2競爭,並逐步逼近Qwen3.8-Max。公司強調,Beam最大的優勢並非單純追求最高模型能力,而是在維持競爭力的同時,大幅降低推理所需的運算資源,讓企業能以更低成本部署。

Beam採用稀疏混合專家模型(Mixture-of-Experts, MoE)架構,總參數達5010億個,但執行每項任務時只啟用230億個參數,因此不需要讓整個模型網路同時運作,有助於降低運算需求並提高執行速度。相較之下,Z.ai的GLM-5.2約有7440億個總參數,每項任務啟用約400億個參數。

‌

Reflection指出,Beam在部分先進推理測試中的表現與GLM-5.2相當,但推理運算量僅約為後者的三分之一至四分之一;若與超過2兆參數的Qwen3.8-Max相比,Beam的推理效率優勢更加明顯。公司因此將Beam定位為適合企業程式開發及代理型工作負載的高效率模型。

Reflection的測試結果顯示,Beam在Terminal Bench v2.1取得80.1分,SWE Bench Pro v2-Hard為77.2分,SWE Bench Pro v1為65.5分,SWEBench Verified則達80.9分。在AIME 2026數學測試中,Beam取得97.8分;GPQA Diamond則為90.5分。

在工具調用與搜尋能力方面,Beam在AutomationBench public取得37.0分,MCP Atlas為78.7分,BrowseComp搭配內容管理為77.4分,DeepSearchQA搭配內容管理則為80.1分。

不過,Beam並非所有項目都領先中國模型。Reflection也承認,在純粹能力表現上,部分前沿開放模型例如Kimi K3仍高於Beam,因此公司目前的主要競爭策略,是以更高的推理效率及較低的每Token成本建立市場優勢。

‌

Beam的訓練規模同樣相當龐大。Reflection表示,模型預訓練使用了2.38兆個經整理的網路及授權資料Token,並進行大規模強化學習(RL)。強化學習階段使用1.05萬張NVIDIA GB300 GPU,持續訓練4周,產生超過1億次rollout,訓練及評分過程則使用約13億個sandbox。

在強化學習期間,Reflection建立接近100萬個訓練環境,涵蓋軟體工程、終端機操作、競賽程式設計、STEM、網路搜尋、工具使用及一般知識工作等任務。公司表示,Beam訓練期間平均維持約11萬個並行rollout,並能在模型能力持續提升的情況下維持訓練穩定性。

Beam的基礎模型則在6144張NVIDIA GB300 NVL72 GPU組成的叢集上完成預訓練,整個端到端預訓練時間不到4周。Reflection表示,公司為了支撐大規模訓練,自行建立大部分基礎設施。

Beam目前仍處於最終紅隊測試及評估階段,Reflection預計在10月稍後正式發布模型權重、技術報告、模型卡及開發者工具,並計畫採用Apache 2.0授權。公司希望透過合作夥伴及開放原始碼工具生態系,讓開發者能將Beam導入現有AI工作流程。

這次發布也凸顯美國AI產業正加速追趕中國在開放權重模型上的優勢。與OpenAI及Anthropic等主要業者以封閉模型及API為主不同,開放權重模型允許企業下載模型、在自有硬體或雲端基礎設施上運行,並進行微調與客製化,因此在資料控制、部署彈性及成本方面具有吸引力。

Reflection成立於2024年,由前Google DeepMind研究人員Misha Laskin及Ioannis Antonoglou創辦,主要開發自動化軟體開發工具。公司今年稍早也與SpaceX簽署運算能力合作協議,可取得馬斯克旗下SpaceX位於Colossus 2資料中心的額外運算資源。

輝達對Reflection的支持則進一步凸顯其在AI基礎設施之外,積極扶植AI模型及開放生態系的策略。隨著中國開放權重模型在成本、客製化能力及程式設計表現上快速進步,美國業者推出Beam等模型,可能進一步加劇全球AI模型市場的價格及效能競爭。

目前Beam仍是Reflection模型系列的第一款產品,公司表示已開始訓練下一款更大型模型。Reflection希望透過持續擴大強化學習及推理效率,縮小美國與中國在開放權重AI模型領域的差距。

‌

文章標籤

section icon

鉅亨講座

看更多
  • 講座
  • 公告
    ‌
    Empty
    Empty
    ‌