美股

輝達宣布Groq 3 LPX全面投產 Vera Rubin推理效率大提升 SpaceX加碼AI代理與太空AI

鉅亨網新聞中心

輝達(Nvidia)(NVDA-US)正加速把AI基礎設施的競爭,從傳統的模型訓練和推理性能,推進到圍繞AI代理(Agentic AI)的Token生成速度、能耗和成本展開的新階段。

cover image of news article
輝達宣布Groq 3 LPX全面投產,Vera Rubin推理效率大幅提升(圖:Shutterstock)

輝達周一(24日)宣布面向交互式AI推理的Groq 3 LPX正式全面投產。作爲Vera Rubin平台的重要組成部分,Groq 3 LPX主打超低延遲Token生成,輝達稱,在Artificial Analysis測試中,搭載Gemma 4 31B模型、100,000 Token上下文時,Groq 3 LPX實現每秒3400個輸出Token,爲該模型創下最高紀錄;針對AI代理編程等低延遲工作負載,其響應速度最高達到最近競爭平台的4倍。


同時,輝達公布Vera Rubin NVL72在真實AI代理工作負載下的新測試結果:基於SemiAnalysis的AgentX工作負載、採用DeepSeek V4 Pro模型,Vera Rubin每MW吞吐量最高達到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。輝達強調,AI代理任務不同於傳統聊天或摘要,任務上下文會隨着數百個步驟不斷累積,甚至達到數十萬Token。

據《華爾街見聞》,輝達同一天輝達還宣布SpaceXAI將採用Vera CPU加速下一代AI代理應用,並擴大基於Vera Rubin的平台建設,隨着其算力規模向數GW擴張;此外,SpaceXAI計劃將優化版Vera Rubin NVL72延伸至太空,用於首代Starmind AI衛星。

輝達此次將Groq 3 LPX正式推向全面生產,核心目的並不是用專用推理晶片取代GPU,而是爲Vera Rubin補充傳統GPU架構在低延遲Token生成方面的能力。

對AI代理而言,一次任務往往不再是「一問一答」:AI代理需要讀取文件、調用工具、執行代碼、檢查結果,再根據結果繼續推理,可能循環數百甚至數千個步驟。在這一過程中,每一步Token生成的速度都會影響整個任務的完成時間。

輝達稱,AI代理因此帶來了兩個不同的計算挑戰:一方面需要高效處理不斷增長的大規模上下文,另一方面需要以極低延遲持續生成Token。Vera Rubin NVL72負責更廣泛的訓練、推理以及上下文處理,而Groq 3 LPX則針對單用戶交互速度進行優化,提升Token生成速率。

輝達最新測試顯示,Groq 3 LPX在Gemma 4 31B、100K上下文條件下達到3400個輸出Token/秒;在AI代理任務和其他延遲敏感型工作負載中,響應速度最高達到最近競爭平台的4倍。輝達稱,這種速度可以讓AI代理更快完成代碼編寫、測試、工具調用和結果驗證等連續任務。

商業化方面,AI雲服務商NEBIUS將成爲首個採用Groq 3 LPX的雲廠商,並計劃將其部署到NEBIUS Token Factory生產推理平台。Groq也計劃成爲該平台最早一批採用者之一。

這意味着,隨着Groq 3 LPX進入全面投產,輝達此前收購Groq技術所形成的能力,開始真正嵌入Vera Rubin的資料中心產品體系。

相比3400 Token/秒這樣的單項性能指標,輝達此次更值得關注的,是其對每MW吞吐量和Token成本的強調。

輝達公佈的測試數據顯示,在SemiAnalysis AgentX工作負載下,Vera Rubin NVL72每MW吞吐量最高達到GB300 NVL72的30倍,對應每Token成本最高降低35倍。該測試使用真實的AI代理編程軌跡,保留了實際的上下文增長、工具調用和子AI代理生成等環節。

因此,每MW吞吐量最高提升30倍只是AI推理效率大幅提升的一種體現,並不是單純意味着晶片的推理速度提高30倍。

這項指標對於AI資料中心的意義尤其突出。傳統大模型服務更多關注單次請求的延遲和吞吐量,而AI代理工作負載會持續消耗Token。輝達援引OpenRouter數據稱,AI代理工作負載消耗的Token數量可以達到簡單聊天請求的15倍。原因在於,一個AI代理可能先查詢資料庫,再搜索新聞和文件,調用子AI代理進行分析,運行代碼並反覆驗證,整個過程中上下文不斷累積。

這也使得AI基礎設施的經濟性開始出現新的衡量方式:同樣一MW電力,到底能夠完成多少有效AI代理任務?

對電力和資料中心資源日益成爲AI擴張瓶頸的背景而言,提高單位電力能夠產生的Token數量,可能比單純提高峰值算力更加重要。

Vera Rubin從「GPU平台」變成完整AI工廠

從架構來看,Groq 3 LPX並不是孤立的產品,而是輝達Vera Rubin「極致協同設計」路線的一部分。

輝達此前已經將Vera Rubin定義爲面向AI代理時代的AI工廠平台。整個系統並非單純由GPU組成,而是圍繞計算、網絡、記憶體和軟體進行協同設計,涵蓋Rubin GPU、Vera CPU、Groq 3 LPX、BlueField-4 DPU、Spectrum-6 SPX等不同組件。

其中,Rubin GPU承擔大規模訓練、推理以及上下文處理等任務;Groq 3 LPX負責高速Token生成;Vera CPU則處理AI代理在模型調用之間產生的大量CPU密集型工作,包括工具編排、代碼執行、資料處理和模擬。

輝達此前公布的架構訊息顯示,Vera Rubin平台通過七款晶片和五種專用機架進行協同設計,目的就是讓不同硬件分別承擔最適合自己的任務,而不是讓一類處理器包辦整個AI工作負載。

這意味着,輝達正在把AI基礎設施從「GPU集群」進一步升級爲一個異構計算系統。

對AI雲端廠商而言,這種架構的意義在於,可以針對訓練、長上下文推理、Token生成、工具調用等不同階段進行資源配置,從而提高整座資料中心的利用率和經濟回報。

SpaceXAI加碼Vera:AI代理從資料中心走向太空

就在Groq 3 LPX全面投產之際,SpaceXAI也宣佈進一步採用輝達Vera Rubin體系。

輝達8月24日宣佈,SpaceXAI將部署Vera CPU,用於下一代AI代理應用。Vera專門針對模型推理之外的CPU工作負載進行設計,包括工具調用、代碼執行、資料處理、任務編排和模擬。

Vera採用88顆輝達自主設計的Olympus核心,並配備高帶寬LPDDR5X記憶體,帶寬最高達到1.2TB/s。輝達稱,在AI代理、強化學習和資料處理等工作負載中,Vera任務完成速度最高可達到x86 CPU的1.8倍。

對於SpaceXAI而言,Vera的價值並不僅僅在於提高CPU性能。

AI代理運行過程中,大量任務發生在GPU推理之間,例如執行代碼、處理資料、調用工具和協調不同AI代理。如果這些任務由CPU處理速度不足,就可能導致GPU等待,從而降低整個AI工廠的利用率。

因此,SpaceXAI希望利用Vera處理這些「模型之外」工作,讓GPU更多地專注於模型訓練和推理,從而提高整個系統的效率。

SpaceXAI同時計劃擴大基於Vera Rubin的Grok AI基礎設施,隨着計算能力向數GW規模擴張;更進一步,該公司還計劃將優化版Vera Rubin NVL72用於首代Starmind AI衛星。

這意味着輝達的加速計算體系正在從地面資料中心向軌道計算延伸。從Groq 3 LPX全面投產,到Vera Rubin公佈30倍每兆瓦吞吐量,再到SpaceXAI將Vera Rubin延伸至Starmind衛星,輝達此次連續釋放的訊息背後,指向的是同一個變化:AI應用正在從生成內容走向自主完成任務。

在聊天和摘要場景中,用戶往往只需要模型快速給出一段文字;而在AI代理場景中,模型需要持續推理、調用工具、執行代碼、訪問外部資料並不斷驗證結果。

這意味着,未來AI基礎設施的核心指標也可能發生變化——從過去關注「訓練一個更大的模型」,逐漸轉向關注單位電力能夠產生多少有效Token、單位成本能夠完成多少任務,以及AI代理完成一項複雜任務究竟需要多長時間。

輝達此次把Groq 3 LPX、Vera CPU和Rubin GPU放進同一套AI工廠體系,正是在針對這項變化重新設計基礎設施。

而SpaceXAI則提供了一個更具想象力的應用方向:若這套體系最終能夠從地面資料中心延伸到軌道,AI運算的界線也將不再侷限於傳統的資料中心機房。


文章標籤

section icon

鉅亨講座

看更多
  • 講座
  • 公告

    Empty
    Empty