從數據到智能 再到進化:Agent 正在重寫 AI 基礎設施
金色財經
一個工程師寫完數據處理代碼,點下提交,然後去喝了杯咖啡。十幾分鐘甚至幾十分鐘之後,他才回到屏幕前看結果、改代碼、再提交。這條「等待—反饋」的空隙,過去一直是數據平台默認的節奏。
Agent 沒有這個空隙。它拿到一次結果,立刻驗證,緊接着並發地去試第二種、第三種方案,飛快拿到反饋,再發起下一輪調用。
人用平台,發過來的是一個相對確定的任務,算完、給結果、走人;Agent 用平台,會不停地換着法子去完成你交代的那個目標。壓力就這樣被放大了——管控的壓力和隱形計算的壓力,會十倍、百倍地往上翻。
這正在成為 2026 年雲端運算需要面對的一種新負載。
AI 正在深入「把模型用起來」的階段。模型一旦長成 Agent,它就不再是一個躺在那裡等你調用的接口,而更像一個會自己找數據、自己拆任務、自己並發試錯、自己一直跑下去的數字員工。它製造出來的負載,和過去十幾年雲平台習慣承載的那種負載,完全是兩回事。
阿里雲智能集團首席技術官李飛飛在雲棲大會上把智能體落地拆成三個詞:Model 決定智能的上限,Context 決定 Agent 讀不讀得懂你的業務,Harness 決定它能不能真正調起工具、把事做完、並且一直跑下去。想同時餵飽這三樣,光把一個模型做大做強,遠遠不夠。
數據流動起來產生智能,智能以 Agent 的形態落進業務,業務跑起來又產生新的數據和新負載,回過頭再推着整個系統往前走。飛輪轉得快不快,取決於三件事——模型生產的效率、智能落地的效率、系統自我進化的效率。
今年雲棲大會上,阿里雲做的事,就是沿着這三個效率,把從數據入湖、訓練集生產、模型訓練、推理服務,一直到系統自己優化自己的整條鏈路,一次性升級了一遍。
貫穿這些升級的,是阿里雲所強調的「芯雲模一體」:讓晶片、雲平台與模型逐漸走向協同設計,打通從原始數據到業務決策的全棧。
01 當模型走進真實世界,數據先成了瓶頸
AI 進入物理世界之後,數據首先發生了變化。
過去的大模型主要處理文本和代碼。自動駕駛、具身智能和科學計算面對的卻是影音、點雲、運動軌跡和傳感信號。原始數據很容易積累,真正困難的是把這些數據清洗、質檢、標註並轉換成模型可以使用的訓練集。
穹徹智能首席科學家呂峻在接受採訪時提到,具身智能的數據以影音和點雲為主,從採集完成到進入訓練,中間可能經過幾十道處理。一次數據版本迭代,短則兩周,長則一個月。儲存、數據處理和模型訓練之間只要有一個環節銜接不暢,整個實驗周期都會被拉長。
從長期看,具身智能可用的數據規模可能仍有兩到三個數量級的缺口。但呂峻認為,現階段更直接的問題已經轉向數據質量:哪些數據真正有效,怎樣完成精細標註和前後質檢,以及算法能否把這些數據轉化成模型能力。
數據生產方式也在隨之變化。傳統人工標註需要組建和培訓團隊,規則改變後還要重新調整流程;模型輔助標註可以更快迭代,並將人力集中到質檢和高難度樣本上。對於具身智能公司來說,這種變化影響的不只是成本,還決定了模型實驗能否足夠頻繁地進行。
阿里雲對 MaxCompute 和 EMR 的升級,針對的正是這條數據生產鏈。MaxCompute 將 CPU、GPU 和大模型 Token 納入統一調度,MaxFrame 和 SQL AI Function 可以直接調用模型處理圖片、文本等全模態數據。面向自動駕駛和具身智能等場景,行業 Skill 則將數據管線進一步封裝,讓開發者通過自然語言組織處理任務。
EMR Serverless Spark 支持 Spark、Ray、Daft 等全模態引擎,並與 Paimon、Iceberg 等開放湖表格式連接。按照阿里雲公布的數據,這套方案可以讓具身智能數據處理耗時減少 40%,PB 級原始數據能夠直接生成 LeRobot、RLDS 格式的訓練集。
數據準備完成後,問題來到了訓練端。PAI-DLC 3.0 引入 Xfuse,對算力底座、訓練框架和任務運行狀態進行聯合分析,自動定位通信、數據讀取、算子和資源調度中的問題。阿里雲公布的測試結果顯示,多模態模型端到端訓練速度提升了 2.4 倍。
這類優化越來越依賴晶片、雲平台和模型之間的協同。
阿里雲智能集團研發副總裁、計算平台事業部負責人汪軍華則在接受採訪時舉例稱,一種模型架構即便效果足夠好,如果與晶片緩存、通信方式和推理框架不匹配,落到真實硬體上仍可能付出很高的成本。AI 基礎設施由此進入一個更強調聯合設計的階段:模型架構需要理解硬體,計算平台也需要理解模型的工作方式。
對於企業而言,模型能力的形成已經是一條連續生產線。原始數據處理得有多快,訓練問題能否及時定位,算力能否隨任務靈活調度,都會影響模型迭代的最終速度。
02 智能到應用,Agent 改變了平台的使用方式
模型訓練完成,只解決了智能從哪裡來的問題。Agent 進入企業,還要先學會如何使用數據。
企業數據通常分散在數據湖、數倉、搜尋和實時計算系統中。不同部門對同一個指標可能有不同口徑,字段背後還隱藏着大量業務規則。Agent 即使找到了數據,也不一定知道這些數據意味著什麼,更不能在生產環境中隨意執行修改和刪除操作。
這便是 Agent 與傳統數據工具的差別。過去,工程師理解數據結構,也知道一次操作可能帶來的影響;Agent 依賴上下文、語義和權限系統作出判斷。一旦這些資訊缺失,它越自動化,潛在風險反而越大。
阿里雲此次提出讓 OpenLake 進一步走向 Agentic Lake。開放湖倉繼續承載統一、實時的全模態數據,湖上的計算引擎則通過 Skill、MCP 和調用接口向 Agent 開放。DataWorks 提供跨引擎語義層、數據治理與任務編排,讓 Agent 可以圍繞業務目標組織數據處理流程。
新發布的 AI 原生大數據服務 ADA,則進一步採用多智能體協同。用戶從一個自然語言入口提出問題,系統再調動離線計算、實時分析、搜尋和 AI 訓推等不同引擎,完成數據分析、工程、治理和運維任務。
自然語言降低了數據使用門檻,也把安全治理推到了更重要的位置。阿里雲資深產品解決方案總監、大數據和人工智慧平台解決方案負責人魏博文在接受採訪時提到,Agent 可以擁有較高的自主性,但涉及數據增、刪、改、查等高風險操作時,需要在一個可控制、可回滾、可審計的數據沙箱中運行。
這意味著企業的數據權限體系需要繼續細化。未來需要管理的不只是某個員工能否訪問一張表,還包括 Agent 能在什麼任務下調用哪些數據、可以執行到哪一步,以及出現異常後由誰接管。
Agent 的運行方式同樣在改變推理基礎設施。它可能圍繞一個任務工作數小時,連續調用多個模型和工具,請求量也會隨任務階段劇烈波動。企業關注的指標因此從單次 Token 生成速度,擴展到冷啟動、緩存、擴縮容、服務穩定性和整體成本。
PAI-InferX 通過智能路由、Cache 感知調度、KV Cache 儲存和模型預熱等能力,處理 Agent 的持續推理負載;PAI-RLS 則提供託管式強化學習服務,讓企業可以利用真實任務軌跡繼續訓練專屬模型。
在直播、風控等實時場景中,數據與行動之間的距離還要進一步縮短。Flink Streaming Agent 支持影音、音頻和事件流的實時接入與理解,並提供動態編排和長中短期記憶。央視體育的實時 AI 解說就是一個例子:Agent 需要同步理解畫面、聲音和賽事事件,再生成與比賽進程對應的解說。
當數據語義、權限治理、推理服務和實時計算被連在一起,Agent 才具備進入真實業務流程的基本條件。
03 從應用到進化,當運行反饋成為基礎設施的新燃料
Agent 進入應用後,會持續製造新的數據、任務軌跡和計算負載。接下來的問題是,當系統複雜度不斷上升,基礎設施自身能否跟上變化。
大規模訓練和數據查詢的優化,過去高度依賴專家。工程師要查看任務狀態,定位數據讀取、通信、算子或者查詢計劃中的瓶頸,再修改參數並重新運行。這種方式適合相對穩定的工作負載,但 Agent 發起的任務更頻繁,組合也更複雜,人工調優很難覆蓋所有變化。
汪軍華描述了一種新的優化過程:Agent 可以主動在訓練任務中插入 Profiling,分析性能瓶頸;發現問題後,再調用訓練框架提供的 Skill,生成新的優化任務;任務完成後比較結果,並形成分析報告。整個過程逐漸從一次人工診斷,變成可以反覆執行的反饋閉環。
PAI-CrystalLLM 體現了類似思路。
萬卡訓練中的許多通信和配置問題,往往只有達到足夠規模才會暴露,直接使用真實集群試錯代價很高。CrystalLLM 使用不到 1% 的 GPU 資源,模擬萬卡集群的訓練效果,相當於為大模型訓練提供一個「風洞」。根據阿里雲的內部實踐,它為訓練任務帶來了 2% 至 10% 的 MFU 絕對提升。
在數據查詢側,Hologres 的自進化查詢優化器會分析真實 Workload,提煉候選優化方案,通過正確性和性能門禁完成驗證,再將有效經驗沉澱回系統。阿里雲公布的數據顯示,它在四個月內自主發現並完成 28 項優化,優化器性能提升 100%,湖上查詢性能提升 38%。
這些能力的共同點,是讓應用產生的負載成為系統優化的輸入。系統可以觀察任務怎樣運行、哪裡出現瓶頸、哪種方案更加有效,再把經過驗證的經驗用於下一輪任務。
穹徹智能的實踐提供了一個更接近業務的結果。其基於 MaxCompute、Hologres、DataWorks 和 PAI 搭建雲上的 Data+AI Pipeline。按照阿里雲公布的數據,數據處理吞吐提升超過十倍,模型訓練效率提升約 50%。對於仍處在快速試驗階段的具身智能公司來說,基礎設施最大的價值,就是把原本以周為單位的數據和模型迭代進一步壓縮。
不過,基礎設施的自我優化仍有明確邊界。
在 AI for Science 場景中,無盡前延 CTO 張林峰認為,偏計算型的學科更容易被 AI 改造,因為數據、模型和結果都可以在數字系統內流轉。一旦進入生物實驗、科學儀器和物理世界操作,問題就會複雜得多:科學軟體效率不高、接口老舊,實驗設備也未必支持自動控制。Agent 即使能夠設計任務,也很難獨立完成從計算到實驗驗證的完整閉環。
這恰好說明,Agent 基礎設施的價值並不等於替企業完成所有創新。它可以降低數據處理和模型試錯的成本,縮短應用反饋進入下一輪訓練的距離,但數據質量、算法路線、行業軟體和物理設備,仍然決定智能最終能走多遠。
從數據產生智能,到智能進入應用,再到應用推動系統優化,阿里雲試圖搭建起一條持續轉動的反饋鏈。Agent 時代基礎設施競爭的關鍵,也正從承載多少模型,轉向能否讓數據、模型和系統一起更快進化。
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
- 讓加密貨幣幫你滾出年化30%現金流
- 掌握全球財經資訊點我下載APP
延伸閱讀
- 比特幣又被Fed嚇跌!8萬美元屢攻不破 連四日走低
- 比特幣多頭夢醒?非農強勁引爆Fed升息警報 才站回8萬美元又被打下來
- 橋水達里歐改口建議持有比特幣!分析:想靠它避險恐怕「錯了」
- 比特幣為何突然暴漲?能否突破8萬美元需觀察這「三項指標」
- 講座
- 公告
上一篇
下一篇