騰訊、阿里、字節,為什麼都在給Agent「造世界」?|甲子光年

甲子光年
2小時前

對Agent來說,「環境」既是考場,也是訓練場。

作者|周悅

編輯|王博

「AI的下半場——從現在開始——將把重心從解決問題轉向定義問題。」

這是姚順雨去年4月在博客《The Second Half(下半場)》中寫下的判斷。他認為,當一套通用訓練方法能夠越來越快地解決現成任務,更重要的問題將變成:AI到底該做什麼,什麼又算真正的進步?

他尤其強調評估(Evaluation)。繼續造更難的基準測試(Benchmark)已經不夠了,他更關心的是,基準測試上的高分,最後能不能轉化為真實工作中的能力。

去年12月,姚順雨加入了騰訊。今年6月,姚順雨以騰訊首席AI科學家、騰訊混元大語言模型及AI Infra負責人的身份暢談了「騰訊AI下半場」。提到Agent,他先強調「環境的重要性:「如果沒有好的環境,Agent就沒辦法去做各種各樣的事情。」

「甲子光年」梳理發現,近半年騰訊混元發布了6篇與「環境」相關的論文。從可執行任務供給,到長時任務、手機環境、自動生成與訓練閉環,再到環境隨模型能力進化,混元正在系統性構建Agent的訓練世界。

巧合的是,另一家大廠也在同一時期走向了這個座標。

今年7月,阿里通義聯合浙大、北大的論文《Towards General Agentic Intelligence via Environment Scaling》發表於ACL 2026 Findings,直接把「Environment Scaling」寫進標題,作者中包括阿里巴巴首席科學家周靖人。

不僅是騰訊與阿里,字節跳動Seed、以及太平洋對岸的OpenAI和 Anthropic,都在湧入同一個戰場。

對Agent來說,環境既是考場,也是訓練場。

排查一個軟件故障,可能起初只有一句簡單的任務描述。但要判斷Agent是否真的具備工作能力,就不能只給它一道考題,還得給它代碼倉庫、運行工具、狀態變化和結果驗證,搭出一個足夠接近真實業務的「世界」。

姚順雨說的「AI下半場」,正在多出一個越來越重要的變量:環境。

1.混元至少4撥人,在給Agent「造世界」

參與過騰訊混元研發的研究人員李非(化名)告訴「甲子光年」,他們從今年2月前後開始明顯關注Environment Scaling。一個很直接的信號來自招聘:當時,OpenAI和Anthropic開始專門招募強化學習環境(RL Environment)的人。

「他們要招這樣的人,那就說明這個方向是有價值的。」李非說。

在他看來,算法逐漸穩定,擴充訓練材料是一條收益相對可預期的路。但面對Agent,只靠靜態網頁和語料,已經不足以覆蓋它需要學習的交互過程。它要調用工具、更改數據庫、經歷一長串操作並拿到即時反饋。

數據沒有消失,只是從文檔變成了可以交互的「世界」。

4月,混元發布SkillSynth,規模化生成終端任務,其中一部分後來被用於Hy3 Preview訓練。

幾個月後,新問題出現了。同一批環境,模型刷上幾個版本就徹底摸透了,有效的學習信號越來越少。訓練環境也有「保質期」。

9月3日,混元公開《Environment Evolution for Terminal Agents》。一作依然是香港科技大學博士生範致遠,12位作者中有11位與4月的原班人馬重合。

不同的是,這次他們不再從零造環境,而是讓已有環境進化。原本Agent只需寫個靜態頁面,升級成從前端到後端部署、動態維護等更復雜的任務。

但這並不是混元一支團隊研究的方向。「甲子光年」梳理發現,僅今年4月至9月,混元至少4組研究人員,圍繞「造環境」發布了6篇論文,累計76人次署名。混元的幾組研究也在不斷向縱深推進:

  • 把任務做長:混元大模型前沿團隊科學家史淯城等人,推出Long-Horizon-Terminal-Bench,把終端任務從幾分鐘拉長到數小時;緊接着又通過15輪遞歸生成了超3.7萬個長程任務,平均一個任務的造價壓到了5美分。

  • 把環境搬上手機:混元視覺團隊發布HyMobileAgent,搭建了包含34個模擬App、超3.4萬項任務的PhoneWorld,從在騰訊健康預約疫苗到跨App調度,讓環境與數據協同擴展(Co-Scaling)。

  • 把環境接進管線:8月發布的UI-Mate,直接把任務生成、搭建沙箱、驗證器連接,將Environment接入後訓練的在線強化學習流水線。

Agent模擬在豆瓣上搜索騰訊視頻熱播電視劇,圖片來源:混元視覺團隊論文《HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents》

與此同時,混元也發生了一輪大的組織調整。

HyMobileAgent論文中的項目負責人是胡瀚。他曾擔任騰訊混元多模態理解負責人,並向姚順雨彙報。今年4月,兩人還共同署名了HY-Embodied-0.5。

7月23日,胡瀚離職創業。原大語言模型部和多模態模型部合併為基礎模型部,由姚順雨統一負責,「強化學習及Agent能力」被明確寫進新部門職責。

李非表示,他所在項目由負責人組織,團隊最初很多選題是研究人員的自主驅動;對於更高層是否存在統一的Environment規劃,他並不了解。

但從產出結果來看,水面下的分散支流,正匯聚成同一條大河。

2.Environment Scaling正在加速

混元對於環境的重視不是個例。

不久前,賓夕法尼亞大學教授、OpenAI研究員蘇煒傑在接受「甲子光年」採訪時打過一個比方:Scaling就像一個「什麼都能往裏扔的籃子」。模型是個高維函數,預訓練的收益放緩了,研究者不斷尋找新的變量,只要找到一個新的變量求導大於零,就能繼續看到收益。

「Scalling law還沒有撞牆,一個變量放緩並不影響大局。」蘇煒傑認為。

阿里通義聯合北大、浙大的團隊,直接把這個新變量命名為「Environment Scaling」,周靖人也在作者名單中。論文認為,訓練時見過的環境越豐富,Agent之後能處理的工具和任務也越多。

今年以來,多項公開工作已經把訓練環境擴展到千級、萬級甚至更大規模。

Ai2與華盛頓大學發布的TMax包含14,600個終端Agent訓練環境;Qwen與浙江大學團隊的SWE-Universe,則從真實GitHub項目中構建了807,693個可驗證的軟件工程環境。

但在「把世界做大」的過程中,所有人都遇到了同一個現實:高質量的環境難造。

混元團隊準備訓練材料時,曾從Hugging Face和GitHub收集47678個公開終端環境。按照環境質量、可解性和難度等要求篩選後,最後只留下127個。

47678個環境,最終只有127個合格——淘汰率高達99.7%。

李非舉例,任務要求和檢測標準如果不一致,對小模型影響不大,「因為小模型本來就不會」;但到了大模型,「如果一個任務的質量不夠,它會很明顯地直接被hack掉」。

「我們不能誤導Agent,也不能靠加Bug把環境變難,故意讓Agent做不對。」 李非認為,好的環境不僅要沒有Bug,還得足夠難,難到當前Agent確實還做不出來。

類似的問題也出現在OpenAI和Anthropic。今年7月,OpenAI重新審計SWE-Bench Pro,發現731個公開任務中,約30%存在不同程度的問題,包括測試過嚴、提示不完整、測試覆蓋不足等。

Anthropic發現,即使模型、任務和Harness都不變,只調整運行環境的CPU、內存等資源配置,Terminal-Bench 2.0在最嚴格與最寬鬆設定之間也能相差6個百分點。

這意味着,環境首先得足夠可靠,質量之外,還有時效性的問題。

模型能力不斷進化,另一類研究想讓環境跟着模型一起進化。比如,字節Seed與中國人民大學團隊的Agent-World已經搭出超過2000個環境、1.9萬個工具,並根據Agent暴露出的能力缺口繼續生成新任務,讓訓練環境跟着模型一起變化。

模型越強,真正還能讓它學到新東西的環境越難找。訓練場不只要造,還得一直翻新。Environment Scaling需要一種持續的供給。

一旦某種資源變得稀缺且昂貴,一門全新的基礎設施生意就會應運而生。

在大模型時代,訓練數據需求把Scale AI推到了超過290億美元的估值。那麼在Agent時代,誰會成為下一個掌握「訓練世界」的Scale AI?

3.下一個Scale AI會出現嗎?

新的供給需求,已經長出生意。

李非觀察到,一些創業公司正在組織人手構建高質量環境,再向模型公司提供。他提到,團隊也嘗試過使用模型直接合成環境:「量可以很快上來,但是它的質量很差。」完全依賴人工,開銷又會明顯增加。

資本已經投入。9月11日,據媒體報道,阿里正在洽談領投AI訓練與評測公司UniPat AI的新一輪孖展,規模約3億美元,對應估值約25億美元;騰訊、紅杉等現有投資者也可能參與。交易仍在磋商中。

UniPat並不是一家純粹的「造環境」的公司。創始人李寬此前在阿里通義DeepResearch團隊從事Agent後訓練、數據合成和強化學習,是WebSailor等工作的核心作者;聯合創始人兼CTO陳亮是北京大學計算語言學研究所博士生。

他們今年推出的Terminal-X、Vibe-Coding Arena等系統,做的正是把任務設計、沙箱環境與評測標準打包的一體化基建。

海外的整合走得更為激進。今年3月拿到a16z領投4300萬美元的Deeptune,專門通過復刻Salesforce、Slack等真實軟件環境提供「Agent健身房」。僅僅4個月後,它就被數據平台Mercor閃電收購——前者懂得怎麼造環境,後者懂得怎麼組織行業專家制定裁判標準。

Mercor CEO Brendan Foody也是Deeptune A輪的天使投資人。他告訴媒體,當初投資,很大程度上就是為了給收購鋪路。

連Scale AI自己,都在今年開闢了強化學習環境(RL Environments)業務,並披露新增訓練項目中接近一半已經涉及強化學習環境。

Environment的需求還不只停留在訓練階段。

9月的外灘大會上,周靖人談到Agent真正進入業務時,專門提到了另一類「環境」:安全沙箱、權限管控、授權、追溯,以及Harness和Agent Framework層的安全執行環境。他認為,Agent要真正進入業務,這些基礎設施必須一起補上。

這裏的執行環境並不等同於前文的訓練環境,但兩者都指向同一個變化:模型越從「會說」走向「會做」,圍繞它的環境越需要被單獨建設。

但在中國市場,戰局遠沒有那麼簡單。

騰訊、阿里、字節都在自建環境。原因在於,環境與後訓練效果直接相關,頭部模型廠很難把核心環境全部外包。而環境運行所需的龐大沙箱、即時隔離與高併發重置,本身又需要依託雲基礎設施。

對想成為「下一個Scale AI」的公司而言,這個賽道很窄。大廠模型團隊懂模型缺什麼,雲平台懂機器調度,但誰真正懂金融機構、律所或一家醫院裏錯綜複雜的真實業務流?

姚順雨在去年預判,AI下半場的重心將「從解決問題轉向定義問題」。當大廠和資本開始花大力氣給Agent「造世界」,這個抽象的判斷,變成一個具體的產業落點。

一年後,答案還在進化,世界也被重新搭建。

*應受訪者要求,李非為化名

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10