一年前,具身智能行業最流行的問題之一還是:機器人的數據從哪里來?到了今天,問題已經悄悄變成了:花這麼多錢采來的數據,到底有沒有用?
最近發生在北京首鋼園的一幕頗有象徵意味。據媒體報導,2025年3月,北京首家人形機器人數據訓練中心在這裏揭牌。規劃中的3000平方米場地要放進108臺機器人,建設家庭康養、新零售、汽車裝配等十大場景。當時,這類訓練中心被視為具身智能時代的新型基礎設施,石景山區甚至提出,專案未來年數據產出量有望超過100萬條。運行不到18個月,變化來了,原運營方已經撤走了自有設備和機器人。專案方解釋,原來的遙操路線與新的發展方向存在偏差,採集數據的品質和精度也沒有達到預期。
據中國信通院等機構近期發佈的《具身智能訓練場研究報告(2026年)》(以下簡稱《報告》)的不完全統計,截至2026年6月底,我國已投入運營的具身智能訓練場超過70個,另有46個處於規劃或建設階段。
與此同時,圍繞數采中心的爭論開始升溫。一些行業人士質疑,部分數采專案依賴政府支持、本體採購和數據回購形成內部迴圈。數采中心沒有消失,但它已經進入重新算賬的階段。
數據荒催生了一門重資產生意
數采中心快速出現,有一個真實的技術背景:機器人缺少高質量的物理世界數據。
大語言模型可以從互聯網獲得海量文字和圖像用於學習。而機器人學習疊衣服、裝配零件或者打開抽屜時,需要知道的更多:手腕轉過什麼角度,夾爪用了多大的力,物體發生滑動後如何糾正,失敗以後怎樣重新完成任務。因此,過去兩年最直接的辦法就是建立訓練場,由人遙控機器人反復操作,將軌跡變成訓練數據。
可這種模式從一開始就很昂貴。上述《報告》估算,一座數千平方米的訓練場通常需要投入數千萬元至上億元。部署100臺人形機器人,僅本體採購就可能達到數千萬元,後面還有場景建設、數據採集設備、算力、網路和存儲,以及人力、維護和場租費用。
更麻煩的是,操作8小時不代表得到8小時有效數據。機器人會失敗,設備會出錯,場景需要複位,數據還要經過清洗和質檢。行業人士估計,專業遙操員一天工作8小時,最終真正可用的數據可能只有兩三個小時。
過去人們習慣用“10萬小時”、“50萬小時”、“百萬小時”描述數采中心的規模。現在看來,這些數字最多只能說明生產能力。真正決定商業價值的,是其中多少數據能夠進入模型、多少能夠賣出去,以及模型吃完這些數據以後究竟變聰明了多少。
數采中心靠什麼回本?
數采中心首先想到的當然是賣數據。然而,一個數采中心的商業模型取決於至少三個變數:效率、銷售率和複購率。10萬小時產能中有多少能通過驗收,是第一道門檻;通過驗收的數據能賣掉多少,是第二道門檻;客戶第二年還會不會繼續購買,是第三道門檻。
這裏有一個具身智能特有的困難。不同機器人的自由度、夾爪、感測器和控制系統並不一樣,一臺機器人採集的數據能在多大程度上遷移給另一臺機器人,目前仍在探索。因此最自然的客戶就是生產這臺機器人的企業。
由此產生了第二種模式:數據回購。例如,軟通動力向深交所提交的檔顯示,其子公司軟通天擎向智元創新採購機器人,用於建設無錫的具身機器人數采場;專案落地以後,智元創新將按照約定進行數據回購,形成“專案獲取—落地—數據回流”的合作閉環。
問題隨之向前推進了一步:如果數采中心最重要的數據客戶長期就是機器人供應商自己,這個市場能夠擴張到多大?一家機器人公司將本體賣給訓練場,訓練場再生產數據,由這家公司購買,由此產生的兩筆交易很難理解為兩個彼此獨立的市場需求。這也是今天“數采中心內迴圈”爭議真正值得關注的地方。
目前,一些地方的數采中心同時承擔招商、產業培育和基礎設施建設功能。據報導,在已經投入使用的64個數采中心中,至少有13個部署了100臺以上機器人;不少專案採用政企共建模式。有行業人士稱,一些專案存在地方平臺採購機器人、機器人廠商再回購數據的安排,一些地方政府對這類專案的投入產出已經開始變得謹慎。
真正的風險,可能還不止回不了本
經濟賬之外,數采中心還遇到了一個更棘手的技術問題:數據規模與數據價值並不天然成正比。這也是北京首鋼園專案調整值得關注的原因。
訓練場為了提高效率,往往把廚房、貨架、流水線甚至病房複刻到一個固定空間裏。這裏光照穩定、地面平整、物品擺放相對規範,機器人可以一天重複數百次同一個動作。真正的工廠卻不會如此配合。
零件可能反光,地面可能有油污,物體擺放每天存在偏差,生產線還有自己的節拍。機器人進入現場以後,真正決定它能不能長期工作的,往往是訓練場裏很少出現的異常情況:抓取失敗、突然遮擋、零件滑落、設備故障,以及失敗後如何恢復。於是出現了一個看似反常的結果:一個數采中心完全可能生產了海量數據,模型能力的提升卻很有限。
近期產業實踐已經開始發生變化。集中式“樣板間”之外,無本體數據採集、第一視角視頻、仿真合成以及分佈式真實場景採集都在快速發展。一些企業把採集設備直接放進家庭、辦公室、零售和生產環境,讓數據在真實活動中自然產生。還有平臺選擇1∶1複刻具體工位,機器人完成中試後再進入生產線,一旦現場出現問題,就將失敗案例帶回來重新訓練。
數據行業因此開始出現一個重要的計價變化。過去賣的是“一小時數據”;未來客戶更關心的可能是,數據讓機器人的任務成功率提高了多少、人工介入減少多少、部署時間縮短多少。數據規模仍然重要,但能力增量取決於數據品質、任務覆蓋、難例比例、與目標本體的匹配程度以及模型的評測結果。
這會讓很多依靠“產能”講故事的數采中心變得尷尬。一個年產100萬小時數據的中心,如果數據高度重複、跨本體遷移困難,對模型提升有限,規模本身不會自動轉化成競爭優勢。相反,一個只生產幾萬小時數據的平臺,如果掌握大量真實生產中的失敗案例、長尾情況和高質量力回饋,它的數據反而可能更加值錢。
數采行業過去最容易測量的是“生產了多少”,下一階段需要回答的是“機器人到底學會了多少”。
數采中心不會消失,“數據工廠”可能會
這一輪質疑並不意味著具身智能不需要數據,高質量物理交互數據依然稀缺。問題在於,第一代數采中心把數據採集理解得過於接近傳統製造業:建一座廠,擺幾百臺機器,雇一批操作員,再用“小時數”衡量產量。
這套模式正在被現實修正。未來真正有生命力的數采中心,很可能同時承擔數據採集、模型訓練、測試驗證、中試和現場問題回流。它的核心資產也會發生變化:機器人的數量和場地面積會逐漸退到次要位置,真實產業場景、模型能力和持續獲得高價值數據的管道會越來越重要。
這或許也是數采中心這一輪“退燒”真正留下的啟示。一個新產業剛剛出現時,數量最容易製造繁榮:多少家中心、多少臺機器人、多少平方米場地、多少萬小時數據,都清晰、直觀,也適合被寫進產業規劃和專案報告。
可當行業開始進入真正的商業化階段,評價體系必須改變。以後再看一家數采中心,值得追問的至少有三個數字:有多少收入來自與本體供應商無關的第三方客戶,客戶有沒有持續複購,採集的數據究竟給模型帶來了多大的能力提升。
前兩個數字檢驗市場是否真正存在,最後一個數字決定這些數據究竟值不值錢。
過去一年,具身智能行業忙著給機器人建“學校”。現在第一批學生已經走到校門口。接下來衡量這些學校價值的標準,會越來越簡單:機器人離開訓練場以後,究竟能不能真正把活兒幹好。
(作者王翔為復旦大學數字與移動治理實驗室研究員)
來源:中國澎湃新聞