實踐)
一筆60億美元的投資把已經(jīng)持續(xù)火熱的人形機器人賽道又一次推向輿論高點。軟銀創(chuàng)始人孫正義通過旗下基金大手筆押注挪威機器人公司1X Technologies外界的第一反應往往是“資本又回來了”。但如果你只把這當成一條融資新聞就會錯過真正重要的信號孫正義押注的并不是某個具體的機器人型號而是一條“先場景、后形態(tài)、再AI大腦”的具身智能商業(yè)化路線。這篇文章不打算討論誰賺誰虧而是想從技術開發(fā)者的視角拆解幾個更實際的問題1X到底做了什么讓老辣的孫正義愿意掏出真金白銀它和波士頓動力、特斯拉Optimus的技術路線差異在哪如果你是一位機器人工程師或AI開發(fā)者現(xiàn)在入局人形機器人應該先補哪些技能、跑通哪些流程、避開哪些坑讀完這篇文章你能對人形機器人行業(yè)的技術棧建立一份比較完整的判斷框架也可以直接照著后半部分的示例在本地搭建一個最小可用的具身智能開發(fā)環(huán)境。1. 這筆投資到底投了什么人形機器人的技術分水嶺先從新聞本身說起。據(jù)多家媒體報道軟銀在本輪融資中投入約60億美元直接推動1X Technologies的估值進入百億美元俱樂部。公開資料顯示1X Technologies成立于2014年總部在挪威前身是Halodi Robotics。這家公司早期做過遠程操作機器人后來逐步轉(zhuǎn)向自主具身智能方向旗下兩條產(chǎn)品線分別是輪式機器人EVE和雙足人形機器人NEO。EVE定位非常明確它沒有雙腿而是采用輪式底盤主要面向安保巡邏、倉儲物流、遠程巡檢等商業(yè)場景已經(jīng)有實際客戶落地使用。NEO則是在2024年8月發(fā)布的雙足人形機器人2025年推出面向家庭場景的NEO Home版本希望通過訂閱制模式進入消費者市場。從公開信息看1X還搭建了名為1X World的機器人數(shù)據(jù)平臺并推出了MindStudio技能訓練平臺。簡單說EVE負責在真實世界里跑業(yè)務、攢數(shù)據(jù)NEO負責探索家庭場景的長期想象力1X World和MindStudio負責把這些數(shù)據(jù)變成可復用的機器人技能。這筆投資真正值得關注的地方不是“孫正義又回來了”而是它確認了一個技術判斷人形機器人的競爭已經(jīng)從“誰的關節(jié)電機更厲害”轉(zhuǎn)向“誰的AI數(shù)據(jù)飛輪轉(zhuǎn)得更快”。如果只看硬件參數(shù)1X未必比波士頓動力Atlas更驚艷但如果看商業(yè)化路徑和數(shù)據(jù)閉環(huán)1X選擇的路線可能是目前最接近“可真實落地”的一種。對普通開發(fā)者來說這條新聞意味著兩件事。第一人形機器人不再只是實驗室里的運動控制難題而是變成了一個“AI模型機器人硬件數(shù)據(jù)平臺”的復合工程問題。第二這個賽道正在從“少數(shù)巨頭玩得起”變成“有AI和機器人基礎的人都能參與”的技術生態(tài)1X World、MindStudio這類平臺的出現(xiàn)本質(zhì)上是在降低開發(fā)門檻。2. 1X的技術路線為什么它和波士頓動力、特斯拉不一樣要理解1X的差異化最好的方式是把頭部人形機器人公司放在一起橫向?qū)Ρ?。公?產(chǎn)品代表產(chǎn)品技術側(cè)重點商業(yè)化方向波士頓動力Atlas運動控制、動態(tài)平衡、液壓/電驅(qū)偏研究展示早期軍事/工業(yè)探索特斯拉Optimus純電驅(qū)、依托車企供應鏈、FSD自動駕駛技術遷移工廠搬運、家庭服務FigureFigure 02OpenAI大模型接入、通用對話與規(guī)劃工業(yè)倉儲、通用任務1X TechnologiesEVE、NEO輪式先商用、雙足后家庭、云端數(shù)據(jù)平臺安保、倉儲、家庭訂閱波士頓動力代表了“運動能力優(yōu)先”的路線他們在雙足動態(tài)行走、翻滾、跳躍等極限運動控制上積累了深厚壁壘但商業(yè)化始終是難題。特斯拉Optimus最大的優(yōu)勢在于工程化成本和供應鏈能力希望用造車的思路把機器人成本打下來。Figure選擇了更激烈的“大模型通用人形”路線直接接入OpenAI生態(tài)強調(diào)機器人的理解與對話能力。1X的路線和以上幾家都不太一樣它的核心思路可以概括為“場景優(yōu)先級”。第一先用輪式機器人EVE進入安保、倉儲、巡邏這類任務邊界相對清晰、安全性容易控制的場景在真實環(huán)境中積累運行數(shù)據(jù)第二在EVE跑通商業(yè)閉環(huán)后再去攻克雙足人形NEO的家庭場景第三用1X World集采全球機器人數(shù)據(jù)通過MindStudio訓練和迭代技能形成一個持續(xù)增強的數(shù)據(jù)飛輪。如果只看產(chǎn)品形態(tài)很多人會誤以為“1X做不出好的雙足才先用輪式”。實際上這個順序背后有非常現(xiàn)實的技術邏輯輪式方案在穩(wěn)定性、能耗、安全性上遠優(yōu)于雙足能更快在真實場景部署而真實場景的數(shù)據(jù)恰恰是訓練復雜任務能力最稀缺的資源。1X先選場景再選形態(tài)最后圍繞場景搭AI能力這條順序和“先做雙足機器人再去找應用場景”的傳統(tǒng)思路完全相反。這里還要澄清一個常見誤解大模型在1X機器人中的作用并不是讓機器人“自己思考”那么簡單。NEO和EVE接入OpenAI模型后主要解決的是任務理解、子任務拆解和對話交互的問題底層運動控制仍然依賴經(jīng)典的機器人控制算法和強化學習策略。大模型更像是機器人的“大腦皮層”負責把模糊的自然語言命令翻譯成可執(zhí)行的技能序列而具體的關節(jié)控制、路徑規(guī)劃依然是機器人工程師熟悉的控制框架。3. “大腦”才是核心具身智能在人形機器人中的真實工作流程“具身智能”這四個字最近被反復提起但它到底在機器人里怎么工作很多開發(fā)者還只有一個模糊的概念。通俗地說具身智能就是讓AI模型不再停留在文字和圖片里而是進入一個能感知、能行動、能反饋的物理身體中。在1X機器人這類產(chǎn)品中一條典型的工作流程是這樣的第一多模態(tài)感知。機器人通過攝像頭、深度傳感器、關節(jié)角度編碼器、觸覺傳感器等硬件獲取周圍環(huán)境的空間信息、物體位置、自身姿態(tài)和受力情況。第二任務理解。用戶通過自然語言發(fā)出指令比如“把桌子上的杯子拿到廚房臺面”大模型接收文本和視覺信息后理解當前場景并將任務拆解成“導航到桌子”“識別杯子”“抓取杯子”“移動到廚房”“放下杯子”等子任務。第三技能調(diào)用。每個子任務對應一個經(jīng)過訓練的動作技能這些技能可能來自仿真訓練也可能來自1X World平臺收集的真實遙操作數(shù)據(jù)。第四運動執(zhí)行。機器人控制器根據(jù)技能庫的指令結(jié)合當前傳感器狀態(tài)實時生成關節(jié)運動軌跡并通過電驅(qū)系統(tǒng)執(zhí)行。第五失敗反饋與重規(guī)劃。如果抓取失敗或物體突然移動機器人需要重新感知環(huán)境調(diào)整動作策略而不是機械地重復原計劃。這和傳統(tǒng)工業(yè)機器人的開發(fā)方式有本質(zhì)區(qū)別。傳統(tǒng)方式下開發(fā)人員需要為每個動作編寫明確的規(guī)則和路徑機器人幾乎沒有環(huán)境適應能力。而具身智能模式下開發(fā)者只需要提供足夠多的示教數(shù)據(jù)和任務描述大模型負責泛化理解技能庫負責提供可復用的動作能力整個系統(tǒng)可以在新任務上更快適應。但這條路也遠沒有宣傳中那么成熟。模型幻覺在機器人上同樣存在大模型可能錯誤地理解物理規(guī)則比如認為杯子可以穿過墻壁、認為抓取易碎品可以用蠻力真實場景的數(shù)據(jù)采集成本極高遙操作雖然能采集數(shù)據(jù)但速度和效率遠遠不能滿足大規(guī)模訓練需求還有安全性問題家庭環(huán)境里存在大量非結(jié)構(gòu)化因素一個動作失誤可能造成財產(chǎn)損失甚至人身傷害。這些挑戰(zhàn)在1X World和MindStudio的架構(gòu)里得到了一定程度的緩解但并沒有完全消除。從工程角度看具身智能的瓶頸通常不在模型層而在數(shù)據(jù)閉環(huán)。模型參數(shù)可以快速迭代但真實機器人數(shù)據(jù)的采集、清洗、標注、增強、訓練、部署是一個極其漫長的工程鏈路。1X選擇讓EVE先在實際商用場景中跑起來本質(zhì)上是想用商業(yè)收入來補貼數(shù)據(jù)采集成本讓數(shù)據(jù)飛輪先轉(zhuǎn)起來。4. 為什么是現(xiàn)在資本、大模型與機器人硬件的交匯點人形機器人并不是一個新概念。過去二十年里這個賽道經(jīng)歷過好幾輪資本熱潮也倒下過一批公司核心原因無外乎三個成本太高、場景太窄、AI泛化能力不足。很多原型機器人能走出實驗室卻無法在真實環(huán)境中穩(wěn)定工作最終只能停留在展示階段。那為什么偏偏是現(xiàn)在資本開始大規(guī)?;貧w根本原因是三個技術變量的同時成熟。第一大模型讓機器人有了任務理解能力。過去機器人只能執(zhí)行程序員預先定義好的指令?,F(xiàn)在VLM視覺語言模型和LLM大語言模型可以讓機器人理解自然語言、識別視覺場景、推理任務步驟。這意味著機器人不再需要為每一個新任務重新編寫邏輯泛化能力有了質(zhì)的提升。第二硬件成本快速下降。電機、減速器、傳感器、電池等核心部件的成本在過去幾年持續(xù)下降尤其是國內(nèi)供應鏈的成熟讓人形機器人的硬件成本從“百萬級”逐步逼近“十萬級”。第三仿真到真實遷移技術逐漸可用。Isaac Sim、MuJoCo等仿真平臺讓開發(fā)者可以在虛擬環(huán)境中大量訓練技能再通過域隨機化等技術遷移到真實機器人上大幅降低了訓練成本。從資本端看孫正義的邏輯不難理解。他早年投資OpenAI深知模型能力的價值現(xiàn)在他把注意力轉(zhuǎn)向機器人本質(zhì)上是想找一個新的“AI載體”。手機是移動互聯(lián)網(wǎng)的入口汽車是自動駕駛的入口而人形機器人有可能成為具身智能時代的物理入口。軟銀同時投資AI模型公司和人形機器人公司就是想在這個入口上占據(jù)位置。這并不意味著高估值等于技術成熟。從1X的公開演示看NEO Home確實展示了疊衣服、煮咖啡、物品整理等家庭任務但視頻展示距離規(guī)?;慨a(chǎn)還有相當距離。行業(yè)里也有不少質(zhì)疑聲音認為人形機器人的商業(yè)化仍然面臨安全性、成本、可靠性等多重障礙。資本可以買來迭代時間但買不來商業(yè)化的確定性。5. 開發(fā)者視角從零開始入局人形機器人需要掌握的技能棧如果看完前面的分析你決定開始關注或入局人形機器人開發(fā)那么真正的問題來了該從哪里開始從技術架構(gòu)上看人形機器人開發(fā)可以分成五個層次第一層AI模型層。這一層負責感知、理解、規(guī)劃常用工具包括OpenCV、PyTorch、HuggingFace Transformers等需要掌握LLM/VLM的基礎調(diào)用和微調(diào)方法。第二層機器人中間件層。ROS 2是目前機器人領域事實上的中間件標準負責進程通信、數(shù)據(jù)分發(fā)、節(jié)點管理。第三層控制層。負責關節(jié)控制、運動規(guī)劃、碰撞檢測常用工具包括ROS 2 Controller Manager、MoveIt 2等。第四層仿真層。在部署到真實硬件之前先用仿真環(huán)境跑通流程常用工具包括MuJoCo、NVIDIA Isaac Sim、Gazebo等。第五層硬件層。包括電機、傳感器、嵌入式開發(fā)常用工具包括Arduino、STM32、CAN總線調(diào)試工具等。對新手來說最友好的入局路徑不是直接買一臺人形機器人而是先用ROS 2搭建一個仿真工作環(huán)境跑通“感知-規(guī)劃-控制”的標準流程。原因很簡單人形機器人平臺價格高、維護復雜、安全要求高直接在真機上調(diào)試的試錯成本太大。而仿真環(huán)境可以讓你快速理解機器人系統(tǒng)的數(shù)據(jù)流和控制流等基礎扎實后再遷移到真機上。編程語言方面Python和C是兩大主力。Python適合算法原型、AI模型調(diào)用、數(shù)據(jù)腳本處理C適合底層控制、實時通信和高性能模塊。建議先掌握Python再根據(jù)項目需要補充C。如果目標是進入像1X這樣的具身智能公司最值錢的技能其實不是單一算法而是理解“數(shù)據(jù)鏈路”的能力。從傳感器數(shù)據(jù)采集、數(shù)據(jù)標注到模型訓練、仿真驗證再到真機部署和反饋閉環(huán)這整條鏈路你都應該能跑通。6. 一條完整的技術鏈路感知、規(guī)劃、執(zhí)行與驗證示例這一節(jié)用一個最小可運行的示例演示人形機器人技能開發(fā)過程中的數(shù)據(jù)流和控制流思路。需要說明的是這個示例不是1X官方SDK的用法而是以通用機器人開發(fā)流程為骨架幫助你理解系統(tǒng)架構(gòu)。實際項目中你需要替換成具體平臺的接口和業(yè)務邏輯。6.1 示例一ROS 2 最小工作空間搭建ROS 2是當前多數(shù)機器人項目的首選中間件。開始之前請先確認已經(jīng)安裝好ROS 2Humble或Jazzy版本均可本文示例以Humble寫命令。如果還沒有安裝可以參照ROS 2官方安裝文檔完成基礎安裝。新建工作空間并編譯# 創(chuàng)建ROS 2工作空間 mkdir -p ~/humanoid_ws/src cd ~/humanoid_ws # 編譯工作空間 colcon build # 加載環(huán)境變量 source install/setup.bash這一步成功之后說明你的機器人開發(fā)基礎環(huán)境已經(jīng)可用。src目錄用來放功能包install目錄存放編譯產(chǎn)物。在實際項目中你會把感知、規(guī)劃、控制等模塊拆分成不同的功能包放在src目錄下統(tǒng)一維護。6.2 示例二感知-決策-控制流程骨架下面是一個簡單的Python示例演示了感知、決策、控制三個模塊的低耦合設計思路。文件路徑為~/humanoid_ws/src/skill_demo/skill_demo/skill_loop.py#!/usr/bin/env python3 import rclpy from rclpy.node import Node from sensor_msgs.msg import Image from geometry_msgs.msg import PoseStamped class PerceptionModule: 感知模塊負責從傳感器數(shù)據(jù)中提取環(huán)境信息 def get_object_pose(self, image_msg): # 在實際項目中這里會調(diào)用視覺模型得到目標物體的位置 # 這里僅返回一個示例位姿 pose PoseStamped() pose.header.frame_id camera_link pose.pose.position.x 0.5 pose.pose.position.y 0.1 pose.pose.position.z 0.8 return pose class DecisionModule: 決策模塊根據(jù)任務指令和感知結(jié)果生成技能序列 def __init__(self, llm_clientNone): # llm_client可以是任意大模型接口實際項目中可注入 self.llm_client llm_client def plan_skill_sequence(self, task_desc, object_pose): # 在實際項目中這里會調(diào)用大模型將自然語言任務拆解為技能序列 skills [navigate_to_table, grasp_cup, move_to_kitchen, place_cup] return skills class ControlModule: 控制模塊執(zhí)行單個技能并返回執(zhí)行結(jié)果 def execute_skill(self, skill_name, object_pose): # 在實際項目中這里會調(diào)用運動控制接口執(zhí)行動作 print(fExecuting skill: {skill_name}) return True class SkillLoopNode(Node): def __init__(self): super().__init__(skill_loop_node) self.perception PerceptionModule() self.decision DecisionModule() self.control ControlModule() def run_task(self, task_desc, image_msg): # 1. 感知 object_pose self.perception.get_object_pose(image_msg) # 2. 決策 skills self.decision.plan_skill_sequence(task_desc, object_pose) # 3. 執(zhí)行 for skill in skills: success self.control.execute_skill(skill, object_pose) if not success: self.get_logger().warn(fSkill failed: {skill}) break def main(argsNone): rclpy.init(argsargs) node SkillLoopNode() rclpy.spin(node) rclpy.shutdown() if __name__ __main__: main()這段代碼把整個流程分成了三個獨立模塊。PerceptionModule負責把圖像數(shù)據(jù)轉(zhuǎn)換成物體位姿DecisionModule負責根據(jù)任務描述和感知結(jié)果生成技能序列實際項目中這里會接入LLM/VLMControlModule負責逐個執(zhí)行技能并返回結(jié)果。這樣的分層設計讓你能在不改變整體架構(gòu)的前提下更換某個模塊的具體實現(xiàn)。6.3 示例三配置文件與仿真驗證在實際項目中機器人參數(shù)通常通過配置文件管理。創(chuàng)建一個robot_skill.yamlrobot: name: neodemo max_linear_speed: 0.5 # m/s max_arm_force: 40.0 # N gripper_timeout: 3.0 # s skill_grasp: approach_height: 0.15 # m pre_grasp_distance: 0.10 # m force_threshold: 8.0 # N在仿真環(huán)境里運行時可以用ros2 param load加載配置并用ros2 topic echo確認感知數(shù)據(jù)是否正常發(fā)布# 加載配置文件實際項目中需配合param server使用 ros2 param load /skill_loop_node robot_skill.yaml # 查看感知話題的消息頻率確認傳感器數(shù)據(jù)流正常 ros2 topic hz /camera/image_raw # 查看規(guī)劃結(jié)果指令是否正常下發(fā) ros2 topic echo /skill_loop_node/skill_command如果仿真環(huán)境里任務執(zhí)行正常就可以將這個流程遷移到真實機器人平臺上。需要提醒的是仿真到真實的遷移過程中環(huán)境的物理差異往往會造成很大的性能落差這一步是實際開發(fā)中最容易踩坑的地方。7. 常見開發(fā)問題與排查方法人形機器人開發(fā)過程中的問題遠比普通軟件項目復雜因為問題可能出現(xiàn)在硬件、控制、AI、通信任意一層。下面列出幾個高頻問題以及對應的排查思路。問題現(xiàn)象可能原因排查方式解決方案仿真中動作流暢真機執(zhí)行失敗仿真與真實環(huán)境差距較大sim-to-real gap對比仿真模型與真實機器人物理參數(shù)增加域隨機化用真實遙操作數(shù)據(jù)微調(diào)大模型給出錯誤的任務拆解提示詞設計不合理或視覺上下文缺失記錄輸入輸出日志檢查視覺輸入是否完整補充多模態(tài)信息使用few-shot示例增加規(guī)則約束ROS 2節(jié)點間通信延遲高DDS配置不當、網(wǎng)絡帶寬不足查看ros2 topic hz和節(jié)點CPU占用調(diào)整QoS策略降低傳感器頻率優(yōu)化網(wǎng)絡配置機器人安全??慨惓E鲎矙z測閾值設置不合理檢查傳感器原始數(shù)據(jù)確認急停邏輯設置多級安全閾值確保硬件急停優(yōu)先級最高數(shù)據(jù)采集效率低依賴人工遙操作數(shù)據(jù)速度慢統(tǒng)計采集數(shù)量和耗時引入半自動采集、合成數(shù)據(jù)增強、自動標注工具排查這類問題時最重要的習慣是“分層定位”。先確認底層硬件和傳感器正常再檢查中間件通信最后再看AI模型邏輯。不要一上來就懷疑模型的問題很多時候系統(tǒng)的根因可能只是一個角度編碼器校準錯誤。8. 最佳實踐與工程建議結(jié)合1X的技術路線和行業(yè)通用經(jīng)驗這里整理幾條對實際項目有幫助的建議。第一場景優(yōu)先先選場景再選形態(tài)。不要為了“像人”而做雙足輪式、履帶式、四足方案在很多場景里都比雙足更穩(wěn)定、更便宜、更安全。1X先做輪式EVE再上雙足NEO就是這個邏輯。第二盡早建立數(shù)據(jù)飛輪。機器人項目的核心競爭力不是某一次訓練的loss降了多少而是能否持續(xù)獲取真實場景數(shù)據(jù)并在數(shù)據(jù)閉環(huán)中不斷迭代技能。第三安全冗余永遠放在第一位。人形機器人要進入家庭和商業(yè)場景硬件急停、軟限位、力控閾值、碰撞檢測這些環(huán)節(jié)不能有僥幸心理。第四重視日志和可觀測性。用ROS 2的bag工具記錄所有傳感器數(shù)據(jù)和控制指令出現(xiàn)問題時可以回放分析這對排查復雜問題非常重要。第五做好版本管理。機器人項目涉及模型、代碼、硬件配置、仿真環(huán)境等多個維度建議使用Docker封裝開發(fā)環(huán)境用Git管理代碼用配置文件統(tǒng)一管理參數(shù)。對團隊協(xié)作來說建議按AI模型組、控制算法組、硬件驅(qū)動組、數(shù)據(jù)平臺組劃分職責并在交付節(jié)點用統(tǒng)一仿真環(huán)境做集成測試。大型機器人項目里最怕的是各個模塊各自開發(fā)、最后聯(lián)調(diào)時出現(xiàn)問題導致責任邊界模糊。9. 總結(jié)與后續(xù)行動建議孫正義60億美元押注1X表面上是資本對一家機器人公司的認可本質(zhì)上是對“具身智能數(shù)據(jù)飛輪”路線的投票。1X用EVE證明了輪式機器人可以先商業(yè)化用NEO展示了雙足人形機器人的家庭場景想象力用1X World和MindStudio搭建了數(shù)據(jù)訓練平臺。這三件事組合起來形成了一個閉環(huán)商業(yè)場景產(chǎn)生數(shù)據(jù)數(shù)據(jù)訓練技能技能反哺產(chǎn)品。這種模式能否跑通還需要時間和市場驗證但至少從技術演進方向看它比“先造一個完美雙足機器人”更務實、更可落地。如果你看完這篇文章決定開始動手我的建議是這周先在本地裝好ROS 2跑通一個機器人仿真環(huán)境完成一次最簡單的物體識別和運動規(guī)劃。然后試著把自己的視覺語言模型接入到一個仿真機器人上讓它理解自然語言指令并完成任務拆解。之后再去關注像1X、宇樹、智元、Figure這樣的公司發(fā)布的技術公開資料。人形機器人的核心技術棧歸根結(jié)底還是AI、控制和系統(tǒng)工程三件事把這三件事打扎實無論行業(yè)風向怎么變你都不會落后。建議收藏這篇文章后續(xù)上手的時候可以作為一份技術路線參考。