執行摘要
近五年的人形機器人研發重心,明顯從「離線規劃(RRT/PRM/CHOMP/TrajOpt)+線上追蹤」的傳統路線,轉向「以學習式策略(RL/IL)在高頻率直接輸出全身控制」或「混合式分層架構(高層規劃/語意 + 中層視覺運動策略 + 低層 kHz 平衡/力控制)」的方向。這個轉向並非單一技術潮流,而是由人形本體的高自由度、接觸豐富(loco-manipulation)、感知不確定性與即時性需求共同逼出的工程選擇。citeturn19view1turn6view0turn12view0
傳統規劃器在高自由度(例如數十到七十多 DOF)且多接觸切換的人形上,會面臨搜索空間維度爆炸、可行集呈現狹窄流形/不連續、以及動力學與摩擦接觸造成的強非凸與組合爆炸,導致「規劃時間不穩定、需要大量調參、對模型誤差與感知延遲脆弱」。即便 TrajOpt 等最佳化式規劃可把部分問題做到百毫秒級,仍多集中在幾何避障/靜態穩定等子問題,遇到真實世界的接觸不確定與外力擾動時,傳統的「走-停-抓-再走」狀態機拼接往往顯得遲鈍且易崩潰。citeturn30view1turn8search7turn19view1
學習式方法之所以「現在才變主流」,關鍵在於訓練與模擬基礎設施完成了跨代升級:GPU 原生大規模並行模擬(例如 Isaac Gym/Isaac Lab)、更成熟的 domain randomization 與 sim-to-real pipeline、以及可在 200 Hz 甚至 1 kHz 直接推論的策略網路,使得昂貴的最佳化/規劃能被「離線攤銷」成線上一次前向推論。這把原本卡在算力與樣本量的 RL 推進到可工程化落地的區間。citeturn17view0turn21search1turn19view1
產業公開資訊也呈現一致訊號:有的公司直言傳統把 locomotion 與 manipulation 分開、再用狀態機縫合「慢、脆弱、不自然」;也有公司把系統拆成「慢速語意/目標(~Hz)+快速視覺運動(200 Hz)+kHz 全身穩定層」,並以大量並行模擬與 domain randomization 做出近似零樣本(zero-shot)落地;另一些公司強調「AI 驅動的 vision + planning + control」與低延遲推論基礎,顯示方向是把學習融入控制堆疊,而不是單純「放棄規劃」。citeturn19view1turn4view0turn18search2
什麼在改變:從「規劃—追蹤」到「策略直接輸出控制」
傳統機器人軟體堆疊常見形式是:感知建立世界模型 → motion planner 產生路徑/軌跡 → 後處理(平滑、時間參數化)→ 控制器追蹤。以 MoveIt 的術語來說,planning pipeline 會把 motion planner 與前/後處理(planning request adapters、時間參數化等)串在一起,輸出可在關節層級遵守速度/加速度限制的軌跡。citeturn7search0turn7search20turn7search1
這類流程在「單一手臂、環境近似靜態、接觸模式簡單」時非常成功,因此 OMPL 這種以 sampling-based 為核心的庫能成為 MoveIt 的預設規劃後端。citeturn7search1turn7search10turn7search21
但在人形上,困難不只來自 DOF 多,而是來自「必須在動態平衡下連續地走、搬、抓、推、拉」,使得規劃問題更像「同時包含多接觸動力學與快速擾動回應的控制問題」。citeturn19view1turn8search13turn6view0
學習式/端到端路線的核心工程直覺是「攤銷(amortization)」:把原本需要每個控制週期解一次(或頻繁重解)的非凸最佳化/規劃,改為在離線用大量模擬與資料學出一個策略,線上只做一次快速推論就能輸出動作(actions / joint targets / torque commands)。在一些公開架構中,系統被刻意切成多時間尺度:慢速語意/目標推理(Hz 級)、快速視覺運動策略(數百 Hz),以及 kHz 級的全身穩定/接觸協調層,形成「從 pixels 到 torque」的連續閉環。citeturn19view0turn19view1
flowchart LR
subgraph Classical[傳統:規劃—追蹤]
P[感知/狀態估計] --> W[世界模型/碰撞場景]
W --> MP[Motion Planner<br/>RRT/PRM/CHOMP/TrajOpt]
MP --> PP[後處理<br/>平滑/時間參數化]
PP --> C[追蹤控制器<br/>WBC/MPC/PD]
end
subgraph Learned[現代:攤銷式控制]
S[多模態感知<br/>vision/touch/proprio] --> PI[學習式策略/分層模型]
PI --> A[高頻輸出<br/>joint targets / torque]
A --> S
end
上圖的分野不代表「規劃消失」,而是規劃的責任被重分配:高層仍可能保留任務級規劃、約束、監控與安全層;但中低層的連續控制與反射(reflex)傾向交給可高頻推論的學習式策略或學到的運動先驗。citeturn19view1turn18search2
傳統 Motion Planning 在高自由度人形上的技術瓶頸
高自由度與可行集形狀使搜索困難。
RRT 被設計用於廣泛類別的 path planning,核心優勢是以隨機取樣迅速探索配置空間。citeturn28search1
PRM 也以取樣建立 roadmap,適合多查詢情境,並在高維配置空間中取得實用效果。citeturn28search2turn28search6
然而,人形的「高 DOF + 自碰撞 + 地面接觸/穩定約束」會把可行解壓縮成非常薄的流形(manifold)或狹窄通道,讓純隨機取樣的有效樣本率下降,且成功時間高度不穩定。OMPL 的 primer 雖指出 sampling-based 對高維問題很有力,但也強調 collision checking 在其中扮演關鍵且昂貴的角色。citeturn28search4turn7search2
高 DOF 人形不只「大」,還更「耦合」。
以公開研究為例,Digit 類人形平台的 floating-base 模型約 30 DOF;即便這已比一般雙臂機械臂複雜許多,仍只是人形光譜中的較低端。citeturn6view0
另一方面,學界也有 70+ DOF 的高動態人形案例,顯示「維度」本身仍在上升。citeturn8search9
當 DOF 增加且腳-地、手-物、身體-環境多點接觸切換頻繁,任何規劃器都得同時處理強耦合約束,難以再把問題拆成「先走到位、再伸手」的弱耦合子問題。citeturn8search13turn19view1
CHOMP/TrajOpt 類「軌跡最佳化式規劃」的局限:非凸、局部極值、初始化敏感。
CHOMP 強調以 functional gradient 迭代改善軌跡;但在含障礙與複雜約束的非凸問題上,容易陷入局部極小值。CHOMP 早期論文即展示:若用 RRT 產生的初始軌跡品質差,CHOMP 可能很快掉進次優的局部極小值。citeturn8search3
MoveIt 的 CHOMP 文件也直接指出:若初始猜測不好,CHOMP 會因 local minima 失敗,並建議用 OMPL 的結果作為 seed 以緩解。citeturn8search7
更廣義地說,MIT 的機器人操作教材也明確提醒:因為屬於非凸最佳化,trajectory optimization 會受 local minima 影響,甚至在存在可行路徑時仍可能找不到。citeturn8search11
TrajOpt 的核心是 sequential convex optimization 與碰撞近似的 convexification,並在工程上做到了相當快的規劃時間;其論文指出在某些手臂規劃基準上能達到約 100–200 ms,且在 18 DOF 的 PR2 full-body 規劃可在 1 秒內完成(i7 3.5GHz)。citeturn30view1
但這種速度主要來自把問題形式化為可快速求解的凸子問題序列,仍然面對「接觸模式選擇(combinatorial)」與「動力學/摩擦接觸非凸」帶來的根本困難;因此 TrajOpt 在論文中針對 Atlas 的示例屬於「靜態穩定」的 walking motion 與避障,距離真實世界的動態平衡與接觸不確定仍有落差。citeturn30view1
此外,MoveIt 的 TrajOpt 教學也明確把其定位為對非凸約束進行近似線性化與凸化的 sequential convex optimization。citeturn7search37
多接觸(multi-contact)loco-manipulation 是傳統規劃的「硬模式」。
多接觸 loco-manipulation 要求機器人在環境中反覆建立/解除多個、且可能非共面的接觸點(腳、手、身體),同時滿足力與動力學限制。相關研究直接將它描述為「多接觸規劃與控制框架」問題,而不是單純幾何避障。citeturn8search13
在這類問題中,接觸切換帶來的混合系統(hybrid dynamics)特性,使得「先規劃再追蹤」的方式很容易因接觸結果與模型預期不一致而失效。citeturn10search12turn19view1
下表用「人形視角」對四類代表性傳統規劃器做工程化對照(重點不是算法優劣,而是它們在高 DOF + 接觸豐富場景中會卡在哪)。citeturn28search1turn28search2turn8search7turn30view1
| 方法族群 | 代表 | 優點 | 在人形上的典型瓶頸 | 在產品/系統中的常見角色 |
|---|---|---|---|---|
| Sampling-based | RRT citeturn28search1 / PRM citeturn28search2 | 對高維幾何路徑有「可用性」,常具 probabilistic completeness;不需可微成本 | 成功時間不穩、依賴大量碰撞檢查;對狹窄可行集/多約束(平衡、自碰撞、接觸)效率差;動力學/力約束多靠後續追蹤補救 citeturn7search2turn8search13 | 低頻率的全局避障、粗路徑;產生 seed 給最佳化器/控制器 citeturn8search7 |
| Gradient trajectory optimization | CHOMP | 直接優化平滑軌跡;可用距離場/可微碰撞成本 citeturn28search11 | 對初始化敏感、易 local minima;遇複雜約束/接觸切換更難穩定收斂 citeturn8search3turn8search7 | 常用作 smoothing / 生成較平順軌跡;或在簡化接觸假設下做局部優化 |
| Sequential convex trajectory optimization | TrajOpt | 工程效率高;論文報告在部分基準可達 100–200ms,18DOF full-body <1s citeturn30view1 | 仍屬非凸問題的局部求解;人形的動態平衡/接觸不確定與接觸序列選擇難以完全納入 citeturn7search37turn19view1 | 受控場景中的全身避障/姿態規劃;或作為中層軌跡生成器 |
| 多接觸規劃與控制 | 多接觸 planning/control 框架 | 能把 multi-contact loco-manipulation 的約束顯式化 citeturn8search13 | 高維 + 接觸切換導致求解負擔與脆弱性;對感知與模型誤差敏感 citeturn10search12turn19view1 | 常落在研究系統或「混合式」堆疊:高層給接觸/步態意圖,低層 WBC/MPC/學習策略做反射 |
即時性、頻率分層與感知延遲
人形需要 kHz 級的關節/力控制回路,但規劃通常做不到。
多個人形控制系統公開報告的控制回路頻率落在 1 kHz 量級。例如 TORO 的全控制回路以 1 kHz 運行,且宣稱有確定性的 2 ms latency。citeturn25view0
在以 Atlas 為背景的 DRC 控制研究中,也描述了 1 kHz 的 joint-level servo(並且只能以 333 Hz 更新期望量),同時在模擬環境中以 1 kHz 進行低層 inverse dynamics;高層控制器的運算時間依地形複雜度約 1–50 ms,低層約 0.5 ms。citeturn27view0turn27view1
這種「多時間尺度」會直接衝擊傳統 motion planning 的定位:若規劃器本身需要數百毫秒到數秒,便只能做低頻率的意圖/路徑更新;真正維持平衡、防跌倒、抗擾動的工作必須由高頻控制層完成。citeturn25view0turn27view1turn8search24
而當任務進入 loco-manipulation(邊走邊操作、邊搬邊維持抓握),高層「走-停-抓」式的狀態機切換會顯得慢且脆弱,因為每個切換點都可能引入延遲與誤差累積。citeturn19view1
感知到行動的延遲與不確定性會放大模組化堆疊的脆弱性。
越多模組,越多「需要被估」的中間狀態:物體姿態、接觸狀態、摩擦係數、地面順應性、關節/驅動器延遲等。任何誤差都會沿 pipeline 傳播,最終在接觸瞬間以跌倒或抓握失敗的形式呈現。這也是為何部分團隊在公開文件中強調「吞吐量、延遲、正確性、決定性」是底層軟體的核心指標。citeturn4view0
同時,實務上也常見「規劃時間不穩」的抱怨:即便在簡單場景(甚至無障礙),MoveIt 使用者也提到規劃時間可能落在 0.7–5 秒;一旦加入多重 path constraints,規劃時間可達數十秒等級。citeturn8search2turn8search6
這種延遲對人形而言往往不可接受,因為外力擾動與地面不確定要求在「不到一秒、甚至分秒」內回應。citeturn22view0turn27view1
混合式(Hybrid)控制的關鍵:把「慢」與「快」分工清楚。
公開的分層架構把「慢」交給語意/目標/任務序列,把「快」交給反射式控制(MPC/WBC/學習策略),以避免把所有複雜性塞進單一 planner。以一個公開的 VLA 分層設計為例:語意理解層在 7–9 Hz 運行,快速視覺運動策略在 200 Hz 生成連續動作。citeturn19view0
更進一步的全身控制分層甚至把最底層的平衡與接觸協調放在 1 kHz,形成明確的頻率金字塔。citeturn19view1
下表把常見的「控制頻率分工」用公開數據對齊,並對照傳統 motion planning 的時間尺度位置。citeturn19view0turn19view1turn12view0turn25view0turn8search24turn8search2
| 層級 | 代表任務 | 典型頻率/延遲(公開數據) | 為什麼影響「放棄傳統規劃」的決策 |
|---|---|---|---|
| 語意/場景理解(慢) | 任務分解、物體語意、目標序列 | 7–9 Hz(VLM 層)citeturn19view0 | 不需要 kHz,但需要穩健一般化;更像「規劃」而非「控制」 |
| 視覺運動策略(快) | 連續到達、抓取、協作調整 | 200 Hz(S1)citeturn19view0turn19view1 | 以推論速度取代在線求解;把最佳化攤銷成前向推論 |
| 全身平衡/接觸協調(最快) | 抗擾動、接觸力分配、協調全身 | 1 kHz(TORO 控制回路;S0)citeturn25view0turn19view1 | motion planning 若做不到 kHz,只能退到更高層;低層必須是反射式閉環 |
| MPC(依問題而定) | 未來時域最佳化、步態/策略更新 | 10 Hz–1 kHz(綜述整理)citeturn12view0;50–100 Hz(hybrid whole-body MPC 案例)citeturn8search24 | 多接觸/高 DOF 下求解成本高;若不能穩定達到所需更新率,就需要策略化/學習化 |
| 傳統 motion planning(常見落點) | 幾何避障、抓取姿態、離線軌跡 | 秒級到數十秒(社群回報)citeturn8search2turn8search6;也可能在優化式方法中到百毫秒級(特定基準)citeturn30view1 | 對人形「邊走邊做」而言,規劃的延遲與不確定性會直接變成失敗率 |
學習式控制為何成為主流:RL/IL 的優勢與成本
優勢一:把「反應能力」變成推論速度。
學習式策略最大的工程價值,是在部署時把複雜決策壓縮成一次前向推論,讓控制可以以 200 Hz 甚至 1 kHz 做閉環更新(尤其是當策略直接輸出關節目標/力矩)。公開案例中,分層系統把快速層放在 200 Hz,最底層的全身穩定層放在 1 kHz,並宣稱以單一神經系統直接控制全身。citeturn19view1turn19view0
優勢二:更能吸收模型誤差與環境變化。
一篇針對真實人形行走的研究指出,雖然傳統控制在多種設定下可達到穩定,但「難以一般化與適應新環境」;該工作提出以 causal transformer 直接根據本體感測歷史輸出下一步動作,並在大量隨機化模擬環境中用 model-free RL 訓練,最後 zero-shot 部署到真機。citeturn6view0
其室外測試描述包含多種材質與狀態(乾/濕、草地/硬地),並報告在一週的戶外整日測試中未觀察到跌倒(但也承認因缺乏外感知可能會碰到障礙)。citeturn22view0
更重要的是,該研究展示了「未在訓練中見過的離散障礙」觸發的腳部卡住(foot-trapping)可出現自發的恢復行為,屬於非明碼規則的適應。citeturn22view2turn14view0
優勢三:能自然處理多接觸與全身耦合的「連續性」。
loco-manipulation 的核心難點之一是:抬手會改變平衡、跨步會改變可達性、手腳彼此形成約束。公開的產業說法指出,傳統把 locomotion 與 manipulation 分開、再用狀態機縫合「慢、脆弱、不自然」,因此需要「單一學習系統」能夠連續地一邊走一邊操作並即時恢復錯誤。citeturn19view1
此外,也有公司以 RL 在高保真模擬中同時跑「數千個虛擬人形」並宣稱能 zero-shot transfer 到實機行走,主張縮短開發週期並提高真實世界魯棒性。citeturn18search0turn18search0
成本與風險:樣本複雜度、獎勵設計與訓練不穩定。
上述真實人形行走研究在方法討論中直言:RL 需要透過 trial-and-error 累積經驗、在高維環境中取得有效 reward signal 需要大量互動與 simulation steps,且直接在 observation space 做 RL 會很慢。citeturn14view0
這個缺點在產業尺度下通常靠兩類手段緩解:其一是用 imitation learning/teacher policy 提升收斂速度(例如先學 state policy,再學 observation policy 的兩階段訓練流程);其二是靠大規模並行模擬與資料生產,把「慢」轉成「可擴展」。citeturn14view0turn17view0turn19view1
對學術/工程團隊而言,這代表「控制器設計」已和「資料與基礎設施設計」緊密綁定。citeturn17view0turn21search1
建議的量化呈現方式(可用於研究報告或內部評審):
把「傳統規劃」與「學習式策略」對同一套任務做對照時,最具說服力的不是單次 demo,而是可重複統計指標:每回合成功率、平均/分位數延遲、擾動恢復時間、能耗、以及在 domain randomization 下的 worst-case 表現。室內模擬基準的 success rate bar chart(含信賴區間)是公開研究常用呈現方式。citeturn22view1
若你要實作繪圖,建議至少準備:
(1) 成功率 vs 地形/擾動強度;(2) 控制迴路延遲分佈(P50/P95/P99);(3) 訓練曲線:回報/失敗型態 vs step 數;(4) sim-to-real gap:同一策略在模擬與真機的 KPI 差值。citeturn14view0turn17view0turn21search30
模擬、算力與 sim-to-real:把「資料」變成競爭力
「為何現在才行」的關鍵:GPU 並行模擬把 RL 變得可負擔。
Isaac Gym 的技術報告把瓶頸說得非常直接:傳統 RL pipeline 在 CPU 模擬 + GPU 訓練之間頻繁搬運資料,造成效率低;因此端到端 GPU 化可帶來 2–3 個數量級的加速,並可在單張 GPU 上同時跑「數萬個」環境,降低研究門檻。citeturn17view0
該報告也用具體數字呈現「基礎設施如何改變可行性」:在某些複雜環境上,單張 A100 可在數分鐘內訓練出 humanoid locomotion 等策略;同時它回顧既有工作曾需要非常龐大的 CPU 叢集(例如提到訓練某些高難度操作任務使用約 30,000 CPU cores)。citeturn17view0
這類數字本質上是在說:當「每次想改 reward/模型都要等好幾天」時,學習式控制很難工程迭代;當訓練縮短到分鐘/小時級別時,學習式控制就會開始取代大量手工規劃與控制調參。citeturn17view0turn14view0
Isaac Lab/Isaac Sim 的定位:把多模態感測、domain randomization、資料管線納入同一框架。
Isaac Lab 被描述為 Isaac Gym 的後繼,建立在 Isaac Sim 之上,整合高吞吐 GPU physics、photorealistic rendering,以及 actuator models、multi-frequency sensor simulation、domain randomization 與資料收集管線,用於 RL/IL 與多模態學習。citeturn21search1turn21search2turn21search11
在「把策略從模擬帶到真機」這條路上,視覺域的 randomization(材質、光照、相機參數等)也被官方文件明確列為必要手段之一。citeturn21search30turn21search7
若以工程直覺描述:這些工具把過去分散在多個 repo、需要大量 glue code 的事情(同步感測、校正、隨機化、批次化、評估)做成一條可複用的「訓練產線」。citeturn21search1turn21search29
MuJoCo 的角色:快速、準確、接觸友善的物理引擎成為共同語言。
MuJoCo 的官方文件與 GitHub 都強調其名稱即「Multi-Joint dynamics with Contact」,目標是提供快速且準確的接觸豐富多體系統模擬,且該 repo 由 Google DeepMind 維護。citeturn21search0turn21search3
Google DeepMind 也公開說明收購 MuJoCo 並將其開源,目的在於讓社群能更容易取得高品質模擬工具。citeturn0search23
值得注意的是:快速模擬不只服務 RL,連「在線(real-time)取樣式 MPC」也開始依賴高效率模擬器的並行能力,顯示控制與規劃在基礎設施層面正趨於融合。citeturn8search0
domain randomization / sim-to-real 的演化:從技巧變成系統方法。
OpenAI 在操作領域的經典工作展示了「全在模擬訓練 + Automatic Domain Randomization(ADR)+ 真機成功」的路線,並把 ADR 描述為提升 sim-to-real 的關鍵之一。citeturn13search6turn13search2
近年的人形/全身控制公開案例則把這條路線推到更大規模:例如某全身控制系統宣稱在超過 200,000 個並行環境中、搭配大量 domain randomization 訓練其 kHz 全身控制層,並以此直接轉移到整個機器人群。citeturn19view1
這種「規模化」的效果是:與其追求一個完美物理模型,不如把模型不確定性直接納入訓練分佈,讓策略在分佈上學會魯棒。citeturn19view1turn6view0turn17view0
下表把常見模擬/訓練基礎設施做工程化比較(著重:你為了學習式控制需要什麼能力)。citeturn17view0turn21search1turn21search0turn21search7
| 平台/工具 | 核心賣點(與人形控制直接相關) | 擴展性線索(公開) | 對 sim-to-real 的支援面向 |
|---|---|---|---|
| MuJoCo | 接觸豐富多體動力學、追求快速準確;由 Google DeepMind 維護 citeturn21search0turn21search3 | 被用作多種控制/學習研究的基礎引擎 citeturn8search0 | 依賴上層框架做 randomization/感測建模(引擎本身提供物理核心) |
| Isaac Gym | 端到端 GPU 模擬+訓練,宣稱 2–3 個數量級加速;單 GPU 可跑數萬環境 citeturn17view0 | 報告給出多任務分鐘級訓練時間與大量並行環境描述 citeturn17view0 | 內建/支持 domain randomization;強調降低資料搬運瓶頸 citeturn17view0 |
| Isaac Sim / Isaac Lab | 高保真物理 + photorealistic rendering + 多模態感測模擬 + domain randomization + 資料管線 citeturn21search1turn21search7 | 官方文與案例強調「千級以上並行」;部分文章給出 4096 env 作為飽和例子(情境依任務而異)citeturn21search26turn21search29 | 有明確的視覺域 randomization 指南(光照/材質/相機等)citeturn21search30 |
公開案例、混合架構與工具鏈角色
image_group{"layout":"carousel","aspect_ratio":"16:9","query":["Figure AI Figure 02 humanoid robot walking","Boston Dynamics Atlas electric humanoid robot","Boston Dynamics Spot robot reinforcement learning locomotion","Tesla Optimus humanoid robot"],"num_per_query":1}
公開披露:誰在用什麼方式「替代」傳統規劃
下表只整理「可被引用的公開說法或論文/官方文件」;若某公司內部細節未公開,會明確標註為未知,而不做腦補推斷。citeturn4view0turn19view1turn18search2turn13search6turn13search20
| 主體 | 公開訊號(與「從傳統規劃轉向學習」直接相關) | 可推論的架構選擇 | 明確未知/假設 |
|---|---|---|---|
| entity["company","Figure AI","humanoid robotics company, us"] | 宣稱 Helix 以「單一組權重」完成多行為、分成 S2(7–9 Hz)與 S1(200 Hz)citeturn19view0;Helix 02 再加入 S0(1 kHz),並宣稱用單一視覺運動網路連所有感測到所有致動、在 >200,000 並行環境 + domain randomization 訓練,且以 >1,000 小時人類動作資料與 sim-to-real RL 取代大量手工 C++ 控制碼 citeturn19view1 | 明確的「分層混合式:語意/目標 + 視覺運動策略 + kHz 全身穩定層」,把傳統狀態機縫合視為瓶頸 citeturn19view1 | 指標(如“最長/最複雜任務”)屬公司宣稱,需獨立基準驗證 citeturn19view1 |
| entity["company","Boston Dynamics","robotics company, us"] | 官方部落格說明將 RL 整合進 Spot locomotion,指出歷史上依賴 MPC,但某些真實情況難以觀測與精準建模;並描述控制在多時間尺度運作,且在 <1 ms 內評估數十個 MPC horizon citeturn18search2;官方支援文件指出 Spot 的 joint-level API 允許以 RL 訓練行為 citeturn18search7;另有官方文章宣布電動 Atlas 新世代 citeturn2search14 | 「RL + MPC」的混合式路線:用 learning 增強對變異/難建模因素的適應,保留 MPC/控制結構做核心穩定性 citeturn18search2 | Atlas 的完整控制堆疊細節多未正式論文化;媒體報導提到 ML/自主,但非等同官方技術白皮書 citeturn18search8 |
| entity["company","Tesla","ev and robotics company"] | 官方頁面宣稱其路線是「以 advanced AI 做 vision 與 planning,並以高效率推論硬體支撐」,用於自駕與雙足機器人;同頁也明確提到訓練深度網路涵蓋 perception 到 control,並強調底層軟體要優化 throughput/latency/determinism citeturn4view0 | 更像「把 AI 深度融入整個 autonomy stack」的方向,而非純粹 classic planner;同時仍招聘 motion planning 與 controls,暗示實務上維持混合式堆疊 citeturn4view0 | Optimus 的低層控制(是否 end-to-end torque、如何處理接觸/平衡)未在官方文件中充分細節化,因此不能斷言其已完全放棄傳統規劃 citeturn4view0 |
| entity["company","OpenAI","ai research company, us"] | 公開案例展示用 ADR 做 sim-to-real,策略在模擬訓練後能在真實世界完成高接觸複雜操作(Rubik’s Cube)citeturn13search6turn13search2 | 強調「大規模模擬 + randomization + 學習式策略」可取代大量手寫接觸規劃與控制 citeturn13search2 | 與「現代人形產品控制堆疊」的直接對應有限(此公開案例聚焦手部操作);近年是否有公開人形控制堆疊仍取決於合作夥伴與披露程度 citeturn13search6 |
| entity["company","Google DeepMind","ai research lab, google"] | 以 RT-2 這類 VLA 模型推動「把 web-scale 視覺語言知識轉成 robot action」的 end-to-end 控制研究方向 citeturn13search0turn13search20;RoboCat 提出跨機器/跨任務的 decision transformer 型 generalist agent citeturn13search1turn13search9;並公開把 MuJoCo 開源、維護其核心 repo citeturn0search23turn21search3 | 「通用策略/基礎模型 + 可重用模擬基礎設施」;更偏向讓 policies 能跨任務、跨 embodiment 移植 citeturn13search1turn21search3 | 這些研究多以操作臂等平台為主;與特定商用人形的落地細節通常不公開 citeturn13search9 |
混合式架構正在成為主流,而不是「二選一」
一個重要結論是:多數嚴肅的人形系統並非真的「丟掉 motion planning」,而是把 motion planning 從「每個 control tick 都要解」移到「任務級或慢速迭代層」,並把中低層控制改成可高頻推論/可高頻反饋的形式。這可從多個公開設計看出:一方面,有系統明確把 S2/S1/S0 分成 7–9 Hz、200 Hz、1 kHz;另一方面,也有系統明確描述「RL 增強 + MPC 基底」的混合控制。citeturn19view0turn19view1turn18search2
同時,傳統工具鏈仍然扮演兩個關鍵角色:
第一,它們是「可比較、可復現」的基準與工程底座,例如 MoveIt 以插件方式載入規劃器、用 planning pipeline 串接前/後處理,並以 OMPL 作為預設 sampling-based 規劃庫。citeturn7search0turn7search1turn7search10
第二,它們提供「可被安全層/監控層理解」的結構化表示(軌跡、約束、碰撞場景),便於與安全驗證、速度限制與產線流程整合。citeturn7search20turn7search36
timeline
2019 : OpenAI 展示 ADR + sim-to-real 操作(Rubik's Cube)citeturn13search6
2021 : Isaac Gym 提出端到端 GPU 模擬+訓練、數萬環境並行、數量級加速citeturn17view0
2023 : RT-2(VLA)推動 end-to-end 觀測到動作的泛化控制citeturn13search0turn13search20
2024 : 真實人形行走的 fully learning-based RL 控制與 zero-shot 部署研究citeturn6view0
2024 : Boston Dynamics 發表電動 Atlas 新世代citeturn2search14
2025 : Helix 公開 S2(7–9Hz)+S1(200Hz) 的分層 VLA 控制citeturn19view0
2026 : Helix 02 公開加入 S0(1kHz)、>200k 並行環境訓練與全身端到端控制citeturn19view1
安全性、驗證、可解釋性與原型落地建議
學習式控制帶來的核心風險:難以形式化保證。
端到端策略把中間表徵(接觸狀態估計、摩擦推斷、障礙幾何)隱含在網路中,讓錯誤更難診斷,也更難像傳統控制那樣做嚴格的穩定性/安全性證明。安全領域的綜述將「安全學習控制」視為必須結合控制理論、約束優化與形式方法的多面問題,而非單純調 reward。citeturn20search4turn20search13
形式驗證方向也指出:要在連續時間閉環中驗證神經網路控制器,需要把可達性分析與 NN 驗證結合,仍屬活躍研究。citeturn20search2turn20search6
主流工程解法:把安全做成「層」,而不是指望策略自己學會。
可落地的路線通常是「策略負責性能與適應,安全層負責硬約束」。例如多層安全框架把 Control Barrier Functions(CBFs)與 MPC 結合,用於腿式機器人的安全與穩健性。citeturn20search19
在 humanoid/legged 的脈絡下,這類方法的價值在於:即便策略在未知接觸或極端狀態下產生危險輸出,安全層仍能在即時 QP/MPC 中把動作投影回可行安全集合(至少在模型足夠準確、約束可表達時)。citeturn20search19turn20search4
對研究者/工程師的原型路線圖(以「能站穩走路 + 基礎操作」為目標)
以下建議聚焦「可在 3–6 個月內做出可評估原型」的路徑;每一步都盡量讓你能用公開工具與可重複指標驗證,而非依賴一次性 demo。
首先,選擇你的「控制輸出型態」:是輸出 joint position targets(較容易接硬體、容錯大),還是輸出 torque(性能更好但安全門檻更高)。公開案例中,同一系統可以把高層策略輸出 joint targets(200 Hz),再由 kHz 層追蹤並處理平衡/接觸,這種分層能顯著降低硬體風險。citeturn19view1turn27view0
其次,建立「模擬—訓練—評估」的產線,而不是只建一個 simulator。若你的策略需要大量互動,GPU 並行模擬會直接決定你能否迭代;端到端 GPU pipeline 與數萬環境級並行,是近年學習式控制能工程化迭代的重要原因。citeturn17view0turn21search1
如果你走 Isaac Lab/Isaac Sim 路線,務必把 domain randomization(物理 + 視覺)與多模態感測同步納入最初版本,因為它直接影響 sim-to-real gap。citeturn21search30turn21search7
如果你走 MuJoCo 路線,優先把接觸模型、摩擦與 actuator/延遲建模做對,因為人形的失敗多出在接觸瞬間而非自由空間。citeturn21search0turn8search13
再次,用「混合式」當作預設:把 task-level planning 保留為慢速層(可用傳統規劃或語言推理產生目標/約束),把高頻 loco-manipulation 交給學習策略或學到的全身先驗,最後外加安全層(CBF/MPC/constraint filter)。這基本對應到近年公開架構的系統設計語言。citeturn19view1turn20search19turn18search2
最後,對樣本/算力做「可交付的預算」:即便公開案例可在頂級 GPU 與高度最佳化 pipeline 中把某些任務訓練縮短到分鐘級,你仍需要預留足夠的迭代成本,特別是 reward、domain randomization、以及 sim-to-real 修正會反覆來回。針對大規模深度網路訓練,公開資訊也顯示訓練成本可到數萬 GPU 小時等級(這裡是以車用自駕網路為例),提醒我們「把訓練放大」是大公司優勢來源之一。citeturn4view0turn17view0
推薦的優先閱讀(偏 primary source,且與本報告各段落一一對應)
若你要快速建立完整心智模型,建議依序讀:
(1) Isaac Gym 技術報告(GPU 並行訓練如何改變可行性與成本結構)citeturn17view0
(2) 真實人形行走的 RL 論文(zero-shot、domain randomization、以及高維 RL 的實作坑)citeturn6view0turn22view1
(3) Helix / Helix 02 的公開架構(分層頻率、資料規模、並行環境規模、以及「為何狀態機脆弱」的工程論述)citeturn19view0turn19view1
(4) Boston Dynamics 對 RL+MPC 的官方解釋(混合式思維與多時間尺度控制)citeturn18search2turn18search7
(5) TrajOpt 與 CHOMP 文件(理解傳統最佳化式規劃的能力邊界與 local minima 問題)citeturn30view1turn8search7turn8search3
(6) 安全學習控制/安全 RL 的綜述(把安全做成層的理論工具箱)citeturn20search4turn20search13turn20search19
本報告的明確假設與未指明事項
本報告對部分公司僅能依公開頁面/文章推論其方向:例如對人形控制的低層細節(是否以端到端力矩、如何做接觸估計、是否使用特定傳統 planner)若未見官方技術白皮書或論文披露,則不做確定性結論;尤其對 entity["company","Tesla","ev and robotics company"] 的人形低層控制細節,目前公開訊息更接近「方向宣示與招聘需求」,因此只能保守判斷其傾向把 AI 深度融入 autonomy stack、並可能維持混合式規劃/控制,而非已完全放棄傳統 motion planning。citeturn4view0