Aktuální technologie v humanoidní robotice
Aktuální technologie v humanoidní robotice
Úvod
Humanoidní roboti jsou dnes v zajímavé fázi. Hardware začíná být dostupnější, simulační prostředí jsou výrazně lepší než před několika lety a robotické foundation modely konečně začínají řešit nejen obraz a jazyk, ale i akci. Zároveň ale stále neexistuje jeden model, který by nahradil celý robotický systém.
Praktičtější je dívat se na humanoidní robotiku jako na řetězec fází: návrh embodimentu, teleoperace a sběr dat, simulace, trénování nebo fine-tuning, inference na robotu a testování v reálném světě. Každá fáze používá jiné technologie a jiné metriky úspěchu. GR00T, Gemini Robotics, OpenVLA, π0.5, Redwood, SONIC, Kimodo nebo Cosmos proto nejsou vzájemně zaměnitelné pojmy. Každý zapadá do jiné části stacku. [1] [2] [3] [4] [5] [6] [7]
Tento článek shrnuje aktuální pojmy a technologie tak, aby bylo jasné, co se používá pro sběr dat, co pro simulaci, co pro fine-tuning, co pro inference a co pro bezpečné nasazení humanoida.

Základní orientace: o čem se dnes skutečně mluví
Současná humanoidní robotika se dá rozdělit do několika vrstev. První je hardware a embodiment: tělo robota, ruce, aktuátory, senzory, kamera, IMU, taktilní prvky a onboard počítač. Druhá je teleoperace: člověk robota ovládá přímo nebo nepřímo a vytváří demonstrace. Třetí je simulace: prostředí, ve kterém se levně a bezpečně testují pohyby, manipulace a policy. Čtvrtá je modelová vrstva: VLA, VFA, diffusion policy, world modely a whole-body control foundation modely. Pátá je runtime vrstva: ROS 2, ros2_control, MoveIt 2, safety supervisor, diagnostika a logování.
Důležité je, že tyto vrstvy se nedají jednoduše sloučit. VLA model může navrhnout akci, ale neměl by bez dalších omezení přímo ovládat všechny klouby humanoida. Simulace může urychlit učení, ale sama nevyřeší sim-to-real rozdíl. Teleoperace může dodat data, ale není automaticky autonomie. ROS 2 může propojit systém, ale není trénovací framework.
Pojmy podle fáze vývoje a nasazení
1. Návrh embodimentu a robotické platformy
V této fázi se řeší, jaké tělo robot má, jaké má ruce, kolik má stupňů volnosti, jaké senzory používá a jaké úlohy má fyzicky zvládnout. U humanoidů je embodiment zásadní, protože model naučený na jedné kinematice se často nepřenáší přímo na jinou.
- Unitree G1 / G1D – dostupná výzkumná platforma, na které dnes vzniká mnoho prací k lokomoci, teleoperaci a sim-to-real experimentům.
- Fourier GR-1, Apptronik Apollo, Figure, 1× NEO, Agility Digit, Sanctuary Phoenix, UBTECH Walker, Tesla Optimus – příklady humanoidních platforem, které ukazují různé strategie: domácnost, logistika, průmysl, výzkum nebo servisní robotika.
- Dexterous hands – ruce jsou samostatný problém. Jemná manipulace často vyžaduje kombinaci vizuálních, taktilních a silových dat.
- URDF / MJCF / USD – formáty pro popis robota v ROS, MuJoCo a NVIDIA Omniverse/Isaac stacku.
Embodiment určuje, jaká data potřebujete, jaký retargeting budete dělat a jak těžký bude sim-to-real přenos.
2. Teleoperace a sběr demonstrací
Teleoperace je dnes jedna z nejdůležitějších částí humanoidního vývoje. Používá se pro rychlé testování embodimentu, sběr demonstračních dat, validaci úloh a jako bezpečnostní fallback při testování. Přehledové práce o teleoperaci humanoidů ukazují, že hlavní problémy jsou retargeting mezi lidským tělem a robotem, latence, kontakt se světem, bezpečnost a rozdíl mezi tím, co cítí operátor, a co se skutečně děje na robotu. [8]
- VR/XR teleoperace – používá headset a controllery nebo hand tracking. Hodí se pro rychlé ověřování scénářů, ergonomie a prostorového záměru. NVIDIA Isaac Sim a Isaac Lab podporují teleoperaci a záznam epizod pro další učení. [9]
- GELLO – levný open-source leader-arm přístup. Uživatel ovládá fyzickou kopii nebo analog robotické paže, což může dávat přesnější demonstrační data než běžné VR controllery. [10]
- Xsens – komerční motion-capture stack pro celé tělo a IMU data. Hodí se pro full-body retargeting, trénink pohybových priorů a validaci chůze či rovnováhy. [11]
- MANUS / Metagloves – rukavice pro snímání prstů a rukou, případně s haptickou zpětnou vazbou. Důležité pro dexterous manipulation a teleoperaci robotických rukou. [12]
- ALOHA, DROID, Open X-Embodiment – datové projekty a datasety, které ukazují trend: robotika se posouvá od izolovaných experimentů k velkým heterogenním datasetům. [13] [14]
Teleoperace tedy není jen dočasná náhrada autonomie. V současném stacku je to datový motor, způsob validace a někdy i nutná bezpečnostní vrstva.
3. Simulace, syntetická data a sim-to-real
Simulace slouží k bezpečnému testování, trénování policy, generování syntetických dat a regresnímu testování. U humanoidů je kritická, protože pády, kolize a chybné kontakty jsou na reálném hardware drahé a rizikové.
- NVIDIA Isaac Sim – simulační prostředí postavené na Omniverse/OpenUSD, často používané pro robotické scény, senzory, syntetická data a propojení s ROS 2. [15]
- Isaac Lab – framework pro robot learning v Isaac Simu. Používá se pro reinforcement learning, imitation learning, policy evaluation a škálování experimentů. [16]
- MuJoCo – rychlý fyzikální engine oblíbený ve výzkumu řízení, reinforcement learningu a benchmarkingu. [17]
- Genesis – novější open-source platforma pro physical AI simulace s důrazem na multi-physics a Python workflow. [18]
- ManiSkill, RoboCasa, SAPIEN – prostředí a benchmarky pro manipulaci, domácí úlohy a simulační trénink. Jsou relevantní hlavně pro vývoj manipulačních policy a datových pipeline.
- Domain randomization – technika, kdy se v simulaci záměrně mění parametry prostředí, objektů, kamer, tření nebo osvětlení, aby policy lépe přežila přenos do reality.
Simulace není důkaz, že systém bude fungovat na reálném robotu. Je to iterativní nástroj, který musí být doplněn real-world testy, kalibrací, logováním a bezpečnostními limity.
4. Foundation modely a policy modely
Tady vzniká nejvíc zmatku. „Robotický foundation model“ může znamenat VLA model, world model, motion model, whole-body control policy nebo proprietární systém konkrétní firmy. Není to jedna kategorie.
- VLA – Vision-Language-Action: model zpracuje obraz, jazykovou instrukci a případně stav robota a predikuje akci. Sem patří GR00T, Gemini Robotics, OpenVLA, π0/π0.5, RT-2/RT-X, Octo nebo SmolVLA. [1] [2] [3] [4] [19] [20]
- VFA – Vision-Force-Action: rozšíření VLA směrem ke kontaktu, síle a taktilním datům. Termín zatím není tak standardizovaný jako VLA, ale je důležitý pro kontaktní manipulaci, insertions a jemnou práci rukou. [21]
- Diffusion policy / flow matching: moderní způsob generování spojitých akcí. Místo jedné diskrétní akce model generuje hladké action chunks nebo trajektorie. Používá se například v GR00T, π0/π0.5 a dalších policy modelech. [1] [3]
- World model: model, který se snaží predikovat nebo generovat budoucí stavy světa. V robotice se používá pro syntetická data, plánování, evaluaci a reasoning, ne nutně jako přímý controller. Typickým příkladem je NVIDIA Cosmos. [7]
- Whole-body control foundation model: model pro řízení celého těla humanoida. Sem patří například SONIC, který se zaměřuje na natural humanoid whole-body control a propojení teleop vstupů, videí, motion commands a výstupů z VLA modelů. [6]
- Motion generation model: model, který generuje kinematické pohyby, referenční motion priory nebo trajektorie. Sem patří NVIDIA Kimodo. [5]
Praktický závěr: VLA model řeší „co a jak provést“ na úrovni akce nebo dovednosti, ale pro humanoida často potřebuje pod sebou whole-body control, safety vrstvu a klasické řízení.
5. Fine-tuning a adaptace na konkrétního robota
Foundation model sám o sobě nestačí. Většina modelů potřebuje adaptaci na konkrétní robot, kameru, ruku, prostředí a akční prostor.
- LeRobot – otevřený framework a datový standard pro robotické datasety, trénování a evaluaci policy. Není to jeden model, ale praktická vrstva pro práci s daty a modely. [22]
- OpenPI / π0 / π0.5 – otevřenější směr robotických VLA modelů od Physical Intelligence. π0.5 je zajímavý tím, že kombinuje robotická data, webová data, detekce objektů, jazykové instrukce a low-level akce pro lepší open-world generalizaci. [3]
- OpenVLA – otevřený 7B VLA model postavený na Open X-Embodiment datech. Vhodný jako výzkumný baseline a pro fine-tuning na konkrétním embodimentu. [4]
- Octo – generalist robotic policy trénovaná na Open X-Embodiment datech, důležitá pro srovnání VLA a diffusion-policy přístupů. [19]
- SmolVLA – menší a praktičtější VLA model v ekosystému Hugging Face/LeRobot, zajímavý pro low-cost výzkum a omezený hardware. [20]
- GR00T N1. x – NVIDIA humanoidní VLA stack s jasným workflow pro data, fine-tuning, evaluaci a deployment. [1]
Fine-tuning je fáze, kde se často rozhoduje, zda model skutečně pomůže, nebo zůstane jen hezkým demo videem. Klíčová je kvalita demonstračních dat, správný action space, synchronizace senzorů a realistické testovací scénáře.
6. Inference, ROS 2 a reálné nasazení
Inference je běh hotového modelu. V humanoidovi ale inference není celý runtime. Model se musí napojit na senzory, plánování, řízení, diagnostiku a bezpečnost. Tady zapadá ROS 2.
- ROS 2 – integrační middleware. Zajišťuje komunikaci mezi uzly, senzory, akčními servery, diagnostikou a vyššími aplikacemi. Není to primárně trénovací framework. [23]
- ros2_control – standardní framework pro napojení controllerů na hardware interfaces. Hodí se pro kloubové řízení, přepínání controllerů a oddělení hardware vrstvy od aplikace. [24]
- MoveIt 2 – manipulační stack pro plánování, kinematiku, kolize a integraci robotických ramen v ROS 2. [25]
- Safety supervisor / guard layer – vrstva, která omezuje rychlosti, síly, zóny, joint limits, self-collision, kontakty a chování při selhání.
- Teleop fallback – možnost, aby člověk převzal řízení nebo zastavil robota, když policy selže.
Typický pattern je jednoduchý: model běží jako samostatný inference server nebo ROS 2 node, vydává cíle nebo akční příkazy, ale skutečný pohyb prochází přes ROS 2, kontroléry a safety vrstvu. To je robustnější než pustit VLA model přímo na aktuátory.

Přehled klíčových modelů, firem a technologií
| Název | Typ | Kde v pipeline | Co je důležité | Dostupnost / poznámka |
|---|---|---|---|---|
| NVIDIA GR00T N1. x | VLA pro humanoidy | fine-tuning, inference | vision-language modul + diffusion/action modul pro robotické akce | open/EA podle verze, nutno hlídat licenci [1] |
| Google Gemini Robotics | VLA + embodied reasoning | reasoning, inference, adaptace | Gemini Robotics, Robotics-ER a On-Device varianta | trusted testers / SDK [2] |
| OpenPI π0 / π0.5 | VLA / flow-matching policy | fine-tuning, inference | continuous action chunks, co-training, open-world generalizace | open-source stack [3] |
| OpenVLA | otevřený VLA | baseline, fine-tuning | 7B model, jazyk + kamera → robotické akce | open baseline, nutný fine-tuning [4] |
| Octo | generalist robotic policy | fine-tuning, evaluace | diffusion policy, jazyk i goal images | open-source výzkum [19] |
| SmolVLA | malý VLA | low-cost fine-tuning/inference | menší model pro LeRobot workflow | vhodné pro dostupnější experimenty [20] |
| NVIDIA Cosmos | world foundation model | simulace, syntetická data, reasoning | generování/predikce světových stavů, physical reasoning | nepřímý controller, spíše datový a eval nástroj [7] |
| NVIDIA SONIC | whole-body control foundation model | inference/řízení pohybu | motion tracking, unified token space, humanoidní celé tělo | doplněk k VLA, ne náhrada VLA [6] |
| NVIDIA Kimodo | motion diffusion model | simulace, motion priors | generuje pohyby z textu a kinematických omezení | pro motion generation, ne přímý controller [5] |
| 1× Redwood AI | proprietární humanoidní VLA | inference v NEO/EVE stacku | vision, language, propriocepce a diffusion policy | uzavřený firemní stack [26] |
| Generalist AI GEN-1 | proprietární embodied model | inference/adaptace | firemně prezentovaný general-purpose physical model | early access, méně veřejných detailů [27] |
| Figure Helix | humanoidní VLA | inference / upper-body control | VLA pro humanoidní horní část těla a ruce | firemní closed stack, důležité demo směru [28] |
| GELLO | teleoperační hardware | sběr demonstrací | low-cost leader arm, přesná data pro imitation learning | open hardware/software [10] |
| Xsens | full-body mocap | teleop, data, validace | motion capture, IMU, Metagloves | komerční stack [11] |
| MANUS | gloves / hand tracking | teleop rukou, sim teleop | prsty, ruce, haptika, Isaac Lab napojení | komerční stack [12] |
| LeRobot | dataset/training framework | data, fine-tuning, evaluace | standardizuje datasety a policy workflow | open-source [22] |
| Isaac Sim / Isaac Lab | simulace a learning | simulace, syntetická data, RL/IL | GPU simulace, robot learning, ROS bridge | NVIDIA ekosystém [15] [16] |
| MuJoCo | fyzikální engine | simulace, RL benchmarky | rychlá fyzika, výzkumná reprodukovatelnost | open-source [17] |
| Genesis | physical AI simulace | simulace, multi-physics | moderní open-source simulační framework | open-source [18] |
| ROS 2 / ros2_control / MoveIt 2 | runtime a integrace | inference, testování, deployment | komunikace, řízení, manipulace, diagnostika | standardní integrační vrstva [23] [24] [25] |
Jak to do sebe prakticky zapadá
Představme si vývoj nové manipulační úlohy pro humanoida: například otevření šuplíku, uchopení předmětu a předání člověku.
Nejdřív je nutné připravit embodiment robota v simulaci i v reálném systému: kinematika, kamery, ruce, limity kloubů a bezpečnostní zóny. Potom se pomocí VR, GELLO nebo rukavic nasbírají demonstrace. Ty se uloží do datového formátu, například LeRobotDataset. Následně se stejná úloha přehraje v simulaci, rozšíří o syntetické varianty a použije pro fine-tuning policy.
Model typu OpenVLA, π0.5 nebo GR00T může dodat schopnost reagovat na obraz a jazykovou instrukci. Whole-body model typu SONIC nebo klasický controller ale stále řeší stabilitu, koordinaci těla a pohyb v limitech. ROS 2 pak propojí policy s kamerami, kontroléry, diagnostikou a bezpečnostní logikou. Pokud systém selže, teleoperace slouží jako fallback a nová data ze selhání se vrací zpět do datasetu.
To je důvod, proč nejrychleji postupují týmy, které neřeší jen model, ale celý datový cyklus: teleop → dataset → simulace → fine-tuning → inference → test → nové logy.
Kde je dnes největší hype a kde reálný posun
Reálný posun je v tom, že robotické modely už nejsou trénované jen na jedné úloze a jednom robotu. Open X-Embodiment, RT-X, OpenVLA, Octo, π0.5 a GR00T ukazují směr k heterogenním datům a cross-embodiment učení. [1] [3] [4] [13] [19]
Reálný posun je také v teleoperaci. Levnější leader-arm řešení, VR/XR workflow a rukavice pro prsty zjednodušují sběr dat. Bez dat ale foundation model zůstane obecný a na konkrétním robotu často nepoužitelný. [8] [10] [12]
Hype vzniká tam, kde se z demo videa odvodí obecná autonomie. Proprietární systémy jako Redwood, GEN-1, Helix nebo Gemini Robotics jsou velmi důležité, ale veřejně dostupné informace se liší hloubkou detailu a reprodukovatelností. Je proto fér je uvádět jako aktivní a důležité směry, ale zároveň rozlišovat mezi otevřeným výzkumným stackem, partner-only modelem a marketingovým demem. [2] [26] [27] [28]
Další hype je představa, že world model sám vyřeší robotiku. Cosmos a podobné modely mohou zásadně pomoci se syntetickými daty, plánováním a evaluací, ale nejsou samy o sobě bezpečný real-time controller humanoida. [7]
Závěr
Humanoidní robotika dnes stojí na kombinaci tří trendů: lepšího hardwaru, lepšího sběru dat a robotických foundation modelů. Samotný model ale nestačí. Úspěšný humanoidní stack musí spojit teleoperaci, simulaci, datasety, fine-tuning, ROS 2 runtime, whole-body control a bezpečnostní vrstvy.
Nejdůležitější praktická otázka proto nezní „který model je nejlepší“, ale „ve které fázi vývoje ho používáme.“ GR00T, Gemini Robotics, OpenVLA, π0.5, Redwood, SONIC, Kimodo nebo Cosmos dávají smysl pouze tehdy, když víme, zda řeší data, simulaci, reasoning, action generation, motion prior, whole-body control nebo deployment.
V blízké době pravděpodobně neuvidíme jednoho univerzálního humanoida, který se naučí cokoliv bez omezení. Uvidíme ale rychlý růst systémů, které budou dobře fungovat v jasně definovaných scénářích, budou sbírat data přes teleoperaci, trénovat v simulaci, adaptovat foundation modely a nasazovat je přes robustní ROS 2 a safety stack.
Zdroje
- [1] NVIDIA Isaac GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- [2] Google DeepMind: Gemini Robotics
- [3] Physical Intelligence: π0.5 / OpenPI
- [4] OpenVLA
- [5] NVIDIA Kimodo
- [6] NVIDIA SONIC
- [7] NVIDIA Cosmos documentation
- [8] A Survey on Teleoperation of Humanoid Robots
- [9] Isaac Sim teleoperation and synthetic data tutorial
- [10] GELLO: A General, Low-Cost, and Intuitive Teleoperation Framework
- [11] Xsens humanoid robotics
- [12] MANUS robotics
- [13] Open X-Embodiment / RT-X
- [14] DROID dataset
- [15] NVIDIA Isaac Sim
- [16] NVIDIA Isaac Lab
- [17] MuJoCo
- [18] Genesis World
- [19] Octo model
- [20] SmolVLA
- [21] FD-VLA: Force-aware Vision-Language-Action model
- [22] Hugging Face LeRobot
- [23] ROS 2 documentation
- [24] ros2_control
- [25] MoveIt 2
- [26] 1× Redwood AI
- [27] Generalist AI GEN-1
- [28] Figure Helix