Fysieke AI maakt sprong voorwaarts met NVIDIA's World Action Models

Fysieke AI maakt sprong voorwaarts met NVIDIA's World Action Models

NVIDIA ziet een nieuwe generatie fysieke AI ontstaan

De wereld van robotica staat mogelijk aan de vooravond van een fundamentele verschuiving. Waar robots jarenlang afhankelijk waren van enorme hoeveelheden specifieke trainingsdata om een taak te leren, ontstaat nu een nieuwe benadering die veel menselijker aanvoelt. NVIDIA noemt deze ontwikkeling de opkomst van World Action Models (WAM's): AI-systemen die eerst leren begrijpen hoe de wereld werkt en daarna pas leren handelen. 

Volgens NVIDIA zouden deze modellen een belangrijke stap kunnen zijn richting veelzijdige robots die zich sneller aanpassen aan nieuwe situaties, zonder voor elke taak opnieuw uitgebreid getraind te moeten worden. 

Waarom huidige robot-AI tegen grenzen aanloopt

De huidige generatie robotmodellen maakt vaak gebruik van zogenaamde Vision-Language-Action-modellen (VLA's). Deze systemen combineren beeldherkenning en taalbegrip om vervolgens acties uit te voeren.

Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models | NVIDIA Technical Blog

Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models | NVIDIA Technical Blog

Quick glossary for readers new to VLA/WAM terminology VLA Vision-Language-Action model: a robot policy that starts from a pretrained VLM backbone and adapts it…

https://developer.nvidia.com

Dat werkt goed voor bekende taken, maar zodra een robot in een onbekende omgeving terechtkomt of een nieuwe beweging moet uitvoeren, ontstaan beperkingen. De robot begrijpt wel wat hij moet doen, maar heeft vaak onvoldoende inzicht in hoe de fysieke wereld zich zal gedragen tijdens die actie. 

Vergelijk het met een beginnende chauffeur die alle verkeersregels kent, maar nog nooit op een gladde weg heeft gereden. Theorie alleen is niet genoeg.

Robots die eerst leren voorspellen

World Action Models pakken dit anders aan. In plaats van direct een actie uit te voeren, leren deze modellen eerst de toekomstige toestand van de wereld voorspellen. Ze bouwen als het ware een interne simulatie van wat er waarschijnlijk gaat gebeuren wanneer een bepaalde actie wordt uitgevoerd. Pas daarna wordt de meest geschikte beweging gekozen. 

Daardoor ontstaat een robot die niet alleen reageert, maar ook vooruitdenkt.

Een robotarm kan bijvoorbeeld voorspellen hoe een object zal bewegen wanneer het wordt opgepakt. Een humanoïde robot kan inschatten hoe een deur zal openen voordat hij eraan trekt. En een autonome machine kan toekomstige situaties simuleren voordat ze daadwerkelijk plaatsvinden. 

Van videodata naar fysieke intelligentie

Een van de opvallendste aspecten van deze nieuwe aanpak is dat robots leren uit enorme hoeveelheden videobeelden.

Videomodellen bevatten namelijk al veel kennis over zwaartekracht, beweging, botsingen en objectgedrag. Door deze bestaande kennis als basis te gebruiken, hoeven robots minder fysieke trainingsuren te maken. Vervolgens worden de modellen verfijnd met robotdata zodat ze niet alleen kunnen voorspellen, maar ook kunnen handelen. 

Dat verklaart ook de titel van NVIDIA's visie: "Pretrained to Imagine, Fine-Tuned to Act". Eerst leert een model zich de wereld voor te stellen, daarna leert het hoe het daarin moet handelen. 

DreamZero toont de mogelijkheden

NVIDIA verwijst naar onderzoek zoals DreamZero, een World Action Model dat is gebouwd op een vooraf getraind videomodel.

In plaats van rechtstreeks acties te genereren, voorspelt DreamZero eerst hoe een toekomstige situatie eruit zal zien. Daarna worden de benodigde handelingen afgeleid uit die voorspelde toekomst. Deze aanpak blijkt vooral sterk in nieuwe omgevingen en onbekende bewegingspatronen, waar traditionele modellen vaak moeite hebben. 

Onderzoekers zien hierin een veelbelovende route naar robots die flexibeler omgaan met onverwachte situaties.

De weg naar algemene robotintelligentie

Binnen NVIDIA groeit de overtuiging dat World Action Models kunnen uitgroeien tot een tweede grote trainingsparadigma voor robotica, naast de huidige Vision-Language-Action-modellen.

De combinatie van videodata, wereldmodellen, simulatie en actieplanning zou robots in staat kunnen stellen om sneller nieuwe vaardigheden te leren, minder afhankelijk te worden van dure robotdata en beter te generaliseren naar onbekende omstandigheden. 

Voor sectoren zoals logistiek, productie, zorg, landbouw en autonome voertuigen kan dat een enorme impact hebben. Robots zouden niet langer uitsluitend vooraf geprogrammeerde machines zijn, maar systemen die actief redeneren over hun omgeving voordat ze handelen. 


Een toekomst waarin robots eerst denken en dan bewegen

De geschiedenis van AI laat zien dat grote doorbraken vaak ontstaan wanneer systemen eerst leren observeren voordat ze leren handelen. Taalmodellen leerden miljarden woorden lezen voordat ze gesprekken konden voeren. Beeldmodellen bekeken miljarden afbeeldingen voordat ze objecten herkenden.

Nu lijkt dezelfde evolutie zich af te tekenen in robotica.

Door robots eerst te laten "dromen" over de toekomst en daarna pas te laten bewegen, ontstaat een vorm van fysieke AI die dichter bij menselijk inzicht komt dan ooit tevoren. Als NVIDIA gelijk krijgt, zouden World Action Models wel eens de ontbrekende schakel kunnen zijn tussen slimme software en echt intelligente machines. 

Aanbevolen voor jou

In de kijker

AI kan vanaf nu de muis overnemen op je scherm

AI kan vanaf nu de muis overnemen op je scherm

Meta zet de volgende stap in AI met AI-gegenereerde posts

Meta zet de volgende stap in AI met AI-gegenereerde posts

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Updates

Inschrijven Nieuwsbrief

Zo word je altijd als eerste op de hoogte gebracht van ons laatste nieuws, updates, jobs, tips & promoties. Stay UP-TO-DATE!

WEBSITE LATEN MAKEN?​​​​​​​​​​​​​​

Kies voor een UP-TO-DATE AI Website 100% in Google

Een UP-TO-DATE AI Website maakt het gemakkelijk om automatisch up-to-date te blijven met je klanten en overal aanwezig te zijn.

Maak een afspraak