Robots krijgen een virtueel oefenterrein dankzij NVIDIA Cosmos 3

Robots krijgen een virtueel oefenterrein dankzij NVIDIA Cosmos 3

NVIDIA ziet open AI-modellen als fundament voor de volgende generatie fysieke AI

Generatieve AI heeft computers geleerd om teksten te schrijven, beelden te maken en complexe vragen te beantwoorden. De volgende grote stap speelt zich echter niet uitsluitend achter een beeldscherm af. AI verhuist steeds nadrukkelijker naar de fysieke wereld, waar robots, autonome voertuigen en intelligente machines zelfstandig moeten waarnemen, redeneren en handelen.

Daarvoor volstaat het niet dat een AI-systeem herkent wat er voor een camera gebeurt. Een robot moet ook kunnen inschatten wat er waarschijnlijk daarna gebeurt en welke actie in die situatie verstandig is. NVIDIA ziet zogeheten wereldmodellen als een belangrijke bouwsteen om dat mogelijk te maken.

Into the Omniverse: How Open World Models Push the Frontier of Physical AI

Into the Omniverse: How Open World Models Push the Frontier of Physical AI

https://blogs.nvidia.com

Met Cosmos 3 zet het bedrijf daarom sterk in op open modellen die niet alleen beelden interpreteren, maar ook toekomstige situaties kunnen simuleren en acties kunnen voorspellen.

Van zien naar begrijpen en voorspellen

Een klassiek computervisiesysteem kan bijvoorbeeld vaststellen dat er een doos op een transportband ligt. Voor een autonome robot is die vaststelling slechts het begin.

De machine moet begrijpen hoe snel de band beweegt, waar de doos naartoe gaat, wanneer die binnen bereik komt en wat er gebeurt wanneer de robot zijn arm uitstrekt. Vervolgens moet het systeem bepalen welke beweging nodig is om het object veilig vast te grijpen.

Dat is de wereld waarin physical AI opereert. Wereldmodellen proberen daarom niet alleen vast te leggen hoe een omgeving eruitziet. Ze leren ook relaties tussen objecten, bewegingen en gebeurtenissen. Daardoor kunnen ze mogelijke toekomstige toestanden van een omgeving simuleren en gegevens genereren waarmee andere AI-systemen kunnen worden getraind.

Voor robots en zelfrijdende voertuigen is dat bijzonder belangrijk. Trainingsgegevens uit de echte wereld verzamelen is duur en tijdrovend, terwijl zeldzame of gevaarlijke situaties moeilijk veilig kunnen worden nagebootst. Virtuele werelden bieden daarvoor een alternatief.

Een robot moet uiteindelijk altijd worden gespecialiseerd

NVIDIA benadrukt tegelijkertijd dat één algemeen AI-model onmogelijk iedere robot en iedere omgeving vooraf kan kennen.

Een magazijnrobot heeft andere camera's, sensoren en bewegingsmogelijkheden dan een humanoïde robot. Een autonoom voertuig rijdt weer in een totaal andere omgeving. Zelfs twee vergelijkbare robots kunnen door hun taken en werkplek andere vaardigheden nodig hebben.

Juist daar krijgt het open karakter van AI-modellen volgens NVIDIA praktische betekenis. Ontwikkelaars moeten toegang hebben tot modelgewichten en de mogelijkheid krijgen om modellen met hun eigen gegevens verder te trainen. De Cosmos-modellen worden daarvoor beschikbaar gesteld onder de OpenMDW 1.1-licentie van de Linux Foundation. Organisaties kunnen de modellen daardoor verder aanpassen aan hun eigen hardware, gegevens en toepassingen.

Virtuele werelden worden de oefenterreinen van machines

Alleen een AI-model aanpassen is niet voldoende. Robots moeten vervolgens uitgebreid kunnen oefenen.

Daar komen NVIDIA Omniverse en OpenUSD in beeld. Met Omniverse-bibliotheken kunnen ontwikkelaars simulatieomgevingen bouwen waarin machines worden getraind en getest voordat ze daadwerkelijk een fabriek, magazijn of openbare weg betreden.

OpenUSD fungeert daarbij als een open fundament voor complexe 3D-omgevingen. Digitale objecten, sensoren en complete digital twins kunnen gemakkelijker tussen verschillende simulaties en ontwikkelprocessen worden hergebruikt. Het idee is dat een onderneming niet telkens een compleet nieuwe virtuele wereld hoeft op te bouwen wanneer bijvoorbeeld een sensor, robot of productieomgeving verandert.

Zo ontstaat uiteindelijk een ontwikkelcyclus waarin echte en virtuele werelden elkaar voortdurend versterken. Data uit de werkelijkheid kan een simulatie verbeteren, waarna de simulatie nieuwe trainingsgegevens oplevert waarmee een robot opnieuw wordt getraind.

Cosmos 3 combineert meerdere soorten intelligentie

Centraal in die strategie staat Cosmos 3, door NVIDIA omschreven als een open foundationmodel voor fysieke AI.

In plaats van afzonderlijke modellen te gebruiken voor verschillende taken, combineert Cosmos 3 visueel redeneren, het genereren van werelden en het voorspellen van acties binnen één modelfamilie.

Ontwikkelaars kunnen het systeem daardoor op verschillende manieren inzetten. Cosmos 3 kan functioneren als vision-language-model om beelden en situaties te begrijpen, maar ook als wereldsimulator die toekomstige situaties voorspelt en synthetische trainingsgegevens genereert.

Daarnaast kan het dienen als basis voor zogenoemde world action models: systemen die niet alleen voorspellen hoe een omgeving verandert, maar die kennis ook koppelen aan mogelijke handelingen.

Daarmee verschuift AI van de vraag “Wat zie ik?” steeds meer richting “Wat gaat er waarschijnlijk gebeuren en wat moet ik vervolgens doen?”

Van 64 miljard parameters tot AI aan de rand

NVIDIA brengt Cosmos 3 in verschillende formaten uit.

Cosmos 3 Super telt 64 miljard parameters en richt zich op hoogwaardige wereldmodellering. Cosmos 3 Nano heeft 16 miljard parameters en is bedoeld voor efficiënter redeneren en verdere training.

Aan de andere kant van het spectrum staat Cosmos 3 Edge met 4 miljard parameters. Deze compactere uitvoering is ontwikkeld voor visueel redeneren rechtstreeks op apparaten en voor het uitvoeren van robotbeleid. Dat laatste is belangrijk voor toepassingen waarbij een machine snel moet reageren. Een robot kan immers niet bij iedere beweging wachten totdat beelden naar een ver datacenter zijn gestuurd en het antwoord terugkomt.

De Edge-versie kan daarom onder meer worden ingezet op RTX-GPU's, DGX-systemen en NVIDIA Jetson-platforms, waaronder Jetson Thor.

NVIDIA claimt sterke prestaties op verschillende benchmarks

Volgens NVIDIA behaalt Cosmos 3 hoge scores op uiteenlopende benchmarks voor beeld- en videogeneratie, wereldmodellering, fysisch begrip, robotbeleid en visuele interpretatie.

Maar belangrijker dan één ranglijst is de bredere richting die hiermee zichtbaar wordt. Wereldmodellen beginnen verschillende onderdelen van fysieke AI samen te brengen die voorheen vaak afzonderlijk werden ontwikkeld.

Naast Cosmos bouwt NVIDIA daarvoor een bredere technologiestapel. Isaac GR00T richt zich op robotica, Alpamayo op autonome voertuigen en Metropolis op vision AI. Cosmos moet daaronder steeds meer fungeren als een algemene laag die machines helpt de fysieke wereld te begrijpen en voorspellen.

Grote bedrijven experimenteren al met wereldmodellen

De technologie blijft ondertussen niet beperkt tot onderzoekslaboratoria. Bedrijven als Doosan Robotics, LG Electronics, Samsung Electronics en Skild AI bouwen volgens NVIDIA met Cosmos aan toepassingen voor robotica. In de wereld van autonome voertuigen noemt het bedrijf onder andere Li Auto, Xiaomi en Afari.

Ook voor industriële AI en slimme omgevingen worden wereldmodellen onderzocht. Daar draait het bijvoorbeeld om intelligente camerasystemen die niet alleen registreren wat er gebeurt, maar gebeurtenissen ook interpreteren en mogelijke ontwikkelingen voorspellen. NVIDIA probeert dat ecosysteem verder uit te bouwen via de Cosmos Coalition, waarin ontwikkelaars, onderzoekers en bedrijven samenwerken rond wereldmodellen, evaluatiemethoden en toepassingen.

Ook Japan krijgt daarbij bijzondere aandacht. Daar wil een bredere groep uit de robotica- en maakindustrie open wereldmodellen ontwikkelen voor onder meer fabrieken, logistiek, landbouw, bouw, gezondheidszorg en transport.


Open modellen worden belangrijker zodra AI de echte wereld betreedt

De opkomst van physical AI maakt de discussie rond open modellen uiteindelijk concreter. Bij een chatbot kan hetzelfde basismodel miljoenen gebruikers bedienen. Bij fysieke AI is de werkelijkheid veel minder uniform. Iedere robot heeft zijn eigen lichaam, sensoren en beperkingen. Iedere fabriek heeft een andere inrichting. Iedere weg, machine en werkomgeving introduceert nieuwe omstandigheden.

Daardoor wordt specialisatie geen extraatje, maar een vereiste. Open wereldmodellen kunnen daarvoor een gemeenschappelijk vertrekpunt vormen. Ontwikkelaars hoeven niet telkens vanaf nul te beginnen, maar kunnen een bestaand model aanpassen aan hun eigen machine en omgeving.

Als die visie werkelijkheid wordt, verandert ook de manier waarop robots worden ontwikkeld. Machines leren dan niet uitsluitend door meer voorbeelden uit de echte wereld te verzamelen. Ze krijgen virtuele werelden waarin ze miljoenen situaties kunnen meemaken voordat ze één stap buiten de simulatie zetten.

De volgende generatie AI zal daardoor mogelijk niet alleen leren praten of kijken. Ze zal moeten leren voorspellen hoe de wereld reageert wanneer ze zelf in beweging komt.

Aanbevolen voor jou

In de kijker

AI kan vanaf nu de muis overnemen op je scherm

AI kan vanaf nu de muis overnemen op je scherm

Meta zet de volgende stap in AI met AI-gegenereerde posts

Meta zet de volgende stap in AI met AI-gegenereerde posts

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Updates

Inschrijven Nieuwsbrief

Zo word je altijd als eerste op de hoogte gebracht van ons laatste nieuws, updates, jobs, tips & promoties. Stay UP-TO-DATE!

WEBSITE LATEN MAKEN?​​​​​​​​​​​​​​

Kies voor een UP-TO-DATE AI Website 100% in Google

Een UP-TO-DATE AI Website maakt het gemakkelijk om automatisch up-to-date te blijven met je klanten en overal aanwezig te zijn.

Maak een afspraak