Kunnen machines een leven lang leren? Twee AI-pioniers denken van wel

Kunnen machines een leven lang leren? Twee AI-pioniers denken van wel

De huidige generatie kunstmatige intelligentie kan schrijven, programmeren, redeneren en complexe opdrachten uitvoeren. Toch ontbreekt er volgens twee prominente AI-onderzoekers iets fundamenteels: zodra een model is getraind en wordt ingezet, houdt het grotendeels op met leren.

Reinforcement-learningpionier Rich Sutton en zijn voormalige student Khurram Javed willen daar verandering in brengen. Met hun nieuwe onderzoeksorganisatie Oak Lab werken ze aan een ander soort kunstmatige intelligentie: systemen die niet alleen vooraf worden getraind, maar gedurende hun hele bestaan blijven leren van wat ze meemaken.

Hun ambitie gaat daarmee verder dan betere taalmodellen. Ze willen uiteindelijk een digitale geest bouwen die zichzelf voortdurend onderhoudt, nieuwe ervaringen verwerkt en jarenlang coherent kan blijven functioneren.

Intelligentie als een voortdurend proces

Sutton geldt als een van de grondleggers van reinforcement learning en verwierf daarnaast bekendheid met zijn essay The Bitter Lesson. De centrale gedachte daarvan is dat algemene methodes die profiteren van steeds meer rekenkracht uiteindelijk doorgaans krachtiger blijken dan systemen waarin mensen grote hoeveelheden specifieke kennis en regels proberen in te bouwen.

Die gedachte krijgt bij Oak Lab een nieuw vervolg. Volgens Sutton zou leren niet moeten worden gezien als een afzonderlijke trainingsfase die eindigt zodra een AI-model wordt gelanceerd. Leren is juist een voortdurend proces. Dat klinkt vanzelfsprekend wanneer naar biologische intelligentie wordt gekeken. Een kind wordt niet eerst jarenlang volledig getraind om vervolgens met bevroren hersenen aan het volwassen leven te beginnen. Mensen en dieren passen hun gedrag voortdurend aan op basis van nieuwe ervaringen.

Volgens Sutton is het daarom opmerkelijk dat de AI-wereld zelfs een aparte term nodig heeft bedacht voor continual learning, oftewel voortdurend leren. Voor hem bestaat er eigenlijk geen andere vorm van werkelijk leren.

Het vreemde probleem van moderne AI

Daarmee komen de onderzoekers bij een zwakke plek van veel hedendaagse AI-assistenten.

Een taalmodel kan tijdens een gesprek nieuwe informatie binnen zijn context gebruiken. Het kan eerdere berichten meenemen en zich daardoor tijdelijk aanpassen aan een gebruiker of opdracht. Maar de fundamentele parameters van het onderliggende model veranderen daarbij doorgaans niet.

Het model doet dus alsof het leert, terwijl zijn kern grotendeels hetzelfde blijft.

Dat verschil wordt belangrijker naarmate AI-agenten zelfstandiger worden. Een agent die maanden of jaren actief moet blijven, kan moeilijk telkens volledig opnieuw worden getraind zodra zijn omgeving verandert. Hij zou uit zijn eigen ervaringen moeten kunnen leren.

Oak Lab wil precies dat probleem aanpakken.

De wereld is te groot om vooraf te simuleren

Een belangrijk uitgangspunt van Sutton en Javed is wat zij de Big World Hypothesis noemen. De echte wereld is volgens hen zo omvangrijk, veranderlijk en complex dat geen enkele dataset, simulator of vooraf gebouwd wereldmodel haar volledig kan bevatten.

Daaruit volgt een ongemakkelijke conclusie voor een deel van de huidige AI-industrie.

Synthetische data, informatie die door modellen of simulaties wordt gegenereerd om andere modellen verder te trainen, kan nuttig lijken omdat daarmee enorme hoeveelheden trainingsmateriaal beschikbaar komen. Sutton is er echter bijzonder kritisch over en noemt een te sterke afhankelijkheid ervan zelfs een grote vergissing.

Een simulatie blijft immers een vereenvoudiging van de werkelijkheid. Wanneer een AI voornamelijk leert van zulke benaderingen, dreigt hij uiteindelijk vooral de beperkingen van zijn eigen kunstmatige wereld te leren.

De werkelijkheid zelf blijft volgens de onderzoekers de rijkste bron van nieuwe informatie.

LLM's waren een wetenschappelijke verrassing

Die kritiek betekent niet dat Sutton weinig waardering heeft voor grote taalmodellen. Integendeel: hij beschouwt hun snelle opkomst als een onverwachte wetenschappelijke doorbraak.

LLM's hebben laten zien dat uit enorme hoeveelheden menselijke taal en kennis opmerkelijk algemene vaardigheden kunnen ontstaan. Maar volgens Sutton vertegenwoordigen ze slechts een deel van wat voor volledige intelligentie nodig is. Hij schat dat taalmodellen misschien ongeveer een kwart van het grotere intelligentieprobleem oplossen. De volgende stap zou daarom niet simpelweg bestaan uit nog grotere modellen met nog meer tekst.

Een werkelijk intelligente machine moet handelen, gevolgen waarnemen, voorspellingen maken, fouten ontdekken en vervolgens haar interne representaties aanpassen. Intelligentie ontstaat in die visie uit een voortdurende wisselwerking tussen een agent en zijn omgeving.

Wat baby's en eekhoorns AI kunnen leren

De vergelijking met dieren speelt daarbij een belangrijke rol.

Geen eekhoorn krijgt miljoenen gelabelde voorbeelden van correcte sprongen tussen boomtakken. Een baby ontvangt evenmin een dataset waarin iedere beweging, ieder voorwerp en iedere sociale interactie vooraf correct is geclassificeerd. Ze experimenteren. Acties leveren gevolgen op. Sommige verwachtingen blijken juist, andere verkeerd. Door die voortdurende feedback ontstaat geleidelijk een intern beeld van de wereld.

Reinforcement learning probeert een vergelijkbaar principe in machines te gebruiken. Voor Sutton en Javed vormt dat mechanisme een belangrijk onderdeel van AI die uiteindelijk zelfstandig kan blijven groeien.

Catastrofaal vergeten hoeft niet permanent te zijn

Een van de grote technische hindernissen is catastrophic forgetting. Wanneer neurale netwerken nieuwe dingen leren, kunnen veranderingen in hun parameters eerder verworven vaardigheden beschadigen. Het systeem wordt beter in een nieuwe taak, maar vergeet ondertussen delen van wat het eerder kende.

Dat probleem wordt vaak gezien als een fundamentele uitdaging voor continual learning. Sutton is optimistischer. Volgens hem is catastrofaal vergeten in principe volledig oplosbaar. Een belangrijk aanknopingspunt komt uit onderzoek naar continual backpropagation. Daarbij wordt geprobeerd neurale netwerken plastisch te houden: onderdelen die niet langer nuttig zijn kunnen worden vernieuwd, terwijl waardevolle kennis behouden blijft.

Het lijkt enigszins op voortdurend onderhoud aan een machine die nooit wordt uitgezet. In plaats van het hele systeem telkens opnieuw te bouwen, worden tijdens het gebruik onderdelen aangepast en vervangen.

Een AI die zichzelf onderhoudt

Daarmee komt Oak Lab bij zijn grotere ambitie: de ontwikkeling van een self-maintaining mind. Zo'n AI zou niet alleen voortdurend nieuwe informatie verzamelen, maar ook zijn eigen interne kennisstructuren onderhouden. Oude aannames moeten kunnen verdwijnen wanneer de werkelijkheid verandert. Nieuwe concepten moeten ontstaan zonder dat bestaande vaardigheden instorten.

Dat zou een fundamentele verschuiving betekenen. Vandaag draait veel AI-ontwikkeling rond een cyclus van verzamelen, trainen en uitrollen. Daarna wordt een model gebruikt totdat een volgende versie verschijnt.

In de visie van Oak Lab zou die scheiding grotendeels verdwijnen. Training en gebruik worden onderdeel van hetzelfde voortdurende proces.

Waarom grote AI-laboratoria moeilijk van koers veranderen

Sutton en Javed denken dat bestaande frontierlabs niet zomaar naar zo'n architectuur kunnen overstappen. Dat heeft volgens hen minder met gebrek aan talent te maken dan met economische en technologische momentum. De huidige aanpak met grote vooraf getrainde modellen levert indrukwekkende resultaten op. Bedrijven hebben enorme infrastructuur, teams en producten rond dat paradigma gebouwd.

Een radicaal andere methode bevindt zich aanvankelijk bijna altijd in het nadeel. Nieuwe technologie kan eerst slechter presteren voordat ze uiteindelijk een hoger plafond bereikt. Javed beschrijft de huidige situatie daarom als een lokaal minimum: binnen het bestaande paradigma kunnen modellen verder worden verbeterd, maar om een fundamenteel betere oplossing te bereiken moet mogelijk eerst een tijdelijke achteruitgang worden geaccepteerd.

Voor grote commerciële laboratoria is zo'n sprong bijzonder moeilijk wanneer miljardeninvesteringen en miljoenen gebruikers afhankelijk zijn van de huidige technologie.

Van The Bitter Lesson naar een nieuwe AI-generatie

Daarmee sluit het onderzoek opnieuw aan bij Suttons bekende Bitter Lesson. De geschiedenis van AI laat volgens die gedachte telkens zien dat onderzoekers graag menselijke kennis rechtstreeks in systemen verwerken, terwijl algemene leermechanismen op lange termijn meestal krachtiger blijken.

Oak Lab trekt die redenering nog verder door. Misschien moet de mens uiteindelijk zelfs stoppen met proberen alle kennis vooraf aan AI te geven. De belangrijkste taak wordt dan niet het bouwen van een machine die alles al weet, maar het ontwerpen van een machine die nooit ophoudt met leren.


Een biljoen parameters op twintig watt

De langetermijnambitie is opvallend. Binnen vijf tot tien jaar hopen de onderzoekers uiteindelijk toe te werken naar een systeem met mogelijk ongeveer een biljoen parameters dat voortdurend blijft leren, intern coherent blijft en met een energieverbruik van ongeveer 20 wattkan functioneren.

Dat laatste cijfer is niet toevallig. Het ligt ongeveer in de orde van grootte van het energieverbruik van het menselijke brein. Het contrast met de huidige AI-industrie kan nauwelijks groter zijn. Moderne frontiermodellen worden ontwikkeld en uitgevoerd op enorme datacenters met grote hoeveelheden gespecialiseerde hardware en elektriciteit. Oak Lab stelt zich uiteindelijk een intelligent systeem voor waarin efficiëntie, permanent leren en autonomie samenkomen.

Of zo'n digitale geest binnen vijf tot tien jaar daadwerkelijk haalbaar blijkt, is een open vraag. Maar het onderzoek legt wel een fundamentele kwestie bloot die achter de huidige AI-race schuilgaat. Misschien ligt de volgende grote sprong niet in een model dat bij zijn lancering nóg meer weet. Misschien ligt hij in een model dat na zijn lancering eindelijk echt begint te leren.

Aanbevolen voor jou

In de kijker

AI kan vanaf nu de muis overnemen op je scherm

AI kan vanaf nu de muis overnemen op je scherm

Meta zet de volgende stap in AI met AI-gegenereerde posts

Meta zet de volgende stap in AI met AI-gegenereerde posts

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Updates

Inschrijven Nieuwsbrief

Zo word je altijd als eerste op de hoogte gebracht van ons laatste nieuws, updates, jobs, tips & promoties. Stay UP-TO-DATE!

WEBSITE LATEN MAKEN?​​​​​​​​​​​​​​

Kies voor een UP-TO-DATE AI Website 100% in Google

Een UP-TO-DATE AI Website maakt het gemakkelijk om automatisch up-to-date te blijven met je klanten en overal aanwezig te zijn.

Maak een afspraak