Wat denkt een AI echt? Een blik in het hoofd van Claude

Wat denkt een AI echt? Een blik in het hoofd van Claude

Een blik achter het gordijn van kunstmatige intelligentie

Kunstmatige intelligentie wordt steeds krachtiger, maar één fundamentele vraag blijft grotendeels onbeantwoord: hoe komt een AI eigenlijk tot haar antwoorden?

Onderzoekers van Anthropic hebben een opmerkelijke stap gezet richting een antwoord. Door diep in de interne werking van hun AI-model Claude te kijken, probeerden ze te achterhalen wat er zich afspeelt tussen een vraag en het uiteindelijke antwoord. Wat ze ontdekten, bleek niet alleen verrassend, maar soms ronduit vreemd.

 

Károly Zsolnai-Fehér - Research Scientist

Two Minute Papers

https://users.cg.tuwien.ac.at

De studie biedt een zeldzame inkijk in de verborgen wereld van moderne AI-systemen en laat zien dat kunstmatige intelligentie veel complexer redeneert dan eerder werd gedacht.

Het zwarte gat van AI wordt langzaam transparanter

Tot nu toe werden grote taalmodellen vaak omschreven als een "black box". Ontwikkelaars weten hoe ze modellen moeten trainen en gebruiken, maar begrijpen vaak niet exact waarom een AI een specifiek antwoord formuleert.

Anthropic ontwikkelde daarom nieuwe technieken om de interne processen van Claude zichtbaar te maken. Vergelijk het met een hersenscan voor AI: onderzoekers probeerden niet alleen te zien wat het model zegt, maar vooral hoe het tot die conclusie komt.

Hierdoor konden ze patronen herkennen die verborgen blijven tijdens normale interacties met een chatbot.

Claude denkt niet woord voor woord

Een van de opvallendste ontdekkingen is dat Claude niet simpelweg het volgende woord voorspelt, zoals vaak wordt aangenomen.

In plaats daarvan blijkt het model abstracte concepten te vormen. Het denkt op een hoger niveau dan losse woorden of zinnen. Wanneer iemand bijvoorbeeld vraagt naar een stad, een persoon of een wetenschappelijk concept, activeert Claude interne representaties die lijken op ideeën of betekenissen.

Dat betekent dat de AI een soort mentale kaart opbouwt van kennis en verbanden, nog voordat er een antwoord verschijnt.

Verborgen concepten duiken overal op

Tijdens het onderzoek ontdekten de wetenschappers dat bepaalde concepten verspreid aanwezig zijn in verschillende delen van het model.

Een idee zoals "veiligheid", "politiek" of "wiskunde" blijkt niet op één plaats opgeslagen te zijn. In plaats daarvan wordt het gerepresenteerd door een netwerk van samenwerkende onderdelen.

Dat lijkt opvallend veel op hoe neurowetenschappers denken dat menselijke hersenen informatie verwerken. Ook daar bevindt een herinnering of vaardigheid zich niet op één enkele locatie, maar ontstaat deze uit samenwerking tussen verschillende hersengebieden.

Meertalige kennis zonder grenzen

Nog opmerkelijker was dat Claude dezelfde concepten gebruikt in verschillende talen.

Wanneer het model bijvoorbeeld nadenkt over een onderwerp in het Engels, Frans of Chinees, blijken vergelijkbare interne representaties actief te worden. De AI vertaalt kennis dus niet letterlijk van taal naar taal, maar lijkt te werken vanuit onderliggende betekenisstructuren.

Dit verklaart waarom moderne taalmodellen vaak verrassend goed presteren in talen waarop ze relatief weinig zijn getraind.

Soms lijkt Claude te plannen

Een van de meest intrigerende bevindingen is dat Claude soms meerdere stappen vooruit lijkt te denken.

Onderzoekers zagen aanwijzingen dat het model niet altijd spontaan woord voor woord reageert. In sommige situaties lijkt het eerst een intern plan te maken en daarna pas het antwoord uit te werken.

Dat doet denken aan hoe mensen eerst nadenken over een strategie voordat ze beginnen te spreken of schrijven.

Hoewel dit nog geen bewijs is van bewustzijn of menselijke intelligentie, toont het wel aan dat moderne AI-systemen geavanceerdere processen gebruiken dan jarenlang werd aangenomen.

De vreemde wereld van verborgen redeneringen

Tijdens de analyse ontdekten onderzoekers ook onverwachte en soms bizarre interne patronen.

Claude bleek regelmatig tussenliggende redeneringen te gebruiken die niet zichtbaar zijn voor gebruikers. Sommige antwoorden ontstaan via routes die zelfs voor de onderzoekers moeilijk te interpreteren zijn.

Dit onderstreept een belangrijk probleem: AI-systemen kunnen correct functioneren zonder dat mensen volledig begrijpen waarom ze bepaalde keuzes maken.

Voor toepassingen in gezondheidszorg, rechtspraak, financiën en overheid wordt die ondoorzichtigheid steeds meer een uitdaging.

Waarom deze ontdekking belangrijk is

Het onderzoek markeert een belangrijke stap in het vakgebied van AI-interpretatie. Naarmate kunstmatige intelligentie steeds meer beslissingen ondersteunt, groeit ook de behoefte om te begrijpen hoe die beslissingen tot stand komen.

Door letterlijk in het "denken" van een AI te kijken, hopen onderzoekers toekomstige modellen veiliger, betrouwbaarder en beter controleerbaar te maken.

Het uiteindelijke doel is niet alleen krachtigere AI, maar vooral AI die mensen kunnen begrijpen en vertrouwen.


Van zwarte doos naar glazen machine

De bevindingen van Anthropic suggereren dat kunstmatige intelligentie veel rijkere interne denkstructuren ontwikkelt dan eerder werd vermoed. Claude blijkt geen eenvoudige tekstgenerator, maar een systeem dat abstracte concepten, verbanden en zelfs voorlopige plannen kan vormen.

Toch roept dat minstens evenveel vragen op als het beantwoordt.

Hoe meer onderzoekers in het hoofd van AI kijken, hoe duidelijker het wordt dat deze digitale denkers nog vol verrassingen zitten. De zwarte doos wordt langzaam transparanter, maar wat zichtbaar wordt, blijkt vaak nog mysterieuzer dan verwacht.

Aanbevolen voor jou

In de kijker

AI kan vanaf nu de muis overnemen op je scherm

AI kan vanaf nu de muis overnemen op je scherm

Meta zet de volgende stap in AI met AI-gegenereerde posts

Meta zet de volgende stap in AI met AI-gegenereerde posts

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Updates

Inschrijven Nieuwsbrief

Zo word je altijd als eerste op de hoogte gebracht van ons laatste nieuws, updates, jobs, tips & promoties. Stay UP-TO-DATE!

WEBSITE LATEN MAKEN?​​​​​​​​​​​​​​

Kies voor een UP-TO-DATE AI Website 100% in Google

Een UP-TO-DATE AI Website maakt het gemakkelijk om automatisch up-to-date te blijven met je klanten en overal aanwezig te zijn.

Maak een afspraak