Nieuw AI-onderzoek laat zien hoe Claude gedachten lijkt te organiseren

Nieuw AI-onderzoek laat zien hoe Claude gedachten lijkt te organiseren

Nieuw onderzoek werpt licht op de verborgen werking van AI

Terwijl mensen slechts een klein deel van hun gedachten bewust ervaren, blijkt een vergelijkbaar mechanisme mogelijk ook aanwezig te zijn in moderne kunstmatige intelligentie. Onderzoekers van Anthropic hebben ontdekt dat hun AI-model Claude beschikt over een intern systeem waarin informatie tijdelijk wordt samengebracht voordat deze zichtbaar wordt in een antwoord. De bevinding biedt een nieuwe blik op de manier waarop geavanceerde taalmodellen informatie verwerken en kan belangrijke gevolgen hebben voor de veiligheid en transparantie van AI. 

Inspiratie uit de neurowetenschap

Voor het onderzoek lieten de wetenschappers zich inspireren door de Global Workspace Theory, een invloedrijke theorie uit de cognitieve neurowetenschap. Volgens deze theorie bereikt een gedachte pas het menselijke bewustzijn wanneer zij terechtkomt in een gedeelde 'werkruimte' die informatie verspreidt naar verschillende hersengebieden.

A global workspace in language models

Interpretability research on Claude's internal thoughts.

https://www.anthropic.com

 

Anthropic onderzocht of een vergelijkbaar principe terug te vinden is in Claude. Daarbij analyseerden de onderzoekers de interne neurale activatie van het model en ontdekten zij een verzameling representaties die functioneert als een centrale informatiehub. Deze interne ruimte lijkt verschillende onderdelen van het model met elkaar te verbinden voordat een uiteindelijke reactie wordt gevormd. 

Niet bewust, maar wel georganiseerd

De onderzoekers benadrukken dat deze ontdekking niet betekent dat Claude bewustzijn bezit. Het onderzoek laat uitsluitend zien dat bepaalde informatie tijdelijk beschikbaar wordt gemaakt voor verschillende onderdelen van het model, vergelijkbaar met de manier waarop het menselijke brein informatie organiseert.

Het grootste deel van de berekeningen verloopt nog altijd volledig buiten deze centrale werkruimte.

Alleen een relatief klein gedeelte wordt gebruikt voor bewuste planning, redenering en het formuleren van antwoorden. Daarmee ontstaat een opvallende parallel tussen biologische en kunstmatige informatieverwerking, zonder dat daar conclusies over bewustzijn aan verbonden mogen worden. 

Een venster op de 'zwarte doos' van AI

Een van de grootste uitdagingen binnen kunstmatige intelligentie is het begrijpen waarom een model tot een bepaalde conclusie komt. AI-systemen worden daarom vaak omschreven als een 'black box': ze leveren indrukwekkende resultaten, maar hun interne besluitvorming blijft grotendeels verborgen.

Door deze centrale werkruimte zichtbaar te maken, hopen onderzoekers beter te kunnen volgen hoe Claude informatie combineert, plannen opstelt en beslissingen neemt. Dat kan bijdragen aan betrouwbaardere AI-systemen waarvan het gedrag eenvoudiger te controleren en te verklaren is. 

Veiligere AI dankzij meer inzicht

De ontdekking heeft niet alleen wetenschappelijke waarde, maar kan ook een belangrijke rol spelen in AI-veiligheid. Wanneer onderzoekers beter begrijpen welke interne representaties actief zijn tijdens het redeneren, wordt het mogelijk om afwijkend of ongewenst gedrag eerder te herkennen.

Anthropic ziet deze vorm van interpretatie als een stap richting AI-systemen die niet alleen krachtiger worden, maar ook transparanter en beter controleerbaar zijn. In de toekomst zou dergelijke kennis kunnen helpen om misleiding, ongewenste strategieën of andere veiligheidsrisico's sneller op te sporen voordat een model zijn uiteindelijke antwoord produceert. 


Een nieuwe fase in AI-onderzoek

Het onderzoek markeert een nieuwe stap in het ontrafelen van de interne werking van grote taalmodellen. Waar eerdere studies vooral lieten zien hoe AI woorden voorspelt, richt dit onderzoek zich op de manier waarop informatie intern wordt georganiseerd voordat zij zichtbaar wordt voor de gebruiker.

Hoewel Claude volgens Anthropic geen bewustzijn bezit, laat het onderzoek zien dat geavanceerde AI steeds complexere vormen van interne informatieverwerking ontwikkelt. Daarmee verschuift de aandacht van uitsluitend prestaties naar een dieper begrip van de mechanismen die aan moderne AI ten grondslag liggen. 

Aanbevolen voor jou

In de kijker

AI kan vanaf nu de muis overnemen op je scherm

AI kan vanaf nu de muis overnemen op je scherm

Meta zet de volgende stap in AI met AI-gegenereerde posts

Meta zet de volgende stap in AI met AI-gegenereerde posts

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Updates

Inschrijven Nieuwsbrief

Zo word je altijd als eerste op de hoogte gebracht van ons laatste nieuws, updates, jobs, tips & promoties. Stay UP-TO-DATE!

WEBSITE LATEN MAKEN?​​​​​​​​​​​​​​

Kies voor een UP-TO-DATE AI Website 100% in Google

Een UP-TO-DATE AI Website maakt het gemakkelijk om automatisch up-to-date te blijven met je klanten en overal aanwezig te zijn.

Maak een afspraak