Door de opkomst van geavanceerde taalmodellen verandert de manier waarop software wordt gebouwd in een razendsnel tempo. Maar wat gebeurt er precies onder de motorkap van AI-systemen zoals Google Gemini? In de videoreeks AI Builder Essentials duiken tech-experts Greg Baugues en Tilde Thurium in het fundament van kunstmatige intelligentie. Ze maken complexe concepten zoals tokens, context windows en Retrieval-Augmented Generation (RAG) inzichtelijk voor iedereen die wil bouwen met de technologie van morgen.
De wereld van softwareontwikkeling beleeft een transformatie. Waar ontwikkelaars voorheen regels code regel voor regel uitschreven, ontstaat er nu een nieuwe manier van werken — in de volksmond ook wel "vibe-coding" genoemd. Hierbij werken mens en AI nauw samen om in een hoog tempo ideeën om te zetten in werkende toepassingen. Om deze manier van bouwen echt te meesteren, is inzicht in de mechanica van Large Language Models (LLM's) echter onmisbaar.
De moleculen van taal: Wat zijn tokens?
Om te begrijpen hoe een model als Google Gemini denkt en communiceert, moet men eerst kijken naar de manier waarop informatie wordt verwerkt. Een AI-model leest geen volzinnen zoals een mens dat doet; het ontleed tekst in zogenaamde tokens.
Een token kan een heel woord zijn, maar ook een deel van een woord, een leesteken of een spatie. Baugues en Thurium leggen uit dat tokens de fundamentele rekeneenheden van een LLM vormen. Alles wat in het model gaat (de input) en alles wat eruit komt (de output) wordt omgerekend in deze digitale bouwstenen.
Het werkgeheugen van de AI: Context windows en gesprekscompressie
Als tokens de moleculen van AI zijn, dan is het context window het werkgeheugen. Dit raamwerk bepaalt hoeveel informatie het model op één specifiek moment kan "herinneren" en meenemen in zijn berekeningen.
Wanneer een gebruiker een lang gesprek voert met een AI-assistent, kan het context window snel volraken. Hier komt het concept van gesprekscompressie (conversation compression) om de hoek kijken: een techniek waarbij eerdere interacties slim worden samengevat om ruimte te besparen zonder de essentiële context te verliezen.
Daarnaast stippen de sprekers de economische kant aan van het zogenaamde "token maxxing". Omdat het verwerken van tokens rekenkracht en dus geld kost, is het balanceren van de hoeveelheid context en de kosten een cruciale vaardigheid geworden voor elke AI-architect.
Actuele kennis via RAG: Geen hallucinaties, wel real-time data
Een bekend gegeven van standaard taalmodellen is dat hun kennis stopt op het moment dat de training is afgerond. Voor toepassingen die afhankelijk zijn van actuele beurskoersen, intern bedrijfsnieuws of het weer van vandaag, is dat een probleem.
Hier biedt Retrieval-Augmented Generation (RAG) de oplossing. RAG werkt als een digitale bibliothecaris: voordat het AI-model antwoord geeft op een vraag, haalt het eerst in real-time de meest recente en relevante data op uit externe bronnen. Vervolgens gebruikt het model zijn taalkundige kwaliteiten om die verse informatie helder te formuleren. Dit verhoogt niet alleen de nauwkeurigheid, maar vermindert ook het risico op "hallucinaties" (foutieve feiten) aanzienlijk.
Klaar voor de volgende stap in AI-ontwikkeling?
Met de combinatie van tokens, ruime context windows en RAG beschikken bouwers over een krachtige gereedschapskist om slimme, contextbewuste en accurate toepassingen te creëren. Greg Baugues en Tilde Thurium laten zien dat wie deze fundamenten beheerst, niet alleen sneller bouwt, maar ook efficiëntere en betrouwbaardere software oplevert.
Bekijk en ervaar het zelf
- Ervaar de concepten in actie: Google Cloud Interactive Demo
- Bekijk meer afleveringen van AI Builder Essentials: AI Building 101 Playlist
- Abonneer op het kanaal: Google Cloud Tech op YouTube









