Niet de AI-modellen, maar de tokens bepalen de rekening

Niet de AI-modellen, maar de tokens bepalen de rekening

Steeds meer bedrijven bouwen toepassingen met kunstmatige intelligentie. Toch ontdekken veel organisaties al snel dat de grootste uitdaging niet de technologie zelf is, maar de kosten die ermee gepaard gaan. Achter vrijwel elke AI-aanroep schuilt namelijk een onzichtbare valuta: de token.

Bij moderne AI-diensten wordt niet afgerekend per vraag of per gebruiker, maar op basis van het aantal tokens dat wordt verwerkt. Elke prompt, elk antwoord en elke extra context die een AI-model ontvangt, verhoogt de uiteindelijke rekening. Daardoor wordt slim omgaan met tokens een essentieel onderdeel van succesvolle AI-ontwikkeling.

Microsoft noemt deze nieuwe discipline AI-tokenomics: het ontwerpen van AI-oplossingen die maximale waarde leveren met een zo efficiënt mogelijk gebruik van tokens.

Elke token telt

Een AI-model verwerkt tekst niet als woorden of zinnen, maar als kleine tekstfragmenten: tokens. Hoe uitgebreider een prompt of hoe langer een gesprek wordt, hoe meer tokens verwerkt moeten worden.

Vooral bij langdurige chats ontstaat een veelvoorkomend probleem. Bij iedere nieuwe vraag wordt vaak de volledige gespreksgeschiedenis opnieuw meegestuurd naar het model. Daardoor groeit de hoeveelheid context voortdurend, zelfs wanneer een groot deel ervan niet langer relevant is.

Deze zogenaamde context window creep kan de kosten ongemerkt fors laten oplopen.

Minder context betekent vaak betere prestaties

Volgens Microsoft is één van de eenvoudigste besparingen het kritisch omgaan met context.

In plaats van complete gesprekken telkens opnieuw te verzenden, kunnen ontwikkelaars eerdere interacties samenvatten of alleen de informatie meesturen die werkelijk noodzakelijk is. Hierdoor hoeft het model minder tekst te verwerken, terwijl de kwaliteit van de antwoorden vaak behouden blijft.

Kortere prompts zorgen bovendien regelmatig voor snellere reacties en een efficiëntere verwerking.

Beperk onnodig lange antwoorden

Niet alleen de invoer bepaalt de kosten. Ook de lengte van de gegenereerde antwoorden heeft directe invloed op het tokenverbruik.

Veel AI-modellen produceren standaard uitgebreide reacties, zelfs wanneer slechts een kort antwoord nodig is. Door vooraf duidelijke instructies te geven én een maximum aantal uitvoertokens in te stellen, kunnen organisaties voorkomen dat AI onnodig lange teksten genereert.

Dat levert niet alleen lagere kosten op, maar maakt de antwoorden vaak ook overzichtelijker.

Slim cachen bespaart opnieuw betalen

Veel AI-toepassingen gebruiken steeds dezelfde achtergrondinformatie, zoals bedrijfsdocumentatie, handleidingen, productinformatie of interne richtlijnen.

Wanneer deze statische informatie telkens opnieuw wordt meegestuurd, worden dezelfde tokens steeds opnieuw afgerekend.

Door gebruik te maken van caching kan deze context één keer worden verwerkt en daarna veel goedkoper worden hergebruikt. Vooral bij grote zakelijke toepassingen kan dit een aanzienlijke kostenbesparing opleveren.

Niet elke vraag heeft het krachtigste AI-model nodig

Een andere belangrijke besparing zit in de keuze van het juiste model.

Een eenvoudige samenvatting of vertaling hoeft niet noodzakelijk door het meest geavanceerde, en duurste, AI-model uitgevoerd te worden. Complexe analyses of specialistische opdrachten vragen wél om krachtigere modellen.

Door AI-verzoeken automatisch te verdelen over verschillende modellen kunnen organisaties de balans vinden tussen kwaliteit, snelheid en kosten.

Microsoft biedt hiervoor binnen Foundry een Model Router, die automatisch bepaalt welk model het meest geschikt is op basis van vooraf ingestelde voorkeuren, zoals maximale kwaliteit, optimale kosten of een evenwicht tussen beide.

Alleen de juiste hulpmiddelen inzetten

Ook AI-agenten gebruiken vaak een groot aantal externe hulpmiddelen, zoals databases, zoekmachines, API's of bedrijfsapplicaties.

Wanneer al deze tools standaard beschikbaar worden gemaakt, groeit de prompt aanzienlijk doordat elke tool moet worden beschreven. Dat verhoogt opnieuw het aantal invoertokens.

Met Toolbox kunnen AI-agenten dynamisch alleen de hulpmiddelen selecteren die daadwerkelijk nodig zijn voor een specifieke opdracht. Volgens Microsoft kan deze aanpak de hoeveelheid invoertokens met wel 90 procent verminderen.

AI optimaliseren als compleet systeem

Het optimaliseren van AI stopt niet bij prompts of modelkeuze.

Microsoft introduceert hiervoor Agent Optimizer, een hulpmiddel dat complete AI-workflows analyseert. Daarbij worden prompts, gebruikte modellen, beschikbare tools en configuraties gezamenlijk getest om efficiëntere combinaties te vinden.

In plaats van afzonderlijke onderdelen te verbeteren, wordt de volledige AI-keten geoptimaliseerd op prestaties én kosten.


Slimmer ontwerpen wordt belangrijker dan grotere modellen

De ontwikkeling van AI verschuift steeds meer van het bouwen van krachtige modellen naar het slim ontwerpen van complete AI-oplossingen.

Bedrijven die hun context beperken, antwoorden optimaliseren, caching toepassen, modellen intelligent routeren en alleen noodzakelijke hulpmiddelen inzetten, kunnen dezelfde functionaliteit leveren tegen aanzienlijk lagere operationele kosten.

Daarmee wordt AI-tokenomics niet alleen een technisch onderwerp voor ontwikkelaars, maar ook een strategisch instrument voor organisaties die AI op grote schaal willen inzetten zonder dat de kosten uit de hand lopen.

De nieuwe AI-economie draait daardoor niet langer uitsluitend om de kracht van het model, maar vooral om de efficiëntie waarmee iedere token wordt gebruikt.

Aanbevolen voor jou

In de kijker

AI kan vanaf nu de muis overnemen op je scherm

AI kan vanaf nu de muis overnemen op je scherm

Meta zet de volgende stap in AI met AI-gegenereerde posts

Meta zet de volgende stap in AI met AI-gegenereerde posts

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Salesforce presenteert Agentforce – Zoals AI voor Sales bedoeld is

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Google Earth laat gebruikers binnenkort ‘tijdreizen’ tot wel 80 jaar terug

Updates

Inschrijven Nieuwsbrief

Zo word je altijd als eerste op de hoogte gebracht van ons laatste nieuws, updates, jobs, tips & promoties. Stay UP-TO-DATE!

WEBSITE LATEN MAKEN?​​​​​​​​​​​​​​

Kies voor een UP-TO-DATE AI Website 100% in Google

Een UP-TO-DATE AI Website maakt het gemakkelijk om automatisch up-to-date te blijven met je klanten en overal aanwezig te zijn.

Maak een afspraak