OpenAI experimenteert met een nieuwe versnelling voor zijn krachtigste AI-workloads. Met Ultrafast mode krijgt GPT-5.6 Sol een nieuwe servicelaag die het model volgens het bedrijf tot veertien keer sneller laat werken dan de standaardverwerking. Daarmee verschuift de aandacht van alleen de intelligentie van AI-modellen steeds nadrukkelijker naar een andere factor: hoe snel die intelligentie beschikbaar is.
De nieuwe modus wordt aangedreven door infrastructuur van Cerebras en kan volgens OpenAI oplopen tot 750 outputtokens per seconde. Vooral bij toepassingen waarin AI verschillende stappen achter elkaar moet uitvoeren, kan zo'n snelheidswinst een aanzienlijk verschil maken.
Van minuten wachten naar werken in de flow
Bij generatieve AI wordt snelheid vaak voorgesteld als een kwestie van comfort. Een antwoord dat in één seconde verschijnt, voelt prettiger dan een antwoord waarvoor iemand tien seconden moet wachten. Bij complexere AI-systemen gaat het echter om veel meer.
Moderne AI-agenten kunnen tientallen of zelfs honderden modelaanroepen nodig hebben om één opdracht uit te voeren. Ze analyseren informatie, zoeken door systemen, schrijven code, controleren resultaten en beslissen vervolgens welke volgende stap nodig is. Iedere vertraging stapelt zich daarbij op.
Ultrafast probeert precies die wachttijd drastisch te verkleinen. OpenAI spreekt over prestaties die tot veertien keer sneller kunnen zijn dan Standard processing. Daardoor kunnen toepassingen die voorheen duidelijk asynchroon aanvoelden steeds dichter bij realtime interactie komen.
Beveiligingsonderzoek in een fractie van de tijd
Een van de opvallendste voorbeelden komt uit het technische werk binnen OpenAI zelf. Een workflow voor beveiligingsonderzoek die vroeger ongeveer één tot twee uur nodig had, kan met Ultrafast volgens het bedrijf worden teruggebracht tot ongeveer 10 à 15 minuten.
Dat verandert niet alleen de duur van de opdracht, maar ook de manier waarop medewerkers met AI kunnen samenwerken. Een onderzoek hoeft niet langer te worden gestart om veel later naar het resultaat terug te keren. De AI kan sneller hypotheses onderzoeken, systemen doorzoeken en bevindingen terugkoppelen terwijl de onderzoeker nog actief met hetzelfde probleem bezig is.
In sommige situaties begint die samenwerking daardoor volgens OpenAI zelfs realtime-achtige eigenschappen te krijgen.
AI kan meer pistes tegelijk onderzoeken
De hogere snelheid opent ook mogelijkheden voor workflows waarin meerdere onderzoekspaden parallel worden uitgevoerd. Technische medewerkers kunnen GPT-5.6 Sol bijvoorbeeld verschillende mogelijke oorzaken van een probleem laten onderzoeken en tegelijkertijd door verschillende systemen laten zoeken.
Ook bij programmeren speelt dat een rol. Wanneer een AI-assistent snel genoeg reageert, wordt hij minder een afzonderlijk hulpmiddel waarop de ontwikkelaar telkens moet wachten en meer een onderdeel van het continue ontwikkelproces.
Daarmee wordt latency een belangrijke factor in de gebruikservaring van AI. Een zeer intelligent model dat telkens lang moet nadenken kan voor sommige toepassingen minder bruikbaar zijn dan hetzelfde model dat vrijwel onmiddellijk kan reageren.
Cerebras levert de rekenkracht achter Ultrafast
Voor de nieuwe servicelaag werkt OpenAI samen met Cerebras, een bedrijf dat gespecialiseerde AI-hardware en infrastructuur ontwikkelt. Die technologie moet ervoor zorgen dat GPT-5.6 Sol aanzienlijk sneller tokens kan produceren zonder dat ontwikkelaars daarvoor naar een ander model hoeven over te stappen.
Dat onderscheid is belangrijk. Ontwikkelaars moesten snelheid traditioneel vaak afwegen tegen modelcapaciteit: een kleiner model reageerde sneller, terwijl een groter model meer redeneervermogen bood.
Ultrafast wijst op een andere richting. In plaats van alleen kleinere modellen in te zetten om latency te verminderen, wordt geprobeerd een krachtig model zelf veel sneller uit te voeren.
Snelheid wordt een nieuwe bouwsteen voor AI-agenten
Voor klassieke chatbots is een hogere tokensnelheid vooral aangenaam. Voor autonome AI-agenten kan ze veel fundamenteler zijn.
Een agent die achtereenvolgens twintig acties uitvoert en bij iedere stap enkele seconden moet wachten, voelt al snel traag aan. Wanneer die wachttijden sterk dalen, kunnen veel uitgebreidere processen binnen dezelfde tijd worden uitgevoerd.
Dat maakt nieuwe toepassingen denkbaar: beveiligingsagenten die incidenten vrijwel onmiddellijk onderzoeken, programmeeragenten die meerdere oplossingen parallel testen of operationele systemen die voortdurend informatie analyseren en meteen op afwijkingen reageren.
De stap van minuten naar seconden kan daardoor net zo belangrijk worden als een verbetering van de intelligentie van het onderliggende model.
Voorlopig slechts voor een beperkte groep
Ultrafast mode is nog geen algemeen beschikbare API-optie. OpenAI stelt de preview voorlopig beschikbaar aan een geselecteerde groep API-klanten. Naarmate er meer capaciteit beschikbaar komt, moet de toegang verder worden uitgebreid.
De preview laat ondertussen zien waar de volgende concurrentiestrijd rond generatieve AI kan plaatsvinden. De industrie draait niet langer uitsluitend om modellen die betere antwoorden produceren. Kosten, energieverbruik, contextvensters en betrouwbaarheid spelen allemaal een rol, maar ook snelheid wordt steeds belangrijker.
Met GPT-5.6 Sol in Ultrafast mode probeert OpenAI die grens verder op te schuiven. Wanneer krachtige modellen honderden tokens per seconde kunnen produceren, verandert AI langzaam van een systeem waarop mensen wachten in een systeem dat tijdens het werk voortdurend kan meedenken.









