Vergeet de traditionele chatbot die pas reageert nadat je op 'verzenden' hebt gedrukt. Google introduceert met de Gemini Live API en het Agent Development Kit (ADK) een visie op AI die niet alleen luistert, maar simultaan meekijkt, nadenkt en actie onderneemt in je browser. Welkom in het tijdperk van de 'omni-app'.
Van statische chats naar een levendige interactie
Wie vandaag de dag met kunstmatige intelligentie werkt, kent het klassieke 'ping-pong-model': jij typt een vraag, de AI verwerkt deze, en geeft seconden later een tekstueel antwoord terug. Praktisch, maar verre van natuurlijk.
In een recente video van Google Cloud Tech legt ontwikkelaar Annie Wang uit waarom we aan de vooravond staan van een fundamentele verschuiving. De nieuwste generatie AI-agents werkt niet meer in gescheiden beurten, maar in één continue, bidirectionele 'live loop'. Terwijl jij spreekt, luistert de agent, kijkt hij mee naar je scherm en kan hij – indien nodig – direct ingrijpen in een echte webbrowser.
Wang noemt dit concept een omni-app: een systeem dat voortdurend waarneemt (perceive), redeneert (reason) en zich uitdrukt (express). Het cruciale verschil? De agent kan worden onderbroken net zoals in een echt menselijk gesprek, waardoor de interactie vloeiend en intuïtief aanvoelt.
De anatomie van een omni-app: de 6 bouwstenen
Om ontwikkelaars te gidsen bij het bouwen van deze geavanceerde agents, trapt Google Cloud een zesdelige onderwijsserie af. Elk deel belicht een essentieel onderdeel van de nieuwe architectuur:
1. Stem & onderbreking (Voice)
Klassieke text-to-speech-systemen zetten tekst pas om in geluid nadat de generatie is afgerond. Een echte live-sessie verwerkt audio streaming. Dit maakt het mogelijk om de AI midden in een zin te onderbreken, wat de hele gebruikersinterface transformaart van een stijve spraakassistent naar een natuurlijke gesprekspartner.
2. Het framework (GenAI SDK vs. ADK)
Wie beheert de interactieloop? Terwijl de standaard GenAI SDK directe toegang geeft tot de modellen, biedt Google's Agent Development Kit (ADK) een robuust raamwerk waarin de agent autonoom de regie behoudt over gesprekken en acties.
3. Gereedschappen & vertraging (Tools & Latency)
Een AI die kan praten is leuk, maar een AI die taken uitvoert heeft functies nodig (function calling). Wanneer een agent tijdens een live gesprek externe hulpprogramma's aanroept, ontstaat er vertraging. Het minimalistisch en razendsnel houden van deze interacties is een van de grootste technische uitdagingen.
4. Handen geven aan de AI (Browser Automation)
Wat als je AI-agent niet alleen informatie zoekt, maar zelf doorklikt? Door spraakgestuurde browserautomatisering krijgt de agent als het ware 'handen' om formulieren in te vullen, websites te navigeren en complexe online taken live uit te voeren.
5. Het geheugen (Facts & Vector Memory)
Een mens herinnert zich feiten én context. Omni-apps combineren gestructureerde feitelijke data met vectorgeheugen om midden in een levendig gesprek relevanter en sneller informatie op te halen.
6. Continu zien (Vision Stream)
In plaats van af en toe een statische screenshot te analyseren, verwerkt de agent een continuous frame stream van videobeelden. Zo ziet de AI direct wat de gebruiker op zijn scherm doet, zonder dat dit de live ervaring vertraagt.
Wat betekent dit voor de toekomst van software?
De stap van chatbots naar omni-apps markeert het einde van software waarin mensen handmatig door menu's en knoppen moeten navigeren. Met technologieën zoals de Gemini Live API en het Agent Development Kit bouwen ontwikkelaars aan assistenten die werkelijk begrijpen, zien en handelen.









