Google toont een toekomst waarin video net zo bewerkbaar wordt als tekst
Tijdens en na zijn jaarlijkse ontwikkelaarsconferentie I/O 2026 heeft Google een reeks indrukwekkende demonstraties vrijgegeven rond twee nieuwe AI-systemen: Gemini Omni en Gemini 3.5. Waar eerdere generatieve AI-modellen vooral tekst, afbeeldingen of korte videoclips konden produceren, presenteert Google nu een platform dat verschillende media tegelijk begrijpt én omzet naar nieuwe content.
Volgens Google vormt Gemini Omni een nieuwe generatie “any-to-any”-AI. Dat betekent dat gebruikers tekst, foto's, videofragmenten en audio kunnen combineren om volledig nieuwe video's te creëren. Bovendien kunnen die video's achteraf verder worden aangepast via een gewone conversatie, zonder complexe montageprogramma's.
|
9 demos of Gemini Omni and Gemini 3.5 in actionWatch 9 videos showing the capabilities of Gemini Omni and Gemini 3.5, announced at Google I/O 2026. |
Van schets naar filmische scène
Een van de opvallendste demonstraties toont hoe Gemini Omni een eenvoudige tekening, referentiefoto of videofragment omzet naar een bewegende scène met realistische details. De AI begrijpt niet alleen wat er zichtbaar is, maar gebruikt ook zijn kennis van de fysieke wereld om bewegingen, perspectieven en interacties geloofwaardig te maken.
Waar veel huidige videomodellen bij elke aanpassing een volledig nieuwe video genereren, probeert Gemini Omni consistentie te bewaren. Gebruikers kunnen bijvoorbeeld vragen om enkel een achtergrond te veranderen, een personage te vervangen of een andere camerahoek te gebruiken, terwijl de rest van de scène intact blijft.
Gemini 3.5 wordt het brein achter complexe AI-agenten
Naast Omni introduceerde Google ook Gemini 3.5, een nieuwe modellenfamilie die speciaal ontworpen werd voor complexe, langdurige taken. De eerste versie, Gemini 3.5 Flash, richt zich op snelheid, redeneringsvermogen en geavanceerde AI-agenten die zelfstandig meerdere stappen kunnen uitvoeren.
Google positioneert Gemini 3.5 als een model dat niet alleen vragen beantwoordt, maar ook zelfstandig workflows kan uitvoeren, code kan schrijven en complexe opdrachten kan afwerken zonder voortdurende menselijke tussenkomst. Daarmee wordt het een belangrijke bouwsteen voor de bredere “agentic AI”-strategie die Google momenteel uitrolt.
Negen demo’s tonen hoe AI media begrijpt
In de nieuwe verzameling van negen demonstratievideo’s laat Google zien hoe beide systemen samenwerken. De voorbeelden variëren van videobewerking en multimodale creatie tot geavanceerd begrip van beeld, geluid en context. De AI kan verwijzingen tussen verschillende media herkennen en deze combineren tot één samenhangend eindresultaat.
Daarmee verschuift AI volgens Google van een hulpmiddel dat afzonderlijke taken uitvoert naar een creatieve partner die volledige producties kan ondersteunen.
Concurrentie voor Sora en andere videomodellen
Met Gemini Omni begeeft Google zich rechtstreeks op het terrein van videomodellen zoals OpenAI Sora. Het verschil zit vooral in de multimodale aanpak. In plaats van enkel een tekstprompt te gebruiken, kunnen gebruikers verschillende soorten input combineren en tijdens het proces blijven bijsturen.
Analisten zien vooral potentieel voor contentcreators, marketingteams, onderwijsinstellingen en bedrijven die sneller audiovisuele content willen produceren zonder uitgebreide videoproductieprocessen. Tegelijk blijft er discussie bestaan over controle, betrouwbaarheid en transparantie van AI-gegenereerde media. Google benadrukt daarom het gebruik van technologieën zoals SynthID om AI-content herkenbaar te houden.
De grens tussen denken en creëren vervaagt
Met Gemini Omni en Gemini 3.5 probeert Google twee werelden samen te brengen die jarenlang gescheiden waren: geavanceerd redeneren en creatieve productie. Waar Gemini 3.5 zich richt op intelligent handelen en probleemoplossing, vormt Omni de creatieve laag die ideeën omzet naar beeld, geluid en video.
De demonstraties maken duidelijk dat Google niet langer enkel inzet op een slimme chatbot, maar op een volledig multimodaal AI-ecosysteem waarin begrijpen, redeneren en creëren steeds meer samensmelten.









