Voor een digitale versie van zichzelf waren tot voor kort een camera, een degelijke opnameomgeving en behoorlijk wat voorbereiding nodig. Synthesia probeert dat proces nu drastisch te verkorten. Met één goede foto kan de gebruiker een persoonlijke AI-avatar creëren die vervolgens in uiteenlopende video's kan verschijnen.
Het opvallende is dat die digitale dubbelganger niet vastzit aan de oorspronkelijke foto. Kleding, achtergrond en zelfs bepaalde acties kunnen worden aangepast. Zo evolueert een eenvoudig portret tot een herbruikbare virtuele presentator.
Van foto naar digitale dubbelganger
Het vertrekpunt is bijzonder eenvoudig. De gebruiker uploadt een duidelijke, goed belichte foto waarop één persoon zichtbaar is. Een opname vanaf ongeveer het middel werkt volgens Synthesia bijzonder goed. De kwaliteit van het bronbeeld blijft belangrijk: hoe beter de foto, hoe overtuigender de uiteindelijke avatar doorgaans oogt.
Daarna bouwt Synthesia met zijn Express-2-technologie een persoonlijke avatar op basis van dat beeld. In tegenstelling tot de oudere methode hoeft daarvoor geen uitgebreide video-opname te worden gemaakt. Na het doorlopen van de vereiste stappen kan de avatar doorgaans binnen enkele minuten beschikbaar zijn.
De technologie gaat bovendien verder dan een mond die simpelweg met tekst meebeweegt. Omdat een foto uiteraard niet vertelt hoe iemand in werkelijkheid beweegt, genereert het systeem zelf lichaamstaal en bewegingen die bij de gesproken boodschap moeten passen.
Ook de stem kan worden gekloond
Wie de illusie van een digitale dubbelganger verder wil doortrekken, kan tijdens het aanmaken optioneel een stemvoorbeeld opnemen. Synthesia gebruikt dat om een persoonlijke AI-stem te creëren. Wie dat liever niet doet, kan een van de beschikbare stemmen van het platform gebruiken.
Daarmee ontstaat een interessant nieuw productiemodel. Iemand hoeft niet telkens opnieuw voor een camera plaats te nemen om een nieuwe presentatie, opleiding of bedrijfsboodschap op te nemen. Een nieuw script kan voldoende zijn om de digitale versie opnieuw aan het woord te laten.
Vandaag in een pak, morgen in werkkleding
Misschien nog interessanter is dat het uiterlijk van de avatar niet beperkt blijft tot de kleding op de originele foto.
De gebruiker kan nieuwe outfits laten genereren en de avatar bijvoorbeeld in formele bedrijfskleding, een casual outfit of contextgebonden werkkleding plaatsen. Ook de omgeving kan worden veranderd. Dezelfde digitale persoon kan daardoor in de ene video in een kantoor verschijnen en in een volgende productie in een compleet andere setting terechtkomen.
Synthesia laat bovendien de houding en plaatsing aanpassen. Een avatar kan bijvoorbeeld zittend of staand worden weergegeven en links, centraal of rechts in een scène worden geplaatst. Voor bedrijven kunnen bij bepaalde abonnementen ook merkelementen zoals kleuren en logo's in kleding en omgevingen worden verwerkt.
Dat maakt van de avatar minder een eenmalig AI-effect en meer een digitale acteur die telkens opnieuw kan worden aangekleed en geregisseerd.
De avatar krijgt ook iets te doen
De volgende stap is beweging. Persoonlijke avatars op basis van een foto ondersteunen ook action-based B-roll. Daardoor kan de digitale persoon niet alleen een tekst presenteren, maar ook in gegenereerde scènes en acties worden verwerkt.
Daarmee schuift AI-video steeds verder weg van het klassieke beeld van een statisch digitaal hoofd voor een neutrale achtergrond. De presentator wordt onderdeel van de scène.
Voor contentmakers en bedrijven opent dat heel wat mogelijkheden. Eén digitale vertegenwoordiger kan bijvoorbeeld worden ingezet voor productuitleg, opleidingen, interne communicatie, marketingvideo's en sociale media, zonder voor iedere variant een nieuwe opnamedag te organiseren. Synthesia positioneert persoonlijke avatars expliciet voor dergelijke toepassingen.
Een document kan het begin van een video worden
Het productieproces hoeft evenmin met een volledig uitgeschreven videoscript te beginnen. Synthesia kan bestaande tekst, links en documenten zoals PowerPoint- of PDF-bestanden omzetten in een eerste videoversie. Vervolgens kunnen een avatar, stem en aanvullende beelden worden toegevoegd.
Dat maakt de technologie vooral interessant voor organisaties die al over grote hoeveelheden geschreven materiaal beschikken. Een handleiding, trainingsdocument of presentatie kan zo het vertrekpunt worden voor videocontent, met dezelfde digitale presentator voor verschillende producties.
De stap van document naar video wordt daardoor steeds kleiner.
Eén foto betekent niet dat toestemming verdwijnt
De eenvoud van het systeem roept vanzelfsprekend ook vragen op over misbruik. Als één foto voldoende is om een overtuigende digitale persoon te maken, zou de technologie in verkeerde handen gemakkelijk problematisch kunnen worden.
Synthesia koppelt het aanmaken van een persoonlijke foto-avatar daarom aan een live opgenomen toestemmingsvideo. De persoon in die opname moet overeenkomen met degene op de geüploade foto. Het platform staat niet toe dat zomaar avatars van publieke figuren of andere personen zonder de vereiste toestemming worden gemaakt.
Die controle is geen detail. Naarmate digitale dubbelgangers realistischer en eenvoudiger te produceren worden, zal aantoonbare toestemming waarschijnlijk een steeds belangrijker onderdeel van dergelijke systemen worden.
De camera verdwijnt niet, maar wordt minder noodzakelijk
De echte verandering zit uiteindelijk niet alleen in de kwaliteit van de avatar. Ze zit vooral in de manier waarop video kan worden geproduceerd.
Een traditionele video vraagt telkens opnieuw voorbereiding: locatie zoeken, camera en belichting opstellen, kleding kiezen, tekst inspreken en eventueel meerdere takes opnemen. Met een persoonlijke AI-avatar verschuift een groot gedeelte van dat werk naar software.
Eén goede foto kan het begin worden van tientallen verschillende presentaties. De kleding kan veranderen, de achtergrond kan veranderen, het script kan worden vervangen en zelfs de taal kan wisselen, terwijl dezelfde herkenbare digitale presentator behouden blijft.
De camera wordt daarmee niet overbodig. Voor authentieke interviews, reportages en persoonlijke communicatie blijft echte aanwezigheid moeilijk te vervangen. Maar voor repetitieve video's, opleidingen, productuitleg en schaalbare bedrijfscommunicatie ontstaat een heel ander productiemodel.
De vraag wordt daardoor steeds minder: wanneer kan iedereen opnieuw voor de camera staan? De interessantere vraag wordt: wanneer is dat eigenlijk nog nodig?









