Google Gemini Omni: praten om video's te maken, niet klikken

Gemini Omni van Google verandert videoproductie: AI zet tekst, afbeeldingen, stemmen of bestaand beeld om in video's en laat gebruikers bewerken met natuurlijke taal. Google integreert het breed in apps zoals Gemini en YouTube.

.2 reacties
Google Gemini Omni: praten om video's te maken, niet klikken

4 Minuten

Volgen op Google

Google heeft een nieuw voorstel voor de toekomst van videoproductie, en het is niet nog een tijdlijn vol lagen, keyframes en priegelige tools. Het is een gesprek. Tijdens Google I/O 2026 onthulde het bedrijf Gemini Omni, een nieuw AI-systeem dat bijna elke input in video kan veranderen, of dat nu een tekstprompt, een stilstaande afbeelding, een geluidsfragment of een bestaand videobestand is.

De eerste versie, Gemini Omni Flash, is gericht op snelle, flexibele videogeneratie. Google rolt het uit in de Gemini-app, Google Flow, YouTube Shorts en YouTube Create, met bredere toegang voor ontwikkelaars en zakelijke gebruikers later. Dat alleen al maakt de lancering opmerkelijk. Dit wordt niet gepresenteerd als een niche-experiment. Google integreert het in producten die mensen al gebruiken.

Wat Gemini Omni ambitieuzer maakt dan een standaard AI-videogenerator is de manier waarop Google wil dat mensen ermee werken. Het bedrijf positioneert de tool minder als software en meer als creatieve samenwerkingspartner. In plaats van scènes handmatig te bewerken, kunnen gebruikers om wijzigingen vragen in gewone taal en het resultaat stap voor stap blijven verfijnen. In Google's visie verdwijnt de gebruikelijke wrijving van videoproductie naar de achtergrond.

Bewerken door te praten, niet door te klikken

Hier wordt de aankondiging interessant. Google zegt dat Gemini Omni is ontworpen om continuïteit te bewaren wanneer gebruikers een project herzien via prompts in natuurlijke taal. Dat betekent dat personages visueel consistent zouden moeten blijven, scènes niet uit elkaar mogen vallen tussen bewerkingen door, en beweging geloofwaardig moet blijven in plaats van bij elke promptwijziging op vreemde of gebroken manieren opnieuw te beginnen.

Het is een bekend probleem in generatieve media. Veel AI-tools kunnen bij de eerste poging een opvallende clip produceren, maar lopen uiteen zodra een gebruiker om een tweede bewerking vraagt. Google probeert dat duidelijk op te lossen. Het bedrijf zegt dat Gemini Omni een sterker begrip heeft van hoe objecten in de echte wereld bewegen, inclusief beweging, zwaartekracht en fysieke interactie. In de praktijk kan dat betekenen dat details zoals een spiegel die bij aanraking als vloeistof rimpelt, of een sculptuur die zich gedraagt alsof het uit bellen bestaat, duidelijk blijven zonder dat de hele scène samenhang verliest.

Dat is belangrijk omdat de echte concurrentie in AI-video niet meer alleen over ruwe capaciteit gaat. Het draait om bruikbaarheid. Wie kan deze tools zo natuurlijk laten voelen dat gewone makers, marketeers, kleine bedrijven en occasionele gebruikers er daadwerkelijk op terugkomen en ze opnieuw willen gebruiken? Google's antwoord, althans voorlopig, is eenvoudig: laat mensen video regisseren op de manier waarop ze spreken.

Gemini Omni kwam niet uit het niets. Het bouwt voort op Google's eerdere werk op het gebied van AI-gegenereerde beelden, vooral de beeldverbeteringen geïntroduceerd met Nano Banana in 2025. Dat model breidde Gemini's visuele gereedschapskist uit en vond praktische toepassingen, van het herstellen van oude familiefoto's tot het omzetten van ruwe schetsen in verfijnde concepten. Gemini Omni neemt diezelfde creatieve logica en rekt die uit naar bewegende beelden.

En Google stopt niet bij video. Het bedrijf zegt dat toekomstige versies van Gemini Omni complexere projecten zullen ondersteunen die foto's, geschreven prompts, muziek en referentiemateriaal in één workflow combineren. Als die roadmap standhoudt, kan de tool evolueren van een videogenerator naar een breder AI-medialab.

Het vertrouwensprobleem verdwijnt niet

Ondanks alle creatieve belofte betreedt Google ook hetzelfde ongemakkelijke terrein waarmee elk groot AI-bedrijf wordt geconfronteerd: vertrouwen. Hoe overtuigender synthetische media worden, hoe moeilijker het is de risico's te negeren. Google zegt dat video's die met Gemini Omni zijn gegenereerd SynthID-watermerken zullen bevatten, het systeem van het bedrijf voor het labelen van AI-gegenereerde inhoud. Het bedrijf is ook van plan verificatietools uit te breiden over Gemini, Chrome en Search als onderdeel van een bredere transparantiecampagne.

Er is ook voorzichtigheid op andere vlakken. Vroege gebruikers kunnen videoavatars maken op basis van henzelf, inclusief hun eigen stem, maar meer geavanceerde stemmodificatiefuncties worden nog geëvalueerd. Die aarzeling zegt veel. De technologie beweegt misschien snel, maar de sociale en veiligheidsvraagstukken bewegen mee.

Dus ja, Gemini Omni gaat over creativiteit. Het gaat ook over controle, authenticiteit en de vraag of AI-gegenereerde video nuttig kan worden zonder verontrustend te worden. Google lijkt te begrijpen dat het bouwen van een krachtig model slechts de helft van het werk is. Mensen laten vertrouwen wat het maakt, en vertrouwen hoe het wordt gebruikt, is de moeilijkere helft.

Toch is de richting duidelijk. Google wil dat videomaken minder voelt als het bedienen van software en meer als het in real time vormgeven van een idee. Als Gemini Omni zelfs een deel van die belofte waarmaakt, verdwijnen traditionele bewerkingstools niet van de ene op de andere dag, maar ze kunnen wel minder onvermijdelijk gaan aanvoelen.

Sanne Jansen
"Als tech-blogger volg ik de Nederlandse startup-scene op de voet. Ik ben altijd op zoek naar de volgende unicorn."

Laat een reactie achter

Reacties (2)

Arjan

Klinkt tof, maar is dit echt veilig? SynthID klinkt ok maar wie checkt naleving in praktijk... en stemmen nabootsen? Hmm.

dataflux

Ok dit is wild... video maken door te praten? Als dat echt vloeiend blijft, gamechanger. Maar ook beetje eng, misbruik risico 🤯