3 Minuten
Stel je voor dat je op een druk treinstation staat, koptelefoon in, en luistert terwijl de woorden van een onbekende bijna nog voor hij zijn zin heeft afgemaakt naar jouw taal worden omgezet. Dat is de belofte die Google waarmaakt met Gemini 3.5 Live Vertalen, een model dat live gesproken vertaling minder mechanisch en meer als een meertalige vriend die in realtime tolkt moet laten aanvoelen.
Gemini 3.5 Live Vertalen kan spraak herkennen en weergeven in meer dan 70 talen, waarbij het ritme, de toonhoogte en het tempo van de spreker behouden blijven zodat vertalingen natuurlijk klinken in plaats van robotachtig. De truc is geen magische druk op knoppen; het is een streaming-aanpak die audio verwerkt terwijl er wordt gesproken, waardoor de ongemakkelijke pauzes van oudere systemen die eerst lieten uitspreken en daarna reageerden, worden verkort.
De latentie is laag. Heel laag. Volgens Google volgen de vertalingen de oorspronkelijke stem met slechts een paar seconden vertraging, wat een vloeiender gesprek oplevert. Het kan ook gemengde taalinput aan zonder handmatige instellingen; je kunt meertalige deelnemers hebben en het model regelt het verloop. Geen menu's tijdens een gesprek die je moet bedienen. Geen gehannes om modi te wisselen. Dat is het doel.
De beschikbaarheid begint in de Google Vertalen-app op Android en iOS. Om het te gebruiken, sluit je koptelefoon aan en tik je op de Live Vertalen-optie linksonder. Als je geen oordopjes bij de hand hebt, stuurt een nieuwe Luistermodus op Android vertalingen via de luidspreker van je telefoon: houd het toestel simpelweg tegen je oor zoals bij een normale oproep en laat de telefoon het tolken doen.

Voor vergaderingen kan dit een potentiële doorbraak betekenen. De live-ondertiteling van Google Meet was eerder beperkt tot slechts vijf talen voor vertaalde spraak. Met Gemini 3.5 breidt de ondersteuning zich uit naar meer dan 70 talen, waardoor meer dan 2.000 mogelijke taalcombinaties in één sessie mogelijk zijn, en dat biedt veel bredere dekking voor internationale teams, klaslokalen en evenementen.
Op het web introduceert Google een één-keer-aanrakingbediening om direct livevertaling te starten. Die bediening wordt deze maand experimenteel uitgerold, een stap die benadrukt dat het bedrijf realtime vertaling als een ingebouwde functie wil laten aanvoelen in plaats van als een extra.
Het model is ontworpen om robuust te zijn in lawaaierige, onvoorspelbare omgevingen. Achtergrondgepraat, straatlawaai of overlappende stemmen, Gemini 3.5 is erop ontworpen dit aan te kunnen. Ontwikkelaars kunnen verwachten dat het model in het hele Google-ecosysteem verschijnt, van Vertalen tot Meet en in API's voor apps van derden.
Alle audio die door Google's modellen wordt geproduceerd, bevat een onzichtbaar SynthID-watermerk ingebed in de uitvoer, waardoor door AI gegenereerde spraak detecteerbaar wordt en misbruik kan worden beperkt.
Er blijven vragen. Hoe zal het systeem regionale dialecten, code-switching of talen met beperkte datasets aanpakken? Hoe worden privacy en toestemming geregeld wanneer gesprekken in realtime worden getranscribeerd en vertaald? Google wijst op twee decennia aan vertaalwerk en zegt dat miljarden gebruikers al op zijn tools vertrouwen, maar het inzetten van een krachtig streamingmodel in het dagelijks gebruik brengt nieuwe beleids- en UX-uitdagingen met zich mee.
Voor wie reist, lesgeeft of wereldwijd vergadert, is de livevertaling van Gemini 3.5 een praktische sprong: minder wrijving, meer directheid en een stem die menselijk klinkt. Wanneer taal ophoudt een barrière te zijn en meer achtergrondgeluid wordt, verschuift de vraag van hoe we vertalen naar hoe we anders luisteren.
.webp)




Laat een reactie achter
Reacties
Nog geen reacties. Wees de eerste.