5 Minuten
Spraak-AI heeft de neiging op papier indrukwekkend te klinken en in de praktijk eigenaardig levenloos. Xiaomi denkt dat het daar een oplossing voor heeft. Het bedrijf heeft OmniVoice vrijgegeven als open source, een nieuw tekst-naar-spraakmodel dat is ontwikkeld voor stemkloning, meertalige spraaksynthese en gedetailleerde controle over hoe een synthetische stem daadwerkelijk klinkt.
Wat de release bijzonder maakt is niet alleen de gebruikelijke belofte van schonere spraak of snellere output. Xiaomi presenteert OmniVoice als een model dat in honderden talen kan werken, inclusief talen met weinig bronnen die vaak genegeerd worden door gangbare spraaksystemen. Als die bewering ook buiten labdemo's standhoudt, kan het veel verder reiken dan vlaggenschiptelefoons en slimme assistenten.
De aankondiging verscheen via Xiaomis officiële WeChat-kanaal, waar het bedrijf zei dat OmniVoice sterk presteert in zowel Chinees als Engels en in sommige meertalige taken commerciële alternatieven kan evenaren of zelfs overtreffen. Dat is een gedurfde bewering. Maar de details suggereren dat Xiaomi mikte op een echt knelpunt in spraaktechnologie: de meeste tekst-naar-spraaksystemen presteren nog steeds het beste in een handvol grote talen, terwijl alles daarbuiten een verwaterde ervaring krijgt.
Waar OmniVoice het gesprek kan veranderen
Xiaomi zegt dat OmniVoice is ontworpen met meertalige spraaksynthese als kern. Het bedrijf omschrijft het als een stemklonings-TTS-model dat honderden talen ondersteunt, inclusief talen met zeer beperkt trainingmateriaal online. In praktische termen betekent dat dat het systeem bedoeld is om begrijpelijke, natuurlijk klinkende spraak te produceren, zelfs wanneer data schaars is, een uitdaging die lange tijd de ontwikkeling van spraak-AI voor regionale en nichetalen heeft vertraagd.
Volgens Xiaomi overtrof het model verschillende commerciële systemen in tests over 24 talen, met name op spraakgelijkheid en verstaanbaarheid, ondanks dat het alleen op open source-datasets is getraind. In een bredere evaluatie over 102 talen zegt het bedrijf dat OmniVoice dicht bij menselijk niveau van verstaanbaarheid kwam en in sommige gevallen dat niveau zelfs overtrof. Zulke beweringen verdienen natuurlijk onafhankelijke verificatie, maar ze geven aan hoe agressief Xiaomi het model in de wereldwijde AI-race wil positioneren.
Een van de interessantste onderdelen van de aankondiging is de nadruk op trainen met weinig data. Xiaomi zegt dat zelfs talen met minder dan 10 uur beschikbaar materiaal nog hoge kwaliteit spraaksynthese kunnen bereiken. Voor gemeenschappen en ontwikkelaars die met ondervertegenwoordigde talen werken, kan dat de echte kop zijn. Een model dat de databariere verlaagt verandert wie spraaktools kan bouwen.
Onder de motorkap kiest OmniVoice een andere route dan veel van de huidige complexere TTS-pijplijnen. In plaats van meerdere modules en voorspellingsstappen te stapelen, zegt Xiaomi dat het een enkel bidirectioneel Transformer-netwerk gebruikt om tekst direct in spraak om te zetten. Eenvoudigere architectuur. Minder bewegende delen. Mogelijk minder knelpunten.
Die opzet hangt ook samen met snelheid. Xiaomi beweert dat OmniVoice op 100.000 uur aan data in één dag getraind kan worden, en dat het tijdens inferentie tot 40 keer realtime snelheid kan draaien in PyTorch. Voor ontwikkelaars is dat van belang. Snelle inferentie is vaak het verschil tussen een flitsende demo en iets dat daadwerkelijk in consumentproducten, klantenservicesystemen, toegankelijkheidstools of contentplatforms kan worden ingebouwd.
Het bedrijf wijst op twee technische keuzes achter die winst. De eerste is wat zij een volledige codeboek random masking-strategie noemen, die naar verluidt zowel de efficiëntie als de algehele modelprestaties tijdens training verbetert. De tweede is het gebruik van een groot taalmodel in pretraining, een stap waarvan Xiaomi zegt dat het helpt de uitspraak en verstaanbaarheid te verbeteren in een niet-autoregressief TTS-framework. Simpel gezegd probeert het model niet alleen vloeiend te klinken. Het probeert taalstructuur goed genoeg te begrijpen om moeilijke woorden natuurlijker uit te spreken.
Dat wordt vooral relevant in de echte wereld, waar spraaksynthese vaak hapert bij namen, accenten, geleende woorden of gemengde taaltekst. Xiaomi zegt dat OmniVoice gebruikers hier ook meer controle geeft. Moeilijke uitspraken, inclusief Chinese polyfone karakters en Engelse eigennamen, kunnen handmatig worden gecorrigeerd om de betrouwbaarheid te verbeteren.
De consumentenfeatures zijn waar OmniVoice minder als een onderzoeksrapport en meer als een platform begint te voelen. Gebruikers kunnen aangepaste stemmen genereren door eigenschappen te beschrijven zoals leeftijd, geslacht, toonhoogte, accent, dialect en spreekstijl. Het kan ook fluisterende stemmen en andere gespecialiseerde vocale stijlen produceren zonder dat er een referentie-audioclip nodig is, wat een duidelijke sprong in flexibiliteit betekent.
Xiaomi zegt ook dat het model ruisige referentie-audio kan opschonen voordat een stem gekloond wordt, waardoor duidelijkere sprekerkenmerken uit opnames in imperfecte omgevingen kunnen worden gehaald. Dat klinkt misschien als een klein detail, maar iedereen die met echte audio heeft gewerkt weet hoe rommelig bronmateriaal meestal is. Een kloningsysteem dat achtergrondlawaai overleeft is veel nuttiger dan een systeem dat alleen in studiocondities werkt.
Dan is er nog expressiviteit. OmniVoice ondersteunt intonatiecontroles, inclusief effecten zoals lachen en zuchten, die synthetische spraak minder robotachtig en meer conversatiegericht kunnen doen aanvoelen. Dat is de richting waarin de markt beweegt. De volgende generatie spraak-AI gaat niet alleen om het nauwkeurig voorlezen van tekst. Het gaat om performance, persoonlijkheid en emotionele nuance.
Xiaomi is niet het eerste bedrijf dat dat nastreeft en het zal ook niet het laatste zijn. Maar door OmniVoice open source te maken, zet het een strategische stap in de veronderstelling dat bredere ontwikkelaars-toegang kan helpen om de spraaktechnologie in meer producten, meer markten en meer talen te krijgen. Als het model zelfs maar een deel van wat Xiaomi belooft waarmaakt, kan OmniVoice een van de meest intrigerende open source spraak-AI-releases van het jaar worden.
.webp)





Laat een reactie achter
Reacties (2)
Wow, als dat echt werkt zou het huge zijn, maar TTS voelt vaak nog kil en onnatuurlijk in practice... benieuwd naar demo's
Klinkt te mooi om waar te zijn... wie verifieert die 102 talen écht? En wat met privacy van gekloonde stemmen, data bronnen? tbh, sceptisch.