
Google AI-taalmodel: meer dan 300 talen beschikbaar
Het universele spraakmodel van Google (USM) heeft zijn taalondersteuning uitgebreid naar meer dan 300 talen, een indrukwekkende mijlpaal die de zoekgigant dichter bij zijn uiteindelijke doel brengt om in 1,000 talen te werken. Deze aankondiging is het resultaat van de belofte van het bedrijf om een machine learning-model te bouwen dat zoveel mogelijk talen omvat.
De USM, een standaard encoder-decoderarchitectuur, gebruikt een Conformer om het log-mel-spectrogram van spraaksignalen als invoer te nemen en een convolutionele sub-sampling uit te voeren. Het model heeft twee miljard parameters en is getraind op 12 miljoen uur spraak en 28 miljard zinnen tekst. Simpel gezegd: GoogleDe onderzoekers trainden het model vooraf op een grote, niet-gelabelde, meertalige dataset en verfijnden het vervolgens op een kleinere set gelabelde data.
Deze aanpak is effectiever dan eerdere technieken en het model wordt al door YouTube gebruikt om ondertitels te genereren voor talen met weinig middelen, zoals Amhaars, Cebuano, Assamees en Azerbeidzjaans, en andere. De USM bereikt minder dan 30% woordfoutpercentage gemiddeld in 73 talen op YouTube.
Vergeleken met Het Whisper-model van OpenAI, USM heeft een relatief lagere woordfoutratio voor ongeveer 18 talen. De computationele efficiëntie moet echter worden verbeterd om zowel de taaldekking als de kwaliteit uit te breiden om het verheven doel van het bedrijf te bereiken.
In Conclusie
De USM van Google is een indrukwekkende prestatie machine learning die de standaard zet voor natuurlijke taalverwerking. Met zijn groeiende taalondersteuning zal het model innovatie blijven stimuleren en toegankelijkheid voor onderbemande talen wereldwijd mogelijk maken.













