Buildrya
Tagasi AI-RADARisse
Gemini 3.5 Transcribe vajab eestikeelse tehnilise kõne päristesti
Tööriistad7 min lugemistKristjan Krimm

Gemini 3.5 Transcribe vajab eestikeelse tehnilise kõne päristesti

Google avas Gemini 3.5 Transcribe'i arendajatele ning lubab 85+ keelt, kohandatud sõnavara ja reaalajavoogu. Eesti kasutuse väärtus sõltub nimede, numbrite, eituste ja paranduste säilimisest.

FacebookXLinkedIn

Lühidalt

  • Google avaldas 26. augustil Gemini 3.5 Transcribe'i salvestatud heli ja reaalajavoo tekstiks teisendamiseks ning avas mudeli arendajatele avaliku eelvaatena.
  • Google'i dokumentatsiooni järgi tuvastab mudel automaatselt enam kui 85 keelt, toetab kuni 1000 kohandatud terminit ning eristab salvestises kuni kaheksat kõnelejat, kuigi kolme või enama kõneleja tugi on eksperimentaalne.
  • Gemini API hinnakirja järgi on salvestatud heli arvestuslik koguhind umbes 0,005 dollarit minutis ja reaalajavoo hind umbes 0,009 dollarit minutis.
  • Google ei ole avaldanud eraldi eestikeelse erialakõne tulemust ning loetavaks toimetav smart-režiim ei sobi olukorda, kus iga öeldud sõna, eitus ja parandus peab säilima.

Google avaldas 26. augustil Gemini 3.5 Transcribe'i, kõne tekstiks teisendamise mudeli, millel on eraldi teenused salvestatud heli ja reaalajavoo jaoks. Arendajad saavad mudelit kasutada Gemini API-s Google AI Studio kaudu ning Google nimetab väljalaset avalikuks eelvaateks ka ettevõtete Gemini Enterprise Agent Platformis.

Mudel ühendab tavapärase kõnetuvastuse funktsioonid generatiivse tekstitöötlusega. See võib väljastada sõnasõnalise transkriptsiooni või eemaldada täitesõnad, lahendada kõneleja eneseparandusi ja vormistada jutu loetavaks tekstiks. Salvestatud heli puhul saab lisada sõnataseme ajatemplid ning kõnelejate eristamise; reaalajavoog töötab WebSocketi kaudu, kuid ei toeta neid kahte funktsiooni.

Google ütleb, et mudel tuvastab automaatselt enam kui 85 keelt ja tuleb toime keele vahetamisega sama vestluse sees. Sellest ei saa siiski järeldada eestikeelse koosoleku, tehniku häälmärkme või meditsiinilise diktaadi töökindlust. Keele olemasolu toeloendis ja erialase kasutuse veamäär on kaks eri asja.

Sõnasõnaline ja loetav transkriptsioon on eri tooted

Gemini 3.5 Transcribe'i vaikerežiim verbatim säilitab Google'i dokumentatsiooni järgi täitesõnad, kordused ja pooleli jäänud algused. See on sobivam alus intervjuule, auditile, kohtumaterjalile või juhtumilogile, kus algse ütluse täpne kuju võib olla oluline.

Smart-režiim teeb sisuliselt toimetamist. See eemaldab „ee“ ja „mm“ tüüpi täitesõnu, parandab kirjavahemärke, vormistab loendeid ning tõlgendab kõnesiseseid parandusi. Näiteks lause „kohtume teisipäeval — ei, kolmapäeval“ peaks väljundisse jätma ainult kolmapäeva. Mugava dikteerimise jaoks on see kasulik, kuid tõendusliku transkripti jaoks muudab mudel allikat.

Režiimide vahe peab olema kasutajaliideses nähtav ja salvestatud koos tulemusega. Kui koosolekumärkmed genereeritakse smart-režiimis, ei tohiks neid hiljem esitada sõnasõnalise protokollina. Risk ei ole ainult sõnastuse silumises: vale eneseparanduse tõlgendus võib muuta kuupäeva, kogust, seadmetähist või eitust.

Google'i API-s ei saa smart-režiimi kombineerida kõnelejate eristamise ega sõnataseme ajatemplitega. See piirang sunnib rakenduse loojat valima: kas loetav valmis tekst või täpsem jälg selle kohta, kes mida millal ütles. Mõnes töövoos on mõistlik säilitada verbatim-väljund ja teha sellest eraldi toimetatud koopia.

Kohandatud sõnavara võib aidata erialatermineid, kuid ei taga neid

Mudelile saab anda kuni 1000 kohandatud fraasi, et kallutada tuvastust nimede, lühendite ja erialasõnade poole. Google märgib, et parimad tulemused saadakse tavaliselt kuni 100 sihitud terminiga ning soovitab võimaluse korral lisada ka teadaoleva keelekoodi.

Eesti tehnilises töös võiks sõnastik sisaldada seadmetähiseid, kliendinimesid, tänavaid, ravimite nimetusi, failinimesid või valdkonna akronüüme. Test peab siiski kontrollima rohkemat kui seda, kas sõna ilmub vähemalt korra õigesti. Oluline on käänete, liitsõnade, tähtede ja numbrite kombinatsioonide ning sarnase kõlaga terminite eristamine.

Kohandatud sõnavara on kallutus, mitte kinnine lubatud sõnade loend. Mudel võib termini ikkagi valesti kirjutada või asetada selle valesse konteksti. Kriitilises töövoos tuleb numbrid, mõõtühikud, eitused ja isikunimed eraldi valideerida, vajadusel reeglite või inimese kinnitusega.

Kõnelejate eristamine töötab ainult salvestatud heli teenuses. Dokumentatsioon lubab kuni kaheksat kõnelejat, kuid märgib kolme või enama kõneleja toe eksperimentaalseks. Koosoleku puhul peab seega mõõtma nii sõnade veamäära kui speaker error rate'i: õige lause vale inimese nime all võib olla sisuliselt sama ohtlik kui valesti kuuldud sõna.

Hinnakiri on madal, kuid minuti hind on hinnang

Gemini API hinnakirjas maksab salvestatud heli sisend kaks dollarit miljoni audio-tokeni ja tekstiväljund 12 dollarit miljoni tokeni kohta. Google teisendab selle eelduslike tokenimäärade alusel ligikaudu 0,003 dollariks sisendheli minuti ja 0,002 dollariks väljundteksti minuti kohta ehk kokku umbes 0,005 dollarit minutis.

Reaalajamudeli sisend maksab 3,50 dollarit ja väljund 21 dollarit miljoni tokeni kohta. Google'i arvestuslik koguhind on umbes 0,009 dollarit minutis. Tunnine salvestis oleks seega ligikaudu 0,30 dollarit ja tunnine reaalajavoog 0,54 dollarit, kui tegelik tokenikasutus vastab hinnakirja eeldustele.

Need ei ole fikseeritud minutihinnad. Arve tekib tokenitest ning väljundi pikkus, kõnetempo ja vormistus mõjutavad kulu. Rakenduse kogukulusse lisanduvad heli salvestamine, voogedastus, failide hoidmine, tööjärjekorrad, vigade korduskatsed, andmekaitse ja inimese parandusaeg.

Salvestatud heli mudel toetab kuni ühe tunni pikkust päringut, kuid kõnelejate eristamise või sõnataseme ajatemplitega langeb piir 30 minutile. Reaalajaseansi piir on kümme minutit. Pikemate kohtumiste rakendus peab seega heli tükeldama ning hoidma kõneleja- ja kontekstijärjepidevust üle segmentide.

Google'i kvaliteedinumbrid ei vasta veel Eesti küsimusele

Google viitab Artificial Analysise mõõtmisele, mille järgi oli keskmine sõnade veamäär reaalajavoos 4,0% ja salvestatud helis 2,6%. FLEURSi mitmekeelsel võrdlusel avaldab ettevõte vastavalt 5,50% ja 5,04% veamäära ning ütleb, et lõpliku transkriptsioonini jõudmise aeg paranes Chirp 3-ga võrreldes 70%.

Need numbrid annavad mudeli üldise positsiooni kohta signaali, kuid ei mõõda automaatselt Eesti töövoogu. Keskmine WER võib varjata keelte erinevusi ning kõik sõnavead ei ole võrdse kaaluga. „Pump töötab“ ja „pump ei tööta“ erinevad ainult ühe sõna võrra, kuid tähendus on vastupidine.

Samuti võib smart-režiim muuta WER-i tõlgendamise keeruliseks, sest eesmärk ei ole sõnasõnaline väljund. Ladusaks toimetatud tekst võib näida kvaliteetne ka siis, kui mudel on detaili ära jätnud. Seetõttu tuleb kvaliteeditest jagada vähemalt kaheks: akustiline täpsus verbatim-režiimis ning informatsiooni säilimine smart-režiimis.

Eesti test peab mõõtma parandusaega, mitte ainult veaprotsenti

Praktiline katse võiks sisaldada eri kõnelejaid, murde- ja võõrkeeleaktsente, telefoniheli, kajavat koosolekuruumi, tänavamüra ning erialatermineid. Sama helikogu tuleks töödelda verbatim- ja smart-režiimis ning vähemalt ühe olemasoleva kõnetuvastusteenusega.

Üldise WER-i kõrval tuleb eraldi hinnata nimede, arvude, kuupäevade, mõõtühikute, eituste, seadmekoodide ja eneseparanduste säilimist. Koosoleku puhul lisandub kõneleja omistamise täpsus; reaalajarakenduses osalise ja lõpliku väljundi viivitus.

Äriline mõõdik on inimese parandusaeg ühe heliminuti kohta. Veidi suurema WER-iga süsteem võib olla parem, kui vead on kiiresti märgatavad ja parandatavad; näiliselt ladus tekst võib olla kallim, kui olulised väljajätud tuleb algsalvestist kuulates üles otsida.

Eesti organisatsioonil tasub enne tundliku heli saatmist eraldi kontrollida valitud API paketi andmekasutus- ja säilitustingimusi. Google'i hinnakiri ütleb, et tasulise API sisu ei kasutata toodete parandamiseks, tasuta taseme sisu aga kasutatakse. See erinevus peab kajastuma nii tehnilises seadistuses kui kasutajatele antavas teabes.

Korduma kippuvad küsimused

Mis on Gemini 3.5 Transcribe?

See on Google'i kõne tekstiks teisendamise mudel, millel on eraldi teenus salvestatud helile ja madala latentsusega reaalajavoole. Mudel toetab automaatset keeletuvastust, kohandatud sõnavara ja loetavaks toimetavat smart-režiimi.

Kas mudel toetab eesti keelt?

Google ütleb, et mudel tuvastab automaatselt üle 85 keele, kuid ei avalda teadaandes eraldi eestikeelset veamäära. Keele üldine tugi ei tõesta eestikeelse erialakõne, nimede ega numbrite töökindlust.

Mis vahe on verbatim- ja smart-režiimil?

Verbatim säilitab täitesõnad, kordused ja pooleli jäänud algused, smart aga eemaldab neid ning tõlgendab parandusi loetavaks tekstiks. Tõendusliku või auditeeritava transkriptsiooni puhul tuleks säilitada verbatim-versioon.

Kas mudel eristab kõnelejaid?

Jah, salvestatud heli teenus toetab kuni kaheksa kõneleja eristamist, kuid kolme või enama kõneleja tugi on eksperimentaalne. Reaalajavoos kõnelejate eristamist praegu ei toetata.

Kui palju transkribeerimine maksab?

Google'i arvestuslik koguhind on salvestatud helile umbes 0,005 dollarit minutis ja reaalajavoole umbes 0,009 dollarit minutis. Tegelik arve põhineb audio- ja teksttokenitel ning võib väljundi pikkuse järgi erineda.

Kui pikka heli saab ühe päringuga töödelda?

Salvestatud heli ülempiir on kuni üks tund, kuid kõnelejate eristamise või sõnataseme ajatemplitega kuni 30 minutit. Reaalajaseanss kestab kuni kümme minutit, seega pikem töövoog vajab tükeldamist.

Kuidas hinnata mudeli sobivust Eesti ettevõttes?

Testige oma päris heliga nimede, numbrite, eituste, terminite, paranduste ja kõnelejate säilimist. Mõõtke lisaks veamäärale viivitust, inimese parandusaega ning andmete säilitamise ja töötlemise nõudeid.

Allikad

  1. 01

    Google

    Google, „Intelligent transcription with Gemini 3.5 Transcribe“, 26. august 2026

    blog.google(avaneb uuel vahelehel)
  2. 02

    Google AI for Developers

    Google AI for Developers, „Audio transcription“, 26. august 2026

    ai.google.dev(avaneb uuel vahelehel)
  3. 03

    Google AI for Developers

    Google AI for Developers, „Gemini Developer API pricing“, vaadatud 27. augustil 2026

    ai.google.dev(avaneb uuel vahelehel)
  4. 04

    Ars Technica

    Ars Technica, „Google announces Gemini 3.5 Transcribe for AI-powered speech-to-text“, 26. august 2026

    arstechnica.com(avaneb uuel vahelehel)
MärksõnadGoogleGemini 3.5 Transcribekõnetuvastustranskriptsiooneesti keelGemini APIdiktofonligipääsetavus

Jaga artiklit

Saada see lugu kolleegile või salvesta hilisemaks.

AI-RADARi uudiskiri

Saa järgmine AI-RADAR postkasti

Kui järgmine praktiline AI-signaal või tööriistamuutus avaldatakse, saad selle otse e-postile.

Arutelu

0 kommentaari

0/1500

Laen kommentaare...