
Společnost Google představila Gemini 3.5 Transcribe, svůj nový model umělé inteligence specializující se na převod řeči na text. Společnost jej popisuje jako svůj dosud nejpřesnější systém, určený pro inteligentní hlasové interakce. Na rozdíl od tradičních systémů tento model nejen přepisuje, co je řečeno, ale také interpretuje záměr mluvčího, opravuje chyby za chodu a vytváří čistý, formátovaný text.
Model je navržen pro použití v reálném čase i pro nahrávání a slibuje dobrý výkon v hlučném prostředí, se silným přízvukem nebo s technickým žargonem. Navíc automaticky detekuje více než 85 jazyků, rozpoznává až tři mluvčí a přidává časová razítka slovo po slově. Toho všeho je podle nezávislého testování dosaženo s pozoruhodně nízkou mírou chyb.
Inteligentní přepis: více než jen diktování
Jednou z klíčových funkcí Gemini 3.5 Transcribe je jeho schopnost rozumět autokorekcím. Pokud například mluvčí řekne: „Sejdeme se v úterý... ne, ve středu,“ model použije druhou možnost. Eliminuje také výplňová slova jako „ehm“ nebo „ehm“ a automaticky používá interpunkci a formátování. Dále umožňuje přidávat vlastní slovní zásobu pro rozpoznávání vlastních jmen, odborných termínů nebo neobvyklých slov. Podle údajů zveřejněných společností Google je míra chyb na slovo 4 % u streamovaného audia a 2,6 % u předem nahraného audia, měřeno umělou analýzou.
Další vynikající funkcí je rychlost. Ve srovnání s předchůdcem, Chirp 3, Google tvrdí, že doba potřebná k získání finálního textu je o 70 % nižší. Při živém streamování je latence kratší než jedna sekunda, což umožňuje jeho využití pro titulky v reálném čase nebo hlasové asistenty.
Integrace do ekosystému Google
Funkce Gemini 3.5 Transcribe je již integrována do několika produktů Google. V systému Android využívá funkce Rambler v Gboardu tento model pro převod hlasu na text. Je k dispozici také v aplikaci Gemini pro macOS, která uživatelům umožňuje používat hlasové příkazy s kontextem obrazovky k sumarizaci souborů, generování obrázků nebo opětovnému použití textu. Google Antigravity ji navíc integruje pro kombinování kontextu obrazovky a historie chatu.
Společnost také oznámila, že tato funkce bude brzy dostupná i v prohlížeči Chrome. To uživatelům umožní diktovat text v libovolném webovém poli, jako jsou e-maily, formuláře nebo příspěvky, bez nutnosti psaní. I když není stanoveno konkrétní datum, očekává se, že tato funkce rozšíří používání hlasové transkripce v prohlížeči.
Dostupnost pro vývojáře
Pro vývojáře je Gemini 3.5 Transcribe k dispozici ve veřejné preview verzi prostřednictvím rozhraní Gemini API, v Google AI Studiu a na platformě Gemini Enterprise Agent Platform. Nabízejí se dvě verze: Live API pro obousměrné streamování v reálném čase s latencí pod jednu sekundu a Interactions API pro zpracování předem nahraného zvuku s uvedením zdroje mluvčího a časovými razítky. První je určena pro hlasové agenty a živé titulky, zatímco druhá je užitečná pro schůzky, pohovory nebo analýzu hovorů.
Model může také delegovat složité úkoly na jiné modely Gemini, jako je generování obrázků nebo analýza souborů, prostřednictvím volání funkcí. Tato funkce je aktuálně k dispozici v aplikaci Gemini pro macOS.
Závazek společnosti Google k hlasovému ovládání jako primárnímu rozhraní je posílen verzí Gemini 3.5 Transcribe. Kombinace přesnosti, rychlosti a inteligentních funkcí z něj činí klíčový nástroj pro uživatele i vývojáře. S blížícím se příchodem do Chromu by se hlasové diktování mohlo stát běžnou součástí webu. Zatím se uvidí, jak se přizpůsobí náročnějším případům použití, ale počáteční data jsou slibná.


