Tehnologie

Gemini 3.5 Transcribe de la Google ajustează vorbirea în 85 de limbi

Adrian Kessler

Gemini 3.5 Transcribe nu doar captează ceea ce spune cineva. Convertește ceea ce a spus în ceea ce a intenționat să spună. Când un vorbitor se corectează în mijlocul frazei — «Să programăm pentru marți, nu, miercuri» — modelul scoate «miercuri» și ignoră corecția. Cuvintele umplutură dispar. Zgomotul de fond nu îl oprește. Rezultatul apare ca text formatat și rafinat, nu ca captură audio brută.

Pentru oricine înregistrează interviuri, podcasturi sau conținut multilingv, această distincție reprezintă întregul flux de lucru. Fiecare instrument de transcriere de pe piață se ocupă de «ceea ce s-a spus». Editorul uman care curăța ulterior se ocupa de tot restul. Google construiește acum acel editor chiar în model.

Modelul suportă două căi API distincte. Live API gestionază fluxul bidirecțional continuu cu latență sub secundă — conceput pentru agenți vocali în timp real, roboți de asistență clienți și orice necesită transcriere instantanee. Interactions API gestionează audio înregistrat: întâlniri complete, jurnale de apeluri și interviuri, oferind atribuirea vorbitorului pentru până la trei participanți cu marcaje temporale. Ambele obțin o rată de eroare de cuvânt de 4,0% în modul streaming și 2,6% în modul non-streaming — măsurată de firma independentă de benchmarking Artificial Analysis. Anteriorul model de vorbire în text al Google, Chirp 3, necesita cu 70% mai mult timp pentru a ajunge la transcrierea finală.

Partea de consum a lansării este mai modestă. Pe Android, Gboard Rambler folosește deja Gemini 3.5 Transcribe pentru introducerea vocală în text. Aplicația Gemini pentru macOS îl suportă în limba engleză printr-o funcție Speak to Window. Chrome este listat ca fiind în curând disponibil, ceea ce ar permite utilizatorilor să dicteze în orice câmp web — răspunsuri, postări, formulare — fără a schimba aplicațiile. Nu a fost confirmată o dată specifică pentru această lansare.

Limitările modelului contează. Atribuirea mai multor vorbitori se limitează la trei participanți; panelurile și mesele rotunde cu distribuții mai mari necesită soluții alternative. Aplicația Rambler pentru consumatori este disponibilă în prezent în «anumite țări și limbi», nu în toate cele 85 pe care modelul le suportă. Google nu a anunțat prețurile pentru API, care se află în previzualizare publică prin Google AI Studio. Accesul enterprise se face prin Gemini Enterprise Agent Platform, unde prețurile se negociază separat. Pentru creatori mai mici, întrebarea costului rămâne deschisă.

Cadrul competitiv este, de asemenea, relevant. Whisper de la OpenAI, încă implicit pentru dezvoltatorii independenți, obține rate de eroare de cuvânt în intervalul 5–7% pe audio în limba engleză și necesită cod de post-procesare pentru a gestiona eliminarea cuvintelor umplutură și formatarea. Servicii precum AssemblyAI și Deepgram oferă diarizarea vorbitorilor, dar nu și corecția încorporată în limbaj natural pe care Gemini 3.5 Transcribe o aplică implicit. Diferența este măsurabilă, dar modul în care se menține în partea mai dificilă a intervalului de 85 de limbi — accente regionale, limbi cu resurse reduse, medii zgomotoase — va necesita teste independente pentru a fi stabilit.

Funcția care semnalează cel mai mult despre direcția pe termen lung a Google este integrarea Chrome. Odată ce introducerea vocală funcționează în orice câmp web, modelul nu mai este un instrument pentru dezvoltatori — este infrastructură pentru modul în care oamenii tastează. Calendarul de lansare pentru această schimbare nu a fost confirmat.

Etichete: , , , , ,

Discuție

Există 0 comentarii.