Tehnologie

ElevenLabs v4 îți clonează vocea din 10 secunde de audio și o face să vorbească 90 de limbi

Susan Hill
Adaugă-ne în Google

ElevenLabs a lansat Eleven v4, un model de conversie a textului în vorbire care citește cu voce tare textul scris, adăugând un râs, un oftat sau un accent francez furios, dacă asta îi cere autorul. Clonarea instantanee a vocii are nevoie de o înregistrare mai scurtă decât un mesaj vocal, iar vocea clonată poate vorbi apoi în zeci de limbi, păstrându-și timbrul. Oricine are un cont gratuit ElevenLabs îl poate folosi.

Pentru cei care creează cu ajutorul sunetului, asta înseamnă că pot scăpa de zile întregi de muncă. Un podcaster poate dubla un episod în japoneză, cu propria voce, un dezvoltator de jocuri independent poate da fiecărui personaj secundar o interpretare distinctă fără să rezerve un studio, iar un narator de audiobookuri poate introduce direct în scenariu o pauză sau un chicotit. Reversul medaliei este la fel de concret: o notă vocală, un fragment dintr-un apel video sau câteva secunde dintr-o postare publică sunt acum suficiente pentru a crea o copie convingătoare a cuiva.

Principala noutate este nivelul de control, iar clonarea vocii necesită doar 10 secunde de înregistrare audio. Modelele ElevenLabs anterioare citeau textul cursiv, dar trebuiau să ghicească starea de spirit. Versiunea 4 acceptă indicații de interpretare introduse direct în text, între paranteze drepte, precum [laughs] sau [said angrily in French accent], dar și indicații de fundal, precum [light rain] sau [phone buzzing]. Compania spune că modelul interpretează tonul și ritmul și din contextul din jur, astfel încât o replică dintr-o scenă tensionată sună tensionat chiar și fără o indicație. În scenele cu mai mulți vorbitori, vocile rămân consecvente pe parcursul unor pasaje lungi — un punct slab al narațiunii sintetice, în care vocile aveau tendința să se schimbe de-a lungul unui capitol.

Numărul limbilor acceptate crește de la 70 în versiunea anterioară la peste 90, iar ElevenLabs a evidențiat japoneza, portugheza braziliană, mandarina și cantoneza drept limbile în care calitatea a crescut cel mai mult, potrivit TechCrunch. O voce clonată își păstrează identitatea când trece la o altă limbă, astfel că o clonă a vocii unui vorbitor de spaniolă care citește în germană sună tot ca acea persoană, dar cu un accent german nativ. Un al doilea model, v4 Turbo, este conceput pentru asistenți vocali și operatori de call-center. Începe să vorbească în aproximativ 150 de milisecunde — cam cât durează pauza dintre replicile a doi interlocutori — și poate începe să vorbească înainte ca chatbotul din spatele său să-și fi terminat răspunsul în scris.

ElevenLabs nu este singura companie de pe această piață. Google, OpenAI, Cartesia, Deepgram și Fish Audio vând toate voci sintetice acelorași dezvoltatori. La câteva ore de la lansare, compania independentă de evaluare Artificial Analysis a plasat v4 pe primul loc în clasamentul său al vocilor, unde ascultătorii evaluează alăturat mostre anonime. ElevenLabs mai spune că aproximativ trei din patru ascultători au preferat v4 în comparațiile oarbe cu produsele concurente, o cifră provenită din propriile teste.

Rezervele încep chiar cu cifra de 10 secunde. ElevenLabs spune că pentru clonarea unei voci este nevoie de consimțământul persoanei a cărei voce este încărcată, că pune la dispoziție un clasificator public care poate semnala materialele audio create cu instrumentele sale și că blochează din start clonarea vocilor unor personalități politice. Aceste verificări împiedică abuzurile ocazionale, dar se bazează pe sinceritatea persoanei care încarcă înregistrarea, iar unui escroc îi ajunge o mostră scurtă din vocea unei rude pentru a înscena un apel de urgență fals. Și oferta gratuită este limitată: aproximativ 10 minute de audio generat pe lună, potrivit analizei planurilor publicate de Unite.AI, iar abonamentele cu plată pornesc de la 6 dolari pe lună.

Eleven v4 și v4 Turbo au devenit disponibile pe 28 septembrie în aplicația pentru creatori ElevenLabs, pe platforma sa de agenți și prin API-ul pentru dezvoltatori. Compania, cu sediul la Londra, a obținut în februarie o finanțare de 500 de milioane de dolari de la Sequoia, la o evaluare de 11 miliarde de dolari, iar TechCrunch relatează că veniturile sale anualizate au depășit 600 de milioane de dolari. Directorul general Mati Staniszewski i-a declarat publicației TechCrunch că firma își propune să se listeze la bursă în următorii ani, fără să indice o dată.

Pentru creatori, o voce care râde la comandă în 90 de limbi înseamnă un studio de înregistrări într-o filă de browser. Pentru toți ceilalți, e încă un motiv să închidă și să sune din nou atunci când o voce cunoscută de la telefon le cere bani.

Etichete: , , , , ,

Adaugă-ne în Google

Discuție

Există 0 comentarii.