ElevenLabs v4 proširuje govornu AI na više od 90 jezika

ElevenLabs je predstavio modele ElevenLabs v4 i v4 Turbo, sa podrškom za više od 90 jezika, nižom latencijom za glasovne agente i proširenom kontrolom izražajnosti. Naslednik modela v3, koji je podržavao 70 jezika, može da klonira glas na osnovu samo 10 sekundi audio-zapisa.
Nova arhitektura za glas i izražajnost
Kompanija navodi da nova arhitektura ubrzava kloniranje glasa i omogućava detaljniju kontrolu načina na koji model govori. V4 bolje održava identitet glasa kroz duže tekstualne celine, dok pri čitanju uzima u obzir kontekst teksta kako bi prilagodio izražajnost.
ElevenLabs je u v3 uveo umetnute oznake za definisanje izraza. U v4 se njihov skup proširuje: korisnici mogu da kombinuju više oznaka, a model prati njihov redosled. To je važno za sadržaje u kojima se glas ne koristi samo za čitanje teksta, već mora da prenese promenu tona ili raspoloženja.
Broj podržanih jezika povećan je sa 70 na više od 90. Najveći skok kvaliteta ElevenLabs je zabeležio za japanski, brazilski portugalski, mandarinski i kantonski, što proširuje primenu modela na višejezične sadržaje i korisničke interakcije.
Niža latencija za glasovne agente
V4 je namenjen i glasovnim agentima, gde niža latencija treba da omogući tečniji razgovor. Model može da počne da proizvodi zvuk čim jezički model koji generiše odgovor počne svoj rad, umesto da čeka kompletan odgovor.
Kompanija dodaje da sistem može različito da obrađuje sukobe, eskalacije i stavljanja poziva na čekanje, sa ciljem boljeg rešavanja korisničkih zahteva. To je relevantno za organizacije koje automatizuju telefonsku podršku, jer ponašanje sistema tokom osetljivih delova razgovora utiče na tok interakcije.
Poslovni kontekst i tržišna utakmica
Više od 55% poslovanja ElevenLabsa dolazi od velikih kompanija, dok rast godišnjeg prihoda kompanije ElevenLabs pokazuje da je godišnji prihod po stopi na početku godine bio oko 330 miliona dolara, a zatim premašio 600 miliona dolara.
Na tržištu izražajnih govornih modela deluju Cartesia, Deepgram, Fish Audio, Boson i WellSaid Labs, dok Google i OpenAI takođe unapređuju svoje glasovne modele. Za poslovne timove praktičan zaključak je da pri proceni govornih sistema proveravaju podržane jezike, latenciju, upravljanje izražajnošću i ponašanje u stvarnim servisnim razgovorima.

