ElevenLabs har lanserat två talmodeller, ElevenLabs v4 och v4 Turbo, med fler uttryckskontroller, lägre fördröjning för röstassistenter och stöd för 90 språk. Företaget säger att användare kan klona en röst från 10 sekunders ljud.
Modellerna använder en ny arkitektur som enligt ElevenLabs ger bättre kontroll och snabbare kloning. De kan följa textens sammanhang när den läses upp och anpassa uttrycket över längre textavsnitt. v4 bygger vidare på de uttryckstaggar som infördes med v3 och låter användare kombinera flera taggar, som modellen sedan följer i ordning.
Den tidigare versionen stödde 70 språk. ElevenLabs säger att de största kvalitetsförbättringarna märktes på japanska, brasiliansk portugisiska, mandarin och kantonesiska.
Företaget säger att v4 passar för röstassistenter eftersom modellen kan börja skapa ljud när språkmodellen bakom den börjar generera ett svar, vilket ger mer flytande samtal. Den kan också hantera konfrontationer, eskaleringar och väntelägen på andra sätt för att hjälpa till att lösa ärenden.
Enligt företaget kommer mer än 55 % av ElevenLabs verksamhet från stora företag. Startupbolaget tog in 500 miljoner dollar tidigare i år i en investeringsrunda ledd av Sequoia, som värderade bolaget till 11 miljarder dollar. Den annualiserade intäktstakten steg från ungefär 330 miljoner dollar i början av året till över 600 miljoner dollar. Företaget har fler än 800 anställda. Vd:n Mati Staniszewski sade till TechCrunch att bolaget siktar på en börsnotering ”under de kommande åren”, men angav ingen tidsplan.
Kommentarer
0Inga kommentarer ännu. Skriv den första.