ElevenLabs ha lanzado dos modelos de voz, ElevenLabs v4 y v4 Turbo, con más controles de expresión, menor latencia para agentes de voz y compatibilidad con 90 idiomas. La empresa afirma que los usuarios pueden clonar una voz a partir de 10 segundos de audio.
Los modelos utilizan una nueva arquitectura que, según ElevenLabs, permite un mejor control y una clonación más rápida. Pueden seguir el contexto del texto mientras lo leen en voz alta y ajustar la expresión en pasajes más largos. v4 amplía las etiquetas de expresión en línea introducidas con v3: permite combinar varias etiquetas y que el modelo las siga en secuencia.
La versión anterior admitía 70 idiomas. ElevenLabs afirma que observó las mayores mejoras de calidad en japonés, portugués brasileño, mandarín y cantonés.
La empresa dice que v4 es adecuado para agentes de voz porque puede empezar a generar audio cuando el modelo de lenguaje que lo impulsa comienza a generar una respuesta, lo que permite conversaciones más fluidas. También puede gestionar de otra manera las confrontaciones, las escaladas y las esperas para ayudar a resolver incidencias.
Según ElevenLabs, más del 55 % de su negocio procede de grandes empresas. La startup recaudó 500 millones de dólares a principios de este año en una ronda liderada por Sequoia, que valoró la compañía en 11.000 millones de dólares. Su ritmo anualizado de ingresos pasó de unos 330 millones de dólares al comienzo del año a más de 600 millones de dólares. La empresa tiene más de 800 empleados. Su director ejecutivo, Mati Staniszewski, dijo a TechCrunch que la compañía aspira a salir a bolsa «en los próximos años», pero no fijó un calendario.
Comentarios
0Aún no hay comentarios. Escribe el primero.