Fish Audio recauda 52 millones de dólares para desarrollar modelos de voz con IA para creadores y empresas
Por Admin
Comienzos humildes y un despegue extraordinario
Fish Audio no fue en sus inicios más que un pequeño proyecto personal lanzado por el ex investigador de Nvidia, Shijia Liu, quien sentía una frustración genuina ante la limitación de las voces sintéticas disponibles en el mercado y su falta de expresividad natural. En respuesta a ello, decidió entrenar un modelo de generación de voz utilizando una sola unidad de procesamiento gráfico y lo publicó como proyecto de código abierto. Hoy, el repositorio de Fish Speech en GitHub ha superado las 31.000 estrellas y es utilizado por desarrolladores independientes, diseñadores de videojuegos y creadores de contenido de todo el mundo.
Una financiación millonaria que impulsa su crecimiento
Fish Audio, con sede en Palo Alto, anunció el cierre de una ronda de financiación inicial por valor de 52 millones de dólares, liderada por los fondos Coreline Ventures y Capital Today, con la participación de otros inversores como 359 Capital, Parable, HF0 y otros. Esta financiación llega en un momento en que la empresa goza de un notable impulso de crecimiento, con una base de más de 8 millones de usuarios y unos ingresos recurrentes anuales estimados en 21 millones de dólares.
Una biblioteca de voz completa para necesidades diversas
La filosofía de Fish Audio gira en torno a ofrecer soluciones de voz adaptables a una amplia variedad de usos, a través de una biblioteca que cuenta con más de 15.000 herramientas de control en lenguaje natural. La empresa ha lanzado cinco modelos durante el último año:
- Cuatro modelos de generación de voz, tres de ellos de código abierto.
- Un modelo de conversión de voz a texto.
- El modelo más reciente, S2.1 Pro, disponible exclusivamente a través de una interfaz de programación de pago.
La empresa ofrece planes mensuales para creadores y equipos que permiten generar un número determinado de minutos de audio con posibilidad de clonar voces, además de una versión empresarial que ya utilizan compañías destacadas como HeyGen y Sanas.
La diversidad de usos marca la diferencia competitiva
La directora ejecutiva y fundadora de la empresa, Risa Cao, explica que cada organización tiene una necesidad distinta: HeyGen, que integra voces en avatares de inteligencia artificial, busca realismo; los estudios de videojuegos necesitan voces de personajes más expresivas y dinámicas; mientras que las empresas de agentes de voz como LiveKit prefieren voces naturales y de respuesta rápida que imiten el estilo de la conversación humana.
El problema del consentimiento y la protección de las voces de los creadores
Fish Audio ha construido su biblioteca de voz sobre un modelo colaborativo que invita a los usuarios a contribuir con sus voces a cambio de una compensación económica cuando estas son utilizadas. Sin embargo, este enfoque ha generado controversia cuando algunos creadores afirmaron que sus voces habían sido subidas sin su conocimiento ni consentimiento. La empresa respondió desarrollando un mecanismo de eliminación automática que permite a los propietarios de las voces presentar una muestra de audio o un documento acreditativo y completar el proceso de eliminación en menos de tres minutos.
No obstante, el desafío fundamental persiste: nada impide que las voces de terceros sean subidas sin su conocimiento, lo que hace que la protección de las voces dependa de que sus propietarios estén atentos. Osuki Honda, socio de Coreline Ventures, considera que la sostenibilidad de este modelo comunitario depende de la confianza de los creadores en la plataforma, y que toda la industria tiene la responsabilidad de adoptar estándares claros que incluyan: la verificación de la titularidad de las voces, la concesión de licencias transparentes, mecanismos de denuncia ágiles y modelos de reparto de ingresos con los creadores.
Una hoja de ruta ambiciosa en un mercado altamente competitivo
Fish Audio tiene previsto lanzar un modelo de comprensión de voz y otro de conversión de voz a voz durante el presente año, en un mercado en el que la competencia es intensa con actores destacados como ElevenLabs, Cartesia, Speechify y otros. Rico Malozzi, socio de 359 Capital, considera que la capacidad de Fish Audio para desarrollar modelos avanzados con un equipo reducido y costes de entrenamiento bajos representa una ventaja técnica real que le permite competir incluso frente a los grandes laboratorios de inteligencia artificial con abundante financiación.
✦ بقلم فريق دروب أيديا
DROPIDEA
Esperamos que este artículo te haya aportado valor real. En DROPIDEA, siempre nos esforzamos por ofrecer contenido de alta calidad que te ayude a crecer y evolucionar en el espacio digital. Síguenos para más artículos y guías útiles.
Etiquetas
Admin
DROPIDEA
Últimos artículos
Una cadena de televisión libra una batalla judicial para recuperar 50 terabytes de su archivo digital
La nueva función de cámara de Google es exclusiva para los teléfonos Pixel 11
Una nueva versión más aterradora de la película «Expediente X» llega a Hulu
Samsung prepara los auriculares Galaxy H1 para competir con los AirPods Max