Fish Audio recauda $52 millones para revolucionar la generación de voz con IA
La startup con sede en Palo Alto, Fish Audio, ha asegurado $52 millones en una ronda seed liderada por Coreline Ventures y Capital Today, con la participación de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0. La compañía ha desarrollado una biblioteca de más de 15,000 controles de lenguaje natural para generar voces realistas y expresivas mediante inteligencia artificial.
Crecimiento y tracción en el mercado
Desde su lanzamiento el año pasado, Fish Audio ha acumulado más de 8 millones de usuarios en sus versiones open source y alojadas, generando un ingreso recurrente anual de $21 millones. Su repositorio Fish Speech en GitHub cuenta con más de 31,000 estrellas y es utilizado por desarrolladores independientes, diseñadores de videojuegos y creadores de contenido.
Orígenes y modelos
Fish Audio comenzó como un proyecto pequeño del exinvestigador de Nvidia Shijia Liao, quien, frustrado por las voces sintéticas poco expresivas del mercado, entrenó un modelo de generación de voz en una sola GPU y lo publicó como open source. Desde entonces, la startup ha lanzado cinco modelos en el último año: cuatro de generación de voz y uno de voz a texto. Tres de sus modelos de generación de voz son open source, mientras que su último modelo S2.1 Pro está disponible solo a través de su API paga.
Fish Audio ofrece planes mensuales pagos para creadores y equipos, que desbloquean un número determinado de minutos de generación más funciones de clonación de voz. También ofrece una versión empresarial de sus API y plataforma, y organizaciones como HeyGen y Sanas ya la están utilizando.
Desafíos de consentimiento y proceso de eliminación
Una de las formas en que la startup ha construido su biblioteca de voces es solicitando a los usuarios que envíen sus propias voces para entrenar los modelos, compensándolos si se utilizan. Sin embargo, esto generó problemas hace unos meses, cuando algunos creadores alegaron que sus voces fueron subidas sin su consentimiento. La startup tenía un proceso de eliminación DMCA, pero las eliminaciones tomaban mucho tiempo.
La CEO y cofundadora, Rissa Cao, explicó que la empresa ha automatizado el proceso de eliminación: “Los creadores pueden enviar una muestra de voz corta o un contrato para demostrar que la voz les pertenece, y su voz será retirada de la plataforma en menos de tres minutos”. No obstante, esto no impide que alguien suba la voz de un artista sin su conocimiento; hasta que el artista lo descubra, su voz seguirá siendo utilizada a menos que solicite su eliminación.
“Un enfoque comunitario solo puede ser una ventaja duradera si los creadores confían en la plataforma. Eso significa que el consentimiento, la transparencia y la atribución deben integrarse en el producto, no tratarse como algo secundario”, afirmó Osuke Honda, socio de Coreline Ventures.
Planes futuros y competencia
De cara al futuro, Fish Audio planea lanzar un modelo de comprensión de audio este año y está desarrollando un modelo de voz a voz. El mercado de generación de voz está saturado, con empresas como ElevenLabs, WellSaid, Cartesia, Speechify, Async (antes Podcastle) y Krisp compitiendo por los presupuestos de creadores y empresas.
Según Rico Mallozzi, socio de 359 Capital, los controles detallados para desarrolladores y el entrenamiento eficiente de modelos ayudarán a Fish Audio a competir mejor con los grandes laboratorios de IA. “Creo que lo que han logrado construir, modelos de última generación, con el equipo que tienen, en comparación con otros laboratorios o empresas de IA bien financiados, es increíble. Muestra su capacidad técnica para cerrar la brecha entre las voces artificiales y las humanas”, comentó.
Fish Audio inició como un proyecto open source que no requería capital externo, pero el interés de los inversores y la necesidad de desarrollar modelos más avanzados para empresas llevó a la startup a buscar financiamiento. Con esta inyección de capital, la compañía planea expandir su equipo y acelerar el desarrollo de nuevas capacidades.