Inteligencia artificial··2 min de lectura

Meta lanza una IA que distingue 20 voces en una misma grabación

Muse Voice Transcribe transcribe audio en tiempo real, identifica a más de 20 hablantes y soporta 70 idiomas. Ya disponible en la app de Meta AI para Mac y en la API.

Meta ha presentado Muse Voice Transcribe, un modelo de transcripción de voz en tiempo real que identifica a más de 20 hablantes distintos dentro de una misma grabación. El anuncio llega antes de que OpenAI o Google muestren algo similar, y la compañía ya lo ha puesto a disposición del público: está disponible en la API y en la aplicación de Meta AI para macOS, donde se puede usar como dictado con la tecla Fn.

El modelo, desarrollado por el equipo de Superinteligencia de Meta, es el primero de percepción en tiempo real que lanza la compañía. Según publicaron en su blog, está entrenado con más de 70 idiomas, de los cuales 25 pasaron una validación exhaustiva antes del lanzamiento. Esto permite, por ejemplo, que una conversación donde los participantes alternan entre idiomas a mitad de frase se transcriba sin problemas.

Cómo funciona por dentro

La arquitectura procesa el audio en fragmentos de 80 milisegundos (12,5 por segundo), cada uno convertido en un token que se analiza de forma autorregresiva. La clave está en que no todas las palabras necesitan el mismo tiempo de análisis: las sencillas se transcriben al instante, mientras que las ambiguas esperan más contexto antes de emitirse. Cuando el audio se detiene, un token especial avisa al modelo de que no llega más información y libera el texto pendiente. Meta llama a esto "escucha flexible".

Para entrenarlo usaron refuerzo que equilibra precisión y latencia: la recompensa combina la exactitud de la transcripción con el tiempo de espera. El resultado, según sus pruebas, es una tasa de error de palabras del 3,1% en inglés, mejor que GPT Live Transcribe y Gemini Transcribe Live. En la identificación de hablantes, la tasa de error es del 17,5%, el valor más bajo entre los modelos populares.

Precio y disponibilidad

Muse Voice Transcribe se ofrece a través de la API por 3 dólares por cada 1.000 minutos de audio. Meta ha confirmado que no tiene planes de publicar los pesos abiertos, así que no habrá versión de código abierto. Además de la app de Mac, estará integrado en Muse Code, su herramienta de desarrollo.

Lo que queda por ver es si cumple lo prometido en situaciones reales: las demos y los benchmarks son de la propia empresa, así que habrá que probarlo en reuniones caóticas de verdad para saber si la diarización de 20 voces funciona tan bien como dicen. Y si OpenAI o Google responden con sus propios modelos en las próximas semanas.

##Relacionado