Imagina terminar una reunión con varias personas hablando, abrir la grabación y obtener una transcripción en la que no solo aparecen las palabras, sino que también se puede distinguir quién dijo cada cosa. Esa es precisamente la clase de tarea que Meta busca facilitar con Muse Voice Transcribe, su nuevo modelo de inteligencia artificial capaz de transcribir voz en tiempo real y reconocer a más de 20 hablantes dentro de una misma grabación.
El modelo fue desarrollado por el equipo de Superinteligencia de Meta y representa el primer modelo de percepción en tiempo real creado por la compañía. Su disponibilidad contempla la API y el dictado de Meta AI para Mac, por lo que la herramienta puede utilizarse tanto para desarrollar aplicaciones como para convertir voz en texto directamente desde el ordenador.
Una de sus características más llamativas es el soporte para más de 70 idiomas. Además, Meta señala que el sistema puede manejar conversaciones en las que una persona cambia de idioma de manera natural, incluso a mitad de una frase. Esta capacidad busca responder a una situación común en conversaciones bilingües, donde el cambio de idioma ocurre sin pausas o indicaciones especiales.
Muse Voice Transcribe puede separar más de 20 voces
La gran diferencia de Muse Voice Transcribe está en la manera en que procesa una conversación. En lugar de tratar una grabación con varias personas como una sola voz, el modelo puede identificar distintos hablantes mientras genera la transcripción. Esto resulta especialmente relevante en reuniones, entrevistas o conversaciones donde varias personas intervienen de manera continua.
Para conseguirlo, Meta entrenó el modelo con más de 70 idiomas y realizó una validación exhaustiva en 25 de ellos antes de su lanzamiento. La IA también puede trabajar con grabaciones que superan una hora de duración sin requerir un procesamiento adicional, según la información proporcionada por la compañía.
El sistema analiza el audio en fragmentos de apenas 80 milisegundos. Cada fragmento se convierte en un token que el modelo procesa de forma autorregresiva. Dicho de manera sencilla, la IA escucha pequeños bloques de sonido y decide si ya tiene suficiente información para escribir una palabra o si necesita esperar un poco más para entender correctamente lo que se está diciendo.
Así implementa Meta la IA para transcribir voz
La implementación de esta herramienta se basa precisamente en ese equilibrio entre rapidez y contexto. Las palabras sencillas pueden aparecer prácticamente al instante, mientras que aquellas que resultan ambiguas necesitan que el modelo espere el siguiente fragmento de audio antes de decidir qué texto producir.
Meta entrenó el sistema mediante un proceso de refuerzo que toma en cuenta dos elementos: la precisión de la transcripción y el tiempo que la IA necesita para responder. De esta forma, el modelo no busca únicamente acertar las palabras, sino también evitar esperas innecesarias durante una conversación.
El funcionamiento también contempla los momentos en los que el audio se detiene. Un token indica al sistema que ya no está entrando información, permitiendo que libere cualquier texto que todavía estuviera pendiente. Meta describe este comportamiento como una escucha flexible, que también se aplica al momento de determinar quién está hablando.
Meta lleva Muse Voice Transcribe a su API
En cuanto a rendimiento, Meta señala una tasa de error de palabras de 3.1 % en inglés. Para la identificación de hablantes, el error indicado es de 17.5 %, el valor más bajo entre los modelos de transcripción populares mencionados en la información proporcionada.
Muse Voice Transcribe ya está disponible mediante la API con un precio de 3 dólares por cada 1,000 minutos de audio procesado. Meta también confirmó que no publicará los pesos del modelo de forma abierta, aunque sí permitirá utilizarlo mediante el dictado de Meta AI para Mac y Muse Code.
Para quienes ya cuentan con la aplicación en Mac, el funcionamiento es directo: basta con presionar la tecla Fn y comenzar a hablar en cualquier aplicación. Así, Muse Voice Transcribe lleva la transcripción de voz en tiempo real desde el desarrollo de IA hasta una herramienta que puede utilizarse directamente durante el trabajo cotidiano.
