Meta Muse Voice Transcribe, la herramienta que transcribe y distingue 20 voces a la vez

El modelo separa conversaciones caóticas en tiempo real y se estrena en la API por 3 dólares cada 1.000 minutos. Llega a la app de Mac antes de que OpenAI mueva ficha.

Meta se ha adelantado a OpenAI con un modelo que transcribe voz en tiempo real y separa hasta 20 voces. Sin rueda de prensa ni directo eterno: la división de IA de Meta lo ha soltado en su blog y ya está en la API.

Qué hace exactamente este modelo

La gracia no es solo que escriba lo que oye. Muse Voice Transcribe identifica a más de 20 hablantes distintos dentro de una misma grabación y detecta pausas. Si has intentado transcribir una reunión con tres personas hablando a la vez, sabes que el resultado suele parecer un poema dadaísta.

Meta ha entrenado el sistema con más de 70 idiomas, de los cuales 25 pasaron por una validación exhaustiva antes del lanzamiento. Los hablantes bilingües pueden alternar de idioma a mitad de frase sin descuadrar al modelo.

Publicidad

En la parte técnica, el modelo procesa el audio en fragmentos de 80 milisegundos, unos 12,5 segmentos por segundo. Cada fragmento se convierte en un token y la IA decide si emite la palabra ya o espera al siguiente bloque para ganar contexto.

Las palabras simples se transcriben casi al instante, mientras que las ambiguas esperan más contexto. Según Meta, este equilibrio entre precisión y latencia no es casual: usaron entrenamiento con refuerzo que premiaba acertar sin demorarse de más.

Muse Voice Transcribe es compatible con grabaciones de más de una hora sin procesamiento adicional. Cuando el audio se corta, un token avisa de que no hay más datos y libera el texto pendiente. Meta llama a esto escucha flexible.

Lo que Meta acaba de soltar no es solo un transcriptor: es una apuesta por separar voces en tiempo real sin que la factura te devuelva a la libreta.

El precio y el rendimiento: la letra pequeña

Los números mandan: un 3,1% de tasa de error de palabras en inglés, por debajo de GPT Live Transcribe y Gemini Transcribe Live. A la hora de diferenciar hablantes, el error se sitúa en el 17,5%, el más bajo entre los modelos populares de transcripción según Meta.

El precio, 3 dólares por cada 1.000 minutos de audio, lo pone al alcance de una startup sin que sangre la tarjeta. Eso sí, no hay pesos abiertos: toca usarlo vía API, el dictado de Meta AI para Mac o Muse Code.

Si ya tienes la app de Meta AI para Mac, pulsa Fn y empieza a hablar en cualquier aplicación. El dictado es la puerta de entrada para probar la transcripción en tiempo real sin montar nada raro.

El precedente que Meta se ha quitado de encima

Hasta ahora, la conversación sobre transcripción con IA estaba dominada por Whisper, el modelo de OpenAI que lleva años salvando redacciones y podcasts. Whisper transcribe bien, pero separar voces en una conversación caótica nunca fue su punto fuerte.

Publicidad

Meta ha puesto el foco en la diarización, la parte aburrida que mata reuniones y salas de redacción. La mejora es evidente, aunque un 17,5% de error todavía deja espacio para subtítulos creativos.

Con este movimiento, la pelota queda en el tejado de OpenAI y Google. Si la transcripción en tiempo real era una bala en la recámara, Meta acaba de disparar primero, y el precio demuestra que también quiere ganar la guerra de los costes.

Hype-O-Meter

Nivel de hype: 8,5/10. El precio por minuto y la separación de hasta 20 voces en tiempo real justifican el ruido, aunque el 17,5% de error al etiquetar hablantes pide no vender la libreta todavía — la reunión se entiende, pero a veces no sabrás quién ha gritado.

El resumen para vagos (TL;DR)

  • 🎯 ¿Qué ha pasado? Meta ha lanzado Muse Voice Transcribe, un transcriptor en tiempo real que distingue hasta 20 voces.
  • 🔥 ¿Por qué importa? Adelanta a OpenAI y Google con mejor tasa de error y un precio de 3 dólares por cada 1.000 minutos.
  • 🤔 ¿Nos afecta o es solo un meme? Si grabas reuniones, pódcast o entrevistas, afecta y bastante; el dictado en Mac ya se puede probar.