Una IA asegura que supera el test de Turing en vídeo y Nvidia lo pone en duda

Tavus sometió a 54 personas a un minuto de videollamada con su modelo Griffin-Lite: 26 creyeron que al otro lado había una persona. Nvidia lo incluye en su benchmark VideoFDB y recuerda que sigue por debajo de la referencia humana.

26 de cada 54 personas creyeron estar hablando con una humana. Era Griffin-Lite, el modelo de Tavus que reivindica el primer test de Turing en vídeo en tiempo real.

La compañía lo ha contado con todo lujo de detalles: 54 participantes reclutados a través de una plataforma independiente, un minuto de conversación cada uno y una pregunta al final. El resultado es que el 48% no distinguió al sistema de una persona. Con el modelo anterior de Tavus, solo 1 de 41 respondió lo mismo.

Ahora el matiz, que es gordo. La prueba la publica la propia empresa, no un laboratorio externo, y a los participantes no se les pidió distinguir desde el principio: primero valoraron naturalidad, confianza y fluidez, y la pregunta incómoda llegó al final. Eso cambia bastante la lectura.

Publicidad

Falta el contexto que el titular se come. El test que Alan Turing describió en 1950 era por escrito, sin caras ni voces, precisamente para que ninguna pista física condicionara al interrogador. Tampoco existe un protocolo oficial que se llame Video Turing Test: en 2023, un trabajo publicado en AI Magazine ya usó ese nombre para medir si una IA comprendía vídeos como un humano. Tavus aplica la misma idea de indistinguibilidad a una videollamada cara a cara.

Qué hace Griffin-Lite que no hacía nada antes

El truco técnico se llama full-duplex. El sistema no espera a que termines de hablar para reaccionar: genera voz e imagen mientras sigue escuchando y observando, y reevalúa la conversación en intervalos por debajo del segundo. Eso le permite asentir a mitad de frase, dejarse interrumpir, o reaccionar a algo que le enseñas a cámara.

Suena a detalle de ingeniería y es justo lo contrario. Reaccionar tarde es el delator número uno de una IA, y ahí se caen la mitad de las demos que prometen conversación natural. Rostro, voz, mirada y gestos salen de las mismas decisiones conversacionales, no de cuatro módulos cosidos con pegamento.

Parecer humano no es hablar bien: es fallar en el momento justo y que nadie note el retraso.

Lo demás sigue en el laboratorio. Griffin-Lite es una versión preliminar de investigación, abierta solo a un grupo cerrado de testers. La plataforma de Tavus para crear agentes audiovisuales ya está en el mercado y se usa en ventas, formación y atención al cliente, pero el modelo estrella no forma parte de ese catálogo. La empresa asegura que llegará una versión más potente.

Dónde está el techo y por qué Nvidia no firma el titular

Hay una referencia externa que ayuda a bajar el hype a la tierra. Nvidia incluye Griffin-Lite en VideoFDB, un benchmark montado con 237 fragmentos de videollamadas reales y 11 dinámicas conversacionales, con rúbricas de 0 a 5 que puntúa un juez basado en un modelo de lenguaje.

El sistema de Tavus lidera las tablas publicadas de percepción con 3,73 frente a 4,20 de la referencia humana, y las de generación con 3,83 frente a 3,92. Y aquí viene el dato que no sale en los titulares: todos los sistemas evaluados siguen por debajo del humano en naturalidad conversacional, según subraya Nvidia. Liderar una tabla y cruzar la raya no son lo mismo.

El precedente más cercano tampoco juega a favor. Un estudio publicado en PNAS en mayo de 2026 puso a varios interrogadores a cinco minutos por escrito con una persona y un modelo: GPT-4.5, con instrucciones extra para interpretar un papel humano, fue elegido como la persona el 73% de las veces. Sin ese bloque de instrucciones, la cifra cayó al 36%. Los protocolos no son comparables, pero el patrón se repite: buena parte del mérito es del guion, no del modelo.

Publicidad

Y queda el elefante. Tavus admite que las mismas funciones que hacen convincente a Griffin pueden llevar a alguien a creer que no habla con una IA, y dice que trabaja en avisos antes de ampliar el lanzamiento. En la UE el marco aprieta: el AI Act obliga desde el 2 de agosto de 2026 a informar de que se interactúa con una IA, salvo cuando resulte evidente. Con un 48% de confusión, evidente no es.

Hype-O-Meter

Nivel de hype: 6,5/10. El full-duplex en tiempo real es un avance de verdad y los números de Nvidia lo confirman, pero la prueba la firma quien vende el producto, el modelo no está disponible para clientes y sigue por debajo de la referencia humana. Hito sí, titular grandilocuente no — de momento.

El resumen para vagos (TL;DR)

  • 🎯 ¿Qué ha pasado? Tavus dice que su modelo Griffin-Lite coló a 26 de 54 personas en una videollamada de un minuto.
  • 🔥 ¿Por qué importa? El full-duplex en vivo es lo más cerca que hemos estado de una conversación sintética creíble.
  • 🤔 ¿Nos afecta o es solo un meme? Importa: si esto se generaliza, el aviso de 'estás hablando con una IA' deja de bastar.