Tavus, la empresa responsable de la IA Griffin, ha puesto a 54 personas a hablar por videollamada con su agente de IA, y casi la mitad (26, un 48%) creyó que al otro lado de la webcam había una persona de carne y hueso. Con eso, Tavus presenta a Griffin como la primera IA en superar el test de Turing en vídeo y en tiempo real. Pero hay un detalle que pone en entredicho el alcance de la prueba: durante el minuto de charla, nadie fue avisado de que podía haber una máquina al otro lado. Eso y un curioso sello de Nvidia cuentan una historia bastante más extraña que el titular.
No hay duda de que sonaba muy "humana" (y hasta grosera: en uno de los vídeos de demostración le suelta a su interlocutor "vaya jersey más feo llevas"), ni de que mejora mucho al modelo anterior de Tavus, que solo convenció al 2,4%. Griffin mira, escucha, interrumpe y reacciona mientras la otra persona habla, supera trampas clásicas como pedirle que enseñe el pulgar y saca temas que no vienen a cuento. Todo en "miniturnos" de menos de un segundo: en vez de esperar a que acabes la frase, sigue la conversación y atiende a tus gestos y a lo que enseñas. Se parece menos a consultar un asistente y más a una videollamada con alguien pendiente de lo que haces. Y esa es exactamente la parte inquietante.
El test de Turing plantea si una máquina puede pasar por humana en una conversación. La versión original se hacía por escrito, sin ver al interlocutor, y medía una primera impresión, no una comprensión general. Por escrito, además, el listón ya cayó: en el estudio de Cameron Jones y Benjamin Bergen, de la Universidad de California en San Diego, GPT-4.5 fue elegido como el humano el 73% de las veces en conversaciones de cinco minutos con una persona y una máquina a la vez. Lo de Tavus sería, en todo caso, el primer aprobado en vídeo.
Lo que ocurrió en las videollamadas
Según la página de investigación de Griffin, publicada el 1 de octubre, a los participantes se les dijo que hablarían un minuto con otro participante sobre qué les ilusionaba de este año. El "otro participante" era Griffin-Lite generando cara, voz y respuestas en directo. Solo al final de la encuesta posterior se les preguntaba si se les había pasado por la cabeza que no fuera una persona real.
Y aquí está la trampa: nadie entró buscando una máquina. Más de la mitad dijo que la posibilidad ni se le pasó por la cabeza, y casi todos ellos respondieron que su interlocutor era real. Los que sí sospecharon lo hicieron pronto, por lo general en los primeros 20 segundos. La seguridad, además, era altísima en los dos bandos (79% de confianza media entre quienes dijeron "humano" y 81% entre quienes dijeron "IA"), y Griffin sacó un 5,8 sobre 7 en ganas de volver a hablar con él, nota que se quedaba en 5,4 incluso entre quienes lo habían cazado. Tavus no da un grupo de control o cuántas personas reales habrían pasado por humanas en esa misma llamada. Y con 54 participantes, el 48% podría estar en realidad entre un 35% y un 61%.
Imagen: Tavus (YouTube)
Contra lo que se ha repetido estos días, NVIDIA no juzgó esas videollamadas. Lo que hizo fue puntuar a Griffin-Lite en VideoFDB, su banco de pruebas de conversación audiovisual, que usa 237 clips de videollamadas reales y un modelo de lenguaje como juez. Griffin queda primero en las dos pruebas (aunque en la de generación solo compite con otros dos sistemas): 3,83 frente al 3,92 de la referencia humana en generación y 3,73 frente a 4,20 en percepción. Lo curioso es su latencia mediana: 1.892 milisegundos frente a los 900 de una persona en generación, y 2.232 frente a 1.400 en percepción. El modelo que mejor imita a un humano tarda en contestar entre un 60% más y el doble. Y aun así casi la mitad no vio el engaño. Por usar un símil conocido y que lo justifique (entre comillas), llevamos tantos años sufriendo problemas de wifi lento o latencia que un segundo de retraso ya no levanta sospechas.
Una IA aún no disponible y qué mide ese 48%
Tavus no ofrece Griffin a sus clientes, solo a un grupo selecto de probadores, y dice que no lo lanzará hasta tener funciones para revelar que es una IA. En Europa, además, desde el 2 de agosto de 2026 el artículo 50.1 del Reglamento de IA obliga a avisar a quien habla con una IA, salvo que resulte obvio para alguien razonablemente atento. Que es, precisamente, lo que ese 48% pone en duda.
El problema real está en quien no pide permiso. En Hong Kong, un empleado de una multinacional transfirió unos 25,6 millones de dólares tras una videoconferencia en la que, según la CNN, todos los asistentes salvo él eran deepfakes; había sospechado del correo inicial y fue la videollamada lo que le convenció. Eso sí, ahí hay caras reales suplantadas y una persona moviendo los hilos. Griffin juega en otra liga: no necesita a nadie al otro lado.
Si una videollamada resulta sospechosa, el truco del pulgar ya no sirve. Lo que sí sirve es no decidir nada con dinero bajo presión, colgar y verificar por otro canal, y acordar una palabra clave con familia y compañeros. Lo que sí demuestra este "no test" de Turing es que, si te dicen que al otro lado hay un humano, más de la mitad ni se plantea la duda. Y eso pone en la picota no solo el test, sino nuestra capacidad de estar alerta.
Imagen de portada: Tavus (vía YouTube)
En Xataka Ciencia | Las gafas con IA se enfrentan a su primera gran ofensiva gubernamental en Europa
En Xataka | OpenAI todavía no sabe qué forma tendrá el trabajo con la IA, así que ha decidido cobrarte por todas
Ver 0 comentarios