
Tecnología · Coherencia temporal
DeepNude video: qué logra y qué no logra la IA
Un video son veinticuatro imágenes por segundo que deben coincidir entre sí. Ahí es donde los modelos se rompen y el resultado empieza a temblar.
En corto
El video no falla porque los modelos sean malos dibujando, sino porque cada cuadro se dibuja como si fuera el primero. La coherencia entre una imagen y la siguiente no sale del modelo de forma natural: hay que forzarla con capas añadidas, y esas capas aguantan unos segundos. De ahí salen el parpadeo, el borde que respira y la piel que cambia de tono a mitad de la toma.
Qué hace cada servicio con una fotografía suelta está en la vista general de estos servicios. Aquí miramos qué pasa al repetir esa operación treinta veces por segundo.
La cuenta que nadie hace
Un video son imágenes sueltas puestas en fila
Un segundo de video son entre veinticuatro y treinta imágenes completas. Cada una pasa por el mismo recorrido que una fotografía aislada, y basta que dos vecinas no coincidan para que el ojo lo cace de inmediato.
Los modelos abiertos publican sus propias cifras, y son modestas. La ficha de Stable Video Diffusion describe un modelo que produce 25 cuadros a 576×1024 píxeles y advierte, en su lista de limitaciones, que los clips salen cortos —cuatro segundos o menos— y que «las caras y las personas en general pueden no generarse correctamente». Es documentación del fabricante, no crítica externa.
El truco para que esos cuadros se parezcan entre sí está descrito en el artículo que acompaña al modelo: se parte de un generador de imágenes ya entrenado y se le insertan capas temporales que miran varios cuadros a la vez. Funciona dentro de una ventana corta. Cuando el clip se alarga, la ventana se acaba y la escena empieza a derivar. Cómo se calcula cada cuadro por separado, sin memoria del anterior, lo desglosa el motor que produce cada cuadro.
Ya resuelto
- Clips de dos a cinco segundos con un sujeto quieto y fondo simple.
- Movimientos de cámara lentos, tipo acercamiento o desplazamiento lateral.
- Iluminación estable si la escena original ya la tenía plana.
- Resoluciones intermedias, suficientes para una pantalla de teléfono.
Sigue roto
- Manos en movimiento: aparecen y desaparecen dedos entre cuadros.
- Rostros de frente durante varios segundos seguidos.
- Objetos que cruzan el cuerpo, como tirantes, cadenas o cabello suelto.
- Giros del torso, donde el modelo tiene que inventar lo que no vio.
- Cualquier texto en la escena: se convierte en garabato al segundo cuadro.
Qué se ve exactamente
Cinco temblores y de dónde viene cada uno
Los defectos del video son de otra familia: aparecen entre cuadros, no dentro de uno. Por eso una captura fija puede parecer impecable mientras el clip completo se cae.
| Lo que se ve | Por qué ocurre | Cuándo se nota |
|---|---|---|
| Borde que respira | La zona marcada se recalcula en cada cuadro y no cae dos veces en el mismo píxel. | En contornos rectos: hombros, cintura, línea del brazo. |
| Piel que cambia de tono | Cada pasada elige su propia media de color; nada obliga a repetir la anterior. | Al pausar y comparar el primer cuadro con el último. |
| Textura hirviendo | El ruido de partida es distinto en cada cuadro y el detalle fino se recompone desde cero. | En superficies uniformes vistas de cerca. |
| Objetos que aparecen y se van | Un elemento delgado cabe o no cabe en la zona según el cuadro. | Con aretes, cadenas, tirantes y mechones de cabello. |
| Deriva de la escena | Al superar la ventana de las capas temporales, el modelo pierde la referencia inicial. | Después del segundo o tercer segundo de clip. |
Las mismas señales, congeladas en una imagen fija, son las marcas que deja un archivo generado. En video el análisis es más fácil, no más difícil: hay decenas de cuadros donde buscar la incoherencia en lugar de uno solo.
Por qué se cobra distinto
La aritmética del segundo
En imagen los catálogos cobran por resultado; en video, por segundo. No es una moda comercial: es la única unidad que refleja el cómputo que hay detrás.
Diez segundos a treinta cuadros por segundo son trescientas generaciones completas, cada una con sus decenas de pasos de eliminación de ruido. Un minuto son mil ochocientas. La tarjeta gráfica que produce una fotografía en segundos necesita minutos para un clip corto, y ese tiempo lo paga alguien: por eso la cola de video es más lenta, el nivel de entrada más recortado y el salto de precio entre imagen y movimiento tan visible. Qué se recorta exactamente en cada escalón está en lo que dejan probar sin pagar.
De ahí, dos comportamientos que se repiten. Los servicios limitan la duración antes que la resolución, porque los segundos cuestan más que los píxeles. Y muchos venden como video una animación de una sola imagen —un vaivén de cámara sobre un resultado fijo—, que cuesta una fracción y no sufre ningún temblor de la tabla anterior: se distingue mirando si el sujeto cambia de postura o solo se mueve el encuadre. Dónde ocurre ese cálculo lo explicamos en los servicios que procesan del otro lado.
Preguntas sobre movimiento
Lo que se pregunta del video
Respuestas con la documentación pública de los modelos abiertos y con lo que se deduce de la propia aritmética de los cuadros.
¿Por qué los clips duran tan poco?
Porque la coherencia entre cuadros vive en una ventana corta. Las capas temporales comparan un puñado de imágenes vecinas; más allá, el modelo no tiene con qué sostener la escena. La ficha de Stable Video Diffusion sitúa sus clips en cuatro segundos o menos.
¿Sirve de algo subir la resolución?
Poco, y a veces empeora. Al ampliar, el detalle fino se recompone en cada cuadro y el hervor de la textura se vuelve más visible. El problema no es la cantidad de píxeles: es que ningún cuadro sabe qué hizo el anterior.
¿Un video es más difícil de desmentir que una foto?
Al revés. Una fotografía da una sola oportunidad de encontrar el defecto; un clip da una por cuadro, más las incoherencias entre ellos. Congelar la imagen cada pocos cuadros y comparar bordes y tonos suele bastar.
¿Qué modelos se usan para este tipo de material?
Derivados de los mismos generadores abiertos, reentrenados con material explícito y con las capas temporales encima. Quién los ajusta y con qué datos lo vemos en qué modelos se usan para material explícito.
¿Cambia algo legalmente que sea video y no foto?
No. El tipo penal mexicano habla de imágenes, videos y audios de contenido íntimo difundidos sin consentimiento, y no distingue el formato ni el origen. Las vías para actuar están en qué hacer si el material ya circula.
¿De dónde viene el nombre que usan estos servicios?
De un programa de que trabajaba solo con imágenes fijas y que estuvo disponible unos días. Quién reutiliza hoy esa marca está en los sitios que se cuelgan del nombre, y la traducción del término, en cómo se nombra en español.
¿Qué pasa exactamente entre que entra el archivo y sale el clip?
Las mismas cuatro etapas de una fotografía, repetidas por cuadro y con una fase extra de ensamblado. El recorrido completo está en el proceso base sobre el que se monta el video.