6 de octubre de 2026
Interpolación de imágenes por IA: lo que logra, dónde falla, con qué herramienta
La interpolación inventa los fotogramas que faltan entre dos fotogramas de un vídeo, para pasar de 24 a 30 o 60 fps. Nuestras pruebas con una danza rápida y con un corte entre dos planos, Topaz frente a RIFE, los defectos que hay que reconocer y las herramientas, desde las gratuitas hasta las profesionales.

Frank HoubreFundador de Imaginode
Qué hace un modelo de interpolación
Un modelo de interpolación recibe dos fotogramas consecutivos, estima el desplazamiento de cada zona de uno al otro, y pinta uno o varios fotogramas intermedios; no conoce ni la escena ni lo que ocurrió realmente entre esos dos instantes.
Entre dos fotogramas de un vídeo a 24 imágenes por segundo transcurre un veinticuatroavo de segundo. Interpolar consiste en adivinar cómo era la escena a la mitad de ese intervalo, o a un tercio, o a dos tercios, según la cadencia buscada. Para ello, el modelo calcula un flujo óptico: para cada pequeña zona del primer fotograma, la dirección y la distancia de su desplazamiento en el segundo.
De ahí deduce un fotograma en el que cada zona ha recorrido una fracción del camino, y después rellena los huecos: cuando un brazo pasa delante de una pared, aparece una parte de la pared, y hay que pintarla. Ahí es donde se distinguen los modelos. Los algoritmos antiguos, como el filtro minterpolate de ffmpeg, trabajan por bloques cuadrados y dejan bordes rasgados. Las redes neuronales entrenadas para esta tarea, RIFE, FILM, las de Topaz, razonan sobre toda la imagen y reconstruyen mejor las zonas descubiertas.
Lo que el modelo no sabe hacer es adivinar un acontecimiento que no aparece en ninguno de los dos fotogramas. Un parpadeo demasiado rápido, una chispa, una pelota que bota entre dos fotogramas: solo ve un antes y un después, y traza una línea recta entre ambos. Para el uso habitual, pasar un plano de 24 a 30 o a 60 imágenes por segundo, no tiene consecuencias. El método completo de conversión está en convertir un vídeo de 24 fps a 30 fps.
La prueba difícil: una danza rápida
Sobre una danza generada a 24 imágenes por segundo, con brazos rápidos y desenfoque de movimiento, Topaz y RIFE produjeron fotogramas intermedios limpios: sin miembro duplicado, sin mano deformada, con el desenfoque de la fuente ocultando el resto.
Esperábamos que las manos fallaran. Tomamos un vídeo de danza de nuestro catálogo de demostraciones, 720 × 1280, 5 segundos, 24 imágenes por segundo, y lo pasamos por dos motores el 6 de octubre de 2026: Topaz, el del nodo Mejorar, hacia 30 y 60 imágenes por segundo, y RIFE, el modelo libre más extendido, que duplica la cadencia hasta 48. Después buscamos, por cálculo, los dos fotogramas consecutivos donde la imagen cambia más, y observamos qué colocó cada motor entre ellos.
El resultado es mejor de lo previsto. En el recorte siguiente, la mano pasa de la cadera hacia delante; el fotograma de RIFE y el de Topaz la colocan a mitad de camino, con un desenfoque coherente, sin sexto dedo ni brazo fantasma. La razón se debe en parte a la fuente: un modelo de vídeo genera desenfoque de movimiento en los gestos rápidos, como una cámara real, y ese desenfoque hace invisibles los errores de interpolación.
Se vio una diferencia en otro aspecto: RIFE, en fal, devuelve un vídeo sin sonido, mientras que Topaz copia la pista de audio de la fuente. En un plano mudo, no importa; en un anuncio con su música, hay que volver a montar el sonido. Topaz también entregó exactamente la cadencia solicitada, mientras que RIFE solo sabe multiplicar: 24 se convierte en 48, 72 o 96, nunca en 25 o 30.
Donde realmente falla: el corte entre dos planos
En un corte seco, la interpolación fabrica un fotograma que no existe: Topaz superpuso los dos planos en un fundido, RIFE sin detección de planos produjo un mosaico de píxeles, y solo RIFE con detección de planos dejó el corte intacto.
El caso de libro es el montaje. Unimos dos planos con un corte seco, dos segundos de un vuelo sobre un pueblo seguidos de dos segundos de un frasco de perfume, y pasamos el archivo por los mismos motores. Entre el último fotograma del pueblo y el primero del frasco, un modelo de interpolación busca un movimiento que no existe, y aun así debe producir un fotograma.
Topaz devolvió un fotograma en el que el frasco se transparenta sobre el pueblo, como un fundido de un solo fotograma, un sesentavo de segundo. RIFE, sin ninguna opción particular, devolvió un fotograma mucho peor: el frasco recortado en cuadrados flotando sobre un fondo de píxeles. Con la opción de detección de cambios de plano activada, RIFE reconoció el corte y lo dejó limpio, sin fotograma inventado.
A velocidad normal, un fotograma fantasma de un sesentavo de segundo suele pasar inadvertido. En un montaje nervioso, con un corte cada dos segundos, da una sensación de suciedad difícil de identificar, y salta a la vista fotograma por fotograma. La regla es sencilla: se interpola cada plano por separado, antes del montaje, nunca el vídeo final.
Otros defectos que hay que reconocer
Más allá de los cortes, la interpolación se equivoca con los objetos que se cruzan, los patrones repetitivos, los textos que se desplazan, los movimientos más rápidos que el ancho de un objeto por fotograma, y los elementos que aparecen de golpe.
Los objetos que se cruzan, dos personas que se adelantan, una mano que pasa delante de un rostro: el modelo debe decidir qué zona pertenece a qué objeto, y el límite entre ambos puede ondular. Los patrones repetitivos, una rejilla, rayas, una valla en movimiento, lo confunden en la correspondencia: una barra se confunde con la de al lado y el patrón parece deslizarse en sentido contrario.
Los textos que se desplazan y las interfaces son otra trampa: las letras se deforman ligeramente en los fotogramas inventados, lo cual se nota en cuanto se lee. Los movimientos muy rápidos, un objeto que se desplaza más que su propio ancho de un fotograma a otro, no tienen una correspondencia fiable: el modelo puede duplicar el objeto o hacerlo aparecer mediante un fundido. Por último, todo lo que surge de golpe de un fotograma a otro, un rayo, un destello, una chispa, se difumina en un fundido en lugar de aparecer nítido.
En los vídeos de IA, buena parte de estos casos es poco frecuente: los modelos generan pocos textos legibles en desplazamiento, y su movimiento suele ser fluido. Los paneos, los drones, los rostros, los productos que giran, los personajes que caminan quedan muy bien. Estos son también los planos donde una cadencia demasiado baja se nota más.
Las herramientas, desde las gratuitas hasta las profesionales
Las herramientas se agrupan en tres familias: programas instalados (Topaz Video, DaVinci Resolve, Premiere Pro, Flowframes), servicios en línea (Topaz for Web, CapCut, TensorPix, HitPaw) y API (Runway, fal); los precios registrados el 6 de octubre de 2026 van de cero a 299 dólares al año.
Topaz Video, antes Video AI, es la referencia de pago. Ofrece cinco modelos de interpolación: Apollo para movimientos no lineales y fuentes algo borrosas, Apollo Fast, Chronos para la conversión de cadencia y el ralentí, Chronos Fast para desplazamientos grandes, y Aion para alta precisión. Cuesta 299 dólares al año o 59 al mes, 699 al año para uso comercial a partir de un millón de facturación. Su versión web, Topaz for Web, apunta a 30, 60, 90 o 120 imágenes por segundo por 19 dólares al mes en promoción. Adobe firmó en junio de 2026 un acuerdo para adquirir Topaz Labs.
En el lado gratuito, Flowframes es una interfaz de Windows para RIFE, DAIN y FLAVR, con licencia libre, cuyas versiones más recientes se publican primero para los mecenas en Patreon. RIFE y FILM, este último publicado por Google, son modelos de investigación presentados en 2022 y utilizables desde la línea de comandos, y ffmpeg ofrece el filtro minterpolate, sin red neuronal. DaVinci Resolve hace interpolación por flujo óptico en su versión gratuita; el modo Speed Warp está reservado a la versión Studio, por 295 dólares. Premiere Pro, por 22,99 dólares al mes, ofrece Optical Flow en la interpolación temporal. Y SVP, por 24,99 dólares de por vida, interpola en tiempo real durante la reproducción, sin archivo que exportar.
En línea, CapCut ofrece flujo óptico a 30, 50 o 60 imágenes por segundo; algunos usuarios han señalado que su ralentí fluido pasó a formar parte del plan Pro. TensorPix anuncia hasta 120 imágenes por segundo, con una prueba gratuita de tres minutos en 720p, y HitPaw una conversión a 60 o 120, desde 24,99 dólares al mes. Para los desarrolladores, la API de Runway convierte a 24, 25, 30, 48, 50, 60 o 120 imágenes por segundo, y sus variantes 23,98, 29,97 y 59,94, por 0,005 dólares el segundo. En Imaginode, el nodo Mejorar funciona con Topaz: 6 créditos los cinco segundos en 720p hasta 30 imágenes por segundo, con el sonido conservado.
El suavizado de movimiento de los televisores
El suavizado de movimiento de los televisores es una interpolación en tiempo real de las películas a 24 imágenes por segundo; da a las películas un aspecto de vídeo, hasta el punto de que Tom Cruise grabó en diciembre de 2018 un mensaje pidiendo desactivarlo, y de que un modo Filmmaker lo desactiva ahora por defecto.
La mayoría de los televisores recientes interpolan por defecto todo lo que muestran, para llenar su panel de 60 o 120 hercios. En el deporte, es un progreso. En una película, es lo que se llama el efecto telenovela: el movimiento se vuelve tan suave que la escena parece grabada en vídeo, como una telenovela, y pierde la ligera trepidación de los 24 fotogramas que distingue al cine. El 4 de diciembre de 2018, Tom Cruise y Christopher McQuarrie publicaron un breve vídeo explicando que este ajuste hace que la mayoría de las películas parezcan vídeo de alta velocidad, y cómo desactivarlo.
La UHD Alliance respondió con el modo Filmmaker, anunciado en agosto de 2019 y lanzado en el salón CES de enero de 2020, que desactiva el suavizado de movimiento, la reducción de ruido y el realce de nitidez, y respeta la cadencia original. Por el lado de la distribución, Netflix exige archivos entregados en su cadencia nativa, la del rodaje y el montaje, y advierte que las conversiones de cadencia mal hechas, que dejan artefactos, son rechazadas.
Para un creador, la lección es doble. No interpolar por reflejo un plano de ficción que debe conservar su textura de cine, y elegir la cadencia según dónde se verá el vídeo. La elección entre 24, 25, 30 y 60 imágenes por segundo, plataforma por plataforma, se detalla en 24, 25, 30 o 60 fps: qué cadencia elegir.
El resumen
La interpolación por IA es fiable en los movimientos continuos, paneos, drones, personajes, incluso rápidos cuando la fuente tiene desenfoque de movimiento; se equivoca en los cortes, los textos, los patrones repetitivos y los acontecimientos instantáneos.
Interpole cada plano antes del montaje, nunca un vídeo ya cortado. Si solo dispone del archivo final, utilice una herramienta que detecte los cambios de plano, y verifique cada corte fotograma por fotograma.
Para una cadencia exacta, 25, 30, 50 o 60, necesita un motor que apunte a una cadencia objetivo, como Topaz; RIFE solo sabe multiplicar por dos, tres o cuatro. Para un plano con sonido, elija un motor que lo copie, o prevea volver a montarlo.
En Imaginode, el nodo Mejorar cambia la cadencia con Topaz en ×1, con el sonido conservado, por 6 créditos los cinco segundos en 720p hasta 30 imágenes por segundo. El flujo de trabajo listo para usar es la plantilla «Cambiar la cadencia de un vídeo».