Blog

6 de outubro de 2026

Interpolação de imagens por IA: o que ela acerta, onde ela falha, com qual ferramenta

A interpolação inventa as imagens que faltam entre dois quadros de um vídeo, para passar de 24 para 30 ou 60 fps. Nossos testes com uma dança rápida e com um corte entre dois planos, Topaz contra RIFE, os defeitos a reconhecer e as ferramentas, do gratuito ao profissional.

Frank Houbre

Frank HoubreFundador do Imaginode

O que faz um modelo de interpolação

Um modelo de interpolação recebe duas imagens consecutivas, estima o deslocamento de cada área de uma para a outra e pinta uma ou mais imagens intermediárias; ele não conhece nem a cena nem o que realmente aconteceu entre os dois instantes.

Entre duas imagens de um vídeo a 24 quadros por segundo, passa-se um vinte e quatro avos de segundo. A interpolação consiste em adivinhar como a cena estava no meio desse intervalo, ou num terço, ou em dois terços, conforme a cadência pretendida. Para isso, o modelo calcula um fluxo óptico: para cada pequena área da primeira imagem, a direção e a distância do seu deslocamento na segunda.

Daí deduz uma imagem em que cada área percorreu uma fração do caminho, e depois preenche os buracos: quando um braço passa na frente de uma parede, uma parte da parede aparece, e é preciso pintá-la. É aí que os modelos se diferenciam. Os algoritmos antigos, como o filtro minterpolate do ffmpeg, trabalham por blocos quadrados e deixam bordas rasgadas. As redes neurais treinadas para essa tarefa, RIFE, FILM, as da Topaz, raciocinam sobre a imagem inteira e reconstroem melhor as áreas reveladas.

O que o modelo não sabe fazer é adivinhar um evento que não aparece em nenhuma das duas imagens. Um piscar de olhos rápido demais, uma faísca, uma bola que quica entre duas imagens: ele só vê um antes e um depois, e traça uma linha reta entre os dois. Para o uso comum, passar um plano de 24 para 30 ou 60 quadros por segundo, isso não tem consequência. O método completo de conversão está em converter um vídeo de 24 fps para 30 fps.

O teste difícil: uma dança rápida

Em uma dança gerada a 24 quadros por segundo, com braços rápidos e desfoque de movimento, Topaz e RIFE produziram imagens intermediárias limpas: nenhum membro duplicado, nenhuma mão deformada, o desfoque da fonte escondendo o resto.

Esperávamos que a quebra aparecesse nas mãos. Pegamos um vídeo de dança do nosso catálogo de demonstrações, 720 × 1280, 5 segundos, 24 quadros por segundo, e o passamos por dois motores em 6 de outubro de 2026: Topaz, o que está por trás do node Aprimorar, rumo a 30 e 60 quadros por segundo, e RIFE, o modelo livre mais difundido, que dobra a cadência para 48. Em seguida, procuramos, por cálculo, as duas imagens consecutivas em que a imagem mais muda, e observamos o que cada motor colocou entre elas.

O resultado é melhor do que o esperado. No recorte abaixo, a mão passa do quadril para a frente; a imagem do RIFE e a da Topaz a colocam no meio do caminho, com um desfoque coerente, sem sexto dedo nem braço fantasma. O motivo está, em parte, na fonte: um modelo de vídeo gera desfoque de movimento em gestos rápidos, como uma câmera real, e esse desfoque torna invisíveis os erros de interpolação.

Uma diferença apareceu em outro ponto: o RIFE, no fal, entrega um vídeo sem som, enquanto a Topaz copia a trilha de áudio da fonte. Em um plano mudo, isso não importa; em um anúncio com música, é preciso recolocar o som na montagem. A Topaz também entregou exatamente a cadência solicitada, enquanto o RIFE só sabe multiplicar: 24 vira 48, 72 ou 96, nunca 25 ou 30.

Da esquerda para a direita: imagem original, imagem inventada pelo RIFE, imagem inventada pela Topaz, imagem original seguinte. Recorte a 100% na mão.
À esquerda, a imagem original; à direita, a imagem inventada pela Topaz um sessenta avos de segundo depois, entre duas imagens originais. Nenhum defeito visível nessa escala.

Onde realmente falha: o corte entre dois planos

Em um corte seco, a interpolação fabrica uma imagem que não existe: a Topaz sobrepôs os dois planos em um fade, o RIFE sem detecção de cena produziu um mosaico de pixels, e só o RIFE com detecção de cena deixou o corte intacto.

O caso clássico é a montagem. Colamos dois planos em corte seco, dois segundos de um sobrevoo de vilarejo e depois dois segundos de um frasco de perfume, e passamos o arquivo pelos mesmos motores. Entre a última imagem do vilarejo e a primeira do frasco, um modelo de interpolação procura um movimento que não existe e, ainda assim, precisa produzir uma imagem.

A Topaz entregou uma imagem em que o frasco aparece por transparência sobre o vilarejo, como um fade de uma única imagem, um sessenta avos de segundo. O RIFE, sem nenhuma opção específica, entregou uma imagem bem pior: o frasco recortado em quadrados flutuando sobre um fundo de pixels. Com a opção de detecção de mudança de cena ativada, o RIFE reconheceu o corte e o deixou limpo, sem imagem inventada.

Em reprodução normal, uma imagem fantasma de um sessenta avos de segundo costuma passar despercebida. Em uma montagem nervosa, com um corte a cada dois segundos, ela dá uma impressão de sujeira difícil de identificar, e salta aos olhos quando se avança imagem por imagem. A regra é simples: interpole cada plano separadamente, antes da montagem, nunca o vídeo final.

Topaz, rumo a 60 quadros por segundo: a imagem inventada no corte sobrepõe os dois planos.
RIFE sem detecção de cena: um mosaico de blocos no ponto do corte.
RIFE com detecção de cena: o corte permanece limpo, a primeira imagem do frasco está intacta.

Os outros defeitos a reconhecer

Além dos cortes, a interpolação se engana com objetos que se cruzam, padrões repetitivos, textos em rolagem, movimentos mais rápidos do que a largura de um objeto por imagem, e elementos que aparecem de uma só vez.

Objetos que se cruzam, duas pessoas que se ultrapassam, uma mão que passa na frente de um rosto: o modelo precisa decidir qual área pertence a qual objeto, e a fronteira entre os dois pode ondular. Os padrões repetitivos, uma grade, listras, uma cerca em movimento, confundem a correspondência: uma barra é tomada pela sua vizinha e o padrão parece deslizar no sentido errado.

Os textos em rolagem e as interfaces são outra armadilha: as letras se deformam levemente nas imagens inventadas, o que se percebe assim que se tenta ler. Os movimentos muito rápidos, um objeto que se desloca mais do que a sua própria largura de uma imagem para outra, não têm correspondência confiável: o modelo pode duplicar o objeto ou fazê-lo aparecer em fade. Por fim, tudo o que surge de uma imagem para a outra, um relâmpago, um flash, uma faísca, é espalhado em fade em vez de aparecer nítido.

Nos vídeos de IA, boa parte desses casos é rara: os modelos geram poucos textos legíveis em rolagem, e o movimento costuma ser fluido. Panorâmicas, drones, rostos, produtos que giram, personagens que caminham passam muito bem. São também os planos em que uma cadência baixa demais mais se nota.

As ferramentas, do gratuito ao profissional

As ferramentas se dividem em três famílias: softwares instalados (Topaz Video, DaVinci Resolve, Premiere Pro, Flowframes), serviços on-line (Topaz for Web, CapCut, TensorPix, HitPaw) e APIs (Runway, fal); os preços verificados em 6 de outubro de 2026 vão de zero a 299 dólares por ano.

O Topaz Video, antigo Video AI, é a referência paga. Ele oferece cinco modelos de interpolação: Apollo para movimentos não lineares e fontes um pouco desfocadas, Apollo Fast, Chronos para conversão de cadência e câmera lenta, Chronos Fast para grandes deslocamentos, e Aion para alta precisão. Custa 299 dólares por ano ou 59 por mês, 699 por ano em uso comercial acima de um milhão em faturamento. Sua versão web, Topaz for Web, visa 30, 60, 90 ou 120 quadros por segundo por 19 dólares por mês em promoção. A Adobe assinou em junho de 2026 um acordo para adquirir a Topaz Labs.

Do lado gratuito, o Flowframes é uma interface Windows para RIFE, DAIN e FLAVR, de código aberto, cujas versões mais recentes saem primeiro para os apoiadores no Patreon. RIFE e FILM, este último publicado pelo Google, são modelos de pesquisa apresentados em 2022 e utilizáveis por linha de comando, e o ffmpeg oferece o filtro minterpolate, sem rede neural. O DaVinci Resolve faz interpolação por fluxo óptico na versão gratuita; o modo Speed Warp é reservado à versão Studio, por 295 dólares. O Premiere Pro, por 22,99 dólares por mês, oferece Optical Flow na interpolação temporal. E o SVP, por 24,99 dólares vitalícios, interpola em tempo real durante a reprodução, sem arquivo a exportar.

On-line, o CapCut oferece fluxo óptico em 30, 50 ou 60 quadros por segundo; usuários relataram que sua câmera lenta fluida passou para o plano Pro. O TensorPix anuncia até 120 quadros por segundo, com um teste gratuito de três minutos em 720p, e o HitPaw uma conversão para 60 ou 120, a partir de 24,99 dólares por mês. Para desenvolvedores, a API da Runway converte para 24, 25, 30, 48, 50, 60 ou 120 quadros por segundo, e suas variantes 23,98, 29,97 e 59,94, por 0,005 dólar o segundo. No Imaginode, o node Aprimorar passa pela Topaz: 6 créditos a cada cinco segundos em 720p até 30 quadros por segundo, com som preservado.

A suavização de movimento das televisões

A suavização de movimento das televisões é uma interpolação em tempo real dos filmes de 24 quadros por segundo; ela dá aos filmes uma aparência de vídeo, a ponto de Tom Cruise ter gravado em dezembro de 2018 uma mensagem pedindo para desativá-la, e de um modo Filmmaker agora desligá-la por padrão.

A maioria das televisões recentes interpola por padrão tudo o que exibe, para preencher sua tela de 60 ou 120 hertz. No esporte, é um avanço. Em um filme, é o que se chama de efeito novela: o movimento fica tão suave que a cena parece ter sido filmada em vídeo, como uma novela de televisão, e perde o leve trepidar dos 24 quadros que assina o cinema. Em 4 de dezembro de 2018, Tom Cruise e Christopher McQuarrie publicaram um breve vídeo explicando que essa configuração faz a maioria dos filmes parecer vídeo de alta velocidade, e como desligá-la.

A UHD Alliance respondeu com o modo Filmmaker, anunciado em agosto de 2019 e lançado na feira CES de janeiro de 2020, que desliga a suavização de movimento, a redução de ruído e a nitidez, e respeita a cadência original. Do lado da distribuição, a Netflix exige arquivos entregues na sua cadência nativa, a das filmagens e da montagem, e avisa que conversões de cadência malfeitas, que deixam artefatos, são rejeitadas.

Para um criador, a lição é dupla. Não interpolar por reflexo um plano de ficção que precisa manter sua textura de cinema, e escolher a cadência conforme o lugar onde o vídeo será assistido. A escolha entre 24, 25, 30 e 60 quadros por segundo, plataforma por plataforma, está detalhada em 24, 25, 30 ou 60 fps: qual cadência escolher.

O resumo

A interpolação por IA é confiável em movimentos contínuos, panorâmicas, drones, personagens, mesmo rápidos quando a fonte tem desfoque de movimento; ela erra nos cortes, nos textos, nos padrões repetitivos e nos eventos instantâneos.

Interpole cada plano antes da montagem, nunca um vídeo já cortado. Se você só tiver o arquivo final, use uma ferramenta que detecte mudanças de cena, e verifique cada corte imagem por imagem.

Para uma cadência exata, 25, 30, 50 ou 60, é preciso um motor que mire em uma cadência alvo, como a Topaz; o RIFE só sabe multiplicar por dois, três ou quatro. Para um plano com som, escolha um motor que o copie, ou preveja recolocá-lo.

No Imaginode, o node Aprimorar muda a cadência com a Topaz em ×1, com som preservado, por 6 créditos a cada cinco segundos em 720p até 30 quadros por segundo. O fluxo de trabalho pronto para uso é o modelo "Alterar a cadência de um vídeo".

Quer testar em um canvas de verdade?

Tudo o que está descrito neste artigo funciona no Imaginode, no seu navegador.

Começar