EPFL Stable Video Infinity: Como a Reciclagem de Erros Resolve o Maior Problema da Geração de Vídeo com IA
Um novo artigo Oral do ICLR 2026 do laboratório VITA da EPFL apresenta a reciclagem de erros, uma técnica que elimina a deriva temporal e permite a geração de vídeo IA de vários minutos sem custo computacional adicional.

Pronto para criar os seus próprios vídeos com IA?
Junte-se a milhares de criadores que utilizam Bonega.ai
O Problema de Deriva que Ninguém Resolveu
Se você tentou gerar vídeo IA de longa duração com qualquer modelo atual, conhece a frustração. Sora 2 limita-se a 15 a 25 segundos dependendo do seu plano. Runway Gen-4.5 máximo em 10 segundos. Kling 3.0 atinge 15 segundos. A razão não é computação ou memória. É a deriva temporal.
A deriva temporal ocorre quando modelos de vídeo autorregressivos acumulam pequenos erros quadro a quadro. Cada quadro gerado torna-se a entrada do próximo, e pequenas imperfeições se combinam exponencialmente. Após algumas centenas de quadros, a saída mal se parece com o prompt original.
Isto é fundamentalmente similar ao problema do "telefone sem fio". Cochichar uma mensagem através de pessoas suficientes e ela se torna irreconhecível. Abordagens anteriores tentaram combater a deriva gerando clipes mais curtos e costurando-os, mas as costuras são visíveis. Outros usaram geração hierárquica (keyframes primeiro, interpolação depois), o que ajuda mas não elimina o problema central.
Bem-vindo à Reciclagem de Erros
O artigo, intitulado "Stable Video Infinity" e aceito como apresentação Oral no ICLR 2026, introduz uma ideia enganosamente simples: ensine o modelo a lidar com seus próprios erros.
Aqui está o insight-chave. Durante o treinamento, modelos de difusão de vídeo padrão aprendem com dados de verdade básica limpos. Eles nunca veem sua própria saída gerada. Quando implantados, eles de repente têm de trabalhar com suas próprias previsões imperfeitas como entrada, e não sabem como lidar com o ruído.
A reciclagem de erros corrige isto modificando o loop de treinamento:
Passagem Direta Padrão
O modelo gera um segmento de vídeo a partir de dados de treinamento limpos.
Coleta de Erros
As próprias previsões do modelo (com suas imperfeições) são capturadas em vez de descartadas.
Reciclagem de Erros
Essas saídas imperfeitas são realimentadas como entrada para a próxima iteração de treinamento, ensinando ao modelo a gerar saída estável mesmo a partir de quadros auto-gerados e ruidosos.
Refinamento Iterativo
Ao longo de muitos ciclos de treinamento, o modelo aprende um mecanismo robusto de autocorreção que previne a acumulação de erros.
A beleza deste enfoque reside em sua elegância. Não há novas arquiteturas de modelo, nenhum parâmetro adicional, nenhum truque em tempo de inferência. O modelo simplesmente aprende durante o treinamento como são as condições reais de implementação.
Por Que Isto Importa Mais do Que Você Pensa
As implicações estendem-se muito além da geração de vídeos de gatos mais longos. Eis o que muda:
Antes da Reciclagem de Erros
- Modelos de vídeo limitados a 4-20 segundos
- Consistência de cena degrada rapidamente
- Identidade do personagem se afasta após alguns segundos
- A física se torna cada vez mais irrealista
- Cor e iluminação se deslocam imprevisivelmente
Depois da Reciclagem de Erros
- Geração de vídeo coerente de vários minutos
- Aparência estável do personagem ao longo de tudo
- Física e relações espaciais consistentes
- Ajuste de cor e iluminação confiável
- Sem degradação de qualidade visível ao longo do tempo
Os Números
A equipe do laboratório VITA testou Stable Video Infinity em múltiplas arquiteturas e benchmarks. Os resultados são impressionantes:
| Métrica | Sem Reciclagem de Erros | Com Reciclagem de Erros | Melhoria |
|---|---|---|---|
| FVD (quanto menor, melhor) | Degrada após 4s | Estável por 2min+ | Significativa |
| Consistência de Personagem | Cai abaixo de 60% em 15s | Mantém 90%+ em 2min | ~50% relativo |
| Coerência Temporal | Deriva visível em 8s | Sem deriva visível em 2min | Salto qualitativo |
| Custo Computacional | Linha de base | Linha de base (aumento 0%) | Custo zero |
O aspecto de custo computacional zero é crítico. A reciclagem de erros é uma técnica em tempo de treinamento, não em tempo de inferência. Uma vez treinado, o modelo é executado exatamente na mesma velocidade e custo de antes.
Como a Reciclagem de Erros Funciona Sob o Capô
Para aqueles que querem os detalhes técnicos, aqui está o que acontece no pipeline de treinamento modificado.
O treinamento de difusão de vídeo padrão usa um cronograma de ruído epsilon aplicado a quadros de verdade básica limpos x_0. O modelo aprende a prever o ruído e recuperar o sinal original. No tempo de inferência, o modelo gera autorregressivamente o quadro t+1 condicionado em sua previsão do quadro t.
O intervalo entre treinamento (entradas limpas) e inferência (entradas auto-geradas) é chamado viés de exposição. A reciclagem de erros aborda isto diretamente.
Detalhes Técnicos: Objetivo de Treinamento Modificado▼
Durante o treinamento, o modelo gera periodicamente quadros usando seus próprios pesos atuais em vez de usar dados de verdade básica. Esses quadros auto-gerados, completos com suas imperfeições, são então usados como entradas de condicionamento para quadros subsequentes na sequência de treinamento.
O parâmetro-chave é a razão de reciclagem r, que controla com que frequência quadros auto-gerados substituem quadros de verdade básica durante o treinamento. O artigo descobre que r = 0.3 (30% de quadros reciclados) atinge desempenho ótimo, equilibrando melhoria de estabilidade com qualidade de sinal de treinamento.
A função de perda modificada permanece o objetivo de difusão padrão. A única diferença é a distribuição de dados que o modelo vê durante o treinamento. É por isso que não há custo computacional em tempo de inferência.
Isto é conceitualmente similar à amostragem agendada em modelos sequência-para-sequência, mas adaptada para o framework de difusão contínua. A equipe do laboratório VITA reconhece esta conexão em seu artigo, enquanto observa que a aplicação ingênua da amostragem agendada a modelos de difusão não funciona. Sua contribuição é a formulação específica que a torna estável para geração de vídeo.
A Vantagem do Código Aberto
Talvez o aspecto mais emocionante: o código é totalmente de código aberto no GitHub (vita-epfl/Stable-Video-Infinity). Isto significa que qualquer laboratório de pesquisa ou empresa pode aplicar reciclagem de erros a seus modelos de vídeo existentes.
O lançamento de código aberto segue uma tendência crescente na comunidade de pesquisa de vídeo com IA. Modelos como LTX-2 e Wan 2.6 demonstraram que abordagens de código aberto podem competir com alternativas proprietárias.
O Que Isto Significa para a Indústria
O timing é notável. Estamos no meio de uma corrida armamentista de vídeo IA onde cada grande ator, de Runway a ByteDance, está pressionando por saída mais longa e de maior qualidade. A reciclagem de erros poderia ser a peça que falta que desbloqueia a próxima geração de capacidades.
Para Cineastas e Criadores
Para Pesquisadores
Para Empresas
Olhando para Frente
O trabalho do laboratório VITA representa uma mudança fundamental em como pensamos sobre geração de vídeo com IA. Em vez de construir modelos cada vez maiores ou adicionar mecanismos complexos em tempo de inferência, a solução foi simplesmente mostrar ao modelo como sua própria saída se parece.
O artigo será apresentado no ICLR 2026, e várias fontes da indústria sugerem que principais fornecedores de modelos de vídeo já estão explorando integração. Se modelos mundiais representam o futuro de como a IA entende física e espaço, reciclagem de erros representa o futuro de como a IA mantém esse entendimento ao longo do tempo.
A era dos vídeos IA de 4 segundos pode estar terminando mais cedo do que ninguém esperava. E não exigirá uma nova arquitetura de modelo ou um orçamento de computação de bilhões de dólares. Apenas um loop de treinamento mais inteligente.
Leituras Adicionais
- A Revolução de Vídeo IA de Código Aberto: Como modelos abertos fecham a lacuna com sistemas proprietários
- Simulação de Física em Vídeo IA: Entender como os modelos aprendem consistência física
- Transformers de Difusão: A arquitetura que potencializa geração de vídeo moderno

Engenheiro de IA de Lausanne que combina profundidade de investigação com inovação prática. Divide o tempo entre arquiteturas de modelos e picos alpinos.
View profile →Artigos relacionados
Continue a explorar com estes artigos relacionados

Frame to Video: como o workflow de imagem para vídeo se tornou o padrão criativo em 2026
O text-to-video domina as manchetes, mas o image-to-video é o que os criadores realmente utilizam. Descubra por que começar com uma única imagem oferece melhores resultados, mais controlo e iteração mais rápida.

Bonega vs Kling AI em 2026: Qual plataforma de vídeo IA é ideal para você?
Bonega.ai e Kling AI geram vídeos profissionais com IA e áudio nativo. Comparamos duração, preços, recursos e qual plataforma se adapta melhor a diferentes criadores.

Bonega vs Runway em 2026: recursos, preços e qual escolher
Comparação detalhada entre Bonega.ai e Runway para geração de vídeo com IA. Analisamos preços, recursos, qualidade de vídeo e qual ferramenta se adapta ao seu fluxo de trabalho.