EPFL Stable Video Infinity: com el reciclatge d'errors resol el problema més gran del vídeo amb IA
Un nou article Oral d'ICLR 2026 d'EPFL introdueix el reciclatge d'errors, una tècnica que elimina la deriva temporal i permet generar vídeo amb IA de diversos minuts sense cap cost de còmput addicional.

Preparat per crear els teus propis vídeos amb IA?
Uneix-te a milers de creadors que utilitzen Bonega.ai
El problema de la deriva que ningú no havia resolt
Si has intentat generar vídeo amb IA de format llarg amb qualsevol model actual, coneixes la frustració. Sora 2 arriba a un màxim de 15 a 25 segons segons el teu pla. Runway Gen-4.5 arriba a 10. Kling 3.0 arriba a 15. El motiu no és el còmput ni la memòria. És la deriva temporal.
La deriva temporal es produeix quan els models de vídeo autoregressius acumulen petits errors fotograma a fotograma. Cada fotograma generat es converteix en l'entrada del següent, i les petites imperfeccions es multipliquen exponencialment. Després d'uns quants centenars de fotogrames, el resultat gairebé no s'assembla al prompt original.
Això és fonamentalment similar al problema del "telèfon trencat". Xiuxiueja un missatge a prou persones i es torna irreconeixible. Els enfocaments anteriors intentaven combatre la deriva generant clips més curts i unint-los, però les transicions són visibles. Altres utilitzaven generació jeràrquica (primer fotogrames clau, després interpolació), cosa que ajuda però no elimina el problema central.
Arriba el reciclatge d'errors
L'article, titulat "Stable Video Infinity" i acceptat com a presentació Oral d'ICLR 2026, introdueix una idea enganyosament simple: ensenyar el model a gestionar els seus propis errors.
Aquesta és la idea clau. Durant l'entrenament, els models estàndard de difusió de vídeo aprenen a partir de dades de referència netes. No veuen mai la seva pròpia sortida generada. Quan es despleguen, de sobte han de treballar amb les seves pròpies prediccions imperfectes com a entrada, i no saben com gestionar el soroll.
El reciclatge d'errors resol això modificant el bucle d'entrenament:
Passada estàndard cap endavant
El model genera un segment de vídeo a partir de dades d'entrenament netes.
Recollida d'errors
Les prediccions del mateix model (amb les seves imperfeccions) es capturen en lloc de descartar-se.
Reciclatge d'errors
Aquestes sortides imperfectes es tornen a introduir com a entrada per a la següent iteració d'entrenament, ensenyant al model a generar una sortida estable fins i tot a partir de fotogrames sorollosos autogenerats.
Refinament iteratiu
Al llarg de molts cicles d'entrenament, el model aprèn un mecanisme robust d'autocorrecció que evita l'acumulació d'errors.
La bellesa d'aquest enfocament és la seva elegància. No hi ha arquitectures de model noves, ni paràmetres addicionals, ni trucs en temps d'inferència. El model simplement aprèn durant l'entrenament com són les condicions reals de desplegament.
Per què això importa més del que penses
Les implicacions van molt més enllà de generar vídeos de gats més llargs. Això és el que canvia:
Abans del reciclatge d'errors
- Models de vídeo limitats a 4-20 segons
- La consistència de l'escena es degrada ràpidament
- La identitat del personatge deriva després d'uns segons
- La física es torna cada vegada més irrealista
- El color i la il·luminació canvien de manera imprevisible
Després del reciclatge d'errors
- Generació coherent de vídeo de diversos minuts
- Aspecte estable dels personatges de principi a fi
- Física i relacions espacials coherents
- Gradació de color i il·luminació fiables
- Sense degradació visible de la qualitat amb el temps
Les xifres
L'equip del VITA Lab va provar Stable Video Infinity en múltiples arquitectures i benchmarks. Els resultats són sorprenents:
| Mètrica | Sense reciclatge d'errors | Amb reciclatge d'errors | Millora |
|---|---|---|---|
| FVD (com més baix, millor) | Es degrada després de 4s | Estable fins a 2min+ | Significativa |
| Consistència del personatge | Baixa per sota del 60% a 15s | Manté 90%+ a 2min | ~50% relatiu |
| Coherència temporal | Deriva visible a 8s | Sense deriva visible a 2min | Salt qualitatiu |
| Sobrecàrrega de còmput | Referència | Referència (augment del 0%) | Cost zero |
L'aspecte de sobrecàrrega de còmput zero és crucial. El reciclatge d'errors és una tècnica de temps d'entrenament, no de temps d'inferència. Un cop entrenat, el model funciona exactament a la mateixa velocitat i cost que abans.
Com funciona el reciclatge d'errors internament
Per a qui vulgui els detalls tècnics, això és el que passa en el pipeline d'entrenament modificat.
L'entrenament estàndard de difusió de vídeo utilitza una programació de soroll epsilon aplicada als fotogrames de referència nets x_0. El model aprèn a predir el soroll i recuperar el senyal original. En temps d'inferència, el model genera autoregressivament el fotograma t+1 condicionat a la seva predicció del fotograma t.
La diferència entre entrenament (entrades netes) i inferència (entrades autogenerades) s'anomena biaix d'exposició. El reciclatge d'errors aborda directament aquesta qüestió.
Detalls tècnics: objectiu d'entrenament modificat▼
Durant l'entrenament, el model genera periòdicament fotogrames amb els seus propis pesos actuals en lloc d'utilitzar dades de referència. Aquests fotogrames autogenerats, amb totes les seves imperfeccions, s'utilitzen després com a entrades de condicionament per als fotogrames posteriors de la seqüència d'entrenament.
L'hiperparàmetre clau és la ràtio de reciclatge r, que controla amb quina freqüència els fotogrames autogenerats substitueixen els fotogrames de referència durant l'entrenament. L'article troba que r = 0.3 (30% de fotogrames reciclats) aconsegueix un rendiment òptim, equilibrant la millora de l'estabilitat amb la qualitat del senyal d'entrenament.
La funció de pèrdua modificada continua sent l'objectiu de difusió estàndard. L'única diferència és la distribució de dades que veu el model durant l'entrenament. Per això no hi ha cap sobrecàrrega computacional en temps d'inferència.
Això és conceptualment similar al mostreig programat en models seqüència a seqüència, però adaptat al marc de difusió contínua. L'equip del VITA Lab atribueix aquesta connexió en el seu article, tot assenyalant que l'aplicació ingènua del mostreig programat als models de difusió no funciona. La seva contribució és la formulació específica que el fa estable per a la generació de vídeo.
L'avantatge del codi obert
Potser l'aspecte més emocionant: el codi és completament de codi obert a GitHub (vita-epfl/Stable-Video-Infinity). Això significa que qualsevol laboratori de recerca o empresa pot aplicar el reciclatge d'errors als seus models de vídeo existents.
El llançament de codi obert segueix una tendència creixent a la comunitat de recerca de vídeo amb IA. Models com LTX-2 i Wan 2.6 han demostrat que els enfocaments de codi obert poden competir amb alternatives propietàries.
Què significa això per a la indústria
El moment és remarcable. Ens trobem en plena cursa armamentista del vídeo amb IA, en què tots els actors principals, des de Runway fins a ByteDance, impulsen resultats més llargs i de més qualitat. El reciclatge d'errors podria ser la peça que falta per desbloquejar la pròxima generació de capacitats.
Per a cineastes i creadors
Per a investigadors
Per a empreses
Mirant endavant
El treball del VITA Lab representa un canvi fonamental en la manera com pensem la generació de vídeo amb IA. En lloc de construir models cada vegada més grans o afegir mecanismes complexos en temps d'inferència, la solució va ser simplement mostrar al model quin aspecte té la seva pròpia sortida.
L'article es presentarà a ICLR 2026, i diverses fonts de la indústria suggereixen que els principals proveïdors de models de vídeo ja n'estan explorant la integració. Si els models del món representen el futur de com la IA entén la física i l'espai, el reciclatge d'errors representa el futur de com la IA manté aquesta comprensió al llarg del temps.
L'era dels vídeos amb IA de 4 segons podria acabar abans del que ningú esperava. I no requerirà una arquitectura de model nova ni un pressupost de còmput de mil milions de dòlars. Només un bucle d'entrenament més intel·ligent.
Lectures addicionals
- La revolució del vídeo amb IA de codi obert: Com els models oberts estan reduint la distància amb els sistemes propietaris
- Simulació física en vídeo amb IA: Comprendre com els models aprenen la coherència física
- Transformers de difusió: L'arquitectura que impulsa la generació de vídeo moderna
Fonts
- International Conference on Learning Representations: Oral (estat d'ICLR 2026) (International Conference on Learning Representations)
- Investigadors d'EPFL VITA via arXiv: Stable Video Infinity admet la generació de vídeo de durada infinita sense inferència addicional… (Investigadors d'EPFL VITA via arXiv)

Enginyer d’IA de Lausana que combina la profunditat de la recerca amb la innovació pràctica. Divideix el seu temps entre arquitectures de models i cims alpins.
View profile →T’ha agradat el que has llegit?
Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.
Articles relacionats
Continua explorant amb aquestes publicacions relacionades

Eines de vídeo amb IA gratuïtes i il·limitades: què funciona el 2026
Les eines de vídeo amb IA gratuïtes i il·limitades solen basar-se en cues o funcionar localment. Descobreix què és realment il·limitat, què s'alenteix i com triar una configuració viable el 2026.

Extensor de vídeo amb IA: Fes el vídeo més llarg el 2026
Utilitza un extensor de vídeo amb IA per allargar un vídeo el 2026. Compara els límits d'extensió, preserva la continuïtat i tria un flux de treball per a clips generats o existents.

Les millors eines d'IA gratuïtes de text a vídeo: guia de 2026
Compara les millors eines d'IA gratuïtes de text a vídeo el 2026, inclosos els seus límits reals de crèdits, marques d'aigua, compromisos de configuració local i un pla de prova pràctic.