Meta PixelSalta al contingut principal
AlexisAlexis· Autoria d’IA, revisada per humans
9 min read
1622 paraules

EPFL Stable Video Infinity: com el reciclatge d'errors resol el problema més gran del vídeo amb IA

Un nou article Oral d'ICLR 2026 d'EPFL introdueix el reciclatge d'errors, una tècnica que elimina la deriva temporal i permet generar vídeo amb IA de diversos minuts sense cap cost de còmput addicional.

EPFL Stable Video Infinity: com el reciclatge d'errors resol el problema més gran del vídeo amb IA

Preparat per crear els teus propis vídeos amb IA?

Uneix-te a milers de creadors que utilitzen Bonega.ai

Tots els models de vídeo amb IA comparteixen el mateix secret incòmode. Genera un clip de 4 segons i els resultats semblen espectaculars. Supera els 15 segons i els personatges comencen a transformar-se, la física es descompon, els colors canvien i tota l'escena deriva cap a la incoherència. El VITA Lab d'EPFL acaba de publicar una solució, i podria ser l'article més important de l'any en generació de vídeo.

El problema de la deriva que ningú no havia resolt

Si has intentat generar vídeo amb IA de format llarg amb qualsevol model actual, coneixes la frustració. Sora 2 arriba a un màxim de 15 a 25 segons segons el teu pla. Runway Gen-4.5 arriba a 10. Kling 3.0 arriba a 15. El motiu no és el còmput ni la memòria. És la deriva temporal.

💡

La deriva temporal es produeix quan els models de vídeo autoregressius acumulen petits errors fotograma a fotograma. Cada fotograma generat es converteix en l'entrada del següent, i les petites imperfeccions es multipliquen exponencialment. Després d'uns quants centenars de fotogrames, el resultat gairebé no s'assembla al prompt original.

Això és fonamentalment similar al problema del "telèfon trencat". Xiuxiueja un missatge a prou persones i es torna irreconeixible. Els enfocaments anteriors intentaven combatre la deriva generant clips més curts i unint-los, però les transicions són visibles. Altres utilitzaven generació jeràrquica (primer fotogrames clau, després interpolació), cosa que ajuda però no elimina el problema central.

Arriba el reciclatge d'errors

L'article, titulat "Stable Video Infinity" i acceptat com a presentació Oral d'ICLR 2026, introdueix una idea enganyosament simple: ensenyar el model a gestionar els seus propis errors.

Oral
Estat d'ICLR 2026
0
Cost de còmput addicional
Minuts
Durada del vídeo

Aquesta és la idea clau. Durant l'entrenament, els models estàndard de difusió de vídeo aprenen a partir de dades de referència netes. No veuen mai la seva pròpia sortida generada. Quan es despleguen, de sobte han de treballar amb les seves pròpies prediccions imperfectes com a entrada, i no saben com gestionar el soroll.

El reciclatge d'errors resol això modificant el bucle d'entrenament:

Pas 1

Passada estàndard cap endavant

El model genera un segment de vídeo a partir de dades d'entrenament netes.

Pas 2

Recollida d'errors

Les prediccions del mateix model (amb les seves imperfeccions) es capturen en lloc de descartar-se.

Pas 3

Reciclatge d'errors

Aquestes sortides imperfectes es tornen a introduir com a entrada per a la següent iteració d'entrenament, ensenyant al model a generar una sortida estable fins i tot a partir de fotogrames sorollosos autogenerats.

Pas 4

Refinament iteratiu

Al llarg de molts cicles d'entrenament, el model aprèn un mecanisme robust d'autocorrecció que evita l'acumulació d'errors.

La bellesa d'aquest enfocament és la seva elegància. No hi ha arquitectures de model noves, ni paràmetres addicionals, ni trucs en temps d'inferència. El model simplement aprèn durant l'entrenament com són les condicions reals de desplegament.

Per què això importa més del que penses

Les implicacions van molt més enllà de generar vídeos de gats més llargs. Això és el que canvia:

Abans del reciclatge d'errors

  • Models de vídeo limitats a 4-20 segons
  • La consistència de l'escena es degrada ràpidament
  • La identitat del personatge deriva després d'uns segons
  • La física es torna cada vegada més irrealista
  • El color i la il·luminació canvien de manera imprevisible

Després del reciclatge d'errors

  • Generació coherent de vídeo de diversos minuts
  • Aspecte estable dels personatges de principi a fi
  • Física i relacions espacials coherents
  • Gradació de color i il·luminació fiables
  • Sense degradació visible de la qualitat amb el temps

Les xifres

L'equip del VITA Lab va provar Stable Video Infinity en múltiples arquitectures i benchmarks. Els resultats són sorprenents:

MètricaSense reciclatge d'errorsAmb reciclatge d'errorsMillora
FVD (com més baix, millor)Es degrada després de 4sEstable fins a 2min+Significativa
Consistència del personatgeBaixa per sota del 60% a 15sManté 90%+ a 2min~50% relatiu
Coherència temporalDeriva visible a 8sSense deriva visible a 2minSalt qualitatiu
Sobrecàrrega de còmputReferènciaReferència (augment del 0%)Cost zero
💡

L'aspecte de sobrecàrrega de còmput zero és crucial. El reciclatge d'errors és una tècnica de temps d'entrenament, no de temps d'inferència. Un cop entrenat, el model funciona exactament a la mateixa velocitat i cost que abans.

Com funciona el reciclatge d'errors internament

Per a qui vulgui els detalls tècnics, això és el que passa en el pipeline d'entrenament modificat.

L'entrenament estàndard de difusió de vídeo utilitza una programació de soroll epsilon aplicada als fotogrames de referència nets x_0. El model aprèn a predir el soroll i recuperar el senyal original. En temps d'inferència, el model genera autoregressivament el fotograma t+1 condicionat a la seva predicció del fotograma t.

La diferència entre entrenament (entrades netes) i inferència (entrades autogenerades) s'anomena biaix d'exposició. El reciclatge d'errors aborda directament aquesta qüestió.

Detalls tècnics: objectiu d'entrenament modificat

Durant l'entrenament, el model genera periòdicament fotogrames amb els seus propis pesos actuals en lloc d'utilitzar dades de referència. Aquests fotogrames autogenerats, amb totes les seves imperfeccions, s'utilitzen després com a entrades de condicionament per als fotogrames posteriors de la seqüència d'entrenament.

L'hiperparàmetre clau és la ràtio de reciclatge r, que controla amb quina freqüència els fotogrames autogenerats substitueixen els fotogrames de referència durant l'entrenament. L'article troba que r = 0.3 (30% de fotogrames reciclats) aconsegueix un rendiment òptim, equilibrant la millora de l'estabilitat amb la qualitat del senyal d'entrenament.

La funció de pèrdua modificada continua sent l'objectiu de difusió estàndard. L'única diferència és la distribució de dades que veu el model durant l'entrenament. Per això no hi ha cap sobrecàrrega computacional en temps d'inferència.

Això és conceptualment similar al mostreig programat en models seqüència a seqüència, però adaptat al marc de difusió contínua. L'equip del VITA Lab atribueix aquesta connexió en el seu article, tot assenyalant que l'aplicació ingènua del mostreig programat als models de difusió no funciona. La seva contribució és la formulació específica que el fa estable per a la generació de vídeo.

L'avantatge del codi obert

Potser l'aspecte més emocionant: el codi és completament de codi obert a GitHub (vita-epfl/Stable-Video-Infinity). Això significa que qualsevol laboratori de recerca o empresa pot aplicar el reciclatge d'errors als seus models de vídeo existents.

Per què importa el codi obert
Qualsevol model existent de difusió de vídeo es pot adaptar amb reciclatge d'errors. No calen canvis arquitectònics, només un bucle d'entrenament modificat. Això podria millorar Sora, Runway, Kling i tots els models de codi obert simultàniament.
Limitacions pràctiques
Requereix reentrenar o ajustar finament el model. Les empreses amb models propietaris han d'invertir còmput en el reentrenament. L'eficàcia de la tècnica pot variar entre arquitectures i escales diferents.

El llançament de codi obert segueix una tendència creixent a la comunitat de recerca de vídeo amb IA. Models com LTX-2 i Wan 2.6 han demostrat que els enfocaments de codi obert poden competir amb alternatives propietàries.

Què significa això per a la indústria

El moment és remarcable. Ens trobem en plena cursa armamentista del vídeo amb IA, en què tots els actors principals, des de Runway fins a ByteDance, impulsen resultats més llargs i de més qualitat. El reciclatge d'errors podria ser la peça que falta per desbloquejar la pròxima generació de capacitats.

🎬

Per a cineastes i creadors

La generació coherent de vídeo de format llarg permet contingut narratiu real. No només clips, sinó escenes, seqüències i, finalment, curtmetratges generats a partir d'un únic prompt.
🔬

Per a investigadors

El reciclatge d'errors ofereix un marc generalitzable. El mateix principi podria aplicar-se a la generació d'àudio, la síntesi d'escenes 3D i qualsevol model generatiu autoregressiu que pateixi deriva.
🏢

Per a empreses

La generació estable de format llarg fa viable el vídeo amb IA per a casos d'ús professionals: demostracions de producte, vídeos de formació i campanyes de màrqueting que requereixen qualitat coherent durant minuts de contingut.

Mirant endavant

El treball del VITA Lab representa un canvi fonamental en la manera com pensem la generació de vídeo amb IA. En lloc de construir models cada vegada més grans o afegir mecanismes complexos en temps d'inferència, la solució va ser simplement mostrar al model quin aspecte té la seva pròpia sortida.

L'article es presentarà a ICLR 2026, i diverses fonts de la indústria suggereixen que els principals proveïdors de models de vídeo ja n'estan explorant la integració. Si els models del món representen el futur de com la IA entén la física i l'espai, el reciclatge d'errors representa el futur de com la IA manté aquesta comprensió al llarg del temps.

L'era dels vídeos amb IA de 4 segons podria acabar abans del que ningú esperava. I no requerirà una arquitectura de model nova ni un pressupost de còmput de mil milions de dòlars. Només un bucle d'entrenament més intel·ligent.

Lectures addicionals


Fonts

Alexis
AlexisAI EngineerAI Author

Enginyer d’IA de Lausana que combina la profunditat de la recerca amb la innovació pràctica. Divideix el seu temps entre arquitectures de models i cims alpins.

View profile →

T’ha agradat el que has llegit?

Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.

Articles relacionats

Continua explorant amb aquestes publicacions relacionades

T’ha agradat aquest article?

Descobreix més idees i mantén-te al dia amb el nostre contingut més recent.