EPFL Stable Video Infinity: Πώς η ανακύκλωση σφαλμάτων λύνει το μεγαλύτερο πρόβλημα του AI video
Μια νέα προφορική παρουσίαση στο ICLR 2026 από το EPFL εισάγει την ανακύκλωση σφαλμάτων, μια τεχνική που εξαλείφει τη χρονική απόκλιση και επιτρέπει παραγωγή AI video πολλών λεπτών χωρίς επιπλέον υπολογιστικό κόστος.

Είστε έτοιμοι να δημιουργήσετε τα δικά σας βίντεο με ΤΝ;
Γίνετε μέλος της κοινότητας χιλιάδων δημιουργών που χρησιμοποιούν το Bonega.ai
Το πρόβλημα της απόκλισης που κανείς δεν έλυσε
Αν έχετε δοκιμάσει να δημιουργήσετε AI video μεγάλης διάρκειας με οποιοδήποτε τρέχον μοντέλο, γνωρίζετε την απογοήτευση. Το Sora 2 περιορίζεται σε 15 έως 25 δευτερόλεπτα, ανάλογα με το πρόγραμμά σας. Το Runway Gen-4.5 φτάνει το πολύ τα 10. Το Kling 3.0 φτάνει τα 15. Ο λόγος δεν είναι η υπολογιστική ισχύς ή η μνήμη. Είναι η χρονική απόκλιση.
Η χρονική απόκλιση συμβαίνει όταν τα αυτοπαλινδρομικά μοντέλα βίντεο συσσωρεύουν μικρά σφάλματα καρέ προς καρέ. Κάθε παραγόμενο καρέ γίνεται η είσοδος για το επόμενο και οι μικροσκοπικές ατέλειες πολλαπλασιάζονται εκθετικά. Μετά από μερικές εκατοντάδες καρέ, η έξοδος μετά βίας μοιάζει με το αρχικό prompt.
Αυτό μοιάζει θεμελιωδώς με το πρόβλημα του «σπασμένου τηλεφώνου». Ψιθυρίστε ένα μήνυμα μέσω αρκετών ανθρώπων και γίνεται αγνώριστο. Προηγούμενες προσεγγίσεις προσπάθησαν να καταπολεμήσουν την απόκλιση δημιουργώντας συντομότερα κλιπ και ενώνοντάς τα, όμως οι ενώσεις είναι ορατές. Άλλες χρησιμοποίησαν ιεραρχική δημιουργία (βασικά καρέ πρώτα, παρεμβολή μετά), κάτι που βοηθά αλλά δεν εξαλείφει το βασικό πρόβλημα.
Η ανακύκλωση σφαλμάτων
Η εργασία, με τίτλο "Stable Video Infinity" και αποδεκτή ως προφορική παρουσίαση στο ICLR 2026, εισάγει μια παραπλανητικά απλή ιδέα: διδάξτε στο μοντέλο να διαχειρίζεται τα δικά του λάθη.
Ακολουθεί η βασική ιδέα. Κατά την εκπαίδευση, τα τυπικά μοντέλα video diffusion μαθαίνουν από καθαρά δεδομένα αναφοράς. Δεν βλέπουν ποτέ τη δική τους παραγόμενη έξοδο. Όταν αναπτύσσονται, ξαφνικά πρέπει να λειτουργούν με τις δικές τους ατελείς προβλέψεις ως είσοδο και δεν γνωρίζουν πώς να διαχειριστούν τον θόρυβο.
Η ανακύκλωση σφαλμάτων το διορθώνει αυτό τροποποιώντας τον βρόχο εκπαίδευσης:
Τυπικό Forward Pass
Το μοντέλο δημιουργεί ένα τμήμα βίντεο από καθαρά δεδομένα εκπαίδευσης.
Συλλογή Σφαλμάτων
Οι προβλέψεις του ίδιου του μοντέλου, μαζί με τις ατέλειές τους, καταγράφονται αντί να απορρίπτονται.
Ανακύκλωση Σφαλμάτων
Αυτές οι ατελείς έξοδοι τροφοδοτούνται ξανά ως είσοδος για την επόμενη επανάληψη εκπαίδευσης, διδάσκοντας στο μοντέλο να παράγει σταθερή έξοδο ακόμη και από θορυβώδη, αυτοπαραγόμενα καρέ.
Επαναληπτική Βελτίωση
Σε πολλούς κύκλους εκπαίδευσης, το μοντέλο μαθαίνει έναν ανθεκτικό μηχανισμό αυτοδιόρθωσης που αποτρέπει τη συσσώρευση σφαλμάτων.
Η ομορφιά αυτής της προσέγγισης βρίσκεται στην κομψότητά της. Δεν υπάρχουν νέες αρχιτεκτονικές μοντέλων, πρόσθετες παράμετροι ή τεχνάσματα κατά τον χρόνο inference. Το μοντέλο απλώς μαθαίνει κατά την εκπαίδευση πώς είναι οι πραγματικές συνθήκες ανάπτυξης.
Γιατί αυτό έχει μεγαλύτερη σημασία απ' όσο νομίζετε
Οι επιπτώσεις ξεπερνούν κατά πολύ τη δημιουργία μεγαλύτερων βίντεο με γάτες. Δείτε τι αλλάζει:
Πριν από την ανακύκλωση σφαλμάτων
- Τα μοντέλα βίντεο περιορίζονται σε 4-20 δευτερόλεπτα
- Η συνέπεια της σκηνής υποβαθμίζεται γρήγορα
- Η ταυτότητα του χαρακτήρα αποκλίνει μετά από λίγα δευτερόλεπτα
- Η φυσική γίνεται όλο και πιο μη ρεαλιστική
- Το χρώμα και ο φωτισμός μεταβάλλονται απρόβλεπτα
Μετά την ανακύκλωση σφαλμάτων
- Συνεκτική παραγωγή βίντεο πολλών λεπτών
- Σταθερή εμφάνιση χαρακτήρων σε όλη τη διάρκεια
- Συνεπής φυσική και χωρικές σχέσεις
- Αξιόπιστη χρωματική διόρθωση και φωτισμός
- Καμία ορατή υποβάθμιση ποιότητας με την πάροδο του χρόνου
Οι αριθμοί
Η ομάδα του VITA Lab δοκίμασε το Stable Video Infinity σε πολλαπλές αρχιτεκτονικές και benchmarks. Τα αποτελέσματα είναι εντυπωσιακά:
| Μετρική | Χωρίς ανακύκλωση σφαλμάτων | Με ανακύκλωση σφαλμάτων | Βελτίωση |
|---|---|---|---|
| FVD (χαμηλότερο είναι καλύτερο) | Υποβαθμίζεται μετά από 4s | Σταθερό έως 2min+ | Σημαντική |
| Συνέπεια χαρακτήρα | Πέφτει κάτω από 60% στα 15s | Διατηρεί 90%+ στα 2min | ~50% σχετική |
| Χρονική συνοχή | Ορατή απόκλιση στα 8s | Καμία ορατή απόκλιση στα 2min | Ποιοτικό άλμα |
| Υπολογιστική επιβάρυνση | Βάση αναφοράς | Βάση αναφοράς (αύξηση 0%) | Μηδενικό κόστος |
Η πτυχή της μηδενικής υπολογιστικής επιβάρυνσης είναι κρίσιμη. Η ανακύκλωση σφαλμάτων είναι μια τεχνική χρόνου εκπαίδευσης, όχι χρόνου inference. Αφού εκπαιδευτεί, το μοντέλο λειτουργεί ακριβώς με την ίδια ταχύτητα και κόστος όπως πριν.
Πώς λειτουργεί η ανακύκλωση σφαλμάτων εσωτερικά
Για όσους θέλουν τις τεχνικές λεπτομέρειες, δείτε τι συμβαίνει στον τροποποιημένο αγωγό εκπαίδευσης.
Η τυπική εκπαίδευση video diffusion χρησιμοποιεί ένα πρόγραμμα θορύβου epsilon που εφαρμόζεται σε καθαρά καρέ αναφοράς x_0. Το μοντέλο μαθαίνει να προβλέπει τον θόρυβο και να ανακτά το αρχικό σήμα. Κατά τον χρόνο inference, το μοντέλο δημιουργεί αυτοπαλινδρομικά το καρέ t+1 υπό συνθήκη της πρόβλεψής του για το καρέ t.
Το χάσμα μεταξύ εκπαίδευσης (καθαρές είσοδοι) και inference (αυτοπαραγόμενες είσοδοι) ονομάζεται μεροληψία έκθεσης. Η ανακύκλωση σφαλμάτων το αντιμετωπίζει άμεσα.
Τεχνικές λεπτομέρειες: Τροποποιημένος στόχος εκπαίδευσης▼
Κατά την εκπαίδευση, το μοντέλο δημιουργεί περιοδικά καρέ χρησιμοποιώντας τα δικά του τρέχοντα βάρη αντί για δεδομένα αναφοράς. Αυτά τα αυτοπαραγόμενα καρέ, μαζί με τις ατέλειές τους, χρησιμοποιούνται έπειτα ως είσοδοι συνθήκης για τα επόμενα καρέ στην ακολουθία εκπαίδευσης.
Η βασική υπερπαράμετρος είναι ο λόγος ανακύκλωσης r, ο οποίος ελέγχει πόσο συχνά τα αυτοπαραγόμενα καρέ αντικαθιστούν τα καρέ αναφοράς κατά την εκπαίδευση. Η εργασία διαπιστώνει ότι r = 0.3 (30% ανακυκλωμένα καρέ) επιτυγχάνει βέλτιστη απόδοση, εξισορροπώντας τη βελτίωση σταθερότητας με την ποιότητα του σήματος εκπαίδευσης.
Η τροποποιημένη συνάρτηση απώλειας παραμένει ο τυπικός στόχος diffusion. Η μόνη διαφορά είναι η κατανομή δεδομένων που βλέπει το μοντέλο κατά την εκπαίδευση. Γι' αυτό δεν υπάρχει υπολογιστική επιβάρυνση κατά τον χρόνο inference.
Αυτό είναι εννοιολογικά παρόμοιο με το scheduled sampling στα μοντέλα sequence-to-sequence, αλλά προσαρμοσμένο στο συνεχές πλαίσιο diffusion. Η ομάδα του VITA Lab αναγνωρίζει αυτή τη σύνδεση στην εργασία της, επισημαίνοντας παράλληλα ότι η αφελής εφαρμογή του scheduled sampling σε μοντέλα diffusion δεν λειτουργεί. Η συνεισφορά τους είναι η συγκεκριμένη διατύπωση που το καθιστά σταθερό για τη δημιουργία βίντεο.
Το πλεονέκτημα του open-source
Ίσως η πιο συναρπαστική πτυχή: ο κώδικας είναι πλήρως open-source στο GitHub (vita-epfl/Stable-Video-Infinity). Αυτό σημαίνει ότι κάθε ερευνητικό εργαστήριο ή εταιρεία μπορεί να εφαρμόσει ανακύκλωση σφαλμάτων στα υπάρχοντα μοντέλα βίντεο.
Η open-source κυκλοφορία ακολουθεί μια αυξανόμενη τάση στην ερευνητική κοινότητα AI video. Μοντέλα όπως το LTX-2 και το Wan 2.6 έχουν δείξει ότι οι open-source προσεγγίσεις μπορούν να ανταγωνιστούν ιδιόκτητες εναλλακτικές.
Τι σημαίνει αυτό για τον κλάδο
Ο χρονισμός είναι αξιοσημείωτος. Βρισκόμαστε στη μέση μιας κούρσας εξοπλισμών AI video, όπου κάθε σημαντικός παίκτης, από το Runway έως το ByteDance, επιδιώκει μεγαλύτερη και υψηλότερης ποιότητας έξοδο. Η ανακύκλωση σφαλμάτων θα μπορούσε να είναι το κομμάτι που έλειπε και που ξεκλειδώνει την επόμενη γενιά δυνατοτήτων.
Για δημιουργούς ταινιών και περιεχομένου
Για ερευνητές
Για επιχειρήσεις
Κοιτάζοντας μπροστά
Η δουλειά του VITA Lab αντιπροσωπεύει μια θεμελιώδη αλλαγή στον τρόπο με τον οποίο σκεφτόμαστε τη δημιουργία AI video. Αντί να κατασκευάσουμε ολοένα μεγαλύτερα μοντέλα ή να προσθέσουμε πολύπλοκους μηχανισμούς χρόνου inference, η λύση ήταν απλώς να δείξουμε στο μοντέλο πώς μοιάζει η δική του έξοδος.
Η εργασία θα παρουσιαστεί στο ICLR 2026 και αρκετές πηγές του κλάδου υποδεικνύουν ότι μεγάλοι πάροχοι μοντέλων βίντεο διερευνούν ήδη την ενσωμάτωσή της. Αν τα world models αντιπροσωπεύουν το μέλλον του τρόπου με τον οποίο το AI κατανοεί τη φυσική και τον χώρο, η ανακύκλωση σφαλμάτων αντιπροσωπεύει το μέλλον του τρόπου με τον οποίο το AI διατηρεί αυτή την κατανόηση με την πάροδο του χρόνου.
Η εποχή των AI video 4 δευτερολέπτων ίσως τελειώσει νωρίτερα από όσο περίμενε κανείς. Και δεν θα απαιτήσει νέα αρχιτεκτονική μοντέλου ή υπολογιστικό προϋπολογισμό δισεκατομμυρίων δολαρίων. Μόνο έναν εξυπνότερο βρόχο εκπαίδευσης.
Περαιτέρω ανάγνωση
- Η επανάσταση του Open-Source AI Video: Πώς τα ανοιχτά μοντέλα μειώνουν το χάσμα με τα ιδιόκτητα συστήματα
- Προσομοίωση φυσικής στο AI Video: Κατανόηση του τρόπου με τον οποίο τα μοντέλα μαθαίνουν φυσική συνέπεια
- Diffusion Transformers: Η αρχιτεκτονική που τροφοδοτεί τη σύγχρονη δημιουργία βίντεο
Πηγές
- International Conference on Learning Representations: Προφορική παρουσίαση (Κατάσταση ICLR 2026) (International Conference on Learning Representations)
- Ερευνητές EPFL VITA μέσω arXiv: Το Stable Video Infinity υποστηρίζει δημιουργία βίντεο απεριόριστης διάρκειας χωρίς πρόσθετο inference… (Ερευνητές EPFL VITA μέσω arXiv)

Μηχανικός ΤΝ από τη Λωζάνη που συνδυάζει ερευνητικό βάθος με πρακτική καινοτομία. Μοιράζει τον χρόνο του ανάμεσα σε αρχιτεκτονικές μοντέλων και αλπικές κορυφές.
View profile →Σας άρεσε ό,τι διαβάσατε;
Μετατρέψτε τις ιδέες σας σε βίντεο ΤΝ απεριόριστης διάρκειας μέσα σε λίγα λεπτά.
Σχετικά άρθρα
Συνεχίστε την εξερεύνηση με αυτές τις σχετικές αναρτήσεις

Τα καλύτερα δωρεάν εργαλεία AI από κείμενο σε βίντεο: Οδηγός 2026
Συγκρίνετε τα καλύτερα δωρεάν εργαλεία AI από κείμενο σε βίντεο το 2026, συμπεριλαμβανομένων των πραγματικών ορίων credits, των υδατογραφημάτων, των συμβιβασμών της τοπικής εγκατάστασης και ενός πρακτικού πλάνου δοκιμών.

Δυνατότητες Grok xAI Image to Video: Οδηγός API Ιουνίου 2026
Οι δυνατότητες image-to-video του Grok xAI τον Ιούνιο του 2026: πώς το Grok Imagine χειρίζεται εικόνες, prompts, εγγενή ήχο, API workflows, ασφάλεια, λογική τιμολόγησης και συγκρίσεις με Sora/Veo.

Τιμολόγηση εργαλείων AI Video το 2026: Πώς να κάνετε προϋπολογισμό χωρίς να καίτε credits
Τα εργαλεία AI video δεν είναι πια δύσκολο να βρεθούν. Το δύσκολο είναι να επιλέξετε το σωστό μοντέλο τιμολόγησης για τη ροή εργασίας σας. Ακολουθεί ένας πρακτικός οδηγός προϋπολογισμού για δημιουργούς και ομάδες.