EPFL Stable Video Infinity: Bagaimana Kitar Semula Ralat Menyelesaikan Masalah Terbesar Video AI
Kertas Oral ICLR 2026 baharu daripada EPFL memperkenalkan kitar semula ralat, teknik yang menghapuskan hanyutan temporal dan membolehkan penjanaan video AI berbilang minit tanpa kos pengkomputeran tambahan.

Masalah Hanyutan yang Tiada Siapa Selesaikan
Jika anda pernah cuba menjana video AI bentuk panjang dengan mana-mana model semasa, anda pasti mengetahui kekecewaannya. Sora 2 dihadkan kepada 15 hingga 25 saat bergantung pada pelan anda. Runway Gen-4.5 maksimum pada 10. Kling 3.0 mencapai 15. Sebabnya bukan pengkomputeran atau memori. Ia ialah hanyutan temporal.
Hanyutan temporal berlaku apabila model video autoregresif mengumpulkan ralat kecil dari bingkai ke bingkai. Setiap bingkai yang dijana menjadi input untuk yang seterusnya, dan ketidaksempurnaan kecil berganda secara eksponen. Selepas beberapa ratus bingkai, outputnya hampir tidak menyerupai gesaan asal.
Ini pada asasnya serupa dengan masalah "permainan telefon". Bisikkan mesej melalui cukup ramai orang dan ia menjadi tidak dapat dikenali. Pendekatan terdahulu cuba melawan hanyutan dengan menjana klip lebih pendek dan mencantumkannya, tetapi sambungannya jelas kelihatan. Yang lain menggunakan penjanaan berhierarki (bingkai utama dahulu, interpolasi kemudian), yang membantu tetapi tidak menghapuskan isu teras.
Kitar Semula Ralat Diperkenalkan
Kertas itu, bertajuk "Stable Video Infinity" dan diterima sebagai pembentangan Oral ICLR 2026, memperkenalkan idea yang kelihatan mudah: ajar model untuk mengendalikan kesilapannya sendiri.
Inilah wawasan utamanya. Semasa latihan, model difusi video standard belajar daripada data asas kebenaran yang bersih. Ia tidak pernah melihat output yang dijananya sendiri. Apabila digunakan, ia tiba-tiba perlu bekerja dengan ramalan tidak sempurnanya sendiri sebagai input, dan ia tidak tahu cara mengendalikan hingar tersebut.
Kitar semula ralat membetulkannya dengan mengubah suai gelung latihan:
Laluan Hadapan Standard
Model menjana segmen video daripada data latihan bersih.
Pengumpulan Ralat
Ramalan model sendiri (berserta ketidaksempurnaannya) ditangkap dan bukannya dibuang.
Kitar Semula Ralat
Output tidak sempurna ini dimasukkan semula sebagai input untuk iterasi latihan seterusnya, mengajar model menjana output stabil walaupun daripada bingkai hingar yang dijana sendiri.
Penambahbaikan Berulang
Melalui banyak kitaran latihan, model mempelajari mekanisme pembetulan kendiri yang kukuh untuk mencegah pengumpulan ralat.
Keindahan pendekatan ini terletak pada keanggunannya. Tiada seni bina model baharu, tiada parameter tambahan, tiada helah pada masa inferens. Model hanya mempelajari keadaan penggunaan sebenar semasa latihan.
Mengapa Ini Lebih Penting daripada Yang Anda Sangka
Implikasinya melangkaui penjanaan video kucing yang lebih panjang. Inilah yang berubah:
Sebelum Kitar Semula Ralat
- Model video terhad kepada 4-20 saat
- Konsistensi adegan merosot dengan cepat
- Identiti watak hanyut selepas beberapa saat
- Fizik menjadi semakin tidak realistik
- Warna dan pencahayaan berubah secara tidak menentu
Selepas Kitar Semula Ralat
- Penjanaan video koheren berbilang minit
- Penampilan watak stabil sepanjang video
- Fizik dan hubungan ruang yang konsisten
- Penggredan warna dan pencahayaan yang boleh dipercayai
- Tiada kemerosotan kualiti yang ketara dari semasa ke semasa
Angka-Angkanya
Pasukan VITA Lab menguji Stable Video Infinity merentasi pelbagai seni bina dan penanda aras. Hasilnya amat ketara:
| Metrik | Tanpa Kitar Semula Ralat | Dengan Kitar Semula Ralat | Peningkatan |
|---|---|---|---|
| FVD (lebih rendah adalah lebih baik) | Merosot selepas 4s | Stabil sehingga 2min+ | Ketara |
| Konsistensi Watak | Turun di bawah 60% pada 15s | Mengekalkan 90%+ pada 2min | ~50% relatif |
| Koheren Temporal | Hanyutan ketara pada 8s | Tiada hanyutan ketara pada 2min | Lonjakan kualitatif |
| Overhed Pengkomputeran | Garis dasar | Garis dasar (peningkatan 0%) | Kos sifar |
Aspek overhed pengkomputeran sifar adalah penting. Kitar semula ralat ialah teknik pada masa latihan, bukan pada masa inferens. Setelah dilatih, model berjalan pada kelajuan dan kos yang sama seperti sebelumnya.
Cara Kitar Semula Ralat Berfungsi di Sebalik Tabir
Bagi mereka yang mahu butiran teknikal, inilah yang berlaku dalam saluran latihan yang diubah suai.
Latihan difusi video standard menggunakan jadual hingar epsilon yang digunakan pada bingkai asas kebenaran bersih x_0. Model belajar meramal hingar dan memulihkan isyarat asal. Pada masa inferens, model menjana bingkai t+1 secara autoregresif berdasarkan ramalannya terhadap bingkai t.
Jurang antara latihan (input bersih) dan inferens (input yang dijana sendiri) dipanggil bias pendedahan. Kitar semula ralat menangani perkara ini secara langsung.
Butiran Teknikal: Objektif Latihan Diubah Suai▼
Semasa latihan, model secara berkala menjana bingkai menggunakan wajaran semasanya sendiri dan bukannya menggunakan data asas kebenaran. Bingkai yang dijana sendiri ini, lengkap dengan ketidaksempurnaannya, kemudiannya digunakan sebagai input pengkondisian untuk bingkai berikutnya dalam urutan latihan.
Hiperparameter utama ialah nisbah kitar semula r, yang mengawal kekerapan bingkai yang dijana sendiri menggantikan bingkai asas kebenaran semasa latihan. Kertas itu mendapati bahawa r = 0.3 (30% bingkai dikitar semula) mencapai prestasi optimum, menyeimbangkan peningkatan kestabilan dengan kualiti isyarat latihan.
Fungsi kehilangan yang diubah suai kekal sebagai objektif difusi standard. Satu-satunya perbezaan ialah taburan data yang dilihat model semasa latihan. Inilah sebabnya tiada overhed pengkomputeran pada masa inferens.
Ini secara konsepnya serupa dengan pensampelan berjadual dalam model urutan-ke-urutan, tetapi disesuaikan untuk rangka kerja difusi berterusan. Pasukan VITA Lab mengiktiraf hubungan ini dalam kertas mereka sambil menyatakan bahawa penggunaan pensampelan berjadual secara naif pada model difusi tidak berfungsi. Sumbangan mereka ialah perumusan khusus yang menjadikannya stabil untuk penjanaan video.
Kelebihan Sumber Terbuka
Mungkin aspek paling mengujakan: kod ini sumber terbuka sepenuhnya di GitHub (vita-epfl/Stable-Video-Infinity). Ini bermakna mana-mana makmal penyelidikan atau syarikat boleh menggunakan kitar semula ralat pada model video sedia ada mereka.
Keluaran sumber terbuka ini mengikuti trend yang semakin berkembang dalam komuniti penyelidikan video AI. Model seperti LTX-2 dan Wan 2.6 telah menunjukkan bahawa pendekatan sumber terbuka boleh bersaing dengan alternatif proprietari.
Apa Maknanya untuk Industri
Masanya sangat luar biasa. Kita berada di tengah-tengah perlumbaan senjata video AI, dengan setiap pemain utama, daripada Runway hingga ByteDance, berusaha menghasilkan output yang lebih panjang dan berkualiti tinggi. Kitar semula ralat mungkin merupakan komponen yang hilang untuk membuka keupayaan generasi seterusnya.
Untuk Pembikin Filem dan Pencipta
Untuk Penyelidik
Untuk Perusahaan
Melangkah ke Hadapan
Kerja VITA Lab mewakili perubahan asas dalam cara kita memikirkan penjanaan video AI. Daripada membina model yang semakin besar atau menambah mekanisme kompleks pada masa inferens, penyelesaiannya ialah dengan menunjukkan kepada model rupa outputnya sendiri.
Kertas itu akan dibentangkan di ICLR 2026, dan beberapa sumber industri mencadangkan bahawa penyedia model video utama sudah meneroka integrasi. Jika model dunia mewakili masa depan cara AI memahami fizik dan ruang, kitar semula ralat mewakili masa depan cara AI mengekalkan pemahaman itu dari semasa ke semasa.
Era video AI 4 saat mungkin berakhir lebih awal daripada jangkaan sesiapa. Dan ia tidak memerlukan seni bina model baharu atau bajet pengkomputeran berbilion dolar. Hanya gelung latihan yang lebih pintar.
Bacaan Lanjut
- Revolusi Video AI Sumber Terbuka: Bagaimana model terbuka merapatkan jurang dengan sistem proprietari
- Simulasi Fizik dalam Video AI: Memahami cara model mempelajari konsistensi fizikal
- Transformer Difusi: Seni bina yang menggerakkan penjanaan video moden
Sumber
- International Conference on Learning Representations: Oral (Status ICLR 2026) (International Conference on Learning Representations)
- Penyelidik EPFL VITA melalui arXiv: Stable Video Infinity menyokong penjanaan video berpanjangan tanpa inferens tambahan… (Penyelidik EPFL VITA melalui arXiv)

Jurutera AI dari Lausanne yang menggabungkan kedalaman penyelidikan dengan inovasi praktikal. Membahagikan masa antara seni bina model dan puncak alpine.
View profile →Artikel Berkaitan
Teruskan meneroka dengan catatan berkaitan ini

Alat Video AI Percuma Tanpa Had: Apa yang Berfungsi pada 2026
Alat video AI percuma tanpa had biasanya berasaskan giliran atau tempatan. Ketahui perkara yang benar-benar tanpa had, perkara yang melambatkan proses, dan cara memilih persediaan 2026 yang praktikal.

Penyambung Video AI: Jadikan Video Lebih Panjang pada 2026
Gunakan penyambung video AI untuk menjadikan video lebih panjang pada 2026. Bandingkan had sambungan, kekalkan kesinambungan, dan pilih aliran kerja untuk klip yang dijana atau sedia ada.

Alat AI Teks-ke-Video Percuma Terbaik: Panduan 2026
Bandingkan alat AI teks-ke-video percuma terbaik pada 2026, termasuk had kredit sebenar, tera air, pertukaran persediaan setempat, dan pelan ujian praktikal.