EPFL Stable Video Infinity: Bagaimana Daur Ulang Kesalahan Menyelesaikan Masalah Terbesar Video AI
Makalah ICLR 2026 lisan baru dari EPFL memperkenalkan teknik daur ulang kesalahan yang menghilangkan hanyutan temporal dan memungkinkan generasi video AI multi-menit tanpa biaya komputasi tambahan.

Masalah Hanyutan yang Tidak Ada yang Pecahkan
Jika Anda pernah mencoba menghasilkan video bentuk panjang AI dengan model apa pun saat ini, Anda tahu frustrasinya. Sora 2 terbatas pada 15 hingga 25 detik tergantung pada rencana Anda. Runway Gen-4.5 mencapai maksimum 10 detik. Kling 3.0 mendorong hingga 15 detik. Alasannya bukan komputasi atau memori. Ini adalah hanyutan temporal.
Hanyutan temporal terjadi ketika model video autoregresif mengumpulkan kesalahan kecil bingkai demi bingkai. Setiap bingkai yang dihasilkan menjadi masukan untuk yang berikutnya, dan ketidaksempurnaan kecil bertambah secara eksponensial. Setelah beberapa ratus bingkai, hasilnya hampir tidak menyerupai permintaan asli.
Ini pada dasarnya serupa dengan masalah "permainan telepon". Bisikkan pesan melalui cukup banyak orang dan itu menjadi tidak dapat dikenali. Pendekatan sebelumnya mencoba melawan hanyutan dengan menghasilkan klip yang lebih pendek dan menjahitnya bersama, tetapi jahitannya terlihat. Yang lain menggunakan generasi hierarki (bingkai kunci terlebih dahulu, interpolasi kedua), yang membantu tetapi tidak menghilangkan masalah inti.
Masuk Daur Ulang Kesalahan
Makalah, berjudul "Stable Video Infinity" dan diterima sebagai presentasi lisan ICLR 2026, memperkenalkan ide yang mudah terlihat namun sulit diimplementasikan: ajarkan model untuk menangani kesalahannya sendiri.
Wawasan kunci di sini adalah sebagai berikut. Selama pelatihan, model difusi video standar belajar dari data kebenaran dasar yang bersih. Mereka tidak pernah melihat keluaran yang mereka hasilkan. Saat digunakan, mereka tiba-tiba harus bekerja dengan prediksi imperfect mereka sendiri sebagai masukan, dan mereka tidak tahu cara menangani kebisingan.
Daur ulang kesalahan memperbaiki ini dengan memodifikasi loop pelatihan:
Lintasan Maju Standar
Model menghasilkan segmen video dari data pelatihan yang bersih.
Pengumpulan Kesalahan
Prediksi model sendiri (dengan ketidaksempurnaannya) ditangkap daripada dibuang.
Daur Ulang Kesalahan
Keluaran tidak sempurna ini diberi makan kembali sebagai masukan untuk iterasi pelatihan berikutnya, mengajarkan model untuk menghasilkan keluaran stabil bahkan dari bingkai yang dihasilkan sendiri dan bising.
Penyempurnaan Berulang
Selama banyak siklus pelatihan, model mempelajari mekanisme koreksi diri yang kuat yang mencegah akumulasi kesalahan.
Keindahan pendekatan ini terletak pada kesederhanaannya. Tidak ada arsitektur model baru, tidak ada parameter tambahan, tidak ada trik waktu inferensi. Model hanya belajar selama pelatihan apa yang terlihat seperti kondisi penerapan nyata.
Mengapa Ini Penting Lebih dari yang Anda Pikirkan
Implikasinya meluas jauh melampaui menghasilkan video kucing yang lebih lama. Berikut apa yang berubah:
Sebelum Daur Ulang Kesalahan
- Model video terbatas pada 4-20 detik
- Konsistensi adegan merosot dengan cepat
- Identitas karakter melayang setelah beberapa detik
- Fisika menjadi semakin tidak realistis
- Warna dan pencahayaan berubah tidak terduga
Setelah Daur Ulang Kesalahan
- Generasi video kohesif multi-menit
- Penampilan karakter yang stabil sepanjang waktu
- Fisika konsisten dan hubungan spasial
- Penilaian warna dan pencahayaan yang dapat diandalkan
- Tidak ada penurunan kualitas yang terlihat seiring waktu
Angka-Angkanya
Tim VITA Lab menguji Stable Video Infinity di berbagai arsitektur dan benchmark. Hasilnya sangat mencolok:
| Metrik | Tanpa Daur Ulang Kesalahan | Dengan Daur Ulang Kesalahan | Perbaikan |
|---|---|---|---|
| FVD (lebih rendah lebih baik) | Berkurang setelah 4 detik | Stabil melalui 2+ menit | Signifikan |
| Konsistensi Karakter | Turun di bawah 60% pada 15 detik | Mempertahankan 90%+ pada 2 menit | ~50% relatif |
| Koherensi Temporal | Hanyutan terlihat pada 8 detik | Tidak ada hanyutan terlihat pada 2 menit | Lompatan kualitatif |
| Overhead Komputasi | Baseline | Baseline (peningkatan 0%) | Biaya nol |
Aspek overhead komputasi nol sangat penting. Daur ulang kesalahan adalah teknik waktu pelatihan, bukan teknik waktu inferensi. Setelah dilatih, model berjalan pada kecepatan dan biaya yang persis sama seperti sebelumnya.
Bagaimana Daur Ulang Kesalahan Bekerja Di Bawah Tenda
Bagi mereka yang menginginkan detail teknis, inilah yang terjadi dalam saluran pelatihan yang dimodifikasi.
Pelatihan difusi video standar menggunakan jadwal kebisingan epsilon yang diterapkan pada bingkai kebenaran dasar yang bersih x_0. Model belajar memprediksi kebisingan dan memulihkan sinyal asli. Pada waktu inferensi, model secara autoregresif menghasilkan bingkai t+1 dengan syarat pada prediksi bingkai t itu.
Kesenjangan antara pelatihan (masukan bersih) dan inferensi (masukan yang dihasilkan sendiri) disebut bias eksposur. Daur ulang kesalahan secara langsung mengatasi ini.
Detail Teknis: Tujuan Pelatihan yang Dimodifikasiโผ
Selama pelatihan, model sesekali menghasilkan bingkai menggunakan bobot saat ini sendiri daripada menggunakan data kebenaran dasar. Bingkai yang dihasilkan sendiri ini, lengkap dengan ketidaksempurnaannya, kemudian digunakan sebagai masukan pengondisian untuk bingkai berikutnya dalam urutan pelatihan.
Parameter hiper kunci adalah rasio daur ulang r, yang mengontrol seberapa sering bingkai yang dihasilkan sendiri menggantikan bingkai kebenaran dasar selama pelatihan. Makalah menemukan bahwa r = 0.3 (30% bingkai yang didaur ulang) mencapai kinerja optimal, menyeimbangkan peningkatan stabilitas dengan kualitas sinyal pelatihan.
Fungsi kerugian yang dimodifikasi tetap menjadi tujuan difusi standar. Satu-satunya perbedaan adalah distribusi data yang dilihat model selama pelatihan. Inilah mengapa tidak ada overhead komputasi pada waktu inferensi.
Ini secara konseptual mirip dengan pengambilan sampel terjadwal dalam model urutan-ke-urutan, tetapi disesuaikan untuk kerangka difusi berkelanjutan. Tim VITA Lab mengkredit koneksi ini dalam makalah mereka sambil mencatat bahwa penerapan naif pengambilan sampel terjadwal ke model difusi tidak berfungsi. Kontribusi mereka adalah formulasi spesifik yang membuatnya stabil untuk generasi video.
Keuntungan Sumber Terbuka
Mungkin aspek paling menarik: kodenya sepenuhnya sumber terbuka di GitHub (vita-epfl/Stable-Video-Infinity). Ini berarti laboratorium penelitian apa pun atau perusahaan dapat menerapkan daur ulang kesalahan ke model video mereka yang ada.
Rilis sumber terbuka mengikuti tren yang berkembang dalam komunitas penelitian video AI. Model seperti LTX-2 dan Wan 2.6 telah menunjukkan bahwa pendekatan sumber terbuka dapat bersaing dengan alternatif proprietary.
Apa Artinya Ini untuk Industri
Waktunya luar biasa. Kami berada di tengah perlombaan senjata video AI di mana setiap pemain utama, dari Runway hingga ByteDance, mendorong keluaran yang lebih lama dan berkualitas lebih tinggi. Daur ulang kesalahan mungkin menjadi bagian yang hilang yang membuka kemampuan generasi berikutnya.
Untuk Pembuat Film dan Kreator
Untuk Peneliti
Untuk Perusahaan
Ke Depan
Pekerjaan VITA Lab mewakili perubahan fundamental dalam cara kami berpikir tentang generasi video AI. Alih-alih membangun model yang semakin besar atau menambahkan mekanisme waktu inferensi yang kompleks, solusinya adalah cukup menunjukkan kepada model apa yang terlihat seperti keluarannya sendiri.
Makalah akan disajikan di ICLR 2026, dan beberapa sumber industri menunjukkan bahwa penyedia model video utama sudah mengeksplorasi integrasi. Jika model dunia mewakili masa depan cara AI memahami fisika dan ruang, daur ulang kesalahan mewakili masa depan cara AI mempertahankan pemahaman itu dari waktu ke waktu.
Era video AI 4 detik mungkin berakhir lebih cepat dari yang diharapkan siapa pun. Dan tidak akan memerlukan arsitektur model baru atau anggaran komputasi senilai satu miliar dolar. Hanya loop pelatihan yang lebih cerdas.
Bacaan Lebih Lanjut
- Revolusi Video AI Sumber Terbuka: Bagaimana model terbuka menutup celah dengan sistem proprietary
- Simulasi Fisika dalam Video AI: Memahami bagaimana model mempelajari konsistensi fisik
- Transformator Difusi: Arsitektur yang mendukung model generasi video modern

Insinyur AI dari Lausanne yang memadukan kedalaman riset dengan inovasi praktis. Membagi waktu antara arsitektur model dan puncak Alpen.
View profile โSuka dengan yang Anda baca?
Ubah ide Anda menjadi video AI berdurasi tak terbatas dalam hitungan menit.
Artikel Terkait
Lanjutkan penjelajahan dengan postingan terkait ini

Google Veo Gratis: Batasan di Google Vids (2026)
Akses gratis Google Veo di Google Vids tidak berlaku untuk semua orang. Lihat batas 50 video per bulan, output 720p, klip gambar 8 detik, dan aturan kelayakan.

AI Video Extender: Membuat Video Lebih Panjang pada 2026
Gunakan AI video extender untuk membuat video lebih panjang pada 2026. Bandingkan input, biaya ekstensi lima detik, dan alur kerja penyuntingan yang mengutamakan kontinuitas.

Alat Video AI Gratis Tanpa Batas: Apa yang Berfungsi pada 2026
Alat video AI gratis tanpa batas biasanya berbasis antrean atau lokal. Pelajari apa yang benar-benar tanpa batas, apa yang memperlambat proses, dan cara memilih setup 2026 yang dapat digunakan.