Meta PixelLewati ke konten utama
AlexisAlexisยท Penulis AI, ditinjau oleh manusia
7 min read
1373 kata

EPFL Stable Video Infinity: Bagaimana Daur Ulang Kesalahan Menyelesaikan Masalah Terbesar Video AI

Makalah ICLR 2026 lisan baru dari EPFL memperkenalkan teknik daur ulang kesalahan yang menghilangkan hanyutan temporal dan memungkinkan generasi video AI multi-menit tanpa biaya komputasi tambahan.

EPFL Stable Video Infinity: Bagaimana Daur Ulang Kesalahan Menyelesaikan Masalah Terbesar Video AI

Siap membuat video AI Anda sendiri?

Bergabunglah dengan ribuan kreator yang menggunakan Bonega.ai

Setiap model video AI memiliki rahasia yang sama tidak menyenangkan. Hasilkan klip 4 detik dan hasilnya terlihat memukau. Dorong melampaui 15 detik dan karakter mulai berubah bentuk, fisika terpecah, warna bergeser, dan seluruh adegan melayang ke dalam ketidakselarasan. Lab VITA EPFL baru saja mempublikasikan solusi, dan ini mungkin makalah paling penting dalam generasi video tahun ini.

Masalah Hanyutan yang Tidak Ada yang Pecahkan

Jika Anda pernah mencoba menghasilkan video bentuk panjang AI dengan model apa pun saat ini, Anda tahu frustrasinya. Sora 2 terbatas pada 15 hingga 25 detik tergantung pada rencana Anda. Runway Gen-4.5 mencapai maksimum 10 detik. Kling 3.0 mendorong hingga 15 detik. Alasannya bukan komputasi atau memori. Ini adalah hanyutan temporal.

๐Ÿ’ก

Hanyutan temporal terjadi ketika model video autoregresif mengumpulkan kesalahan kecil bingkai demi bingkai. Setiap bingkai yang dihasilkan menjadi masukan untuk yang berikutnya, dan ketidaksempurnaan kecil bertambah secara eksponensial. Setelah beberapa ratus bingkai, hasilnya hampir tidak menyerupai permintaan asli.

Ini pada dasarnya serupa dengan masalah "permainan telepon". Bisikkan pesan melalui cukup banyak orang dan itu menjadi tidak dapat dikenali. Pendekatan sebelumnya mencoba melawan hanyutan dengan menghasilkan klip yang lebih pendek dan menjahitnya bersama, tetapi jahitannya terlihat. Yang lain menggunakan generasi hierarki (bingkai kunci terlebih dahulu, interpolasi kedua), yang membantu tetapi tidak menghilangkan masalah inti.

Masuk Daur Ulang Kesalahan

Makalah, berjudul "Stable Video Infinity" dan diterima sebagai presentasi lisan ICLR 2026, memperkenalkan ide yang mudah terlihat namun sulit diimplementasikan: ajarkan model untuk menangani kesalahannya sendiri.

Lisan
Status ICLR 2026
0
Biaya Komputasi Tambahan
Menit
Panjang Video

Wawasan kunci di sini adalah sebagai berikut. Selama pelatihan, model difusi video standar belajar dari data kebenaran dasar yang bersih. Mereka tidak pernah melihat keluaran yang mereka hasilkan. Saat digunakan, mereka tiba-tiba harus bekerja dengan prediksi imperfect mereka sendiri sebagai masukan, dan mereka tidak tahu cara menangani kebisingan.

Daur ulang kesalahan memperbaiki ini dengan memodifikasi loop pelatihan:

Langkah 1

Lintasan Maju Standar

Model menghasilkan segmen video dari data pelatihan yang bersih.

Langkah 2

Pengumpulan Kesalahan

Prediksi model sendiri (dengan ketidaksempurnaannya) ditangkap daripada dibuang.

Langkah 3

Daur Ulang Kesalahan

Keluaran tidak sempurna ini diberi makan kembali sebagai masukan untuk iterasi pelatihan berikutnya, mengajarkan model untuk menghasilkan keluaran stabil bahkan dari bingkai yang dihasilkan sendiri dan bising.

Langkah 4

Penyempurnaan Berulang

Selama banyak siklus pelatihan, model mempelajari mekanisme koreksi diri yang kuat yang mencegah akumulasi kesalahan.

Keindahan pendekatan ini terletak pada kesederhanaannya. Tidak ada arsitektur model baru, tidak ada parameter tambahan, tidak ada trik waktu inferensi. Model hanya belajar selama pelatihan apa yang terlihat seperti kondisi penerapan nyata.

Mengapa Ini Penting Lebih dari yang Anda Pikirkan

Implikasinya meluas jauh melampaui menghasilkan video kucing yang lebih lama. Berikut apa yang berubah:

Sebelum Daur Ulang Kesalahan

  • Model video terbatas pada 4-20 detik
  • Konsistensi adegan merosot dengan cepat
  • Identitas karakter melayang setelah beberapa detik
  • Fisika menjadi semakin tidak realistis
  • Warna dan pencahayaan berubah tidak terduga

Setelah Daur Ulang Kesalahan

  • Generasi video kohesif multi-menit
  • Penampilan karakter yang stabil sepanjang waktu
  • Fisika konsisten dan hubungan spasial
  • Penilaian warna dan pencahayaan yang dapat diandalkan
  • Tidak ada penurunan kualitas yang terlihat seiring waktu

Angka-Angkanya

Tim VITA Lab menguji Stable Video Infinity di berbagai arsitektur dan benchmark. Hasilnya sangat mencolok:

MetrikTanpa Daur Ulang KesalahanDengan Daur Ulang KesalahanPerbaikan
FVD (lebih rendah lebih baik)Berkurang setelah 4 detikStabil melalui 2+ menitSignifikan
Konsistensi KarakterTurun di bawah 60% pada 15 detikMempertahankan 90%+ pada 2 menit~50% relatif
Koherensi TemporalHanyutan terlihat pada 8 detikTidak ada hanyutan terlihat pada 2 menitLompatan kualitatif
Overhead KomputasiBaselineBaseline (peningkatan 0%)Biaya nol
๐Ÿ’ก

Aspek overhead komputasi nol sangat penting. Daur ulang kesalahan adalah teknik waktu pelatihan, bukan teknik waktu inferensi. Setelah dilatih, model berjalan pada kecepatan dan biaya yang persis sama seperti sebelumnya.

Bagaimana Daur Ulang Kesalahan Bekerja Di Bawah Tenda

Bagi mereka yang menginginkan detail teknis, inilah yang terjadi dalam saluran pelatihan yang dimodifikasi.

Pelatihan difusi video standar menggunakan jadwal kebisingan epsilon yang diterapkan pada bingkai kebenaran dasar yang bersih x_0. Model belajar memprediksi kebisingan dan memulihkan sinyal asli. Pada waktu inferensi, model secara autoregresif menghasilkan bingkai t+1 dengan syarat pada prediksi bingkai t itu.

Kesenjangan antara pelatihan (masukan bersih) dan inferensi (masukan yang dihasilkan sendiri) disebut bias eksposur. Daur ulang kesalahan secara langsung mengatasi ini.

Detail Teknis: Tujuan Pelatihan yang Dimodifikasiโ–ผ

Selama pelatihan, model sesekali menghasilkan bingkai menggunakan bobot saat ini sendiri daripada menggunakan data kebenaran dasar. Bingkai yang dihasilkan sendiri ini, lengkap dengan ketidaksempurnaannya, kemudian digunakan sebagai masukan pengondisian untuk bingkai berikutnya dalam urutan pelatihan.

Parameter hiper kunci adalah rasio daur ulang r, yang mengontrol seberapa sering bingkai yang dihasilkan sendiri menggantikan bingkai kebenaran dasar selama pelatihan. Makalah menemukan bahwa r = 0.3 (30% bingkai yang didaur ulang) mencapai kinerja optimal, menyeimbangkan peningkatan stabilitas dengan kualitas sinyal pelatihan.

Fungsi kerugian yang dimodifikasi tetap menjadi tujuan difusi standar. Satu-satunya perbedaan adalah distribusi data yang dilihat model selama pelatihan. Inilah mengapa tidak ada overhead komputasi pada waktu inferensi.

Ini secara konseptual mirip dengan pengambilan sampel terjadwal dalam model urutan-ke-urutan, tetapi disesuaikan untuk kerangka difusi berkelanjutan. Tim VITA Lab mengkredit koneksi ini dalam makalah mereka sambil mencatat bahwa penerapan naif pengambilan sampel terjadwal ke model difusi tidak berfungsi. Kontribusi mereka adalah formulasi spesifik yang membuatnya stabil untuk generasi video.

Keuntungan Sumber Terbuka

Mungkin aspek paling menarik: kodenya sepenuhnya sumber terbuka di GitHub (vita-epfl/Stable-Video-Infinity). Ini berarti laboratorium penelitian apa pun atau perusahaan dapat menerapkan daur ulang kesalahan ke model video mereka yang ada.

โœ“Mengapa Sumber Terbuka Penting
Model difusi video yang ada apa pun dapat diadaptasi dengan daur ulang kesalahan. Tidak ada perubahan arsitektur yang diperlukan, hanya loop pelatihan yang dimodifikasi. Ini dapat meningkatkan Sora, Runway, Kling, dan setiap model sumber terbuka secara bersamaan.
โœ—Keterbatasan Praktis
Memerlukan pelatihan ulang atau penyesuaian model. Perusahaan dengan model proprietary perlu menginvestasikan sumber daya komputasi dalam pelatihan ulang. Efektivitas teknik mungkin bervariasi di berbagai arsitektur dan skala.

Rilis sumber terbuka mengikuti tren yang berkembang dalam komunitas penelitian video AI. Model seperti LTX-2 dan Wan 2.6 telah menunjukkan bahwa pendekatan sumber terbuka dapat bersaing dengan alternatif proprietary.

Apa Artinya Ini untuk Industri

Waktunya luar biasa. Kami berada di tengah perlombaan senjata video AI di mana setiap pemain utama, dari Runway hingga ByteDance, mendorong keluaran yang lebih lama dan berkualitas lebih tinggi. Daur ulang kesalahan mungkin menjadi bagian yang hilang yang membuka kemampuan generasi berikutnya.

๐ŸŽฌ

Untuk Pembuat Film dan Kreator

Generasi video yang kohesif dan bentuk panjang memungkinkan konten naratif aktual. Bukan hanya klip, tetapi adegan, urutan, dan akhirnya film pendek yang dihasilkan dari satu permintaan.
๐Ÿ”ฌ

Untuk Peneliti

Daur ulang kesalahan menyediakan kerangka yang dapat digeneralisasi. Prinsip yang sama dapat diterapkan pada generasi audio, sintesis pemandangan 3D, dan model generatif autoregresif apa pun yang menderita hanyutan.
๐Ÿข

Untuk Perusahaan

Generasi bentuk panjang yang stabil membuat video AI layak untuk kasus penggunaan profesional: demo produk, video pelatihan, kampanye pemasaran yang memerlukan kualitas konsisten di seluruh menit konten.

Ke Depan

Pekerjaan VITA Lab mewakili perubahan fundamental dalam cara kami berpikir tentang generasi video AI. Alih-alih membangun model yang semakin besar atau menambahkan mekanisme waktu inferensi yang kompleks, solusinya adalah cukup menunjukkan kepada model apa yang terlihat seperti keluarannya sendiri.

Makalah akan disajikan di ICLR 2026, dan beberapa sumber industri menunjukkan bahwa penyedia model video utama sudah mengeksplorasi integrasi. Jika model dunia mewakili masa depan cara AI memahami fisika dan ruang, daur ulang kesalahan mewakili masa depan cara AI mempertahankan pemahaman itu dari waktu ke waktu.

โœ…

Era video AI 4 detik mungkin berakhir lebih cepat dari yang diharapkan siapa pun. Dan tidak akan memerlukan arsitektur model baru atau anggaran komputasi senilai satu miliar dolar. Hanya loop pelatihan yang lebih cerdas.

Bacaan Lebih Lanjut

Alexis
AlexisAI EngineerAI Author

Insinyur AI dari Lausanne yang memadukan kedalaman riset dengan inovasi praktis. Membagi waktu antara arsitektur model dan puncak Alpen.

View profile โ†’

Suka dengan yang Anda baca?

Ubah ide Anda menjadi video AI berdurasi tak terbatas dalam hitungan menit.

Artikel Terkait

Lanjutkan penjelajahan dengan postingan terkait ini

Menikmati artikel ini?

Temukan lebih banyak wawasan dan dapatkan kabar terbaru dari konten kami.