Meta PixelLangkau ke kandungan utama
AlexisAlexis· Penulis AI, disemak oleh manusia
7 min read
1383 perkataan

EPFL Stable Video Infinity: Bagaimana Kitar Semula Ralat Menyelesaikan Masalah Terbesar Video AI

Kertas Oral ICLR 2026 baharu daripada EPFL memperkenalkan kitar semula ralat, teknik yang menghapuskan hanyutan temporal dan membolehkan penjanaan video AI berbilang minit tanpa kos pengkomputeran tambahan.

EPFL Stable Video Infinity: Bagaimana Kitar Semula Ralat Menyelesaikan Masalah Terbesar Video AI

Bersedia untuk mencipta video AI anda sendiri?

Sertai ribuan pencipta yang menggunakan Bonega.ai

Setiap model video AI mempunyai rahsia buruk yang sama. Jana klip 4 saat dan hasilnya kelihatan menakjubkan. Lepasi 15 saat, watak mula berubah bentuk, fizik menjadi kacau, warna berubah, dan keseluruhan adegan hanyut menjadi tidak koheren. VITA Lab EPFL baru sahaja menerbitkan penyelesaian, dan ia mungkin kertas paling penting dalam penjanaan video tahun ini.

Masalah Hanyutan yang Tiada Siapa Selesaikan

Jika anda pernah cuba menjana video AI bentuk panjang dengan mana-mana model semasa, anda pasti mengetahui kekecewaannya. Sora 2 dihadkan kepada 15 hingga 25 saat bergantung pada pelan anda. Runway Gen-4.5 maksimum pada 10. Kling 3.0 mencapai 15. Sebabnya bukan pengkomputeran atau memori. Ia ialah hanyutan temporal.

💡

Hanyutan temporal berlaku apabila model video autoregresif mengumpulkan ralat kecil dari bingkai ke bingkai. Setiap bingkai yang dijana menjadi input untuk yang seterusnya, dan ketidaksempurnaan kecil berganda secara eksponen. Selepas beberapa ratus bingkai, outputnya hampir tidak menyerupai gesaan asal.

Ini pada asasnya serupa dengan masalah "permainan telefon". Bisikkan mesej melalui cukup ramai orang dan ia menjadi tidak dapat dikenali. Pendekatan terdahulu cuba melawan hanyutan dengan menjana klip lebih pendek dan mencantumkannya, tetapi sambungannya jelas kelihatan. Yang lain menggunakan penjanaan berhierarki (bingkai utama dahulu, interpolasi kemudian), yang membantu tetapi tidak menghapuskan isu teras.

Kitar Semula Ralat Diperkenalkan

Kertas itu, bertajuk "Stable Video Infinity" dan diterima sebagai pembentangan Oral ICLR 2026, memperkenalkan idea yang kelihatan mudah: ajar model untuk mengendalikan kesilapannya sendiri.

Oral
Status ICLR 2026
0
Kos Pengkomputeran Tambahan
Minutes
Panjang Video

Inilah wawasan utamanya. Semasa latihan, model difusi video standard belajar daripada data asas kebenaran yang bersih. Ia tidak pernah melihat output yang dijananya sendiri. Apabila digunakan, ia tiba-tiba perlu bekerja dengan ramalan tidak sempurnanya sendiri sebagai input, dan ia tidak tahu cara mengendalikan hingar tersebut.

Kitar semula ralat membetulkannya dengan mengubah suai gelung latihan:

Langkah 1

Laluan Hadapan Standard

Model menjana segmen video daripada data latihan bersih.

Langkah 2

Pengumpulan Ralat

Ramalan model sendiri (berserta ketidaksempurnaannya) ditangkap dan bukannya dibuang.

Langkah 3

Kitar Semula Ralat

Output tidak sempurna ini dimasukkan semula sebagai input untuk iterasi latihan seterusnya, mengajar model menjana output stabil walaupun daripada bingkai hingar yang dijana sendiri.

Langkah 4

Penambahbaikan Berulang

Melalui banyak kitaran latihan, model mempelajari mekanisme pembetulan kendiri yang kukuh untuk mencegah pengumpulan ralat.

Keindahan pendekatan ini terletak pada keanggunannya. Tiada seni bina model baharu, tiada parameter tambahan, tiada helah pada masa inferens. Model hanya mempelajari keadaan penggunaan sebenar semasa latihan.

Mengapa Ini Lebih Penting daripada Yang Anda Sangka

Implikasinya melangkaui penjanaan video kucing yang lebih panjang. Inilah yang berubah:

Sebelum Kitar Semula Ralat

  • Model video terhad kepada 4-20 saat
  • Konsistensi adegan merosot dengan cepat
  • Identiti watak hanyut selepas beberapa saat
  • Fizik menjadi semakin tidak realistik
  • Warna dan pencahayaan berubah secara tidak menentu

Selepas Kitar Semula Ralat

  • Penjanaan video koheren berbilang minit
  • Penampilan watak stabil sepanjang video
  • Fizik dan hubungan ruang yang konsisten
  • Penggredan warna dan pencahayaan yang boleh dipercayai
  • Tiada kemerosotan kualiti yang ketara dari semasa ke semasa

Angka-Angkanya

Pasukan VITA Lab menguji Stable Video Infinity merentasi pelbagai seni bina dan penanda aras. Hasilnya amat ketara:

MetrikTanpa Kitar Semula RalatDengan Kitar Semula RalatPeningkatan
FVD (lebih rendah adalah lebih baik)Merosot selepas 4sStabil sehingga 2min+Ketara
Konsistensi WatakTurun di bawah 60% pada 15sMengekalkan 90%+ pada 2min~50% relatif
Koheren TemporalHanyutan ketara pada 8sTiada hanyutan ketara pada 2minLonjakan kualitatif
Overhed PengkomputeranGaris dasarGaris dasar (peningkatan 0%)Kos sifar
💡

Aspek overhed pengkomputeran sifar adalah penting. Kitar semula ralat ialah teknik pada masa latihan, bukan pada masa inferens. Setelah dilatih, model berjalan pada kelajuan dan kos yang sama seperti sebelumnya.

Cara Kitar Semula Ralat Berfungsi di Sebalik Tabir

Bagi mereka yang mahu butiran teknikal, inilah yang berlaku dalam saluran latihan yang diubah suai.

Latihan difusi video standard menggunakan jadual hingar epsilon yang digunakan pada bingkai asas kebenaran bersih x_0. Model belajar meramal hingar dan memulihkan isyarat asal. Pada masa inferens, model menjana bingkai t+1 secara autoregresif berdasarkan ramalannya terhadap bingkai t.

Jurang antara latihan (input bersih) dan inferens (input yang dijana sendiri) dipanggil bias pendedahan. Kitar semula ralat menangani perkara ini secara langsung.

Butiran Teknikal: Objektif Latihan Diubah Suai

Semasa latihan, model secara berkala menjana bingkai menggunakan wajaran semasanya sendiri dan bukannya menggunakan data asas kebenaran. Bingkai yang dijana sendiri ini, lengkap dengan ketidaksempurnaannya, kemudiannya digunakan sebagai input pengkondisian untuk bingkai berikutnya dalam urutan latihan.

Hiperparameter utama ialah nisbah kitar semula r, yang mengawal kekerapan bingkai yang dijana sendiri menggantikan bingkai asas kebenaran semasa latihan. Kertas itu mendapati bahawa r = 0.3 (30% bingkai dikitar semula) mencapai prestasi optimum, menyeimbangkan peningkatan kestabilan dengan kualiti isyarat latihan.

Fungsi kehilangan yang diubah suai kekal sebagai objektif difusi standard. Satu-satunya perbezaan ialah taburan data yang dilihat model semasa latihan. Inilah sebabnya tiada overhed pengkomputeran pada masa inferens.

Ini secara konsepnya serupa dengan pensampelan berjadual dalam model urutan-ke-urutan, tetapi disesuaikan untuk rangka kerja difusi berterusan. Pasukan VITA Lab mengiktiraf hubungan ini dalam kertas mereka sambil menyatakan bahawa penggunaan pensampelan berjadual secara naif pada model difusi tidak berfungsi. Sumbangan mereka ialah perumusan khusus yang menjadikannya stabil untuk penjanaan video.

Kelebihan Sumber Terbuka

Mungkin aspek paling mengujakan: kod ini sumber terbuka sepenuhnya di GitHub (vita-epfl/Stable-Video-Infinity). Ini bermakna mana-mana makmal penyelidikan atau syarikat boleh menggunakan kitar semula ralat pada model video sedia ada mereka.

Mengapa Sumber Terbuka Penting
Mana-mana model difusi video sedia ada boleh dipasang semula dengan kitar semula ralat. Tiada perubahan seni bina diperlukan, hanya gelung latihan yang diubah suai. Ini boleh menambah baik Sora, Runway, Kling, dan setiap model sumber terbuka secara serentak.
Batasan Praktikal
Memerlukan latihan semula atau penalaan halus model. Syarikat dengan model proprietari perlu melabur pengkomputeran dalam latihan semula. Keberkesanan teknik ini mungkin berbeza merentasi seni bina dan skala yang berlainan.

Keluaran sumber terbuka ini mengikuti trend yang semakin berkembang dalam komuniti penyelidikan video AI. Model seperti LTX-2 dan Wan 2.6 telah menunjukkan bahawa pendekatan sumber terbuka boleh bersaing dengan alternatif proprietari.

Apa Maknanya untuk Industri

Masanya sangat luar biasa. Kita berada di tengah-tengah perlumbaan senjata video AI, dengan setiap pemain utama, daripada Runway hingga ByteDance, berusaha menghasilkan output yang lebih panjang dan berkualiti tinggi. Kitar semula ralat mungkin merupakan komponen yang hilang untuk membuka keupayaan generasi seterusnya.

🎬

Untuk Pembikin Filem dan Pencipta

Penjanaan video koheren bentuk panjang membolehkan kandungan naratif sebenar. Bukan sekadar klip, tetapi adegan, urutan, dan akhirnya filem pendek yang dijana daripada satu gesaan.
🔬

Untuk Penyelidik

Kitar semula ralat menyediakan rangka kerja yang boleh digeneralisasikan. Prinsip yang sama boleh digunakan pada penjanaan audio, sintesis adegan 3D, dan mana-mana model generatif autoregresif yang mengalami hanyutan.
🏢

Untuk Perusahaan

Penjanaan bentuk panjang yang stabil menjadikan video AI sesuai untuk kes penggunaan profesional: demo produk, video latihan, kempen pemasaran yang memerlukan kualiti konsisten merentasi beberapa minit kandungan.

Melangkah ke Hadapan

Kerja VITA Lab mewakili perubahan asas dalam cara kita memikirkan penjanaan video AI. Daripada membina model yang semakin besar atau menambah mekanisme kompleks pada masa inferens, penyelesaiannya ialah dengan menunjukkan kepada model rupa outputnya sendiri.

Kertas itu akan dibentangkan di ICLR 2026, dan beberapa sumber industri mencadangkan bahawa penyedia model video utama sudah meneroka integrasi. Jika model dunia mewakili masa depan cara AI memahami fizik dan ruang, kitar semula ralat mewakili masa depan cara AI mengekalkan pemahaman itu dari semasa ke semasa.

Era video AI 4 saat mungkin berakhir lebih awal daripada jangkaan sesiapa. Dan ia tidak memerlukan seni bina model baharu atau bajet pengkomputeran berbilion dolar. Hanya gelung latihan yang lebih pintar.

Bacaan Lanjut


Sumber

Alexis
AlexisAI EngineerAI Author

Jurutera AI dari Lausanne yang menggabungkan kedalaman penyelidikan dengan inovasi praktikal. Membahagikan masa antara seni bina model dan puncak alpine.

View profile →

Suka apa yang anda baca?

Tukar idea anda menjadi video AI berdurasi tanpa had dalam beberapa minit.

Artikel Berkaitan

Teruskan meneroka dengan catatan berkaitan ini

Menikmati artikel ini?

Temui lebih banyak pandangan dan kekal dikemas kini dengan kandungan terkini kami.