Meta PixelLangkau ke kandungan utama
DamienDamien· Penulis AI, disemak oleh manusia
5 min read
959 perkataan

Helios: Model 14B yang Menjalankan Video AI Masa Nyata pada Perangkat Keras Konsumen

Helios dari Universitas Peking, ByteDance, dan Canva menghasilkan video AI selama satu menit pada 19.5 FPS hanya dengan VRAM 6GB, dan sepenuhnya sumber terbuka.

Helios: Model 14B yang Menjalankan Video AI Masa Nyata pada Perangkat Keras Konsumen

Bersedia untuk mencipta video AI anda sendiri?

Sertai ribuan pencipta yang menggunakan Bonega.ai

Hambatan terbesar untuk pembuatan video AI masa nyata selalu menjadi kekuatan komputasi. Helios, model 14-miliar-parameter baru dari Universitas Peking, ByteDance, dan Canva, baru saja menghancurkan hambatan itu. Ini berjalan pada 19.5 bingkai per detik pada H100 tunggal, menghasilkan video hingga 60 detik panjang, dan hanya membutuhkan sekitar 6GB VRAM dengan offloading grup. Oh, dan dilisensikan Apache 2.0.

Mengapa Helios Penting

Model video AI sebagian besar memaksa Anda memilih: kualitas atau kecepatan. Model besar seperti Veo 3.1 atau Runway Gen-4.5 menghasilkan hasil yang menakjubkan, tetapi berjalan pada kluster awan dan mengenakan per detik. Model yang lebih kecil cocok untuk GPU konsumen tetapi menghasilkan output yang terlihat jauh lebih lemah. Helios menolak pilihan itu.

14B
Parameter
19.5
FPS pada H100 tunggal
~6GB
VRAM dengan offloading
60s
Panjang video maksimum

Wawasan utama: Helios adalah model difusi autoregresif yang menghasilkan video bingkai demi bingkai dalam mode streaming, bukan denoising seluruh video sekaligus. Ini berarti dapat mulai menampilkan bingkai segera sambil masih menghasilkan sisanya. Tidak ada menunggu klip penuh untuk dirender.

Cara Kerjanya

Model difusi tradisional memproses seluruh video secara bersamaan. Anda mengirimkan prompt, menunggu beberapa menit, dan mendapatkan klip lengkap. Helios mengambil pendekatan yang sama sekali berbeda.

Difusi TradisionalHelios (Autoregressive Diffusion)
Proses semua bingkai sekaligusBuat bingkai demi bingkai
Persyaratan memori tinggiPenggunaan memori konstan
Output hanya jika sepenuhnya selesaiAlirkan output secara real-time
Kualitas menurun dengan panjangKualitas konsisten di setiap panjang

Model menggunakan mekanisme perhatian temporal dua arah yang memungkinkan setiap bingkai baru mereferensikan konteks masa lalu dan masa depan dalam jendela geser. Ini mencegah drift kualitas yang biasanya mengganggu model video autoregresif, di mana bingkai kemudian secara bertahap kehilangan koherensi dengan bingkai sebelumnya.

💡
Helios mencapai video selama satu menit (hingga 1.452 bingkai) tanpa mengandalkan trik KV-cache atau hack anti-drifting. Arsitektur itu sendiri mempertahankan konsistensi.

Sudut Perangkat Keras Konsumen

Di sini hal-hal menjadi praktis. Dengan group offloading, Helios dapat berjalan pada perangkat keras dengan sekitar 6GB VRAM. Itu menempatkannya tepat di wilayah RTX 4060 Ti, kartu yang menghabiskan sekitar $400.

Bandingkan dengan pembuatan berbasis awan:

MetodeBiaya per menit videoPerangkat keras yang diperlukan
Cloud API (Sora, Veo)$2-8 per generasiTidak ada (awan)
Helios (lokal, H100)~$0.15 dalam listrikH100 ($25,000+)
Helios (lokal, RTX 4060 Ti)~$0.01 dalam listrikRTX 4060 Ti (~$400)

Pertukaran dengan GPU konsumen adalah kecepatan. Pada RTX 4060 Ti Anda tidak akan mencapai 19.5 FPS. Harapkan lebih dekat ke 2-3 FPS, yang masih berarti video 60 detik dalam kurang dari 10 menit. Untuk pembuatan lokal, pribadi, tanpa batas, itu menarik.

Tolok Ukur yang Mendukung Klaim

Helios tidak hanya mengklaim kinerja real-time. Ini mencetak secara kompetitif pada tolok ukur kualitas video standar.

💡
Pada VBench, Helios cocok atau melampaui model dengan penghitungan parameter serupa di semua kualitas gerakan, konsistensi temporal, dan penilaian estetika. Hasil tolok ukur lengkap tersedia di makalah (arXiv:2603.04379).

Tim penelitian, kolaborasi antara Universitas Peking, ByteDance, dan Canva, secara khusus diuji melawan:

  • CogVideoX (13B parameter): Helios sesuai kualitas pada generasi 5-10x lebih cepat
  • Pyramid Flow (dasar autoregresif): Helios menghasilkan output yang lebih konsisten temporal
  • Open-Sora v1.2: Helios menghasilkan klip yang lebih panjang dan lebih koheren

Perbandingan kritis adalah dengan model dalam kisaran parameter 1-2B, seperti LTX-2 dan varian CogVideo yang lebih kecil. Helios berjalan dengan kecepatan serupa sambil menghasilkan output yang terlihat seperti berasal dari model yang jauh lebih besar.

Apa yang Benar-Benar Bisa Anda Lakukan Dengan Itu

Helios bukan keingintahuan penelitian. Ini adalah alat praktis yang dapat Anda instal dan jalankan hari ini.

  • Pembuatan teks ke video hingga 60 detik
  • Animasi gambar ke video dari bingkai referensi
  • Keluaran streaming real-time (mulai menonton saat membuat)
  • Lisensi Apache 2.0 (penggunaan komersial diizinkan)
  • Offloading grup untuk dukungan GPU konsumen

Lisensi Apache 2.0 signifikan. Tidak seperti banyak model open-weight yang membatasi penggunaan komersial, Helios secara eksplisit memungkinkannya. Ini membuka pintu bagi pengembang independen, studio kecil, dan startup untuk membangun produk di atas model tanpa biaya lisensi.

Gambaran Besar

Helios mengubah bagaimana kita mendekati aksesibilitas video AI. Generasi sebelumnya dari model video "terbuka" baik memerlukan perangkat keras tingkat perusahaan atau menghasilkan hasil yang terlihat secara nyata lebih buruk dari rekan awan mereka.

Pembuatan Awan
Tidak perlu investasi perangkat keras, keluaran kualitas tertinggi, model yang terus diperbarui
Pembuatan Lokal (Helios)
Biaya per-generasi nol, privasi penuh, tanpa batas laju, lisensi yang ramah bisnis, kemampuan offline

Untuk profesional yang menghasilkan ratusan iterasi per proyek, ekonomi bergeser secara signifikan. GPU $400 membayar sendiri setelah kira-kira 200-300 generasi awan. Untuk tim yang bereksperimen dengan video AI dalam produk, sifat pembuatan lokal yang tidak terbatas menghilangkan keraguan untuk bereksperimen.

Kami mencakup ekosistem pembuatan lokal yang berkembang dalam panduan menjalankan video AI secara lokal, dan Helios cocok langsung ke alur kerja itu. Ini juga dibangun di atas terobosan pembuatan real-time yang kami tulis tentang dengan TurboDiffusion, membawa konsep lebih jauh dengan model yang jauh lebih besar.

Apa Selanjutnya

Tim Helios telah menunjukkan pekerjaan tindak lanjut pada kemampuan audio-visual generation dan interactive control. Jika keuntungan efisiensi yang sama diterapkan, kita bisa melihat pembuatan video audio-visual real-time, yang dapat dikontrol, pada perangkat keras konsumen pada akhir 2026.

Untuk saat ini, Helios tersedia di GitHub di bawah Apache 2.0. Jika Anda memiliki GPU NVIDIA dengan VRAM 6GB+ dan ingin bereksperimen dengan pembuatan video AI lokal yang kompetitif secara nyata, ini adalah titik masuk terkuat yang tersedia.

💡

Bacaan terkait: Lihat bagaimana model open-source menutup kesenjangan dengan platform proprietary, atau jelajahi pendekatan LTX-2 ke generasi 4K asli pada GPU konsumen.

Damien
DamienAI DeveloperAI Author

Pembangun AI dari Lyon yang gemar mengubah konsep ML yang kompleks menjadi resipi mudah. Apabila tidak menyahpepijat model, anda akan menemuinya berbasikal di lembah Rhône.

View profile →

Suka apa yang anda baca?

Tukar idea anda menjadi video AI berdurasi tanpa had dalam beberapa minit.

Artikel Berkaitan

Teruskan meneroka dengan catatan berkaitan ini

Menikmati artikel ini?

Temui lebih banyak pandangan dan kekal dikemas kini dengan kandungan terkini kami.