Helios, โมเดล 14B ที่ทำงาน AI วิดีโอแบบเรียลไทม์บนฮาร์ดแวร์ผู้บริโภค
มหาวิทยาลัยปักกิ่ง ByteDance และ Canva ของ Helios สร้างวิดีโอ AI ยาวหนึ่งนาทีที่ 19.5 FPS ด้วย VRAM เพียง 6GB เท่านั้น และมีลิขสิทธิ์เปิดแบบเต็มที่

เหตุใด Helios จึงสำคัญ
โมเดล AI วิดีโอส่วนใหญ่บังคับให้คุณเลือก: คุณภาพหรือความเร็ว โมเดลขนาดใหญ่เช่น Veo 3.1 หรือ Runway Gen-4.5 ให้ผลลัพธ์ที่น่าทึ่ง แต่ทำงานบนกลุ่มคลาวด์และคิดค่าใช้งานต่อวินาที โมเดลที่เล็กกว่าพอดีกับ GPU ผู้บริโภค แต่ให้ผลลัพธ์ที่อ่อนแอลงอย่างเห็นได้ชัด Helios ปฏิเสธตัวเลือกนี้
ข้อมูลเชิงลึกหลัก: Helios เป็น โมเดล diffusion autoregressive ที่สร้างวิดีโอแบบ frame-by-frame ในลักษณะสตรีม มากกว่า denoising วิดีโอทั้งหมดในครั้งเดียว ซึ่งหมายความว่ามันสามารถเริ่มส่งออกเฟรมได้ทันทีในขณะที่ยังคงสร้างส่วนที่เหลือ ไม่ต้องรอให้คลิปแสดงผลเสร็จสิ้น
วิธีการทำงาน
โมเดล diffusion แบบดั้งเดิมประมวลผลวิดีโอทั้งหมดพร้อมกัน คุณส่งคำแจง รอนาที และได้รับคลิปที่สมบูรณ์ Helios ใช้วิธีการที่แตกต่างโดยพื้นฐาน
| Diffusion แบบดั้งเดิม | Helios (Autoregressive Diffusion) |
|---|---|
| ประมวลผลเฟรมทั้งหมดพร้อมกัน | สร้าง frame-by-frame |
| ข้อกำหนดหน่วยความจำสูง | การใช้หน่วยความจำคงที่ |
| ผลลัพธ์เฉพาะเมื่อเสร็จสิ้นอย่างสมบูรณ์ | ส่งออกสตรีมแบบเรียลไทม์ |
| คุณภาพลดลงตามความยาว | คุณภาพสอดคล้องกันที่ความยาวใด ๆ |
โมเดลใช้ กลไก bi-directional temporal attention ที่ให้ผลต่างเฟรมใหม่แต่ละเฟรมอ้างอิงทั้งบริบทในอดีตและอนาคตภายในหน้าต่างเลื่อน สิ่งนี้ป้องกันการลอยตัวของคุณภาพที่มักจะบ้านหลังบ้านวิดีโอ autoregressive ซึ่งเฟรมในภายหลังค่อย ๆ สูญเสียความสอดคล้องกับเฟรมก่อนหน้า
มุมฮาร์ดแวร์ผู้บริโภค
นี่คือที่ที่สิ่งต่าง ๆ กลายเป็นปฏิบัติจริง ด้วย group offloading Helios สามารถทำงานบนฮาร์ดแวร์ที่มี VRAM ประมาณ 6GB ซึ่งวางสิ่งนี้ลงในดินแดน RTX 4060 Ti การ์ดที่ราคาประมาณ $400
เปรียบเทียบกับการสร้างบนคลาวด์:
| วิธี | ต้นทุนต่อนาทีของวิดีโอ | ฮาร์ดแวร์ที่จำเป็น |
|---|---|---|
| Cloud API (Sora, Veo) | $2-8 ต่อการสร้าง | ไม่มี (คลาวด์) |
| Helios (ท้องถิ่น H100) | ~$0.15 ในไฟฟ้า | H100 ($25,000+) |
| Helios (ท้องถิ่น RTX 4060 Ti) | ~$0.01 ในไฟฟ้า | RTX 4060 Ti (~$400) |
แลกเปลี่ยนกับ GPU ผู้บริโภคคือความเร็ว บน RTX 4060 Ti คุณจะไม่พุ่ง 19.5 FPS คาดว่าใกล้เคียง 2-3 FPS มากขึ้น ซึ่งยังคงหมายถึงวิดีโอ 60 วินาทีในสิ่งที่น้อยกว่า 10 นาที สำหรับการสร้างท้องถิ่น ส่วนตัว ไม่มีขีดจำกัด นั่นน่าสนใจ
เกณฑ์มาตรฐานที่สนับสนุนการเรียกร้อง
Helios ไม่เพียงแต่อ้างการทำงานแบบเรียลไทม์ มันคะแนนแข่งขันบนเกณฑ์มาตรฐานคุณภาพวิดีโอ
ทีมวิจัยการทำงานร่วมกันระหว่างมหาวิทยาลัยปักกิ่ง ByteDance และ Canva โดยเฉพาะอย่างยิ่งทดสอบกับ:
- CogVideoX (พารามิเตอร์ 13B): Helios จับคู่คุณภาพที่การสร้างเร็ว 5-10x
- Pyramid Flow (autoregressive baseline): Helios ให้ผลลัพธ์ที่สอดคล้องกันของเวลามากขึ้น
- Open-Sora v1.2: Helios สร้างคลิปที่ยาวกว่า สอดคล้องมากขึ้น
การเปรียบเทียบที่สำคัญคือกับโมเดลในช่วง 1-2B พารามิเตอร์ เช่น LTX-2 และ CogVideo ตัวแปรที่เล็กกว่า Helios ทำงานด้วยความเร็วที่คล้ายกันในขณะที่ให้ผลลัพธ์ที่ดูเหมือนมาจากโมเดลที่ใหญ่กว่ามาก
สิ่งที่คุณจริง ๆ สามารถทำได้กับมัน
Helios ไม่ใช่ความอยากรู้ของวิจัย มันเป็นเครื่องมือเชิงปฏิบัติที่คุณสามารถติดตั้งและเรียกใช้งานวันนี้ได้
- ✓การสร้างข้อความเป็นวิดีโอถึง 60 วินาที
- ✓ภาพเคลื่อนไหวจากภาพไปยังวิดีโอจากเฟรมอ้างอิง
- ✓เอาต์พุตสตรีมแบบเรียลไทม์ (เริ่มชมในขณะที่สร้าง)
- ✓ลิขสิทธิ์ Apache 2.0 (อนุญาตการใช้งานเชิงพาณิชย์)
- ✓Group offloading สำหรับการสนับสนุน GPU ผู้บริโภค
ลิขสิทธิ์ Apache 2.0 มีนัยสำคัญ ซึ่งแตกต่างจากโมเดลน้ำหนักเปิดจำนวนมากที่ จำกัด การใช้งานเชิงพาณิชย์ Helios อนุญาตอย่างชัดเจน นี่เปิดประตูสำหรับนักพัฒนาอิสระ สตูดิโอเล็ก ๆ และเริ่มต้นต้นเพื่อสร้างผลิตภัณฑ์ด้านบนโมเดลโดยไม่มีค่าธรรมเนียมลิขสิทธิ์
ภาพใหญ่
Helios เปลี่ยนวิธีที่เราเข้าหาการเข้าถึงวิดีโอ AI รุ่นก่อนหน้าของโมเดลวิดีโอ "เปิด" ต้องการฮาร์ดแวร์ระดับองค์กรหรือให้ผลลัพธ์ที่ดูแย่กว่าคู่ของคลาวด์อย่างเห็นได้ชัด
สำหรับมืออาชีพที่สร้างร้อย ๆ ของการวนซ้ำต่อโครงการ เศรษฐศาสตร์เปลี่ยนไปอย่างมีนัยสำคัญ GPU $400 จ่ายตัวเองหลังจากการสร้างคลาวด์ประมาณ 200-300 สำหรับทีมที่ทดลองวิดีโอ AI ในผลิตภัณฑ์ ลักษณะไม่มีขีดจำกัดของการสร้างท้องถิ่นจะขจัดการลังเล
เราครอบคลุมการสร้างสตรีมท้องถิ่นที่เติบโตในของเรา แนวทางในการเรียกใช้วิดีโอ AI ในท้องถิ่น และ Helios พอดีโดยตรงเข้าไปในเวิร์กโฟลว์นั้น นอกจากนี้ยังสร้างขึ้นจาก ความก้าวหน้าของการสร้างแบบเรียลไทม์ ที่เราเขียนด้วย TurboDiffusion นำแนวคิดไปไกลกว่าด้วยโมเดลที่ใหญ่กว่ามาก
มีอะไรต่อจากนี้
ทีม Helios ได้บอกใบ้เกี่ยวกับงานติดตามใจในการสร้าง audio-visual และความสามารถ control interacting แล้ว หากได้รับประโยชน์ในประสิทธิภาพเดียวกัน เราอาจเห็นการสร้างวิดีโอแบบเรียลไทม์ที่ควบคุมได้ audio-inclusive บนฮาร์ดแวร์ผู้บริโภคโดยปลายปี 2026
สำหรับตอนนี้ Helios มีอยู่บน GitHub ภายใต้ Apache 2.0 ถ้าคุณมี NVIDIA GPU ที่มี VRAM 6GB+ และต้องการทดลองการสร้างวิดีโอ AI ท้องถิ่นแข่งขันได้อย่างแท้จริง นี่คือจุดเข้า
ที่แข็งแกร่งที่สุด
การอ่านที่เกี่ยวข้อง: ดูวิธีโมเดลโอเพนซอร์สกำลัง ปิดช่องว่างกับแพลตฟอร์มที่เป็นกรรมสิทธิ์ หรือสำรวจ วิธีการสร้าง 4K แบบ LTX-2 ดั้งเดิม บน GPU ผู้บริโภค

นักพัฒนา AI จากลียงผู้ชื่นชอบการเปลี่ยนแนวคิด ML ที่ซับซ้อนให้เป็นสูตรง่าย ๆ เมื่อไม่ได้แก้บั๊กโมเดล คุณจะพบเขาปั่นจักรยานผ่านหุบเขาโรน
View profile →บทความที่เกี่ยวข้อง
สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

ByteDance Vidi2: AI ที่เข้าใจวิดีโอเหมือนนักตัดต่อมืออาชีพ
ByteDance เพิ่งเปิดโค้ดต้นฉบับของ Vidi2 โมเดลที่มีพารามิเตอร์ 12 พันล้านตัว ที่สามารถเข้าใจเนื้อหาวิดีโอได้ดีพอที่จะตัดต่อวิดีโอหลายชั่วโมงให้กลายเป็นคลิปที่สมบูรณ์แบบโดยอัตโนมัติ ปัจจุบันใช้งานอยู่ใน TikTok Smart Split

SkyReels V4: โมเดล AI ตัวแรกที่มองเห็นและได้ยินในเวลาเดียวกัน
SkyReels V4 จาก Skywork AI นำเสนอสถาปัตยกรรม dual-stream diffusion ที่สร้างวิดีโอและเสียงที่ซิงก์กันในรอบเดียว นี่คือสิ่งที่มีความหมายต่อครีเอเตอร์

Seedance 2.0 มาถึง CapCut แล้ว และ Hollywood ไม่พอใจอย่างมาก
ByteDance เพิ่งเปิดตัวโมเดล AI สร้างวิดีโอที่เป็นที่ถกเถียงใน CapCut หลัง Sora ปิดตัวไปเพียงไม่กี่วัน เรื่องนี้สำคัญอย่างไร และทำไม Hollywood ถึงต่อสู้กลับ