Helios, โมเดล 14B ที่ทำงาน AI วิดีโอแบบเรียลไทม์บนฮาร์ดแวร์ผู้บริโภค
มหาวิทยาลัยปักกิ่ง ByteDance และ Canva ของ Helios สร้างวิดีโอ AI ยาวหนึ่งนาทีที่ 19.5 FPS ด้วย VRAM เพียง 6GB เท่านั้น และมีลิขสิทธิ์เปิดแบบเต็มที่

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?
เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai เริ่มสร้างหลังชำระเงิน
เหตุใด Helios จึงสำคัญ
โมเดล AI วิดีโอส่วนใหญ่บังคับให้คุณเลือก: คุณภาพหรือความเร็ว โมเดลขนาดใหญ่เช่น Veo 3.1 หรือ Runway Gen-4.5 ให้ผลลัพธ์ที่น่าทึ่ง แต่ทำงานบนกลุ่มคลาวด์และคิดค่าใช้งานต่อวินาที โมเดลที่เล็กกว่าพอดีกับ GPU ผู้บริโภค แต่ให้ผลลัพธ์ที่อ่อนแอลงอย่างเห็นได้ชัด Helios ปฏิเสธตัวเลือกนี้
ข้อมูลเชิงลึกหลัก: Helios เป็น โมเดล diffusion autoregressive ที่สร้างวิดีโอแบบ frame-by-frame ในลักษณะสตรีม มากกว่า denoising วิดีโอทั้งหมดในครั้งเดียว ซึ่งหมายความว่ามันสามารถเริ่มส่งออกเฟรมได้ทันทีในขณะที่ยังคงสร้างส่วนที่เหลือ ไม่ต้องรอให้คลิปแสดงผลเสร็จสิ้น
วิธีการทำงาน
โมเดล diffusion แบบดั้งเดิมประมวลผลวิดีโอทั้งหมดพร้อมกัน คุณส่งคำแจง รอนาที และได้รับคลิปที่สมบูรณ์ Helios ใช้วิธีการที่แตกต่างโดยพื้นฐาน
| Diffusion แบบดั้งเดิม | Helios (Autoregressive Diffusion) |
|---|---|
| ประมวลผลเฟรมทั้งหมดพร้อมกัน | สร้าง frame-by-frame |
| ข้อกำหนดหน่วยความจำสูง | การใช้หน่วยความจำคงที่ |
| ผลลัพธ์เฉพาะเมื่อเสร็จสิ้นอย่างสมบูรณ์ | ส่งออกสตรีมแบบเรียลไทม์ |
| คุณภาพลดลงตามความยาว | คุณภาพสอดคล้องกันที่ความยาวใด ๆ |
โมเดลใช้ กลไก bi-directional temporal attention ที่ให้ผลต่างเฟรมใหม่แต่ละเฟรมอ้างอิงทั้งบริบทในอดีตและอนาคตภายในหน้าต่างเลื่อน สิ่งนี้ป้องกันการลอยตัวของคุณภาพที่มักจะบ้านหลังบ้านวิดีโอ autoregressive ซึ่งเฟรมในภายหลังค่อย ๆ สูญเสียความสอดคล้องกับเฟรมก่อนหน้า
มุมฮาร์ดแวร์ผู้บริโภค
นี่คือที่ที่สิ่งต่าง ๆ กลายเป็นปฏิบัติจริง ด้วย group offloading Helios สามารถทำงานบนฮาร์ดแวร์ที่มี VRAM ประมาณ 6GB ซึ่งวางสิ่งนี้ลงในดินแดน RTX 4060 Ti การ์ดที่ราคาประมาณ $400
เปรียบเทียบกับการสร้างบนคลาวด์:
| วิธี | ต้นทุนต่อนาทีของวิดีโอ | ฮาร์ดแวร์ที่จำเป็น |
|---|---|---|
| Cloud API (Sora, Veo) | $2-8 ต่อการสร้าง | ไม่มี (คลาวด์) |
| Helios (ท้องถิ่น H100) | ~$0.15 ในไฟฟ้า | H100 ($25,000+) |
| Helios (ท้องถิ่น RTX 4060 Ti) | ~$0.01 ในไฟฟ้า | RTX 4060 Ti (~$400) |
แลกเปลี่ยนกับ GPU ผู้บริโภคคือความเร็ว บน RTX 4060 Ti คุณจะไม่พุ่ง 19.5 FPS คาดว่าใกล้เคียง 2-3 FPS มากขึ้น ซึ่งยังคงหมายถึงวิดีโอ 60 วินาทีในสิ่งที่น้อยกว่า 10 นาที สำหรับการสร้างท้องถิ่น ส่วนตัว ไม่มีขีดจำกัด นั่นน่าสนใจ
เกณฑ์มาตรฐานที่สนับสนุนการเรียกร้อง
Helios ไม่เพียงแต่อ้างการทำงานแบบเรียลไทม์ มันคะแนนแข่งขันบนเกณฑ์มาตรฐานคุณภาพวิดีโอ
ทีมวิจัยการทำงานร่วมกันระหว่างมหาวิทยาลัยปักกิ่ง ByteDance และ Canva โดยเฉพาะอย่างยิ่งทดสอบกับ:
- CogVideoX (พารามิเตอร์ 13B): Helios จับคู่คุณภาพที่การสร้างเร็ว 5-10x
- Pyramid Flow (autoregressive baseline): Helios ให้ผลลัพธ์ที่สอดคล้องกันของเวลามากขึ้น
- Open-Sora v1.2: Helios สร้างคลิปที่ยาวกว่า สอดคล้องมากขึ้น
การเปรียบเทียบที่สำคัญคือกับโมเดลในช่วง 1-2B พารามิเตอร์ เช่น LTX-2 และ CogVideo ตัวแปรที่เล็กกว่า Helios ทำงานด้วยความเร็วที่คล้ายกันในขณะที่ให้ผลลัพธ์ที่ดูเหมือนมาจากโมเดลที่ใหญ่กว่ามาก
สิ่งที่คุณจริง ๆ สามารถทำได้กับมัน
Helios ไม่ใช่ความอยากรู้ของวิจัย มันเป็นเครื่องมือเชิงปฏิบัติที่คุณสามารถติดตั้งและเรียกใช้งานวันนี้ได้
- ✓การสร้างข้อความเป็นวิดีโอถึง 60 วินาที
- ✓ภาพเคลื่อนไหวจากภาพไปยังวิดีโอจากเฟรมอ้างอิง
- ✓เอาต์พุตสตรีมแบบเรียลไทม์ (เริ่มชมในขณะที่สร้าง)
- ✓ลิขสิทธิ์ Apache 2.0 (อนุญาตการใช้งานเชิงพาณิชย์)
- ✓Group offloading สำหรับการสนับสนุน GPU ผู้บริโภค
ลิขสิทธิ์ Apache 2.0 มีนัยสำคัญ ซึ่งแตกต่างจากโมเดลน้ำหนักเปิดจำนวนมากที่ จำกัด การใช้งานเชิงพาณิชย์ Helios อนุญาตอย่างชัดเจน นี่เปิดประตูสำหรับนักพัฒนาอิสระ สตูดิโอเล็ก ๆ และเริ่มต้นต้นเพื่อสร้างผลิตภัณฑ์ด้านบนโมเดลโดยไม่มีค่าธรรมเนียมลิขสิทธิ์
ภาพใหญ่
Helios เปลี่ยนวิธีที่เราเข้าหาการเข้าถึงวิดีโอ AI รุ่นก่อนหน้าของโมเดลวิดีโอ "เปิด" ต้องการฮาร์ดแวร์ระดับองค์กรหรือให้ผลลัพธ์ที่ดูแย่กว่าคู่ของคลาวด์อย่างเห็นได้ชัด
สำหรับมืออาชีพที่สร้างร้อย ๆ ของการวนซ้ำต่อโครงการ เศรษฐศาสตร์เปลี่ยนไปอย่างมีนัยสำคัญ GPU $400 จ่ายตัวเองหลังจากการสร้างคลาวด์ประมาณ 200-300 สำหรับทีมที่ทดลองวิดีโอ AI ในผลิตภัณฑ์ ลักษณะไม่มีขีดจำกัดของการสร้างท้องถิ่นจะขจัดการลังเล
เราครอบคลุมการสร้างสตรีมท้องถิ่นที่เติบโตในของเรา แนวทางในการเรียกใช้วิดีโอ AI ในท้องถิ่น และ Helios พอดีโดยตรงเข้าไปในเวิร์กโฟลว์นั้น นอกจากนี้ยังสร้างขึ้นจาก ความก้าวหน้าของการสร้างแบบเรียลไทม์ ที่เราเขียนด้วย TurboDiffusion นำแนวคิดไปไกลกว่าด้วยโมเดลที่ใหญ่กว่ามาก
มีอะไรต่อจากนี้
ทีม Helios ได้บอกใบ้เกี่ยวกับงานติดตามใจในการสร้าง audio-visual และความสามารถ control interacting แล้ว หากได้รับประโยชน์ในประสิทธิภาพเดียวกัน เราอาจเห็นการสร้างวิดีโอแบบเรียลไทม์ที่ควบคุมได้ audio-inclusive บนฮาร์ดแวร์ผู้บริโภคโดยปลายปี 2026
สำหรับตอนนี้ Helios มีอยู่บน GitHub ภายใต้ Apache 2.0 ถ้าคุณมี NVIDIA GPU ที่มี VRAM 6GB+ และต้องการทดลองการสร้างวิดีโอ AI ท้องถิ่นแข่งขันได้อย่างแท้จริง นี่คือจุดเข้า
ที่แข็งแกร่งที่สุด
การอ่านที่เกี่ยวข้อง: ดูวิธีโมเดลโอเพนซอร์สกำลัง ปิดช่องว่างกับแพลตฟอร์มที่เป็นกรรมสิทธิ์ หรือสำรวจ วิธีการสร้าง 4K แบบ LTX-2 ดั้งเดิม บน GPU ผู้บริโภค

เพอร์โซนานักพัฒนา AI เขียนบทช่วยสอนเชิงปฏิบัติการที่เปลี่ยนแนวคิดแมชชีนเลิร์นนิงให้เป็นขั้นตอนที่ทำตามได้ง่ายสำหรับครีเอเตอร์วิดีโอ ร่างเนื้อหาด้วย Claude เผยแพร่หลังผ่านการตรวจสอบอัตโนมัติ
View profile →ชอบสิ่งที่คุณอ่านไหม?
เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที เริ่มสร้างหลังชำระเงิน
บทความที่เกี่ยวข้อง
สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

ByteDance Vidi2: AI ที่เข้าใจวิดีโอเหมือนนักตัดต่อมืออาชีพ
ByteDance เพิ่งเปิดโค้ดต้นฉบับของ Vidi2 โมเดลที่มีพารามิเตอร์ 12 พันล้านตัว ที่สามารถเข้าใจเนื้อหาวิดีโอได้ดีพอที่จะตัดต่อวิดีโอหลายชั่วโมงให้กลายเป็นคลิปที่สมบูรณ์แบบโดยอัตโนมัติ ปัจจุบันใช้งานอยู่ใน TikTok Smart Split

SkyReels V4: โมเดล AI ตัวแรกที่มองเห็นและได้ยินในเวลาเดียวกัน
SkyReels V4 จาก Skywork AI นำเสนอสถาปัตยกรรม dual-stream diffusion ที่สร้างวิดีโอและเสียงที่ซิงก์กันในรอบเดียว นี่คือสิ่งที่มีความหมายต่อครีเอเตอร์

Seedance 2.0 มาถึง CapCut แล้ว และ Hollywood ไม่พอใจอย่างมาก
ByteDance เพิ่งเปิดตัวโมเดล AI สร้างวิดีโอที่เป็นที่ถกเถียงใน CapCut หลัง Sora ปิดตัวไปเพียงไม่กี่วัน เรื่องนี้สำคัญอย่างไร และทำไม Hollywood ถึงต่อสู้กลับ