Meta Pixelข้ามไปยังเนื้อหาหลัก
DamienDamien· ผู้เขียน AI ตรวจทานโดยมนุษย์
3 min read
423 คำ

Helios, โมเดล 14B ที่ทำงาน AI วิดีโอแบบเรียลไทม์บนฮาร์ดแวร์ผู้บริโภค

มหาวิทยาลัยปักกิ่ง ByteDance และ Canva ของ Helios สร้างวิดีโอ AI ยาวหนึ่งนาทีที่ 19.5 FPS ด้วย VRAM เพียง 6GB เท่านั้น และมีลิขสิทธิ์เปิดแบบเต็มที่

Helios, โมเดล 14B ที่ทำงาน AI วิดีโอแบบเรียลไทม์บนฮาร์ดแวร์ผู้บริโภค

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?

เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai

อุปสรรคที่ใหญ่ที่สุดในการสร้างวิดีโอ AI แบบเรียลไทม์มักจะเป็นการคำนวณ Helios โมเดล 14 พันล้านพารามิเตอร์ใหม่จากมหาวิทยาลัยปักกิ่ง ByteDance และ Canva ได้ทำลายอุปสรรคนี้ ทำงานที่ 19.5 เฟรมต่อวินาทีบน H100 เดียว สร้างวิดีโอยาวสูงถึง 60 วินาที และต้องการเพียง VRAM ประมาณ 6GB กับการออฟโหลดกลุ่ม และใช่ลิขสิทธิ์ Apache 2.0

เหตุใด Helios จึงสำคัญ

โมเดล AI วิดีโอส่วนใหญ่บังคับให้คุณเลือก: คุณภาพหรือความเร็ว โมเดลขนาดใหญ่เช่น Veo 3.1 หรือ Runway Gen-4.5 ให้ผลลัพธ์ที่น่าทึ่ง แต่ทำงานบนกลุ่มคลาวด์และคิดค่าใช้งานต่อวินาที โมเดลที่เล็กกว่าพอดีกับ GPU ผู้บริโภค แต่ให้ผลลัพธ์ที่อ่อนแอลงอย่างเห็นได้ชัด Helios ปฏิเสธตัวเลือกนี้

14B
พารามิเตอร์
19.5
FPS บน H100 เดียว
~6GB
VRAM พร้อมการออฟโหลด
60s
ความยาววิดีโอสูงสุด

ข้อมูลเชิงลึกหลัก: Helios เป็น โมเดล diffusion autoregressive ที่สร้างวิดีโอแบบ frame-by-frame ในลักษณะสตรีม มากกว่า denoising วิดีโอทั้งหมดในครั้งเดียว ซึ่งหมายความว่ามันสามารถเริ่มส่งออกเฟรมได้ทันทีในขณะที่ยังคงสร้างส่วนที่เหลือ ไม่ต้องรอให้คลิปแสดงผลเสร็จสิ้น

วิธีการทำงาน

โมเดล diffusion แบบดั้งเดิมประมวลผลวิดีโอทั้งหมดพร้อมกัน คุณส่งคำแจง รอนาที และได้รับคลิปที่สมบูรณ์ Helios ใช้วิธีการที่แตกต่างโดยพื้นฐาน

Diffusion แบบดั้งเดิมHelios (Autoregressive Diffusion)
ประมวลผลเฟรมทั้งหมดพร้อมกันสร้าง frame-by-frame
ข้อกำหนดหน่วยความจำสูงการใช้หน่วยความจำคงที่
ผลลัพธ์เฉพาะเมื่อเสร็จสิ้นอย่างสมบูรณ์ส่งออกสตรีมแบบเรียลไทม์
คุณภาพลดลงตามความยาวคุณภาพสอดคล้องกันที่ความยาวใด ๆ

โมเดลใช้ กลไก bi-directional temporal attention ที่ให้ผลต่างเฟรมใหม่แต่ละเฟรมอ้างอิงทั้งบริบทในอดีตและอนาคตภายในหน้าต่างเลื่อน สิ่งนี้ป้องกันการลอยตัวของคุณภาพที่มักจะบ้านหลังบ้านวิดีโอ autoregressive ซึ่งเฟรมในภายหลังค่อย ๆ สูญเสียความสอดคล้องกับเฟรมก่อนหน้า

💡
Helios ได้วิดีโอยาวนาทีถึง 1,452 เฟรม โดยไม่พึ่งพา KV-cache เคล็ดลับหรือแฮกแอนตี-ดริฟต์ สถาปัตยกรรมเองรักษาความสอดคล้องกัน

มุมฮาร์ดแวร์ผู้บริโภค

นี่คือที่ที่สิ่งต่าง ๆ กลายเป็นปฏิบัติจริง ด้วย group offloading Helios สามารถทำงานบนฮาร์ดแวร์ที่มี VRAM ประมาณ 6GB ซึ่งวางสิ่งนี้ลงในดินแดน RTX 4060 Ti การ์ดที่ราคาประมาณ $400

เปรียบเทียบกับการสร้างบนคลาวด์:

วิธีต้นทุนต่อนาทีของวิดีโอฮาร์ดแวร์ที่จำเป็น
Cloud API (Sora, Veo)$2-8 ต่อการสร้างไม่มี (คลาวด์)
Helios (ท้องถิ่น H100)~$0.15 ในไฟฟ้าH100 ($25,000+)
Helios (ท้องถิ่น RTX 4060 Ti)~$0.01 ในไฟฟ้าRTX 4060 Ti (~$400)

แลกเปลี่ยนกับ GPU ผู้บริโภคคือความเร็ว บน RTX 4060 Ti คุณจะไม่พุ่ง 19.5 FPS คาดว่าใกล้เคียง 2-3 FPS มากขึ้น ซึ่งยังคงหมายถึงวิดีโอ 60 วินาทีในสิ่งที่น้อยกว่า 10 นาที สำหรับการสร้างท้องถิ่น ส่วนตัว ไม่มีขีดจำกัด นั่นน่าสนใจ

เกณฑ์มาตรฐานที่สนับสนุนการเรียกร้อง

Helios ไม่เพียงแต่อ้างการทำงานแบบเรียลไทม์ มันคะแนนแข่งขันบนเกณฑ์มาตรฐานคุณภาพวิดีโอ

💡
บน VBench Helios จับคู่หรือเกินกว่าโมเดลที่มีจำนวนพารามิเตอร์ที่คล้ายกันในคุณภาพการเคลื่อนไหว ความสอดคล้องของเวลา และการให้คะแนนแนวโน้ม ผลการทดสอบเต็มรูปแบบมีอยู่ในเอกสาร (arXiv:2603.04379)

ทีมวิจัยการทำงานร่วมกันระหว่างมหาวิทยาลัยปักกิ่ง ByteDance และ Canva โดยเฉพาะอย่างยิ่งทดสอบกับ:

  • CogVideoX (พารามิเตอร์ 13B): Helios จับคู่คุณภาพที่การสร้างเร็ว 5-10x
  • Pyramid Flow (autoregressive baseline): Helios ให้ผลลัพธ์ที่สอดคล้องกันของเวลามากขึ้น
  • Open-Sora v1.2: Helios สร้างคลิปที่ยาวกว่า สอดคล้องมากขึ้น

การเปรียบเทียบที่สำคัญคือกับโมเดลในช่วง 1-2B พารามิเตอร์ เช่น LTX-2 และ CogVideo ตัวแปรที่เล็กกว่า Helios ทำงานด้วยความเร็วที่คล้ายกันในขณะที่ให้ผลลัพธ์ที่ดูเหมือนมาจากโมเดลที่ใหญ่กว่ามาก

สิ่งที่คุณจริง ๆ สามารถทำได้กับมัน

Helios ไม่ใช่ความอยากรู้ของวิจัย มันเป็นเครื่องมือเชิงปฏิบัติที่คุณสามารถติดตั้งและเรียกใช้งานวันนี้ได้

  • การสร้างข้อความเป็นวิดีโอถึง 60 วินาที
  • ภาพเคลื่อนไหวจากภาพไปยังวิดีโอจากเฟรมอ้างอิง
  • เอาต์พุตสตรีมแบบเรียลไทม์ (เริ่มชมในขณะที่สร้าง)
  • ลิขสิทธิ์ Apache 2.0 (อนุญาตการใช้งานเชิงพาณิชย์)
  • Group offloading สำหรับการสนับสนุน GPU ผู้บริโภค

ลิขสิทธิ์ Apache 2.0 มีนัยสำคัญ ซึ่งแตกต่างจากโมเดลน้ำหนักเปิดจำนวนมากที่ จำกัด การใช้งานเชิงพาณิชย์ Helios อนุญาตอย่างชัดเจน นี่เปิดประตูสำหรับนักพัฒนาอิสระ สตูดิโอเล็ก ๆ และเริ่มต้นต้นเพื่อสร้างผลิตภัณฑ์ด้านบนโมเดลโดยไม่มีค่าธรรมเนียมลิขสิทธิ์

ภาพใหญ่

Helios เปลี่ยนวิธีที่เราเข้าหาการเข้าถึงวิดีโอ AI รุ่นก่อนหน้าของโมเดลวิดีโอ "เปิด" ต้องการฮาร์ดแวร์ระดับองค์กรหรือให้ผลลัพธ์ที่ดูแย่กว่าคู่ของคลาวด์อย่างเห็นได้ชัด

การสร้างคลาวด์
ไม่จำเป็นต้องลงทุนฮาร์ดแวร์ เอาต์พุตคุณภาพสูงสุด โมเดลที่ปรับปรุงอย่างต่อเนื่อง
การสร้างท้องถิ่น (Helios)
ต้นทุนต่อการสร้างเป็นศูนย์ ความเป็นส่วนตัวเต็มรูปแบบ ไม่มีขีดจำกัดอัตรา ลิขสิทธิ์ที่เอื้อต่อการพาณิชย์ ปิดการใช้งาน

สำหรับมืออาชีพที่สร้างร้อย ๆ ของการวนซ้ำต่อโครงการ เศรษฐศาสตร์เปลี่ยนไปอย่างมีนัยสำคัญ GPU $400 จ่ายตัวเองหลังจากการสร้างคลาวด์ประมาณ 200-300 สำหรับทีมที่ทดลองวิดีโอ AI ในผลิตภัณฑ์ ลักษณะไม่มีขีดจำกัดของการสร้างท้องถิ่นจะขจัดการลังเล

เราครอบคลุมการสร้างสตรีมท้องถิ่นที่เติบโตในของเรา แนวทางในการเรียกใช้วิดีโอ AI ในท้องถิ่น และ Helios พอดีโดยตรงเข้าไปในเวิร์กโฟลว์นั้น นอกจากนี้ยังสร้างขึ้นจาก ความก้าวหน้าของการสร้างแบบเรียลไทม์ ที่เราเขียนด้วย TurboDiffusion นำแนวคิดไปไกลกว่าด้วยโมเดลที่ใหญ่กว่ามาก

มีอะไรต่อจากนี้

ทีม Helios ได้บอกใบ้เกี่ยวกับงานติดตามใจในการสร้าง audio-visual และความสามารถ control interacting แล้ว หากได้รับประโยชน์ในประสิทธิภาพเดียวกัน เราอาจเห็นการสร้างวิดีโอแบบเรียลไทม์ที่ควบคุมได้ audio-inclusive บนฮาร์ดแวร์ผู้บริโภคโดยปลายปี 2026

สำหรับตอนนี้ Helios มีอยู่บน GitHub ภายใต้ Apache 2.0 ถ้าคุณมี NVIDIA GPU ที่มี VRAM 6GB+ และต้องการทดลองการสร้างวิดีโอ AI ท้องถิ่นแข่งขันได้อย่างแท้จริง นี่คือจุดเข้า

ที่แข็งแกร่งที่สุด

💡

การอ่านที่เกี่ยวข้อง: ดูวิธีโมเดลโอเพนซอร์สกำลัง ปิดช่องว่างกับแพลตฟอร์มที่เป็นกรรมสิทธิ์ หรือสำรวจ วิธีการสร้าง 4K แบบ LTX-2 ดั้งเดิม บน GPU ผู้บริโภค

Damien
DamienAI DeveloperAI Author

นักพัฒนา AI จากลียงผู้ชื่นชอบการเปลี่ยนแนวคิด ML ที่ซับซ้อนให้เป็นสูตรง่าย ๆ เมื่อไม่ได้แก้บั๊กโมเดล คุณจะพบเขาปั่นจักรยานผ่านหุบเขาโรน

View profile →

ชอบสิ่งที่คุณอ่านไหม?

เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที

บทความที่เกี่ยวข้อง

สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

ByteDance Vidi2: AI ที่เข้าใจวิดีโอเหมือนนักตัดต่อมืออาชีพ
AI VideoVideo Editing

ByteDance Vidi2: AI ที่เข้าใจวิดีโอเหมือนนักตัดต่อมืออาชีพ

ByteDance เพิ่งเปิดโค้ดต้นฉบับของ Vidi2 โมเดลที่มีพารามิเตอร์ 12 พันล้านตัว ที่สามารถเข้าใจเนื้อหาวิดีโอได้ดีพอที่จะตัดต่อวิดีโอหลายชั่วโมงให้กลายเป็นคลิปที่สมบูรณ์แบบโดยอัตโนมัติ ปัจจุบันใช้งานอยู่ใน TikTok Smart Split

Read
SkyReels V4: โมเดล AI ตัวแรกที่มองเห็นและได้ยินในเวลาเดียวกัน
SkyReelsAI Video

SkyReels V4: โมเดล AI ตัวแรกที่มองเห็นและได้ยินในเวลาเดียวกัน

SkyReels V4 จาก Skywork AI นำเสนอสถาปัตยกรรม dual-stream diffusion ที่สร้างวิดีโอและเสียงที่ซิงก์กันในรอบเดียว นี่คือสิ่งที่มีความหมายต่อครีเอเตอร์

Read
Seedance 2.0 มาถึง CapCut แล้ว และ Hollywood ไม่พอใจอย่างมาก
AI VideoSeedance

Seedance 2.0 มาถึง CapCut แล้ว และ Hollywood ไม่พอใจอย่างมาก

ByteDance เพิ่งเปิดตัวโมเดล AI สร้างวิดีโอที่เป็นที่ถกเถียงใน CapCut หลัง Sora ปิดตัวไปเพียงไม่กี่วัน เรื่องนี้สำคัญอย่างไร และทำไม Hollywood ถึงต่อสู้กลับ

Read

ชอบบทความนี้ไหม?

ค้นพบข้อมูลเชิงลึกเพิ่มเติมและติดตามเนื้อหาล่าสุดของเรา