Helios: Mô hình AI video thời gian thực 14B chạy trên phần cứng tiêu dùng
Helios từ Đại học Bắc Kinh, ByteDance và Canva tạo ra video AI dài tới 1 phút với tốc độ 19.5 FPS chỉ với 6GB VRAM thông qua tách nhóm, hoàn toàn mã nguồn mở.

Tại sao Helios lại quan trọng
Hầu hết các mô hình video AI buộc bạn phải lựa chọn: chất lượng hoặc tốc độ. Các mô hình lớn như Veo 3.1 hoặc Runway Gen-4.5 tạo ra kết quả tuyệt vời, nhưng chúng chạy trên các cụm đám mây và tính phí theo giây. Các mô hình nhỏ hơn vừa với GPU tiêu dùng nhưng tạo ra kết quả yếu hơn rõ rệt. Helios từ chối lựa chọn đó.
Hiểu biết chính: Helios là một mô hình khuếch tán tự hồi quy tạo ra video khung hình một cách theo luồng, thay vì khử nhiễu một video hoàn chỉnh cùng một lúc. Điều này có nghĩa là nó có thể bắt đầu xuất ra các khung hình ngay lập tức trong khi vẫn tạo ra phần còn lại. Không cần chờ đợi một đoạn hoàn chỉnh hiển thị.
Nó hoạt động như thế nào
Các mô hình khuếch tán truyền thống xử lý toàn bộ video cùng một lúc. Bạn gửi một lời nhắc, chờ đợi vài phút, và nhận được một đoạn hoàn chỉnh. Helios có một cách tiếp cận hoàn toàn khác nhau.
| Khuếch tán truyền thống | Helios (Khuếch tán tự hồi quy) |
|---|---|
| Xử lý tất cả các khung hình cùng một lúc | Tạo ra khung hình theo khung hình |
| Yêu cầu bộ nhớ cao | Sử dụng bộ nhớ không đổi |
| Chỉ xuất khi hoàn toàn hoàn thành | Xuất luồng thời gian thực |
| Chất lượng giảm khi độ dài tăng | Chất lượng nhất quán ở bất kỳ độ dài nào |
Mô hình sử dụng cơ chế chú ý thời gian hai chiều cho phép mỗi khung hình mới tham chiếu cả bối cảnh quá khứ và tương lai trong một cửa sổ trượt. Điều này ngăn chặn sự trôi chất lượng thường xuyên làm tổn hại các mô hình video tự hồi quy, trong đó các khung hình sau này dần dần mất sự nhất quán với những khung hình trước đó.
Khía cạnh phần cứng tiêu dùng
Đây là nơi mọi thứ trở nên thực tế. Với tách nhóm, Helios có thể chạy trên phần cứng có khoảng 6GB VRAM. Điều đó đặt nó chính xác trong vùng RTX 4060 Ti, thẻ này có giá khoảng $400.
So sánh với tạo dựa trên đám mây:
| Phương pháp | Chi phí mỗi phút video | Phần cứng cần thiết |
|---|---|---|
| API đám mây (Sora, Veo) | $2-8 mỗi lần tạo | Không (đám mây) |
| Helios (cục bộ, H100) | ~$0,15 điện | H100 ($25.000+) |
| Helios (cục bộ, RTX 4060 Ti) | ~$0,01 điện | RTX 4060 Ti (~$400) |
Sự đánh đổi với GPU tiêu dùng là tốc độ. Trên RTX 4060 Ti, bạn sẽ không đạt 19,5 FPS. Dự kiến gần 2-3 FPS, điều đó vẫn có nghĩa là video 60 giây hoàn thành trong dưới 10 phút. Đối với tạo cục bộ, riêng tư, không giới hạn, đó là điều hấp dẫn.
Điểm chuẩn hỗ trợ những tuyên bố
Helios không chỉ tuyên bố hiệu suất thời gian thực. Nó ghi điểm cạnh tranh trên các điểm chuẩn chất lượng video tiêu chuẩn.
Nhóm nghiên cứu, một sự hợp tác giữa Đại học Bắc Kinh, ByteDance và Canva, đã kiểm tra cụ thể đối với:
- CogVideoX (13B tham số): Helios phù hợp với chất lượng ở tốc độ tạo nhanh gấp 5-10 lần
- Pyramid Flow (đường cơ sở tự hồi quy): Helios tạo ra kết quả nhất quán theo thời gian hơn
- Open-Sora v1.2: Helios tạo ra các đoạn dài hơn, mạch lạc hơn
Sự so sánh quan trọng là với các mô hình trong phạm vi 1-2B tham số, như LTX-2 và các biến thể CogVideo nhỏ hơn. Helios chạy ở tốc độ tương tự trong khi tạo ra kết quả trông giống như nó đến từ một mô hình lớn hơn nhiều.
Những gì bạn thực sự có thể làm với nó
Helios không phải là một sự tò mò nghiên cứu. Nó là một công cụ thực tế mà bạn có thể cài đặt và chạy hôm nay.
- ✓Tạo video từ văn bản dài tới 60 giây
- ✓Hoạt ảnh hình ảnh-video từ một khung hình tham chiếu
- ✓Xuất luồng thời gian thực (bắt đầu xem khi đang tạo)
- ✓Giấy phép Apache 2.0 (cho phép sử dụng thương mại)
- ✓Tách nhóm cho hỗ trợ GPU tiêu dùng
Giấy phép Apache 2.0 rất quan trọng. Không giống như nhiều mô hình trọng lượng mở hạn chế sử dụng thương mại, Helios cho phép một cách rõ ràng. Điều này mở cửa cho các nhà phát triển độc lập, các studio nhỏ và các công ty khởi nghiệp để xây dựng các sản phẩm trên mô hình mà không có phí cấp phép.
Bức tranh lớn hơn
Helios thay đổi cách chúng tôi tiếp cận khả năng truy cập video AI. Thế hệ trước các mô hình video "mở" yêu cầu phần cứng cấp doanh nghiệp hoặc tạo ra kết quả trông rõ rệt tệ hơn so với các mô hình tương ứng trên đám mây.
Đối với những chuyên gia tạo ra hàng trăm lần lặp lại mỗi dự án, kinh tế học thay đổi đáng kể. GPU $400 tự trả tiền sau khoảng 200-300 lần tạo đám mây. Đối với các nhóm thử nghiệm video AI trong các sản phẩm, bản chất không giới hạn của tạo cục bộ loại bỏ sự do dự để thử nghiệm.
Chúng tôi đã bao gồm hệ sinh thái tạo cục bộ đang phát triển trong hướng dẫn của chúng tôi để chạy video AI cục bộ, và Helios phù hợp trực tiếp vào quy trình công việc đó. Nó cũng dựa trên bước ngoặt tạo thời gian thực mà chúng tôi đã viết với TurboDiffusion, đưa khái niệm xa hơn với một mô hình lớn hơn nhiều.
Điều gì sẽ xảy ra tiếp theo
Nhóm Helios đã gợi ý về công việc tiếp theo trên tạo âm thanh hình ảnh và khả năng kiểm soát tương tác. Nếu các lợi ích hiệu suất tương tự áp dụng, chúng tôi có thể thấy tạo video thời gian thực, có thể kiểm soát, bao gồm âm thanh trên phần cứng tiêu dùng vào cuối năm 2026.
Hiện tại, Helios có sẵn trên GitHub dưới Apache 2.0. Nếu bạn có GPU NVIDIA với 6GB+ VRAM và muốn thử nghiệm tạo video AI cục bộ thực sự cạnh tranh, đây là điểm vào mạnh nhất có sẵn.
Đọc liên quan: Xem cách các mô hình mã nguồn mở đóng khoảng cách với các nền tảng độc quyền, hoặc khám phá cách tiếp cận của LTX-2 để tạo 4K gốc trên GPU tiêu dùng.

Nhà phát triển AI đến từ Lyon, yêu thích việc biến các khái niệm ML phức tạp thành công thức đơn giản. Khi không gỡ lỗi mô hình, bạn sẽ thấy anh ấy đạp xe qua thung lũng Rhône.
View profile →Bạn thích những gì vừa đọc?
Biến ý tưởng của bạn thành video AI có độ dài không giới hạn chỉ trong vài phút.
Bài viết liên quan
Tiếp tục khám phá với các bài viết liên quan này

ByteDance Vidi2: AI hiểu video như một biên tập viên
ByteDance vừa mở mã nguồn Vidi2, mô hình 12 tỷ tham số hiểu nội dung video đủ tốt để tự động biên tập hàng giờ cảnh quay thành các clip hoàn thiện. Nó đã cung cấp sức mạnh cho TikTok Smart Split.

SkyReels V4: Mô Hình AI Đầu Tiên Vừa Nhìn Vừa Nghe Cùng Lúc
SkyReels V4 của Skywork AI giới thiệu kiến trúc khuếch tán hai luồng, tạo đồng thời video và âm thanh đồng bộ trong một lượt duy nhất. Đây là điều nó mang lại cho người sáng tạo.

Seedance 2.0 ra mắt trên CapCut, Hollywood không chịu ngồi yên
ByteDance vừa tung mô hình video AI gây tranh cãi lên CapCut, chỉ hai ngày sau khi Sora đóng cửa. Đây là lý do sự kiện này quan trọng, và tại sao Hollywood đang phản công toàn diện.