EPFL Stable Video Infinity: Cách tái chế lỗi giải quyết vấn đề lớn nhất của video AI
Một bài báo Oral mới tại ICLR 2026 từ EPFL giới thiệu tái chế lỗi, một kỹ thuật loại bỏ sự trôi lệch theo thời gian và cho phép tạo video AI dài nhiều phút mà không phát sinh thêm chi phí tính toán.

Vấn đề trôi lệch chưa ai giải quyết
Nếu bạn đã thử tạo video AI dạng dài bằng bất kỳ mô hình hiện tại nào, bạn sẽ hiểu sự thất vọng này. Sora 2 giới hạn ở 15 đến 25 giây tùy gói của bạn. Runway Gen-4.5 tối đa 10 giây. Kling 3.0 đạt 15 giây. Lý do không phải là năng lực tính toán hay bộ nhớ. Đó là sự trôi lệch theo thời gian.
Sự trôi lệch theo thời gian xảy ra khi các mô hình video tự hồi quy tích lũy những lỗi nhỏ theo từng khung hình. Mỗi khung hình được tạo ra trở thành đầu vào cho khung tiếp theo, và các khiếm khuyết nhỏ cộng dồn theo cấp số nhân. Sau vài trăm khung hình, đầu ra gần như không còn giống prompt ban đầu.
Về cơ bản, điều này giống với vấn đề "trò chơi truyền tin". Thì thầm một thông điệp qua đủ nhiều người và nó trở nên không thể nhận ra. Các phương pháp trước đây cố chống lại sự trôi lệch bằng cách tạo các clip ngắn hơn rồi ghép lại, nhưng các điểm nối vẫn lộ rõ. Những phương pháp khác dùng tạo theo phân cấp (khung hình chính trước, nội suy sau), giúp ích nhưng không loại bỏ được vấn đề cốt lõi.
Tái chế lỗi xuất hiện
Bài báo có tiêu đề "Stable Video Infinity" và được chấp nhận là một bài trình bày Oral tại ICLR 2026, giới thiệu một ý tưởng đơn giản đến bất ngờ: dạy mô hình xử lý chính những sai lầm của nó.
Đây là insight then chốt. Trong quá trình huấn luyện, các mô hình khuếch tán video tiêu chuẩn học từ dữ liệu chuẩn sạch. Chúng không bao giờ nhìn thấy đầu ra do chính mình tạo ra. Khi được triển khai, chúng đột ngột phải làm việc với các dự đoán không hoàn hảo của chính mình làm đầu vào, và chúng không biết cách xử lý nhiễu.
Tái chế lỗi khắc phục điều này bằng cách sửa đổi vòng lặp huấn luyện:
Lượt truyền xuôi tiêu chuẩn
Mô hình tạo một đoạn video từ dữ liệu huấn luyện sạch.
Thu thập lỗi
Các dự đoán của chính mô hình, cùng những khiếm khuyết của chúng, được thu thập thay vì bị loại bỏ.
Tái chế lỗi
Các đầu ra không hoàn hảo này được đưa trở lại làm đầu vào cho lần lặp huấn luyện tiếp theo, dạy mô hình tạo đầu ra ổn định ngay cả từ những khung hình nhiễu do chính nó tạo ra.
Tinh chỉnh lặp lại
Qua nhiều chu kỳ huấn luyện, mô hình học được một cơ chế tự sửa lỗi mạnh mẽ, ngăn chặn sự tích lũy lỗi.
Vẻ đẹp của phương pháp này nằm ở sự thanh lịch. Không có kiến trúc mô hình mới, không có tham số bổ sung, không có mẹo suy luận. Mô hình chỉ đơn giản học trong quá trình huấn luyện cách các điều kiện triển khai thực tế trông như thế nào.
Tại sao điều này quan trọng hơn bạn nghĩ
Hàm ý của nó vượt xa việc tạo các video mèo dài hơn. Đây là những gì thay đổi:
Trước tái chế lỗi
- Mô hình video bị giới hạn ở 4-20 giây
- Tính nhất quán của cảnh suy giảm nhanh chóng
- Danh tính nhân vật trôi lệch sau vài giây
- Vật lý ngày càng phi thực tế
- Màu sắc và ánh sáng thay đổi khó lường
Sau tái chế lỗi
- Tạo video mạch lạc dài nhiều phút
- Ngoại hình nhân vật ổn định xuyên suốt
- Vật lý và quan hệ không gian nhất quán
- Chỉnh màu và ánh sáng đáng tin cậy
- Không suy giảm chất lượng rõ rệt theo thời gian
Các con số
Nhóm VITA Lab đã thử nghiệm Stable Video Infinity trên nhiều kiến trúc và benchmark. Kết quả rất ấn tượng:
| Chỉ số | Không tái chế lỗi | Có tái chế lỗi | Cải thiện |
|---|---|---|---|
| FVD (thấp hơn là tốt hơn) | Suy giảm sau 4s | Ổn định đến hơn 2 phút | Đáng kể |
| Tính nhất quán của nhân vật | Giảm dưới 60% ở 15s | Duy trì 90%+ ở 2 phút | ~50% tương đối |
| Tính mạch lạc theo thời gian | Trôi lệch rõ rệt ở 8s | Không có trôi lệch rõ rệt ở 2 phút | Bước nhảy vọt về chất lượng |
| Chi phí tính toán bổ sung | Mức cơ sở | Mức cơ sở (tăng 0%) | Không tốn thêm chi phí |
Khía cạnh không phát sinh chi phí tính toán bổ sung là yếu tố then chốt. Tái chế lỗi là kỹ thuật ở thời điểm huấn luyện, không phải thời điểm suy luận. Khi đã huấn luyện xong, mô hình chạy với tốc độ và chi phí hoàn toàn giống như trước.
Tái chế lỗi hoạt động như thế nào bên trong
Dành cho những ai muốn biết chi tiết kỹ thuật, đây là những gì xảy ra trong pipeline huấn luyện đã được sửa đổi.
Huấn luyện khuếch tán video tiêu chuẩn sử dụng lịch nhiễu epsilon áp dụng cho các khung hình chuẩn sạch x_0. Mô hình học cách dự đoán nhiễu và khôi phục tín hiệu gốc. Ở thời điểm suy luận, mô hình tự hồi quy tạo khung hình t+1 với điều kiện dựa trên dự đoán về khung hình t.
Khoảng cách giữa huấn luyện (đầu vào sạch) và suy luận (đầu vào tự tạo) được gọi là thiên lệch phơi nhiễm. Tái chế lỗi trực tiếp giải quyết vấn đề này.
Chi tiết kỹ thuật: Mục tiêu huấn luyện đã sửa đổi▼
Trong quá trình huấn luyện, mô hình định kỳ tạo các khung hình bằng trọng số hiện tại của chính nó thay vì dùng dữ liệu chuẩn. Những khung hình tự tạo này, bao gồm cả các khiếm khuyết, sau đó được dùng làm đầu vào điều kiện cho các khung hình tiếp theo trong chuỗi huấn luyện.
Siêu tham số then chốt là tỷ lệ tái chế r, kiểm soát tần suất khung hình tự tạo thay thế khung hình chuẩn trong quá trình huấn luyện. Bài báo nhận thấy r = 0.3 (30% khung hình tái chế) đạt hiệu suất tối ưu, cân bằng giữa cải thiện độ ổn định và chất lượng tín hiệu huấn luyện.
Hàm mất mát đã sửa đổi vẫn là mục tiêu khuếch tán tiêu chuẩn. Khác biệt duy nhất là phân phối dữ liệu mà mô hình nhìn thấy trong quá trình huấn luyện. Đây là lý do không có chi phí tính toán bổ sung ở thời điểm suy luận.
Về mặt khái niệm, điều này tương tự scheduled sampling trong các mô hình sequence-to-sequence, nhưng được điều chỉnh cho khuôn khổ khuếch tán liên tục. Nhóm VITA Lab ghi nhận mối liên hệ này trong bài báo, đồng thời lưu ý rằng việc áp dụng scheduled sampling một cách ngây thơ cho mô hình khuếch tán không hiệu quả. Đóng góp của họ là công thức cụ thể giúp phương pháp ổn định cho việc tạo video.
Lợi thế mã nguồn mở
Có lẽ khía cạnh thú vị nhất là: mã nguồn được mở hoàn toàn trên GitHub (vita-epfl/Stable-Video-Infinity). Điều này có nghĩa bất kỳ phòng nghiên cứu hoặc công ty nào cũng có thể áp dụng tái chế lỗi cho các mô hình video hiện có của họ.
Bản phát hành mã nguồn mở này tiếp nối xu hướng phát triển trong cộng đồng nghiên cứu video AI. Các mô hình như LTX-2 và Wan 2.6 đã cho thấy các phương pháp mã nguồn mở có thể cạnh tranh với các lựa chọn độc quyền.
Điều này có ý nghĩa gì với ngành
Thời điểm này thật đáng chú ý. Chúng ta đang ở giữa cuộc chạy đua vũ trang về video AI, nơi mọi tên tuổi lớn, từ Runway đến ByteDance, đều thúc đẩy đầu ra dài hơn và chất lượng cao hơn. Tái chế lỗi có thể là mảnh ghép còn thiếu mở khóa thế hệ năng lực tiếp theo.
Dành cho nhà làm phim và nhà sáng tạo
Dành cho nhà nghiên cứu
Dành cho doanh nghiệp
Hướng về phía trước
Công trình của VITA Lab đại diện cho một thay đổi nền tảng trong cách chúng ta suy nghĩ về tạo video AI. Thay vì xây dựng các mô hình ngày càng lớn hơn hoặc thêm cơ chế suy luận phức tạp, giải pháp chỉ đơn giản là cho mô hình thấy đầu ra của chính nó trông như thế nào.
Bài báo sẽ được trình bày tại ICLR 2026, và một số nguồn trong ngành cho thấy các nhà cung cấp mô hình video lớn đã bắt đầu khám phá khả năng tích hợp. Nếu world models đại diện cho tương lai về cách AI hiểu vật lý và không gian, tái chế lỗi đại diện cho tương lai về cách AI duy trì sự hiểu biết đó theo thời gian.
Kỷ nguyên video AI 4 giây có thể kết thúc sớm hơn bất kỳ ai dự đoán. Và điều đó không đòi hỏi kiến trúc mô hình mới hay ngân sách tính toán hàng tỷ đô la. Chỉ cần một vòng lặp huấn luyện thông minh hơn.
Đọc thêm
- Cuộc cách mạng video AI mã nguồn mở: Cách các mô hình mở đang thu hẹp khoảng cách với các hệ thống độc quyền
- Mô phỏng vật lý trong video AI: Tìm hiểu cách các mô hình học tính nhất quán vật lý
- Diffusion Transformers: Kiến trúc vận hành việc tạo video hiện đại
Nguồn
- International Conference on Learning Representations: Oral (Trạng thái ICLR 2026) (International Conference on Learning Representations)
- Các nhà nghiên cứu EPFL VITA qua arXiv: Stable Video Infinity hỗ trợ tạo video có độ dài vô hạn mà không cần suy luận bổ sung… (Các nhà nghiên cứu EPFL VITA qua arXiv)

Kỹ sư AI đến từ Lausanne, kết hợp chiều sâu nghiên cứu với đổi mới thực tiễn. Chia thời gian giữa kiến trúc mô hình và những đỉnh núi Alps.
View profile →Bạn thích những gì vừa đọc?
Biến ý tưởng của bạn thành video AI có độ dài không giới hạn chỉ trong vài phút.
Bài viết liên quan
Tiếp tục khám phá với các bài viết liên quan này

Công cụ video AI miễn phí không giới hạn: Điều gì hiệu quả trong năm 2026
Các công cụ video AI miễn phí không giới hạn thường dựa trên hàng đợi hoặc chạy cục bộ. Tìm hiểu điều gì thực sự không giới hạn, điều gì làm chậm tiến độ và cách chọn thiết lập khả thi cho năm 2026.

Trình mở rộng video AI: Kéo dài video vào năm 2026
Sử dụng trình mở rộng video AI để kéo dài video vào năm 2026. So sánh giới hạn mở rộng, duy trì tính liên tục và chọn quy trình làm việc cho các clip đã tạo hoặc hiện có.

Các công cụ AI chuyển văn bản thành video miễn phí tốt nhất: Hướng dẫn 2026
So sánh các công cụ AI chuyển văn bản thành video miễn phí tốt nhất năm 2026, gồm giới hạn credit thực tế, watermark, đánh đổi khi thiết lập cục bộ và kế hoạch kiểm thử thực tế.