Meta PixelBỏ qua để đến nội dung chính
AlexisAlexis· Tác giả AI, đã được con người biên tập
11 min read
2104 từ

EPFL Stable Video Infinity: Cách tái chế lỗi giải quyết vấn đề lớn nhất của video AI

Một bài báo Oral mới tại ICLR 2026 từ EPFL giới thiệu tái chế lỗi, một kỹ thuật loại bỏ sự trôi lệch theo thời gian và cho phép tạo video AI dài nhiều phút mà không phát sinh thêm chi phí tính toán.

EPFL Stable Video Infinity: Cách tái chế lỗi giải quyết vấn đề lớn nhất của video AI

Sẵn sàng tạo video AI của riêng bạn?

Tham gia cùng hàng nghìn nhà sáng tạo đang sử dụng Bonega.ai

Mọi mô hình video AI đều có cùng một bí mật khó nói. Tạo một clip 4 giây và kết quả trông tuyệt đẹp. Vượt quá 15 giây, nhân vật bắt đầu biến dạng, vật lý trở nên sai lệch, màu sắc thay đổi và toàn bộ cảnh trôi dần vào sự rời rạc. VITA Lab của EPFL vừa công bố một giải pháp, và đây có thể là bài báo quan trọng nhất về tạo video trong năm nay.

Vấn đề trôi lệch chưa ai giải quyết

Nếu bạn đã thử tạo video AI dạng dài bằng bất kỳ mô hình hiện tại nào, bạn sẽ hiểu sự thất vọng này. Sora 2 giới hạn ở 15 đến 25 giây tùy gói của bạn. Runway Gen-4.5 tối đa 10 giây. Kling 3.0 đạt 15 giây. Lý do không phải là năng lực tính toán hay bộ nhớ. Đó là sự trôi lệch theo thời gian.

💡

Sự trôi lệch theo thời gian xảy ra khi các mô hình video tự hồi quy tích lũy những lỗi nhỏ theo từng khung hình. Mỗi khung hình được tạo ra trở thành đầu vào cho khung tiếp theo, và các khiếm khuyết nhỏ cộng dồn theo cấp số nhân. Sau vài trăm khung hình, đầu ra gần như không còn giống prompt ban đầu.

Về cơ bản, điều này giống với vấn đề "trò chơi truyền tin". Thì thầm một thông điệp qua đủ nhiều người và nó trở nên không thể nhận ra. Các phương pháp trước đây cố chống lại sự trôi lệch bằng cách tạo các clip ngắn hơn rồi ghép lại, nhưng các điểm nối vẫn lộ rõ. Những phương pháp khác dùng tạo theo phân cấp (khung hình chính trước, nội suy sau), giúp ích nhưng không loại bỏ được vấn đề cốt lõi.

Tái chế lỗi xuất hiện

Bài báo có tiêu đề "Stable Video Infinity" và được chấp nhận là một bài trình bày Oral tại ICLR 2026, giới thiệu một ý tưởng đơn giản đến bất ngờ: dạy mô hình xử lý chính những sai lầm của nó.

Oral
Trạng thái ICLR 2026
0
Chi phí tính toán bổ sung
Phút
Độ dài video

Đây là insight then chốt. Trong quá trình huấn luyện, các mô hình khuếch tán video tiêu chuẩn học từ dữ liệu chuẩn sạch. Chúng không bao giờ nhìn thấy đầu ra do chính mình tạo ra. Khi được triển khai, chúng đột ngột phải làm việc với các dự đoán không hoàn hảo của chính mình làm đầu vào, và chúng không biết cách xử lý nhiễu.

Tái chế lỗi khắc phục điều này bằng cách sửa đổi vòng lặp huấn luyện:

Bước 1

Lượt truyền xuôi tiêu chuẩn

Mô hình tạo một đoạn video từ dữ liệu huấn luyện sạch.

Bước 2

Thu thập lỗi

Các dự đoán của chính mô hình, cùng những khiếm khuyết của chúng, được thu thập thay vì bị loại bỏ.

Bước 3

Tái chế lỗi

Các đầu ra không hoàn hảo này được đưa trở lại làm đầu vào cho lần lặp huấn luyện tiếp theo, dạy mô hình tạo đầu ra ổn định ngay cả từ những khung hình nhiễu do chính nó tạo ra.

Bước 4

Tinh chỉnh lặp lại

Qua nhiều chu kỳ huấn luyện, mô hình học được một cơ chế tự sửa lỗi mạnh mẽ, ngăn chặn sự tích lũy lỗi.

Vẻ đẹp của phương pháp này nằm ở sự thanh lịch. Không có kiến trúc mô hình mới, không có tham số bổ sung, không có mẹo suy luận. Mô hình chỉ đơn giản học trong quá trình huấn luyện cách các điều kiện triển khai thực tế trông như thế nào.

Tại sao điều này quan trọng hơn bạn nghĩ

Hàm ý của nó vượt xa việc tạo các video mèo dài hơn. Đây là những gì thay đổi:

Trước tái chế lỗi

  • Mô hình video bị giới hạn ở 4-20 giây
  • Tính nhất quán của cảnh suy giảm nhanh chóng
  • Danh tính nhân vật trôi lệch sau vài giây
  • Vật lý ngày càng phi thực tế
  • Màu sắc và ánh sáng thay đổi khó lường

Sau tái chế lỗi

  • Tạo video mạch lạc dài nhiều phút
  • Ngoại hình nhân vật ổn định xuyên suốt
  • Vật lý và quan hệ không gian nhất quán
  • Chỉnh màu và ánh sáng đáng tin cậy
  • Không suy giảm chất lượng rõ rệt theo thời gian

Các con số

Nhóm VITA Lab đã thử nghiệm Stable Video Infinity trên nhiều kiến trúc và benchmark. Kết quả rất ấn tượng:

Chỉ sốKhông tái chế lỗiCó tái chế lỗiCải thiện
FVD (thấp hơn là tốt hơn)Suy giảm sau 4sỔn định đến hơn 2 phútĐáng kể
Tính nhất quán của nhân vậtGiảm dưới 60% ở 15sDuy trì 90%+ ở 2 phút~50% tương đối
Tính mạch lạc theo thời gianTrôi lệch rõ rệt ở 8sKhông có trôi lệch rõ rệt ở 2 phútBước nhảy vọt về chất lượng
Chi phí tính toán bổ sungMức cơ sởMức cơ sở (tăng 0%)Không tốn thêm chi phí
💡

Khía cạnh không phát sinh chi phí tính toán bổ sung là yếu tố then chốt. Tái chế lỗi là kỹ thuật ở thời điểm huấn luyện, không phải thời điểm suy luận. Khi đã huấn luyện xong, mô hình chạy với tốc độ và chi phí hoàn toàn giống như trước.

Tái chế lỗi hoạt động như thế nào bên trong

Dành cho những ai muốn biết chi tiết kỹ thuật, đây là những gì xảy ra trong pipeline huấn luyện đã được sửa đổi.

Huấn luyện khuếch tán video tiêu chuẩn sử dụng lịch nhiễu epsilon áp dụng cho các khung hình chuẩn sạch x_0. Mô hình học cách dự đoán nhiễu và khôi phục tín hiệu gốc. Ở thời điểm suy luận, mô hình tự hồi quy tạo khung hình t+1 với điều kiện dựa trên dự đoán về khung hình t.

Khoảng cách giữa huấn luyện (đầu vào sạch) và suy luận (đầu vào tự tạo) được gọi là thiên lệch phơi nhiễm. Tái chế lỗi trực tiếp giải quyết vấn đề này.

Chi tiết kỹ thuật: Mục tiêu huấn luyện đã sửa đổi

Trong quá trình huấn luyện, mô hình định kỳ tạo các khung hình bằng trọng số hiện tại của chính nó thay vì dùng dữ liệu chuẩn. Những khung hình tự tạo này, bao gồm cả các khiếm khuyết, sau đó được dùng làm đầu vào điều kiện cho các khung hình tiếp theo trong chuỗi huấn luyện.

Siêu tham số then chốt là tỷ lệ tái chế r, kiểm soát tần suất khung hình tự tạo thay thế khung hình chuẩn trong quá trình huấn luyện. Bài báo nhận thấy r = 0.3 (30% khung hình tái chế) đạt hiệu suất tối ưu, cân bằng giữa cải thiện độ ổn định và chất lượng tín hiệu huấn luyện.

Hàm mất mát đã sửa đổi vẫn là mục tiêu khuếch tán tiêu chuẩn. Khác biệt duy nhất là phân phối dữ liệu mà mô hình nhìn thấy trong quá trình huấn luyện. Đây là lý do không có chi phí tính toán bổ sung ở thời điểm suy luận.

Về mặt khái niệm, điều này tương tự scheduled sampling trong các mô hình sequence-to-sequence, nhưng được điều chỉnh cho khuôn khổ khuếch tán liên tục. Nhóm VITA Lab ghi nhận mối liên hệ này trong bài báo, đồng thời lưu ý rằng việc áp dụng scheduled sampling một cách ngây thơ cho mô hình khuếch tán không hiệu quả. Đóng góp của họ là công thức cụ thể giúp phương pháp ổn định cho việc tạo video.

Lợi thế mã nguồn mở

Có lẽ khía cạnh thú vị nhất là: mã nguồn được mở hoàn toàn trên GitHub (vita-epfl/Stable-Video-Infinity). Điều này có nghĩa bất kỳ phòng nghiên cứu hoặc công ty nào cũng có thể áp dụng tái chế lỗi cho các mô hình video hiện có của họ.

Vì sao mã nguồn mở quan trọng
Bất kỳ mô hình khuếch tán video hiện có nào cũng có thể được cải tiến bằng tái chế lỗi. Không cần thay đổi kiến trúc, chỉ cần sửa đổi vòng lặp huấn luyện. Điều này có thể đồng thời cải thiện Sora, Runway, Kling và mọi mô hình mã nguồn mở.
Hạn chế thực tế
Cần huấn luyện lại hoặc tinh chỉnh mô hình. Các công ty sở hữu mô hình độc quyền cần đầu tư năng lực tính toán để huấn luyện lại. Hiệu quả của kỹ thuật có thể khác nhau giữa các kiến trúc và quy mô khác nhau.

Bản phát hành mã nguồn mở này tiếp nối xu hướng phát triển trong cộng đồng nghiên cứu video AI. Các mô hình như LTX-2Wan 2.6 đã cho thấy các phương pháp mã nguồn mở có thể cạnh tranh với các lựa chọn độc quyền.

Điều này có ý nghĩa gì với ngành

Thời điểm này thật đáng chú ý. Chúng ta đang ở giữa cuộc chạy đua vũ trang về video AI, nơi mọi tên tuổi lớn, từ Runway đến ByteDance, đều thúc đẩy đầu ra dài hơn và chất lượng cao hơn. Tái chế lỗi có thể là mảnh ghép còn thiếu mở khóa thế hệ năng lực tiếp theo.

🎬

Dành cho nhà làm phim và nhà sáng tạo

Tạo video mạch lạc dạng dài cho phép tạo nội dung có cốt truyện thực sự. Không chỉ là clip, mà còn là cảnh, chuỗi cảnh và cuối cùng là phim ngắn được tạo từ một prompt duy nhất.
🔬

Dành cho nhà nghiên cứu

Tái chế lỗi cung cấp một khuôn khổ có thể khái quát hóa. Nguyên tắc tương tự có thể áp dụng cho tạo âm thanh, tổng hợp cảnh 3D và bất kỳ mô hình tạo sinh tự hồi quy nào gặp vấn đề trôi lệch.
🏢

Dành cho doanh nghiệp

Khả năng tạo nội dung dạng dài ổn định giúp video AI khả thi cho các trường hợp sử dụng chuyên nghiệp: demo sản phẩm, video đào tạo, chiến dịch marketing đòi hỏi chất lượng nhất quán xuyên suốt nhiều phút nội dung.

Hướng về phía trước

Công trình của VITA Lab đại diện cho một thay đổi nền tảng trong cách chúng ta suy nghĩ về tạo video AI. Thay vì xây dựng các mô hình ngày càng lớn hơn hoặc thêm cơ chế suy luận phức tạp, giải pháp chỉ đơn giản là cho mô hình thấy đầu ra của chính nó trông như thế nào.

Bài báo sẽ được trình bày tại ICLR 2026, và một số nguồn trong ngành cho thấy các nhà cung cấp mô hình video lớn đã bắt đầu khám phá khả năng tích hợp. Nếu world models đại diện cho tương lai về cách AI hiểu vật lý và không gian, tái chế lỗi đại diện cho tương lai về cách AI duy trì sự hiểu biết đó theo thời gian.

Kỷ nguyên video AI 4 giây có thể kết thúc sớm hơn bất kỳ ai dự đoán. Và điều đó không đòi hỏi kiến trúc mô hình mới hay ngân sách tính toán hàng tỷ đô la. Chỉ cần một vòng lặp huấn luyện thông minh hơn.

Đọc thêm


Nguồn

Alexis
AlexisAI EngineerAI Author

Kỹ sư AI đến từ Lausanne, kết hợp chiều sâu nghiên cứu với đổi mới thực tiễn. Chia thời gian giữa kiến trúc mô hình và những đỉnh núi Alps.

View profile →

Bạn thích những gì vừa đọc?

Biến ý tưởng của bạn thành video AI có độ dài không giới hạn chỉ trong vài phút.

Bài viết liên quan

Tiếp tục khám phá với các bài viết liên quan này

Bạn thích bài viết này chứ?

Khám phá thêm nhiều thông tin hữu ích và cập nhật nội dung mới nhất của chúng tôi.