Meta Pixelข้ามไปยังเนื้อหาหลัก
AlexisAlexis· ผู้เขียน AI ตรวจทานโดยมนุษย์
3 min read
515 คำ

EPFL Stable Video Infinity: การรีไซเคิลข้อผิดพลาดแก้ปัญหาใหญ่ที่สุดของวิดีโอ AI ได้อย่างไร

บทความ Oral ใหม่ของ ICLR 2026 จาก EPFL นำเสนอการรีไซเคิลข้อผิดพลาด ซึ่งเป็นเทคนิคที่ขจัดการดริฟต์ตามเวลาและช่วยให้สร้างวิดีโอ AI ความยาวหลายนาทีได้โดยไม่มีต้นทุนคอมพิวต์เพิ่มเติม

EPFL Stable Video Infinity: การรีไซเคิลข้อผิดพลาดแก้ปัญหาใหญ่ที่สุดของวิดีโอ AI ได้อย่างไร

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?

เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai

โมเดลวิดีโอ AI ทุกตัวมีความลับที่ไม่น่าพูดถึงเหมือนกัน สร้างคลิป 4 วินาทีแล้วผลลัพธ์ดูน่าทึ่ง แต่เมื่อเกิน 15 วินาที ตัวละครเริ่มเปลี่ยนรูป ฟิสิกส์พัง สีเปลี่ยน และทั้งฉากค่อย ๆ เลื่อนไปสู่ความไม่สอดคล้องกัน VITA Lab ของ EPFL เพิ่งเผยแพร่ทางออก และมันอาจเป็นบทความที่สำคัญที่สุดของการสร้างวิดีโอในปีนี้

ปัญหาการดริฟต์ที่ยังไม่มีใครแก้ได้

หากคุณเคยลองสร้างวิดีโอ AI แบบยาวด้วยโมเดลปัจจุบัน คุณย่อมรู้ถึงความน่าหงุดหงิด Sora 2 จำกัดที่ 15 ถึง 25 วินาที ขึ้นอยู่กับแพ็กเกจของคุณ Runway Gen-4.5 สูงสุดที่ 10 วินาที Kling 3.0 ไปได้ถึง 15 วินาที เหตุผลไม่ใช่คอมพิวต์หรือหน่วยความจำ แต่คือ การดริฟต์ตามเวลา

💡

การดริฟต์ตามเวลาเกิดขึ้นเมื่อโมเดลวิดีโอแบบ autoregressive สะสมข้อผิดพลาดเล็กน้อยทีละเฟรม แต่ละเฟรมที่สร้างขึ้นจะกลายเป็นอินพุตของเฟรมถัดไป และความไม่สมบูรณ์เล็กน้อยจะทบต้นแบบเอ็กซ์โพเนนเชียล หลังผ่านไปไม่กี่ร้อยเฟรม ผลลัพธ์แทบไม่คล้ายกับพรอมต์ต้นฉบับ

สิ่งนี้คล้ายกับปัญหา "เกมกระซิบ" โดยพื้นฐาน กระซิบข้อความผ่านคนมากพอ ข้อความก็จะกลายเป็นสิ่งที่จำไม่ได้ วิธีการก่อนหน้านี้พยายามต่อสู้กับการดริฟต์ด้วยการสร้างคลิปสั้นกว่าแล้วนำมาต่อกัน แต่รอยต่อมองเห็นได้ วิธีอื่นใช้การสร้างแบบลำดับชั้น (สร้างคีย์เฟรมก่อน แล้วค่อยทำ interpolation) ซึ่งช่วยได้ แต่ไม่กำจัดปัญหาหลัก

การมาถึงของการรีไซเคิลข้อผิดพลาด

บทความชื่อ "Stable Video Infinity" ซึ่งได้รับคัดเลือกเป็น การนำเสนอ Oral ของ ICLR 2026 นำเสนอแนวคิดที่เรียบง่ายอย่างน่าหลอกลวง: สอนโมเดลให้รับมือกับข้อผิดพลาดของตัวเอง

Oral
สถานะ ICLR 2026
0
ต้นทุนคอมพิวต์เพิ่มเติม
นาที
ความยาววิดีโอ

นี่คือข้อมูลเชิงลึกสำคัญ ระหว่างการฝึก โมเดล diffusion สำหรับวิดีโอมาตรฐานเรียนรู้จากข้อมูล ground-truth ที่สะอาด พวกมันไม่เคยเห็นเอาต์พุตที่ตัวเองสร้างขึ้น เมื่อถูกนำไปใช้งานจริง พวกมันจึงต้องทำงานกับคำทำนายที่ไม่สมบูรณ์ของตัวเองในฐานะอินพุตอย่างกะทันหัน และไม่รู้ว่าจะจัดการกับสัญญาณรบกวนอย่างไร

การรีไซเคิลข้อผิดพลาดแก้ปัญหานี้ด้วยการปรับลูปการฝึก:

ขั้นตอนที่ 1

Forward Pass มาตรฐาน

โมเดลสร้างส่วนของวิดีโอจากข้อมูลฝึกที่สะอาด

ขั้นตอนที่ 2

การเก็บรวบรวมข้อผิดพลาด

คำทำนายของโมเดลเอง (พร้อมความไม่สมบูรณ์) ถูกเก็บไว้แทนที่จะทิ้ง

ขั้นตอนที่ 3

การรีไซเคิลข้อผิดพลาด

เอาต์พุตที่ไม่สมบูรณ์เหล่านี้ถูกป้อนกลับเป็นอินพุตสำหรับรอบการฝึกถัดไป สอนโมเดลให้สร้างเอาต์พุตที่เสถียรได้แม้จากเฟรมที่มีสัญญาณรบกวนและสร้างขึ้นเอง

ขั้นตอนที่ 4

การปรับปรุงแบบวนซ้ำ

ตลอดหลายรอบการฝึก โมเดลเรียนรู้กลไกการแก้ไขตัวเองที่แข็งแกร่ง ซึ่งป้องกันการสะสมของข้อผิดพลาด

ความงดงามของแนวทางนี้อยู่ที่ความเรียบง่าย ไม่มีสถาปัตยกรรมโมเดลใหม่ ไม่มีพารามิเตอร์เพิ่มเติม และไม่มีเทคนิคพิเศษตอน inference โมเดลเพียงเรียนรู้ระหว่างการฝึกว่าสภาพการใช้งานจริงเป็นอย่างไร

เหตุใดเรื่องนี้จึงสำคัญกว่าที่คุณคิด

นัยสำคัญของมันไปไกลกว่าการสร้างวิดีโอแมวยาวขึ้น นี่คือสิ่งที่เปลี่ยนไป:

ก่อนการรีไซเคิลข้อผิดพลาด

  • โมเดลวิดีโอจำกัดที่ 4-20 วินาที
  • ความสอดคล้องของฉากลดลงอย่างรวดเร็ว
  • อัตลักษณ์ของตัวละครดริฟต์หลังผ่านไปไม่กี่วินาที
  • ฟิสิกส์ไม่สมจริงมากขึ้นเรื่อย ๆ
  • สีและแสงเปลี่ยนอย่างคาดเดาไม่ได้

หลังการรีไซเคิลข้อผิดพลาด

  • สร้างวิดีโอที่สอดคล้องกันได้หลายนาที
  • รูปลักษณ์ของตัวละครเสถียรตลอดทั้งวิดีโอ
  • ฟิสิกส์และความสัมพันธ์เชิงพื้นที่สอดคล้องกัน
  • การเกรดสีและแสงที่เชื่อถือได้
  • ไม่มีการลดลงของคุณภาพที่มองเห็นได้เมื่อเวลาผ่านไป

ตัวเลข

ทีม VITA Lab ทดสอบ Stable Video Infinity กับสถาปัตยกรรมและเกณฑ์มาตรฐานหลายแบบ ผลลัพธ์โดดเด่น:

ตัวชี้วัดไม่มีการรีไซเคิลข้อผิดพลาดมีการรีไซเคิลข้อผิดพลาดการปรับปรุง
FVD (ยิ่งต่ำยิ่งดี)ลดลงหลัง 4sเสถียรตลอด 2min+มีนัยสำคัญ
ความสอดคล้องของตัวละครลดลงต่ำกว่า 60% ที่ 15sรักษา 90%+ ที่ 2minสัมพัทธ์ ~50%
ความสอดคล้องตามเวลาเห็นการดริฟต์ที่ 8sไม่เห็นการดริฟต์ที่ 2minก้าวกระโดดเชิงคุณภาพ
ภาระคอมพิวต์เพิ่มเติมค่าพื้นฐานค่าพื้นฐาน (เพิ่มขึ้น 0%)ไม่มีต้นทุน
💡

ประเด็นที่ไม่มีภาระคอมพิวต์เพิ่มเติมมีความสำคัญอย่างยิ่ง การรีไซเคิลข้อผิดพลาดเป็นเทคนิคในช่วงการฝึก ไม่ใช่ในช่วง inference เมื่อฝึกเสร็จแล้ว โมเดลทำงานด้วยความเร็วและต้นทุนเท่าเดิมทุกประการ

การรีไซเคิลข้อผิดพลาดทำงานเบื้องหลังอย่างไร

สำหรับผู้ที่ต้องการรายละเอียดทางเทคนิค นี่คือสิ่งที่เกิดขึ้นในไปป์ไลน์การฝึกที่ปรับแก้แล้ว

การฝึก video diffusion มาตรฐานใช้ตารางสัญญาณรบกวน epsilon กับเฟรม ground-truth ที่สะอาด x_0 โมเดลเรียนรู้ที่จะทำนายสัญญาณรบกวนและกู้คืนสัญญาณต้นฉบับ ในช่วง inference โมเดลสร้างเฟรม t+1 แบบ autoregressive โดยมีเงื่อนไขจากคำทำนายของเฟรม t

ช่องว่างระหว่างการฝึก (อินพุตสะอาด) และ inference (อินพุตที่สร้างขึ้นเอง) เรียกว่า exposure bias การรีไซเคิลข้อผิดพลาดจัดการกับปัญหานี้โดยตรง

รายละเอียดทางเทคนิค: เป้าหมายการฝึกที่ปรับแก้

ระหว่างการฝึก โมเดลจะสร้างเฟรมเป็นระยะโดยใช้น้ำหนักปัจจุบันของตัวเอง แทนที่จะใช้ข้อมูล ground-truth จากนั้นเฟรมที่สร้างขึ้นเองเหล่านี้ ซึ่งรวมถึงความไม่สมบูรณ์ของมัน จะถูกใช้เป็นอินพุตแบบมีเงื่อนไขสำหรับเฟรมถัดไปในลำดับการฝึก

hyperparameter สำคัญคือ อัตราส่วนการรีไซเคิล r ซึ่งควบคุมความถี่ที่เฟรมสร้างเองเข้ามาแทนที่เฟรม ground-truth ระหว่างการฝึก บทความพบว่า r = 0.3 (เฟรมรีไซเคิล 30%) ให้ประสิทธิภาพที่เหมาะสมที่สุด โดยรักษาสมดุลระหว่างการเพิ่มความเสถียรและคุณภาพของสัญญาณการฝึก

ฟังก์ชัน loss ที่ปรับแก้ยังคงเป็นเป้าหมาย diffusion มาตรฐาน ความแตกต่างเพียงอย่างเดียวคือการกระจายข้อมูลที่โมเดลเห็นระหว่างการฝึก นี่จึงเป็นเหตุผลที่ไม่มีภาระคอมพิวต์ในช่วง inference

ในเชิงแนวคิด สิ่งนี้คล้ายกับ scheduled sampling ในโมเดล sequence-to-sequence แต่ถูกปรับให้เข้ากับกรอบ diffusion แบบต่อเนื่อง ทีม VITA Lab ให้เครดิตความเชื่อมโยงนี้ในบทความ พร้อมระบุว่าการนำ scheduled sampling มาใช้กับโมเดล diffusion โดยตรงนั้นใช้ไม่ได้ ผลงานของพวกเขาคือสูตรเฉพาะที่ทำให้มันเสถียรสำหรับการสร้างวิดีโอ

ข้อได้เปรียบของโอเพนซอร์ส

บางทีแง่มุมที่น่าตื่นเต้นที่สุดคือ โค้ดเป็นโอเพนซอร์สทั้งหมด บน GitHub (vita-epfl/Stable-Video-Infinity) ซึ่งหมายความว่าห้องปฏิบัติการวิจัยหรือบริษัทใด ๆ สามารถนำการรีไซเคิลข้อผิดพลาดไปใช้กับโมเดลวิดีโอที่มีอยู่ของตนได้

เหตุใดโอเพนซอร์สจึงสำคัญ
โมเดล video diffusion ที่มีอยู่ทุกตัวสามารถปรับเพิ่มการรีไซเคิลข้อผิดพลาดได้ ไม่ต้องเปลี่ยนสถาปัตยกรรม เพียงปรับลูปการฝึก สิ่งนี้อาจปรับปรุง Sora, Runway, Kling และทุกโมเดลโอเพนซอร์สไปพร้อมกัน
ข้อจำกัดในทางปฏิบัติ
ต้องฝึกโมเดลใหม่หรือ fine-tune บริษัทที่มีโมเดลกรรมสิทธิ์ต้องลงทุนคอมพิวต์ในการฝึกใหม่ ประสิทธิผลของเทคนิคอาจแตกต่างกันไปในแต่ละสถาปัตยกรรมและขนาด

การเผยแพร่โอเพนซอร์สนี้สอดคล้องกับแนวโน้มที่กำลังเติบโตในชุมชนวิจัยวิดีโอ AI โมเดลอย่าง LTX-2 และ Wan 2.6 แสดงให้เห็นว่าแนวทางโอเพนซอร์สสามารถแข่งขันกับทางเลือกแบบกรรมสิทธิ์ได้

สิ่งที่หมายถึงสำหรับอุตสาหกรรม

ช่วงเวลานี้น่าทึ่ง เราอยู่ท่ามกลางการแข่งขันด้านวิดีโอ AI ที่ผู้เล่นรายใหญ่ทุกคน ตั้งแต่ Runway ถึง ByteDance กำลังผลักดันเอาต์พุตให้ยาวขึ้นและมีคุณภาพสูงขึ้น การรีไซเคิลข้อผิดพลาดอาจเป็นชิ้นส่วนที่ขาดหายไป ซึ่งปลดล็อกความสามารถยุคถัดไป

🎬

สำหรับผู้สร้างภาพยนตร์และครีเอเตอร์

การสร้างวิดีโอที่สอดคล้องกันแบบยาวช่วยให้สร้างเนื้อหาเชิงเล่าเรื่องได้จริง ไม่ใช่แค่คลิป แต่เป็นฉาก ลำดับเหตุการณ์ และท้ายที่สุดคือภาพยนตร์สั้นที่สร้างจากพรอมต์เดียว
🔬

สำหรับนักวิจัย

การรีไซเคิลข้อผิดพลาดนำเสนอกรอบงานที่นำไปใช้ทั่วไปได้ หลักการเดียวกันอาจใช้กับการสร้างเสียง การสังเคราะห์ฉาก 3D และโมเดลกำเนิดแบบ autoregressive ทุกชนิดที่ประสบปัญหาการดริฟต์
🏢

สำหรับองค์กร

การสร้างวิดีโอแบบยาวที่เสถียรทำให้วิดีโอ AI เหมาะกับกรณีใช้งานระดับมืออาชีพ เช่น เดโมผลิตภัณฑ์ วิดีโอฝึกอบรม และแคมเปญการตลาดที่ต้องการคุณภาพสม่ำเสมอตลอดเนื้อหาหลายนาที

มองไปข้างหน้า

ผลงานของ VITA Lab แสดงถึงการเปลี่ยนแปลงพื้นฐานในการคิดเกี่ยวกับการสร้างวิดีโอ AI แทนที่จะสร้างโมเดลที่ใหญ่ขึ้นเรื่อย ๆ หรือเพิ่มกลไก inference ที่ซับซ้อน ทางออกคือเพียงแสดงให้โมเดลเห็นว่าเอาต์พุตของตัวเองมีหน้าตาอย่างไร

บทความจะถูกนำเสนอที่ ICLR 2026 และแหล่งข่าวในอุตสาหกรรมหลายแห่งชี้ว่าผู้ให้บริการโมเดลวิดีโอรายใหญ่กำลังสำรวจการผสานรวมแล้ว หาก world models แสดงถึงอนาคตของวิธีที่ AI เข้าใจฟิสิกส์และพื้นที่ การรีไซเคิลข้อผิดพลาดก็แสดงถึงอนาคตของวิธีที่ AI รักษาความเข้าใจนั้นไว้ตลอดเวลา

ยุคของวิดีโอ AI ความยาว 4 วินาทีอาจสิ้นสุดเร็วกว่าที่ใครคาดไว้ และมันไม่ต้องอาศัยสถาปัตยกรรมโมเดลใหม่ หรืองบคอมพิวต์มูลค่าหลายพันล้านดอลลาร์ เพียงลูปการฝึกที่ฉลาดกว่า

อ่านเพิ่มเติม


แหล่งข้อมูล

Alexis
AlexisAI EngineerAI Author

วิศวกร AI จากโลซานที่ผสานความลึกซึ้งด้านการวิจัยเข้ากับนวัตกรรมเชิงปฏิบัติ แบ่งเวลาระหว่างสถาปัตยกรรมโมเดลและยอดเขาแอลป์

View profile →

ชอบสิ่งที่คุณอ่านไหม?

เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที

บทความที่เกี่ยวข้อง

สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

เครื่องมือวิดีโอ AI ฟรีแบบไม่จำกัด: อะไรใช้ได้จริงในปี 2026
เครื่องมือฟรีวิดีโอ AI

เครื่องมือวิดีโอ AI ฟรีแบบไม่จำกัด: อะไรใช้ได้จริงในปี 2026

เครื่องมือวิดีโอ AI ฟรีแบบไม่จำกัดมักทำงานผ่านคิวหรือในเครื่อง เรียนรู้ว่าอะไรไม่จำกัดจริง อะไรทำให้ช้าลง และวิธีเลือกการตั้งค่าที่ใช้งานได้ในปี 2026

Read
ตัวขยายวิดีโอ AI: ทำให้วิดีโอยาวขึ้นในปี 2026
วิดีโอ AIการตัดต่อวิดีโอ

ตัวขยายวิดีโอ AI: ทำให้วิดีโอยาวขึ้นในปี 2026

ใช้ตัวขยายวิดีโอ AI เพื่อทำให้วิดีโอยาวขึ้นในปี 2026 เปรียบเทียบข้อจำกัดในการขยาย รักษาความต่อเนื่อง และเลือกเวิร์กโฟลว์สำหรับคลิปที่สร้างขึ้นหรือคลิปที่มีอยู่

Read
เครื่องมือ AI แปลงข้อความเป็นวิดีโอฟรีที่ดีที่สุด: คู่มือปี 2026
วิดีโอ AIเครื่องมือฟรี

เครื่องมือ AI แปลงข้อความเป็นวิดีโอฟรีที่ดีที่สุด: คู่มือปี 2026

เปรียบเทียบเครื่องมือ AI แปลงข้อความเป็นวิดีโอฟรีที่ดีที่สุดในปี 2026 รวมถึงขีดจำกัดเครดิตจริง ลายน้ำ ข้อแลกเปลี่ยนของการตั้งค่าแบบโลคัล และแผนการทดสอบที่ใช้งานได้จริง

Read

ชอบบทความนี้ไหม?

ค้นพบข้อมูลเชิงลึกเพิ่มเติมและติดตามเนื้อหาล่าสุดของเรา