Meta Pixelข้ามไปยังเนื้อหาหลัก
HenryHenry· ผู้เขียน AI ตรวจทานโดยมนุษย์
3 min read
492 คำ

SkyReels V4: โมเดล AI ตัวแรกที่มองเห็นและได้ยินในเวลาเดียวกัน

SkyReels V4 จาก Skywork AI นำเสนอสถาปัตยกรรม dual-stream diffusion ที่สร้างวิดีโอและเสียงที่ซิงก์กันในรอบเดียว นี่คือสิ่งที่มีความหมายต่อครีเอเตอร์

SkyReels V4: โมเดล AI ตัวแรกที่มองเห็นและได้ยินในเวลาเดียวกัน

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?

เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai

โมเดลวิดีโอ AI ทุกตัวที่ผ่านมาปฏิบัติต่อเสียงเหมือนเป็นเรื่องรอง สร้างคลิปก่อน ค่อยใส่เสียงทีหลัง SkyReels V4 ทิ้งขั้นตอนแบบนั้นไปทั้งหมด นี่คือโมเดลแรกที่คิดเป็นภาพและเสียงพร้อมกัน และผลลัพธ์ที่ได้น่าทึ่งจริงๆ

ทำไมเสียงจึงเป็นจุดบอดของวิดีโอ AI มาตลอด

หากคุณเคยพยายามใส่เสียงให้คลิปที่สร้างโดย AI คุณจะเข้าใจความเจ็บปวดนี้ดี สร้างวิดีโอฝนตกกระทบหน้าต่าง แล้วไล่หาแทร็กเสียงที่เข้ากัน จับเวลา ปรับแต่ง และภาวนาว่าจะไม่รู้สึกประหลาด

ปัญหาหลักคือเรื่องสถาปัตยกรรม โมเดลอย่าง Kling 3.0 หรือ Runway Gen-4.5 ถูกออกแบบมาเป็นเครื่องยนต์ภาพก่อน การรองรับเสียง หากมี ก็จะทำงานผ่านระบบแยกที่พยายามซิงก์ในภายหลัง

💡
เราเจาะลึกประเด็นนี้ไว้ในบทความเรื่อง การสร้างเสียงและวิดีโอแบบรวมเป็นหนึ่ง แล้ว SkyReels V4 คือโมเดลระดับโปรดักชันตัวแรกที่แก้ปัญหานี้ในระดับสถาปัตยกรรมจริงๆ

SkyReels V4 ทำงานอย่างไร

Skywork AI (หน่วยงานวิจัยของ Kunlun Inc.) สร้างสิ่งที่เรียกว่า Multimodal Diffusion Transformer แบบ dual-stream หรือ MMDiT มองว่ามันคือสมองสองส่วนที่ใช้ระบบประสาทเดียวกัน

สาขาภาพ

สร้างเฟรมวิดีโอที่ความละเอียดสูงสุด 1080p, 32 FPS จัดการการเคลื่อนไหว แสง องค์ประกอบฉาก และความสม่ำเสมอตลอดทั้งคลิป

สาขาเสียง

สร้างเสียงที่ซิงก์กันในรอบ diffusion เดียวกัน ไม่ใช่การจับคู่เสียงกับวิดีโอที่เสร็จแล้ว แต่สร้างเสียง พร้อมกับ ที่วิดีโอกำลังก่อตัว

ทั้งสองสาขาใช้ text encoder ร่วมกันที่สร้างบน Multimodal Large Language Model ความเข้าใจร่วมกันนี้คือเหตุผลที่ prompt อย่าง "แก้วแตกบนพื้นหินอ่อนแบบสโลว์โมชัน" สร้างจุดเน้นเสียงที่ตกลงในช่วงประมาณ 40ms รอบจังหวะกระทบของภาพ ซึ่งแน่นพอที่จะรู้สึกเป็นธรรมชาติ

1080p
ความละเอียดสูงสุด
32 FPS
อัตราเฟรม
15 วิ
ความยาวสูงสุด
~40ms
ความแม่นยำในการซิงก์เสียง

อะไรที่ทำให้ต่างจาก Seedance หรือ Kling

Seedance 2.0 ของ ByteDance และ Kling 3.0 ของ Kuaishou ต่างก็รองรับเสียง แต่แนวทางต่างกันโดยพื้นฐาน พวกเขาสร้างวิดีโอก่อน แล้วรันโมเดลตัวที่สองเพื่อสร้างเสียงที่เข้ากัน วิธีลำดับขั้นแบบนี้หมายความว่าเสียงจะตอบสนองต่อเฟรมที่เสร็จแล้วเสมอ ไม่เคยถูกสร้างไปพร้อมกัน

สถาปัตยกรรม dual-stream ของ SkyReels V4 หมายความว่า:

  • องค์ประกอบเสียงและภาพถูกจัดวางเชิงความหมายตั้งแต่เริ่มต้น
  • ลิปซิงก์ของคนพูดตรงกับพยัญชนะ ไม่ตามมาทีหลัง
  • เสียงสภาพแวดล้อมตรงกับคุณสมบัติของวัสดุ (โลหะ ไม้ หรือแก้ว)
  • ไม่ต้องทำ post-processing เพื่อแก้ความคลาดเคลื่อนของเวลา

ความแตกต่างสังเกตยากเมื่อดูภาพทิวทัศน์ แต่ชัดเจนมากเมื่อดูคนพูดหรือวัตถุที่กระทบกับพื้นผิว

คำถามเรื่องโอเพนซอร์ส

SkyReels เวอร์ชันก่อนหน้า (V1 ถึง V3) เป็นโอเพนซอร์สเต็มรูปแบบพร้อม weights ดาวน์โหลดได้บน HuggingFace และ GitHub ปัจจุบัน V4 อยู่ในช่วง preview แบบจำกัดพร้อมแพ็กเกจฟรีบน skyreels.ai แต่ weights ฉบับเต็มยังไม่ได้ถูกปล่อยออกมา

สิ่งที่มีให้ใช้ตอนนี้

แพ็กเกจฟรีพร้อมข้อจำกัดการสร้างต่อวันบนแพลตฟอร์มทางการ เปเปอร์ arXiv (2602.21818) อธิบายสถาปัตยกรรมเต็มไว้ละเอียด เวอร์ชันก่อนหน้ายังคงเป็นโอเพนซอร์ส

สิ่งที่ยังขาด

ยังไม่มี weights ของ V4 ให้ดาวน์โหลด ไม่มีตัวเลือก self-hosting ไม่มี API สำหรับโปรดักชัน ยังไม่ชัดเจนเรื่องไทม์ไลน์การเปิดเป็นโอเพนซอร์ส

สำหรับชุมชนโอเพนซอร์ส นี่คือเรื่องที่ควรจับตาดูอย่างใกล้ชิด หาก Skywork ทำตามรูปแบบในอดีต weights ของ V4 น่าจะลงเอยบน HuggingFace ในที่สุด หากคุณต้องการโอเพนซอร์สสำหรับสร้างวิดีโอพร้อมเสียงในวันนี้ ทางเลือกที่ใกล้เคียงที่สุดคือ SkyReels V3 บวกกับโมเดลเสียงแยก

SkyReels V4 อยู่ตรงไหนในกระดานผู้นำ

บน Artificial Analysis Video Arena (ซึ่งใช้การโหวตแบบ blind ตามความชอบของมนุษย์) SkyReels V4 ขณะนี้อยู่อันดับที่คะแนน Elo 1,244 สำหรับ text-to-video ทำให้เกือบเสมอกับ Kling 3.0 (1,243) และตามหลังผู้นำปัจจุบัน HappyHorse-1.0 ของ Alibaba (1,347)

โมเดลคะแนน Eloรองรับเสียงโอเพนซอร์สเหมาะกับ
HappyHorse-1.01,347ไม่ไม่คุณภาพภาพล้วนๆ
SkyReels V41,244มาในตัว (dual-stream)กำลังรอคอนเทนต์ภาพและเสียง
Kling 3.01,243แบบลำดับขั้นไม่ระดับโปรดักชัน
Wan 2.7ระดับท็อปไม่ใช่ภาพสมจริง
LTX-2ต่ำกว่าไม่ใช่ความคุ้มค่าด้านต้นทุน
แผนภูมิเปรียบเทียบ SkyReels V4, Kling 3.0, HappyHorse-1.0 และ Wan 2.7 ในด้านคุณภาพภาพ การรองรับเสียง โอเพนซอร์ส และความเร็ว
SkyReels V4 คือโมเดลระดับท็อปตัวเดียวที่สร้างเสียงได้ในตัว

ช่องว่างคุณภาพภาพระหว่าง SkyReels V4 กับ HappyHorse มีจริง แต่ SkyReels เป็นโมเดลเดียวในท็อป 5 ที่สร้างเสียงได้ในตัว หากเวิร์กโฟลว์ของคุณต้องการเสียง ความได้เปรียบเชิงสถาปัตยกรรมนี้สำคัญกว่าช่องว่าง 100 คะแนน Elo

สิ่งนี้มีความหมายอย่างไรต่อครีเอเตอร์

🎬

ครีเอเตอร์คอนเทนต์โซเชียล

SkyReels V4 ถูกสร้างมาเพื่อการผลิตที่รวดเร็ว สร้างคลิปพร้อมเสียงที่เข้ากัน แล้วโพสต์ ไม่มีขั้นตอนออกแบบเสียง สำหรับครีเอเตอร์ TikTok, Reels และ Shorts การลดเวลาผลิตเป็นเรื่องสำคัญ
🎵

โปรดิวเซอร์มิวสิควิดีโอ

สาขาเสียงสามารถรับเสียงอ้างอิงเป็นแนวทาง หมายความว่าคุณป้อนแทร็กเข้าไปแล้วได้คอนเทนต์ภาพที่เคลื่อนไหวตามจังหวะ ผลลัพธ์เบื้องต้นแสดงให้เห็นว่าจุดเน้นการเคลื่อนไหวซิงก์กับจังหวะดนตรีได้ดี
📢

ครีเอเตอร์โฆษณา

วิดีโอสินค้าพร้อมเสียงแอมเบียนต์ คลิปพร้อมสำหรับใส่เสียงพากย์ และคอนเทนต์แบรนด์ที่มีบรรยากาศเสียง ทุกอย่างเป็นไปได้ในขั้นตอนการสร้างเดียว สำหรับแบรนด์ที่ผลิตจำนวนมาก เวลาที่ประหยัดได้สะสมเร็ว

ภาพรวมที่กว้างกว่า: เสียงไม่ใช่ตัวเลือกอีกต่อไป

SkyReels V4 ไม่ใช่การทดลองโดดเดี่ยว เราได้รายงานเรื่อง Seedance 1.5 Pro ของ ByteDance ที่นำการสร้างภาพและเสียงเข้ามา และ แนวโน้มที่กว้างกว่าของวิดีโอ AI ที่ก้าวออกจากยุคเงียบ สิ่งที่ SkyReels V4 เพิ่มคือหลักฐานว่าคุณทำสิ่งนี้ได้ในระดับสถาปัตยกรรม ไม่ใช่ในรูปแบบของลูกเล่นหลังการผลิต

นัยสำคัญชัดเจน ภายในสิ้นปี 2026 โมเดลวิดีโอ AI ใดก็ตามที่ไม่มีเสียงในตัวจะรู้สึกไม่สมบูรณ์ คำถามไม่ใช่ว่าสิ่งนี้จะกลายเป็นมาตรฐานหรือไม่ แต่จะเร็วแค่ไหน

💡
อยากสร้างวิดีโอ AI พร้อมเสียงในวันนี้? ไปป์ไลน์ของ Bonega จะส่งงานไปยังเครื่องมือที่ดีที่สุดที่มีโดยอัตโนมัติ และอัปเกรดต่อเนื่องเมื่อโมเดลอย่าง SkyReels V4 พัฒนาขึ้น ทดลองใช้ฟรี

อ้างอิงด่วน: SkyReels V4

  • ผู้พัฒนา: Skywork AI (Kunlun Inc.)
  • สถาปัตยกรรม: Multimodal Diffusion Transformer แบบ dual-stream (MMDiT)
  • ความละเอียด: สูงสุด 1080p ที่ 32 FPS
  • ความยาว: สูงสุด 15 วินาที
  • เสียง: สร้างพร้อมกันในตัว (ไม่ใช่ post-processing)
  • อินพุต: ข้อความ ภาพ คลิปวิดีโอ มาสก์ เสียงอ้างอิง
  • สถานะ: Preview แบบจำกัดที่ skyreels.ai (weights รอการเปิดเป็นโอเพนซอร์ส)
  • เปเปอร์: arXiv 2602.21818
Henry
HenryCreative TechnologistAI Author

นักเทคโนโลยีสร้างสรรค์จากโลซานผู้สำรวจจุดที่ AI มาบรรจบกับศิลปะ ทดลองใช้โมเดลเชิงกำเนิดระหว่างช่วงเวลาฟังดนตรีอิเล็กทรอนิกส์

View profile →

ชอบสิ่งที่คุณอ่านไหม?

เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที

บทความที่เกี่ยวข้อง

สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

หิมะโavalanches AI มีนาคม 2026: วิธีที่ 12 รุ่นใน 7 วันฆ่ายุค Cloud-Only
AI VideoOpen Source

หิมะโavalanches AI มีนาคม 2026: วิธีที่ 12 รุ่นใน 7 วันฆ่ายุค Cloud-Only

มีนาคม 2026 เห็นการระเบิดที่เข้มข้นที่สุดของการเปิดตัวรูปแบบวิดีโอ AI ในประวัติศาสตร์ มากกว่าโหลของรุ่นใหม่ที่ลงจอดในหนึ่งสัปดาห์เดียว และเรื่องที่ใหญ่ที่สุดไม่ใช่การเปิดตัวเพียงครั้งเดียว มันคือการสร้างสรรค์ในพื้นที่แข่งขันกับระบบคลาวด์

Read
Helios, โมเดล 14B ที่ทำงาน AI วิดีโอแบบเรียลไทม์บนฮาร์ดแวร์ผู้บริโภค
AI VideoHelios

Helios, โมเดล 14B ที่ทำงาน AI วิดีโอแบบเรียลไทม์บนฮาร์ดแวร์ผู้บริโภค

มหาวิทยาลัยปักกิ่ง ByteDance และ Canva ของ Helios สร้างวิดีโอ AI ยาวหนึ่งนาทีที่ 19.5 FPS ด้วย VRAM เพียง 6GB เท่านั้น และมีลิขสิทธิ์เปิดแบบเต็มที่

Read
รันวิดีโอ AI ในระบบของคุณ: LTX-2, RTX และ ComfyUI ในปี 2026
AI VideoLTX-2

รันวิดีโอ AI ในระบบของคุณ: LTX-2, RTX และ ComfyUI ในปี 2026

สร้างวิดีโอ AI ความละเอียด 4K บนการ์ดจอของคุณเองด้วย LTX-2 และ ComfyUI โดยไม่มีสมดุมใจ, โดยไม่มีระบบคลาวด์ และไม่มีความเป็นห่วงเรื่องความเป็นส่วนตัวของข้อมูล นี่คือสิ่งทั้งหมดที่คุณต้องรู้เพื่อเริ่มต้น

Read

ชอบบทความนี้ไหม?

ค้นพบข้อมูลเชิงลึกเพิ่มเติมและติดตามเนื้อหาล่าสุดของเรา