Meta Pixelข้ามไปยังเนื้อหาหลัก
DamienDamien· ผู้เขียน AI ตรวจทานโดยมนุษย์
3 min read
524 คำ

Alibaba HappyHorse-1.0: โมเดลลึกลับที่ขึ้นอันดับหนึ่งบนทุกกระดานผู้นำ AI Video

โมเดลชื่อ HappyHorse-1.0 ปรากฏบน Artificial Analysis โดยไม่มีการระบุที่มา ขึ้นสู่อันดับ 1 ทั้ง text-to-video และ image-to-video ก่อนจะเปิดเผยว่าเป็นของ Alibaba นี่คือสิ่งที่เรารู้เกี่ยวกับสถาปัตยกรรม ทีมงาน และความหมายต่อตลาด AI video

Alibaba HappyHorse-1.0: โมเดลลึกลับที่ขึ้นอันดับหนึ่งบนทุกกระดานผู้นำ AI Video

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?

เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai

เมื่อวันที่ 7 เมษายน 2026 โมเดลที่ไม่มีใครเคยได้ยินชื่อปรากฏขึ้นบน Artificial Analysis Video Arena ภายในสามวัน โมเดลดังกล่าวครองอันดับ 1 ทั้งการสร้าง text-to-video และ image-to-video ไม่มีแบรนด์ ไม่มีข่าวประชาสัมพันธ์ และไม่มีชื่อบริษัทกำกับอยู่ จากนั้น Alibaba ยืนยันว่าเป็นโมเดลของพวกเขา นี่คือเรื่องราวของ HappyHorse-1.0 ม้ามืดที่เพิ่งสับเปลี่ยนอันดับของ AI video

การเปิดเผย

Artificial Analysis ดำเนินการ Video Arena ที่ผู้ใช้ส่งพรอมป์ต์ โมเดลนิรนามสองตัวสร้างผลลัพธ์ และผู้ใช้เลือกผลลัพธ์ที่ตนชอบกว่า คะแนนโหวตจะป้อนเข้าสู่ระบบจัดอันดับ Elo (คณิตศาสตร์แบบเดียวกับที่ใช้ในการจัดอันดับหมากรุก) โมเดลไม่สามารถบิดเบือนระบบได้ เพราะผู้ประเมินไม่เคยรู้ว่าโมเดลใดสร้างผลลัพธ์ใด

HappyHorse-1.0 เข้าสู่เวทีนี้เมื่อวันที่ 7 เมษายนด้วยโปรไฟล์ว่างเปล่า ไม่มีโลโก้ ไม่มีการระบุบริษัท ภายในวันที่ 10 เมษายน โมเดลนี้ครองตำแหน่งสูงสุดใน 2 จาก 4 หมวดการจัดอันดับ และ Alibaba ยืนยันความเป็นเจ้าของผ่านบัญชี X ที่เพิ่งสร้างและคำแถลงต่อ CNBC

💡
หุ้นของ Alibaba ที่จดทะเบียนในฮ่องกงเพิ่มขึ้น 2.12% ในวันที่ประกาศ และก่อนหน้านั้นเพิ่มขึ้นแล้ว 6.75% ในช่วงต้นสัปดาห์ ขณะที่กระแสคาดเดาเกี่ยวกับโมเดลลึกลับกำลังก่อตัว

ตัวเลข

คะแนน Elo ของ HappyHorse บอกเรื่องราวได้อย่างชัดเจน:

1333
Elo T2V (ไม่มีเสียง)
1392
Elo I2V (ไม่มีเสียง)
1205
Elo T2V (มีเสียง)

เพื่อเปรียบเทียบ อันดับ 1 ก่อนหน้านี้ใน text-to-video คือ Seedance 2.0 ของ ByteDance ที่ Elo 1273 HappyHorse เอาชนะไป 60 คะแนน ซึ่งเป็นช่องว่างที่โดยทั่วไปต้องใช้เวลาหลายเดือนจึงจะปิดได้ ใน image-to-video HappyHorse ทำได้ 1392 เทียบกับ 1355 ของ Seedance 2.0

หมวดที่รวมเสียงให้ภาพที่ต่างออกไป HappyHorse อยู่อันดับ 2 รองจาก Seedance 2.0 (Elo 1219 เทียบกับ 1205) ซึ่งบ่งชี้ว่าไปป์ไลน์เสียงยังต้องพัฒนาต่อเมื่อเทียบกับคุณภาพวิดีโอ

หมวดหมู่HappyHorseอันดับ 1 ก่อนหน้าช่องว่าง
Text-to-Video (ไม่มีเสียง)13331273 (Seedance 2.0)+60
Image-to-Video (ไม่มีเสียง)13921355 (Seedance 2.0)+37
Text-to-Video (มีเสียง)12051219 (Seedance 2.0)-14

สถาปัตยกรรม: Transformer เดียว ประมวลผลทุกอย่างพร้อมกัน

ระบบ AI video ส่วนใหญ่เชื่อมต่อองค์ประกอบแยกกัน ได้แก่ text encoder, video generator และโมเดลเสียงที่เพิ่มเข้ามาภายหลัง HappyHorse ใช้แนวทางที่ต่างออกไป

โมเดลใช้ Self-Attention Transformer แบบ single-stream 40 ชั้น โดยไม่มีโมดูล Cross-Attention โทเค็นข้อความ วิดีโอ และเสียงทั้งหมดไหลผ่าน transformer stack เดียวกันพร้อมกัน การออกแบบแบบรวมศูนย์นี้กำจัดพารามิเตอร์ที่ซ้ำซ้อนและลดความซับซ้อนของการอนุมาน

สถาปัตยกรรมแบบรวมศูนย์
ข้อความ วิดีโอ และเสียงได้รับการประมวลผลในการส่งผ่านครั้งเดียว ไม่มีไปป์ไลน์เสียงแยกต่างหาก องค์ประกอบที่ต้องจัดการน้อยลง และความหน่วงต่ำกว่า
เสียงยังตามหลัง
แม้มีการออกแบบแบบรวมศูนย์ คุณภาพเสียงยังอยู่อันดับ 2 รองจากไปป์ไลน์เสียงเฉพาะทางของ Seedance 2.0

ไปป์ไลน์การอนุมานมีขนาดกะทัดรัดผิดปกติ: ใช้เพียง 8 ขั้นตอนการลดสัญญาณรบกวน โดยไม่มี Classifier-Free Guidance (CFG) เปรียบเทียบกับโมเดลคู่แข่งจำนวนมากที่ใช้ 25-50 ขั้นตอนพร้อมเปิดใช้ CFG สิ่งนี้ชี้ให้เห็นถึงการกลั่นโมเดลอย่างเข้มข้นระหว่างการฝึก โดยแลกความสามารถดิบกับความเร็ว

ทีมเบื้องหลัง

HappyHorse มาจาก Future Life Lab ภายใต้ Taotian Group ของ Alibaba (ฝ่ายอีคอมเมิร์ซ) ผู้นำคือ Zhang Di อดีต VP ของ Kuaishou และหัวหน้าฝ่ายเทคนิคของ Kling AI

รายละเอียดนี้สำคัญ Zhang Di สร้างวัฒนธรรมวิศวกรรมเบื้องหลัง Kling หนึ่งในโมเดล AI video ที่แข็งแกร่งที่สุดของปี 2025 เขาเข้าใจความท้าทายด้านโครงสร้างพื้นฐาน ไปป์ไลน์การฝึก และช่องว่างด้านการประเมินผล การนำประสบการณ์นั้นมาใช้กับทรัพยากรการประมวลผลของ Alibaba เป็นสมการที่ต่างจากการดำเนินงานสตาร์ทอัพอิสระ

💡
HappyHorse รองรับ lip sync แบบเนทีฟใน 6 ภาษา ได้แก่ จีน อังกฤษ ญี่ปุ่น เกาหลี เยอรมัน และฝรั่งเศส ความสามารถหลายภาษานี้บ่งชี้ถึงโมเดลที่ฝึกด้วยข้อมูลหลากหลายซึ่งผ่านการคัดสรรอย่างรอบคอบ

เหตุใดจึงสำคัญต่อตลาด

ตลาด AI video ในเดือนเมษายน 2026 มีความผันผวนสูงเป็นพิเศษ:

มีนาคม 2026

ประกาศยุติ Sora

OpenAI ยืนยันว่า Sora จะยุติการให้บริการ ในวันที่ 26 เมษายน ต้นทุนการประมวลผลและแรงกดดันจากการแข่งขันพิสูจน์แล้วว่าไม่ยั่งยืน

กุมภาพันธ์ 2026

ระงับ Seedance 2.0

ByteDance ถูกบังคับให้หยุดการเปิดตัวหลังข้อพิพาทลิขสิทธิ์กับสตูดิโอฮอลลีวูด

7 เมษายน 2026

HappyHorse ปรากฏตัว

โมเดลนิรนามเข้าสู่ Artificial Analysis Video Arena

10 เมษายน 2026

Alibaba ยืนยันความเป็นเจ้าของ

หุ้นพุ่งขึ้นเมื่อมีการเปิดเผยตัวตน

ขณะที่ Sora กำลังปิดตัวลงและ Seedance เผชิญปัญหากฎหมาย HappyHorse มาถึงในช่วงที่ตลาดกำลังมองหาผู้นำรายใหม่ Runway Gen-4.5 ยังคงแข็งแกร่งในเวิร์กโฟลว์การผลิต และ Google Veo 3.1 ครองพื้นที่การผสานรวมระดับองค์กร แต่ในด้านคุณภาพการสร้างดิบที่วัดจากความชอบของมนุษย์แบบไม่เปิดเผยชื่อ HappyHorse ครองตำแหน่งสูงสุดแล้ว

Open Source: เร็ว ๆ นี้ (อาจจะ)

GitHub repository และ Hugging Face model hub ต่างแสดงข้อความ "Coming Soon" ณ วันที่ 11 เมษายน ทีมงานสัญญาว่าจะเปิดตัว weights แบบ open-source ครบทั้ง 15 billion parameters พร้อมใบอนุญาตเชิงพาณิชย์ หากเกิดขึ้น HappyHorse จะเป็นโมเดลวิดีโอ open-source ที่ใหญ่ที่สุดที่มีให้ใช้งาน ใหญ่กว่า 2B parameters ของ LTX-Video อย่างมาก

แต่ "coming soon" ไม่ใช่ "released" จนกว่า weights จะดาวน์โหลดได้และผ่านการตรวจสอบอย่างอิสระ ผล benchmark เหล่านี้ยังมีเครื่องหมายดอกจัน ชุมชน AI video เรียนรู้ที่จะรอผลลัพธ์ที่ทำซ้ำได้ก่อนประกาศผู้ชนะ

สิ่งที่ต้องจับตา

สามสิ่งจะกำหนดว่า HappyHorse จะรักษาความเป็นผู้นำไว้ได้หรือไม่:

  • การเปิดตัว weights แบบ open-source และการทำซ้ำผล benchmark อย่างอิสระ
  • การปรับปรุงคุณภาพเสียงให้เทียบเท่าหรือเหนือกว่า Seedance 2.0 ในหมวดที่รวมเสียง
  • ความพร้อมใช้งานของ API และราคา เพราะการครอง benchmark ไม่มีความหมายหากครีเอเตอร์เข้าถึงโมเดลไม่ได้

พื้นที่การสร้าง AI video เคลื่อนไหวอย่างรวดเร็ว ในเดือนมกราคม Runway Gen-4.5 ดูเหมือนไร้เทียมทาน ในเดือนกุมภาพันธ์ Seedance 2.0 คว้ามงกุฎไป ตอนนี้ HappyHorse ครองมันอยู่ คำถามไม่ใช่ว่าสิ่งใดจะเอาชนะมันได้ในที่สุดหรือไม่ แต่คือเมื่อไรและมาจากที่ใด

สำหรับครีเอเตอร์และนักพัฒนาที่กำลังสร้างไปป์ไลน์วิดีโอในวันนี้ ข้อสรุปมีความชัดเจนในทางปฏิบัติ: ไม่มีโมเดลใดอยู่บนจุดสูงสุดได้นาน กลยุทธ์ที่ดีที่สุดคือสร้างเวิร์กโฟลว์ที่สามารถสลับโมเดลตามการเปลี่ยนแปลงของกระดานผู้นำ แทนที่จะเดิมพันทุกอย่างกับชื่อเดียว

💡
Alibaba เพิ่งเปิดตัว Wan 2.7 with Thinking Mode เช่นกัน ซึ่งเป็นโมเดลแยกจากแผนก Tongyi Lab ของพวกเขา โมเดลวิดีโอหลัก 2 โมเดลจากทีม Alibaba คนละทีมในสัปดาห์เดียวกัน ส่งสัญญาณถึงการผลักดัน AI video ทั่วทั้งบริษัท

แหล่งข้อมูล

Damien
DamienAI DeveloperAI Author

นักพัฒนา AI จากลียงผู้ชื่นชอบการเปลี่ยนแนวคิด ML ที่ซับซ้อนให้เป็นสูตรง่าย ๆ เมื่อไม่ได้แก้บั๊กโมเดล คุณจะพบเขาปั่นจักรยานผ่านหุบเขาโรน

View profile →

ชอบสิ่งที่คุณอ่านไหม?

เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที

บทความที่เกี่ยวข้อง

สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

Google Veo 3.1 Lite: การสร้างวิดีโอ AI ต้นทุนต่ำมาถึง Gemini API แล้ว
วิดีโอ AIGoogle Veo

Google Veo 3.1 Lite: การสร้างวิดีโอ AI ต้นทุนต่ำมาถึง Gemini API แล้ว

Google เพิ่งเปิดตัว Veo 3.1 Lite ซึ่งเป็นโมเดลสร้างวิดีโอ AI ที่รวดเร็วและเข้าถึงได้ใน Gemini API นี่คือสิ่งที่นักพัฒนาต้องรู้เกี่ยวกับราคา ข้อแลกเปลี่ยนด้านคุณภาพ และการนำวิดีโอไปใช้ในแอปโปรดักชัน

Read
การปฏิวัติ World Model ของวิดีโอ AI: ฟิสิกส์ซิมูเลชันกำลังแทนที่การสร้างพิกเซลในปี 2026
วิดีโอ AIโมเดลโลก

การปฏิวัติ World Model ของวิดีโอ AI: ฟิสิกส์ซิมูเลชันกำลังแทนที่การสร้างพิกเซลในปี 2026

จากการทำนายพิกเซลไปจนถึงการจำลองฟิสิกส์, โมเดลโลกกำลังเปลี่ยนแปลงวิธีที่ AI สร้างวิดีโอโดยพื้นฐาน นี่คือเหตุผลว่าทำไมสิ่งนี้จึงสำคัญสำหรับผู้สร้าง

Read
ปฏิวัติวิดีโอ AI แบบโอเพนซอร์ส: GPU สำหรับผู้บริโภคจะแข่งกับยักษ์ใหญ่ด้านเทคโนโลยีได้หรือไม่?
วิดีโอ AIโอเพนซอร์ส

ปฏิวัติวิดีโอ AI แบบโอเพนซอร์ส: GPU สำหรับผู้บริโภคจะแข่งกับยักษ์ใหญ่ด้านเทคโนโลยีได้หรือไม่?

ByteDance และ Tencent เพิ่งเปิดตัวโมเดลวิดีโอโอเพนซอร์สที่รันบนฮาร์ดแวร์สำหรับผู้บริโภค สิ่งนี้เปลี่ยนแปลงทุกอย่างสำหรับครีเอเตอร์อิสระ

Read

ชอบบทความนี้ไหม?

ค้นพบข้อมูลเชิงลึกเพิ่มเติมและติดตามเนื้อหาล่าสุดของเรา