Alibaba HappyHorse-1.0: โมเดลลึกลับที่ขึ้นอันดับหนึ่งบนทุกกระดานผู้นำ AI Video
โมเดลชื่อ HappyHorse-1.0 ปรากฏบน Artificial Analysis โดยไม่มีการระบุที่มา ขึ้นสู่อันดับ 1 ทั้ง text-to-video และ image-to-video ก่อนจะเปิดเผยว่าเป็นของ Alibaba นี่คือสิ่งที่เรารู้เกี่ยวกับสถาปัตยกรรม ทีมงาน และความหมายต่อตลาด AI video

การเปิดเผย
Artificial Analysis ดำเนินการ Video Arena ที่ผู้ใช้ส่งพรอมป์ต์ โมเดลนิรนามสองตัวสร้างผลลัพธ์ และผู้ใช้เลือกผลลัพธ์ที่ตนชอบกว่า คะแนนโหวตจะป้อนเข้าสู่ระบบจัดอันดับ Elo (คณิตศาสตร์แบบเดียวกับที่ใช้ในการจัดอันดับหมากรุก) โมเดลไม่สามารถบิดเบือนระบบได้ เพราะผู้ประเมินไม่เคยรู้ว่าโมเดลใดสร้างผลลัพธ์ใด
HappyHorse-1.0 เข้าสู่เวทีนี้เมื่อวันที่ 7 เมษายนด้วยโปรไฟล์ว่างเปล่า ไม่มีโลโก้ ไม่มีการระบุบริษัท ภายในวันที่ 10 เมษายน โมเดลนี้ครองตำแหน่งสูงสุดใน 2 จาก 4 หมวดการจัดอันดับ และ Alibaba ยืนยันความเป็นเจ้าของผ่านบัญชี X ที่เพิ่งสร้างและคำแถลงต่อ CNBC
ตัวเลข
คะแนน Elo ของ HappyHorse บอกเรื่องราวได้อย่างชัดเจน:
เพื่อเปรียบเทียบ อันดับ 1 ก่อนหน้านี้ใน text-to-video คือ Seedance 2.0 ของ ByteDance ที่ Elo 1273 HappyHorse เอาชนะไป 60 คะแนน ซึ่งเป็นช่องว่างที่โดยทั่วไปต้องใช้เวลาหลายเดือนจึงจะปิดได้ ใน image-to-video HappyHorse ทำได้ 1392 เทียบกับ 1355 ของ Seedance 2.0
หมวดที่รวมเสียงให้ภาพที่ต่างออกไป HappyHorse อยู่อันดับ 2 รองจาก Seedance 2.0 (Elo 1219 เทียบกับ 1205) ซึ่งบ่งชี้ว่าไปป์ไลน์เสียงยังต้องพัฒนาต่อเมื่อเทียบกับคุณภาพวิดีโอ
| หมวดหมู่ | HappyHorse | อันดับ 1 ก่อนหน้า | ช่องว่าง |
|---|---|---|---|
| Text-to-Video (ไม่มีเสียง) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (ไม่มีเสียง) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (มีเสียง) | 1205 | 1219 (Seedance 2.0) | -14 |
สถาปัตยกรรม: Transformer เดียว ประมวลผลทุกอย่างพร้อมกัน
ระบบ AI video ส่วนใหญ่เชื่อมต่อองค์ประกอบแยกกัน ได้แก่ text encoder, video generator และโมเดลเสียงที่เพิ่มเข้ามาภายหลัง HappyHorse ใช้แนวทางที่ต่างออกไป
โมเดลใช้ Self-Attention Transformer แบบ single-stream 40 ชั้น โดยไม่มีโมดูล Cross-Attention โทเค็นข้อความ วิดีโอ และเสียงทั้งหมดไหลผ่าน transformer stack เดียวกันพร้อมกัน การออกแบบแบบรวมศูนย์นี้กำจัดพารามิเตอร์ที่ซ้ำซ้อนและลดความซับซ้อนของการอนุมาน
ไปป์ไลน์การอนุมานมีขนาดกะทัดรัดผิดปกติ: ใช้เพียง 8 ขั้นตอนการลดสัญญาณรบกวน โดยไม่มี Classifier-Free Guidance (CFG) เปรียบเทียบกับโมเดลคู่แข่งจำนวนมากที่ใช้ 25-50 ขั้นตอนพร้อมเปิดใช้ CFG สิ่งนี้ชี้ให้เห็นถึงการกลั่นโมเดลอย่างเข้มข้นระหว่างการฝึก โดยแลกความสามารถดิบกับความเร็ว
ทีมเบื้องหลัง
HappyHorse มาจาก Future Life Lab ภายใต้ Taotian Group ของ Alibaba (ฝ่ายอีคอมเมิร์ซ) ผู้นำคือ Zhang Di อดีต VP ของ Kuaishou และหัวหน้าฝ่ายเทคนิคของ Kling AI
รายละเอียดนี้สำคัญ Zhang Di สร้างวัฒนธรรมวิศวกรรมเบื้องหลัง Kling หนึ่งในโมเดล AI video ที่แข็งแกร่งที่สุดของปี 2025 เขาเข้าใจความท้าทายด้านโครงสร้างพื้นฐาน ไปป์ไลน์การฝึก และช่องว่างด้านการประเมินผล การนำประสบการณ์นั้นมาใช้กับทรัพยากรการประมวลผลของ Alibaba เป็นสมการที่ต่างจากการดำเนินงานสตาร์ทอัพอิสระ
เหตุใดจึงสำคัญต่อตลาด
ตลาด AI video ในเดือนเมษายน 2026 มีความผันผวนสูงเป็นพิเศษ:
ประกาศยุติ Sora
OpenAI ยืนยันว่า Sora จะยุติการให้บริการ ในวันที่ 26 เมษายน ต้นทุนการประมวลผลและแรงกดดันจากการแข่งขันพิสูจน์แล้วว่าไม่ยั่งยืน
ระงับ Seedance 2.0
ByteDance ถูกบังคับให้หยุดการเปิดตัวหลังข้อพิพาทลิขสิทธิ์กับสตูดิโอฮอลลีวูด
HappyHorse ปรากฏตัว
โมเดลนิรนามเข้าสู่ Artificial Analysis Video Arena
Alibaba ยืนยันความเป็นเจ้าของ
หุ้นพุ่งขึ้นเมื่อมีการเปิดเผยตัวตน
ขณะที่ Sora กำลังปิดตัวลงและ Seedance เผชิญปัญหากฎหมาย HappyHorse มาถึงในช่วงที่ตลาดกำลังมองหาผู้นำรายใหม่ Runway Gen-4.5 ยังคงแข็งแกร่งในเวิร์กโฟลว์การผลิต และ Google Veo 3.1 ครองพื้นที่การผสานรวมระดับองค์กร แต่ในด้านคุณภาพการสร้างดิบที่วัดจากความชอบของมนุษย์แบบไม่เปิดเผยชื่อ HappyHorse ครองตำแหน่งสูงสุดแล้ว
Open Source: เร็ว ๆ นี้ (อาจจะ)
GitHub repository และ Hugging Face model hub ต่างแสดงข้อความ "Coming Soon" ณ วันที่ 11 เมษายน ทีมงานสัญญาว่าจะเปิดตัว weights แบบ open-source ครบทั้ง 15 billion parameters พร้อมใบอนุญาตเชิงพาณิชย์ หากเกิดขึ้น HappyHorse จะเป็นโมเดลวิดีโอ open-source ที่ใหญ่ที่สุดที่มีให้ใช้งาน ใหญ่กว่า 2B parameters ของ LTX-Video อย่างมาก
แต่ "coming soon" ไม่ใช่ "released" จนกว่า weights จะดาวน์โหลดได้และผ่านการตรวจสอบอย่างอิสระ ผล benchmark เหล่านี้ยังมีเครื่องหมายดอกจัน ชุมชน AI video เรียนรู้ที่จะรอผลลัพธ์ที่ทำซ้ำได้ก่อนประกาศผู้ชนะ
สิ่งที่ต้องจับตา
สามสิ่งจะกำหนดว่า HappyHorse จะรักษาความเป็นผู้นำไว้ได้หรือไม่:
- ✓การเปิดตัว weights แบบ open-source และการทำซ้ำผล benchmark อย่างอิสระ
- ✓การปรับปรุงคุณภาพเสียงให้เทียบเท่าหรือเหนือกว่า Seedance 2.0 ในหมวดที่รวมเสียง
- ✓ความพร้อมใช้งานของ API และราคา เพราะการครอง benchmark ไม่มีความหมายหากครีเอเตอร์เข้าถึงโมเดลไม่ได้
พื้นที่การสร้าง AI video เคลื่อนไหวอย่างรวดเร็ว ในเดือนมกราคม Runway Gen-4.5 ดูเหมือนไร้เทียมทาน ในเดือนกุมภาพันธ์ Seedance 2.0 คว้ามงกุฎไป ตอนนี้ HappyHorse ครองมันอยู่ คำถามไม่ใช่ว่าสิ่งใดจะเอาชนะมันได้ในที่สุดหรือไม่ แต่คือเมื่อไรและมาจากที่ใด
สำหรับครีเอเตอร์และนักพัฒนาที่กำลังสร้างไปป์ไลน์วิดีโอในวันนี้ ข้อสรุปมีความชัดเจนในทางปฏิบัติ: ไม่มีโมเดลใดอยู่บนจุดสูงสุดได้นาน กลยุทธ์ที่ดีที่สุดคือสร้างเวิร์กโฟลว์ที่สามารถสลับโมเดลตามการเปลี่ยนแปลงของกระดานผู้นำ แทนที่จะเดิมพันทุกอย่างกับชื่อเดียว
แหล่งข้อมูล
- Kaiyuan Securities Research Institute: HappyHorse-1.0 reached 1333 Elo and topped the Artificial Analysis video leaderboard on April… (Kaiyuan Securities Research Institute)

นักพัฒนา AI จากลียงผู้ชื่นชอบการเปลี่ยนแนวคิด ML ที่ซับซ้อนให้เป็นสูตรง่าย ๆ เมื่อไม่ได้แก้บั๊กโมเดล คุณจะพบเขาปั่นจักรยานผ่านหุบเขาโรน
View profile →บทความที่เกี่ยวข้อง
สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

Google Veo 3.1 Lite: การสร้างวิดีโอ AI ต้นทุนต่ำมาถึง Gemini API แล้ว
Google เพิ่งเปิดตัว Veo 3.1 Lite ซึ่งเป็นโมเดลสร้างวิดีโอ AI ที่รวดเร็วและเข้าถึงได้ใน Gemini API นี่คือสิ่งที่นักพัฒนาต้องรู้เกี่ยวกับราคา ข้อแลกเปลี่ยนด้านคุณภาพ และการนำวิดีโอไปใช้ในแอปโปรดักชัน

การปฏิวัติ World Model ของวิดีโอ AI: ฟิสิกส์ซิมูเลชันกำลังแทนที่การสร้างพิกเซลในปี 2026
จากการทำนายพิกเซลไปจนถึงการจำลองฟิสิกส์, โมเดลโลกกำลังเปลี่ยนแปลงวิธีที่ AI สร้างวิดีโอโดยพื้นฐาน นี่คือเหตุผลว่าทำไมสิ่งนี้จึงสำคัญสำหรับผู้สร้าง

ปฏิวัติวิดีโอ AI แบบโอเพนซอร์ส: GPU สำหรับผู้บริโภคจะแข่งกับยักษ์ใหญ่ด้านเทคโนโลยีได้หรือไม่?
ByteDance และ Tencent เพิ่งเปิดตัวโมเดลวิดีโอโอเพนซอร์สที่รันบนฮาร์ดแวร์สำหรับผู้บริโภค สิ่งนี้เปลี่ยนแปลงทุกอย่างสำหรับครีเอเตอร์อิสระ