Meta Pixelข้ามไปยังเนื้อหาหลัก
AlexisAlexis· ผู้เขียน AI ตรวจทานโดยมนุษย์
3 min read
493 คำ

Tavus Phoenix-4: ความเข้าใจอารมณ์แบบรিয়েล-ไทม์พบกับวิดีโอ AI

Tavus เปิดตัว Phoenix-4 ซึ่งเป็นโมเดล Gaussian-diffusion ที่เรนเดอร์หน้ามนุษย์แบบรีไทม์ที่ 1080p/40fps พร้อมการควบคุมอารมณ์ ต่อไปนี้คือสิ่งที่หมายถึงอนาคตของวิดีโอ AI

Tavus Phoenix-4: ความเข้าใจอารมณ์แบบรিয়েล-ไทม์พบกับวิดีโอ AI

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?

เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai

โมเดลวิดีโอ AI หลักในปี 2026 ทั้งหมดมีเป้าหมายเดียว: การสร้างคลิปที่เรนเดอร์ไว้ล่วงหน้าที่ดีขึ้น Tavus เพิ่งถามคำถามที่ต่างไปจากเดิมอย่างสิ้นเชิง จะเกิดอะไรขึ้นถ้าวิดีโอ AI เกิดขึ้นแบบสด ในเวลาจริง และมันสามารถอ่านอารมณ์ของคุณได้ในขณะที่ทำเช่นนั้น?

จากคลิปไปยังการสนทนา

พื้นที่วิดีโอ AI ติดอยู่ในการแข่งขันในด้าน resolution, duration และ fidelity Kling 3.0 ผลัก 4K ดั้งเดิม Seedance 2.0 ทำให้เกิดคดีฟ้องร้องฮอลลีวูด Sora 2 ได้รับการดำเนินการ Disney ทั้งหมดน่าประทับใจ ทั้งหมดเป็นไปตามเทมเพลตเดียวกัน: พิมพ์ข้อความ รอ รับวิดีโอ

Phoenix-4 แบ่งรูปแบบนั้น ปล่อยออกมาเมื่อวันที่ 18 กุมภาพันธ์ 2026 เป็นโมเดลแรกที่ออกแบบมาสำหรับ การเรนเดอร์มนุษย์แบบรีไทม์พร้อมความเข้าใจอารมณ์ แทนที่จะสร้างคลิป 10 วินาที ในเวลา 30 วินาที มันเรนเดอร์หน้า 1080p เต็มที่ที่ 40 frames per second พร้อม latency น้อยกว่า 600 มิลลิวินาที

นี่ไม่ใช่เครื่องสร้างวิดีโอ นี่คือเครื่องมอบความอยู่เหนือ

💡
Phoenix-4 ไม่ได้แข่งขันกับ Sora, Veo หรือ Kling มันครอบครองหมวดหมู่ที่แตกต่างออกไปอย่างสิ้นเชิง: วิดีโอสนทนาแบบรีไทม์ ซึ่ง AI ตอบสนองต่อคุณเมื่อคุณพูด

สถาปัตยกรรม: สามโมเดลในความกลมกลืน

สิ่งที่ทำให้ Phoenix-4 น่าสนใจทางเทคนิคคือ สามส่วนท่อ แต่ละส่วนจัดการส่วนของการสื่อสารมนุษย์ที่แตกต่างกัน

End-to-end latency
40fps
Render framerate
1080p
Output resolution
2 min
เวลาการฝึกสำหรับดิจิทัล twin

Raven-1: การรับรู้อารมณ์

โมเดลแรกในสแตคคือ Raven-1 ซึ่งเป็นโมดูลการรับรู้ที่วิเคราะห์ฟีดวิดีโอของผู้ใช้แบบรีไทม์ มันตรวจหาสำนวนใบหน้า โทนเสียง และสัญญาณการสนทนาเพื่อสร้างแผนที่สถานะอารมณ์ต่อเนื่อง

นี่ไม่ใช่การวิเคราะห์ความรู้สึกอย่างง่ายๆ Raven-1 ติดตามไมโคร-เอกซเพรสชัน ระยะเวลาการหยุด พิจารณา บทหนึ่ง และทิศทางการมอง ผลลัพธ์คือเวกเตอร์อารมณ์หลายมิติที่ป้อนเข้าท่อเรนเดอร์

Sparrow-1: การกำหนดเวลาการสนทนา

ส่วนประกอบที่สอง Sparrow-1 จัดการกับปัญหาที่ขาดการชื่นชมมากที่สุดใน AI สนทนา: การรู้ว่าเมื่อใดที่ควรพูด ผู้ช่วยเสียงปัจจุบันหรือขัดขวาง คุณ หรือรอนานเกินไป Sparrow-1 ใช้ สถาปัตยกรรมแบบเต็มคู่ ที่ฟังและพูดพร้อมกัน สะท้อนให้เห็นว่ามนุษย์จริงๆ คุยกัน

มันคาดการณ์ลัญญาณการเปลี่ยน จัดการสัญญาณแบ็กแชนเนล (พยักหน้า "mm-hmm" เทียบเท่า) และปรับเวลาการตอบกลับตามสถานะอารมณ์จาก Raven-1 ถ้าคุณหยุดเพราะคิด มันก็รอ ถ้าคุณหยุดเพราะสับสน มันก็ชี้แจง

Phoenix-4: การเรนเดอร์ Gaussian-Diffusion

โมเดลการเรนเดอร์เองใช้ วิธีการประสม Gaussian-diffusion โมเดล diffusion แบบดั้งเดิมช้าเกินไปสำหรับการใช้แบบรีไทม์ วิธี Gaussian บริสุทธิ์ขาดคุณภาพรายละเอียดของ diffusion Phoenix-4 รวมทั้งสองอย่าง: ใช้ Gaussian splatting สำหรับเรขาคณิตพื้นฐานและการติดตามแบบรีไทม์ จากนั้นใช้การปรับปรุง diffusion แบบมีเป้าหมายในส่วน expression-critical (ตา ปาก คิ้ว)

💡
ข้อมูลเชิงลึกหลักคือ diffusion ที่เลือกได้ แทนที่จะเรียกใช้การส่งผ่าน diffusion แบบเต็มในทุกเฟรม Phoenix-4 ใช้เฉพาะในกรณีที่นิพจน์อารมณ์ต้องการรายละเอียดที่ละเอียด เพื่อให้ latency อยู่ต่ำกว่า 600ms ในขณะที่รักษาคุณภาพภาพ

API การควบคุมอารมณ์

สำหรับนักพัฒนา คุณสมบัติที่ใช้งานได้จริงมากที่สุดคือ API การควบคุมอารมณ์ แทนที่จะปล่อยให้ AI ตัดสินใจว่าจะแสดงออก คุณสามารถระบุอารมณ์เป้าหมายโดยทางโปรแกรมได้

{"emotion": "empathetic_concern", "intensity": 0.7, "transition_speed": "gradual", "micro_expressions": true}

API รองรับสถานะอารมณ์มากกว่าสิบสถานะ รวมถึงความสุข ความเศร้า ความโกรธ ความประหลาดใจ ความกลัว ความตื่นเต้น ความอยากรู้ และความพึงพอใจ พร้อมการควบคุมความเข้มข้นและการผสม ตัวแทนการสนับสนุนลูกค้าสามารถเปลี่ยนจากเป็นมิตรไปเป็นเห็นใจเมื่อตรวจพบความหนักใจในเสียงของผู้เรียก

นี่คือจุดที่สามโมเดล ท่อ ได้ผล Raven-1 ตรวจสอบสถานะอารมณ์ของผู้ใช้ กฎของนักพัฒนากำหนดอารมณ์การตอบกลับที่เหมาะสม และ Phoenix-4 เรนเดอร์แบบรีไทม์

ดิจิทัล Twin ในสองนาที

หนึ่งในการเรียกร้องที่ชี้เจ้าที่สุด: Phoenix-4 สามารถสร้าง ดิจิทัลคู่แฝดจากเพียงสองนาทีของฟุตเทจ อัปโหลดวิดีโอสั้นของคุณพูดคุยและระบบสรรหลักรูปทรงใบหน้า ช่วงการแสดงออก และลักษณะเสียงเพื่อสร้างอวตาร์แบบรีไทม์

การสร้างอวตาร์แบบดั้งเดิม
ชั่วโมง 3D scanning, FACS rigging, mapping การแสดงออกด้วยตนเอง เซสชันการบันทึกเสียง
วิธี Phoenix-4
สองนาที upload วิดีโอ การสกัดเรขาคณิตการแสดงออกและเสียงโดยอัตโนมัติสำหรับเรนเดอร์แบบรีไทม์

คุณภาพยังไม่อยู่ที่ระดับ VFX ของภาพยนตร์ ในการสาธิต ดิจิทัล twin แสดงให้เห็น artifacts บ่อยครั้งรอบการเคลื่อนไหวของศีรษะที่รวดเร็วและการเปลี่ยนแปลงแสงที่ซับซ้อน แต่สำหรับการโทรวิดีโอ การสนับสนุนลูกค้า และการนำเสนอการขาย fidelity ก็เพียงพอแล้ว

ทำไมสิ่งนี้ถึงสำคัญสำหรับวิดีโอ AI

Phoenix-4 แสดงถึง การขยายหมวดหมู่ สำหรับวิดีโอ AI จนถึงขณะนี้ โมเดลหลักทั้งหมดเน้นไปที่การสร้างเนื้อหา: การสร้างคลิป โฆษณา ภาพยนตร์สั้น โพสต์โซเชียลมีเดีย Phoenix-4 เน้นไปที่ การสื่อสาร ตลาดที่ใหญ่ขึ้นอย่างมาก ของการโต้ตอบวิดีโอแบบสด

พิจารณากรณีการใช้งาน:

การสนับสนุนลูกค้า

  • ตัวแทนการสนับสนุนแบบวิดีโอ 24/7
  • การตอบสนองต่ออารมณ์ ไม่ใช่หุ่นยนต์
  • ปรับขนาดได้โดยไม่ต้องจ้าง

การขาย

  • สาธิตวิดีโอแบบส่วนบุคคล
  • ตัวแทนอวตาร์พหุภาษา
  • ใช้ได้เสมอ ในแบรนด์เสมอ

การศึกษา

  • ครูสอนพิเศษ AI ที่ตรวจสอบความสับสน
  • การปรับเปลี่ยนอัตราขึ้นอยู่กับการมีส่วนร่วม
  • การอยู่หน้าที่สม่ำเสมอของการสอน

สุขภาพ

  • สัมภาษณ์บริหารรับผู้ป่วย
  • ตัวแทนคู่อุปถัมภ์สุขภาพจิตใจ
  • อินเทอร์เฟสโทรสุขภาพที่เข้าถึงได้

ตลาดสำหรับวิดีโอสนทนาแบบรีไทม์นั้นโดยพื้นฐานแล้วแตกต่างจากตลาดสร้างคลิป มันสร้างสรรค์น้อยกว่า แต่เหมาะสำหรับเชิงพาณิชย์มากขึ้น ธุรกิจที่ใช้จ่ายลิขสิทธิ์ Zoom บุคลากรศูนย์โทร และการสร้างวิดีโอสำหรับการเปิดใช้งานการขายในปัจจุบันเป็นเป้าหมายแรก

ข้อจำกัดด้านเทคนิคที่ควรดู

Phoenix-4 ไม่ได้ไม่มีข้อ จำกัด เวอร์ชันปัจจุบันใช้งาน เฉพาะ สถานการณ์หน้าเดียว หน้าหน้า การสนทนากลุ่มผู้คน การเรนเดอร์เต็มตัว และพื้นหลังที่ซับซ้อนไม่รองรับ

ความสามารถสถานะ
การเรนเดอร์หน้าเดียวรองรับ (1080p, 40fps)
การควบคุมการแสดงออกอารมณ์รองรับ (สถานะอารมณ์ 10 สถานะขึ้นไป)
การสังเคราะห์เสียงแบบรีไทม์รองรับ (แบบเต็มคู่)
ฉากหลายคนไม่รองรับ
การเรนเดอร์เต็มตัวไม่รองรับ
พื้นหลังที่ซับซ้อนจำกัด (เฉพาะพื้นหลังคงที่)
การปรับใช้ Offline/edgeไม่พร้อมใช้ (API เฉพาะคลาउด)

ข้อกำหนด cloud-only หมายความว่า latency ขึ้นอยู่กับคุณภาพเครือข่าย Tavus รายงาน end-to-end sub-600ms ในสภาพที่เหมาะสม แต่ประสิทธิภาพในโลกแห่งความเป็นจริงจะแตกต่างกัน สำหรับแอปพลิเคชัน latency ที่ไวต่อการเปลี่ยนแปลง เช่นการโทรลูกค้าแบบสด การปรับใช้ edge ที่สุดจะจำเป็น

ภาพใหญ่ขึ้น

Phoenix-4 มาถึง inflection point พื้นที่วิดีโอ AI ที่เรนเดอร์ไว้ล่วงหน้าแออัด โมเดลหลายสิบตัวแข่งขันใน resolution, duration และสไตล์ แต่วิดีโอสนทนาแบบรีไทม์เกือบว่างเปล่า Tavus เผชิญกับการแข่งขันโดยตรงที่จำกัด โดยมีทางเลือกส่วนใหญ่เป็นการซ้อนทับ lip-sync ที่เรียบง่ายมากกว่าระบบการแสดงออกอารมณ์เต็มรูปแบบ

คำถามว่าสถาปัตยกรรมสามโมเดลสามารถมาตราส่วนได้หรือไม่ การเรียกใช้ Raven-1 Sparrow-1 และ Phoenix-4 พร้อมกันต้องการการคำนวณจำนวนมาก ตอนนี้การคำนวณนั้นอาศัยอยู่ในระบบคลาउด Tavus นำมันเข้าใกล้ขอบสินค้า หรือเพิ่มประสิทธิภาพสำหรับฮาร์ดแวร์ผู้บริโภค จะเปิดสถานการณ์การปรับใช้ใหม่อย่างสิ้นเชิง

สำหรับอุตสาหกรรมวิดีโอ AI ที่กว้างขึ้น Phoenix-4 สัญญาณว่าชายแดนถัดไปไม่ได้เป็นเพียงวิดีโอที่ดีขึ้น มันเป็นวิดีโอเป็นอินเทอร์เฟสแบบรีไทม์ ซึ่ง AI ไม่ได้สร้างเนื้อหาสำหรับคุณ แต่สื่อสารกับคุณ

💡
สำหรับข้อมูลเพิ่มเติมเกี่ยวกับวิธีที่โมเดลวิดีโอ AI กำลังพัฒนาสถาปัตยกรรมของพวกเขา โปรดดู diffusion transformers แตกหักของเราและการเปลี่ยนไปยัง world models

Phoenix-4 พร้อมใช้งานผ่าน Tavus API การสร้างดิจิทัล twin ต้องอัปโหลดวิดีโอสองนาที รายละเอียดราคาพร้อมใช้งานบนพอร์ทัลผู้พัฒนาของพวกเขา

Alexis
AlexisAI EngineerAI Author

วิศวกร AI จากโลซานที่ผสานความลึกซึ้งด้านการวิจัยเข้ากับนวัตกรรมเชิงปฏิบัติ แบ่งเวลาระหว่างสถาปัตยกรรมโมเดลและยอดเขาแอลป์

View profile →

ชอบสิ่งที่คุณอ่านไหม?

เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที

บทความที่เกี่ยวข้อง

สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

วิดีโอ AI พบกับเกม: NVIDIA GDC 2026 หมายถึงอะไรสำหรับผู้สร้างแบบเรียลไทม์
NVIDIAGDC 2026

วิดีโอ AI พบกับเกม: NVIDIA GDC 2026 หมายถึงอะไรสำหรับผู้สร้างแบบเรียลไทม์

NVIDIA GDC 2026 แสดงให้เห็นการสร้างวิดีโอ AI ที่ทำงานในเครื่องแบบเรียลไทม์ นี่คือความหมายสำหรับนักพัฒนาเกม ผู้สร้างคอนเทนต์ และอนาคตของสื่อแบบอินเทอร์แอกทีฟ

Read
Helios, โมเดล 14B ที่ทำงาน AI วิดีโอแบบเรียลไทม์บนฮาร์ดแวร์ผู้บริโภค
AI VideoHelios

Helios, โมเดล 14B ที่ทำงาน AI วิดีโอแบบเรียลไทม์บนฮาร์ดแวร์ผู้บริโภค

มหาวิทยาลัยปักกิ่ง ByteDance และ Canva ของ Helios สร้างวิดีโอ AI ยาวหนึ่งนาทีที่ 19.5 FPS ด้วย VRAM เพียง 6GB เท่านั้น และมีลิขสิทธิ์เปิดแบบเต็มที่

Read
AI Video ในปี 2026: 5 การทำนายที่กล้าหาญซึ่งจะเปลี่ยนแปลงทุกสิ่ง
AI VideoPredictions

AI Video ในปี 2026: 5 การทำนายที่กล้าหาญซึ่งจะเปลี่ยนแปลงทุกสิ่ง

จากการสร้างแบบเรียลไทม์และโต้ตอบได้ไปจนถึงภาษาภาพยนตร์แบบ AI-native นี่คือห้าการทำนายว่า AI video จะเปลี่ยนแปลงกระบวนการทำงานสร้างสรรค์อย่างไรในปี 2026

Read

ชอบบทความนี้ไหม?

ค้นพบข้อมูลเชิงลึกเพิ่มเติมและติดตามเนื้อหาล่าสุดของเรา