Meta PixelBỏ qua để đến nội dung chính
AlexisAlexis· Tác giả AI, đã được con người biên tập
10 min read
1852 từ

Tavus Phoenix-4: Trí Tuệ Cảm Xúc Thời Gian Thực Gặp Gỡ Video AI

Tavus vừa công bố Phoenix-4, một mô hình khuếch tán Gaussian có thể kết xuất khuôn mặt con người theo thời gian thực ở 1080p/40fps với khả năng kiểm soát cảm xúc. Điều này có ý nghĩa gì với tương lai của video AI.

Tavus Phoenix-4: Trí Tuệ Cảm Xúc Thời Gian Thực Gặp Gỡ Video AI

Sẵn sàng tạo video AI của riêng bạn?

Tham gia cùng hàng nghìn nhà sáng tạo đang sử dụng Bonega.ai

Mỗi mô hình video AI chính năm 2026 đều tập trung vào một mục tiêu: tạo ra những clip được kết xuất trước tốt hơn. Tavus vừa đặt ra một câu hỏi hoàn toàn khác. Nếu video AI xảy ra theo thời gian thực và nó có thể đọc cảm xúc của bạn trong khi làm điều đó thì sao?

Từ Clip Đến Cuộc Hội Thoại

Ngành công nghiệp video AI đã bị mắc kẹt trong một cuộc chạy đua vũ trang về độ phân giải, thời lượng và độ trung thực. Kling 3.0 đã đẩy 4K gốc. Seedance 2.0 kích hoạt các vụ kiện của Hollywood. Sora 2 đạt được một thỏa thuận với Disney. Tất cả đều ấn tượng, tất cả đều tuân theo cùng một mẫu: nhập một lời nhắc, chờ đợi, nhận được một video.

Phoenix-4 phá vỡ mô hình đó. Được phát hành vào ngày 18 tháng 2 năm 2026, nó là mô hình đầu tiên được thiết kế cho kết xuất khuôn mặt con người theo thời gian thực với trí tuệ cảm xúc. Thay vì tạo ra một clip 10 giây trong 30 giây, nó kết xuất một khuôn mặt 1080p đầy đủ ở 40 khung hình mỗi giây với độ trễ dưới 600 mili giây.

Đó không phải là một trình tạo video. Đó là một công cụ hiện diện.

💡
Phoenix-4 không cạnh tranh với Sora, Veo hoặc Kling. Nó chiếm một danh mục hoàn toàn khác: video hội thoại thời gian thực, nơi AI phản ứng với bạn khi bạn nói.

Kiến Trúc: Ba Mô Hình Trong Hòa Hợp

Điều khiến Phoenix-4 thú vị từ góc độ kỹ thuật là đường dẫn ba thành phần của nó, mỗi thành phần xử lý một phần riêng biệt của giao tiếp con người.

Độ trễ đầu cuối
40fps
Tốc độ khung kết xuất
1080p
Độ phân giải đầu ra
2 phút
Thời gian đào tạo bộ đôi kỹ thuật số

Raven-1: Nhận Thức Cảm Xúc

Mô hình đầu tiên trong ngăn xếp là Raven-1, một mô đun nhận thức phân tích luồng video của người dùng theo thời gian thực. Nó phát hiện các biểu hiện trên khuôn mặt, giọng nói và các dấu hiệu trò chuyện để xây dựng bản đồ trạng thái cảm xúc liên tục.

Đây không phải là phân tích tâm trạng đơn giản. Raven-1 theo dõi các biểu hiện vi tính, thời gian tạm dừng, tốc độ lời nói và hướng nhìn. Kết quả là một vectơ cảm xúc đa chiều được cấp vào đường dẫn kết xuất.

Sparrow-1: Thời Gian Hội Thoại

Thành phần thứ hai, Sparrow-1, xử lý vấn đề được đánh giá thấp nhất trong AI hội thoại: biết khi nào nên nói. Những trợ lý thoại hiện tại hoặc làm bạn bị gián đoạn hoặc chờ quá lâu. Sparrow-1 sử dụng kiến trúc song công để nghe và nói đồng thời, phản ánh cách con người thực sự hội thoại.

Nó dự đoán các tín hiệu lựa chọn, quản lý các tín hiệu từ sau (gật đầu, các tương đương "mm-hmm") và điều chỉnh thời gian phản hồi dựa trên trạng thái cảm xúc từ Raven-1. Nếu bạn tạm dừng vì bạn đang suy nghĩ, nó chờ đợi. Nếu bạn tạm dừng vì bạn bối rối, nó sẽ làm rõ.

Phoenix-4: Kết Xuất Khuếch Tán Gaussian

Chính mô hình kết xuất sử dụng cách tiếp cận lai Gaussian-diffusion. Các mô hình khuếch tán truyền thống quá chậm để sử dụng theo thời gian thực. Các phương pháp Gaussian thuần túy thiếu chất lượng chi tiết của khuếch tán. Phoenix-4 kết hợp cả hai: nó sử dụng phun tắm Gaussian cho hình học cơ sở và theo dõi theo thời gian thực, sau đó áp dụng tinh chỉnh khuếch tán theo hướng mục tiêu trên các vùng quan trọng về biểu hiện (mắt, miệng, lông mày).

💡
Thông tin chi tiết chính là khuếch tán lựa chọn. Thay vì chạy một lượt khuếch tán đầy đủ trên mỗi khung hình, Phoenix-4 chỉ áp dụng nó nơi biểu hiện cảm xúc đòi hỏi chi tiết tinh tế. Điều này giữ độ trễ dưới 600ms trong khi duy trì chất lượng hình ảnh.

API Kiểm Soát Cảm Xúc

Đối với các nhà phát triển, tính năng thực tế nhất là API Kiểm Soát Cảm Xúc. Thay vì để AI quyết định cách thể hiện cảm xúc, bạn có thể chỉ định cảm xúc mục tiêu theo lập trình.

{
  "emotion": "empathetic_concern",
  "intensity": 0.7,
  "transition_speed": "gradual",
  "micro_expressions": true
}

API hỗ trợ hơn mười trạng thái cảm xúc, bao gồm niềm vui, buồn, tức giận, ngạc nhiên, sợ hãi, h興奋, tò mò và thỏa mãn, với các điều khiển cường độ và pha trộn. Một avatar hỗ trợ khách hàng có thể thay đổi từ thân thiện sang đồng cảm khi phát hiện sự bực bội trong giọng nói của người gọi.

Đây là nơi đường dẫn ba mô hình phát huy tác dụng. Raven-1 phát hiện trạng thái cảm xúc của người dùng, các quy tắc của nhà phát triển xác định cảm xúc phản hồi thích hợp, và Phoenix-4 kết xuất nó theo thời gian thực.

Bộ Đôi Kỹ Thuật Số Trong Hai Phút

Một trong những tuyên bố đáng chú ý nhất: Phoenix-4 có thể tạo một bộ đôi kỹ thuật số tùy chỉnh chỉ từ hai phút video. Tải lên một video ngắn về bạn nói chuyện, và hệ thống trích xuất đủ hình học mặt, phạm vi biểu hiện và đặc điểm giọng nói để tạo ra một avatar theo thời gian thực.

Tạo avatar truyền thống
Quét 3D hàng giờ, rigging FACS, ánh xạ biểu hiện thủ công, phiên ghi âm giọng nói
Cách tiếp cận Phoenix-4
Tải lên video hai phút, trích xuất tự động hình học, biểu hiện và giọng nói để kết xuất theo thời gian thực

Chất lượng chưa ở mức độ VFX điện ảnh. Trong các bản demo, các bộ đôi kỹ thuật số hiển thị các hình ảnh tạo tác thỉnh thoảng xung quanh các chuyển động đầu nhanh và chuyển đổi ánh sáng phức tạp. Nhưng đối với các cuộc gọi video, hỗ trợ khách hàng và bài thuyết trình bán hàng, độ trung thực là nhiều hơn mức đủ.

Tại Sao Điều Này Quan Trọng Với Video AI

Phoenix-4 đại diện cho một sự mở rộng danh mục cho video AI. Cho đến nay, mọi mô hình chính đều tập trung vào việc tạo nội dung: tạo clip, quảng cáo, phim ngắn, bài đăng trên phương tiện truyền thông xã hội. Phoenix-4 tập trung vào giao tiếp, thị trường lớn hơn nhiều của tương tác video trực tiếp.

Hãy xem xét các trường hợp sử dụng:

Hỗ Trợ Khách Hàng

  • Đại lý hỗ trợ dựa trên video 24/7
  • Phản ứng cảm xúc, không phải máy móc
  • Mở rộng quy mô mà không cần tuyển dụng

Bán Hàng

  • Bản demo video được cá nhân hóa
  • Đại diện avatar đa ngôn ngữ
  • Luôn có sẵn, luôn đúng nhãn hiệu

Giáo Dục

  • Giáo viên AI phát hiện sự bối rối
  • Tốc độ thích ứng dựa trên mức độ tham gia
  • Hiện diện giảng dạy nhất quán

Chăm Sóc Sức Khỏe

  • Phỏng vấn nhập viện bệnh nhân
  • Bạn đồng hành kiểm tra sức khỏe tâm thần
  • Giao diện chăm sóc sức khỏe từ xa có thể truy cập

Thị trường video hội thoại theo thời gian thực khác về cơ bản so với thị trường tạo clip. Nó ít sáng tạo hơn nhưng có tác động thương mại trực tiếp hơn. Các doanh nghiệp hiện đang chi tiêu cho giấy phép Zoom, nhân viên trung tâm gọi và sản xuất video hỗ trợ bán hàng là những mục tiêu đầu tiên.

Những Hạn Chế Kỹ Thuật Cần Lưu Ý

Phoenix-4 không phải là không có ràng buộc. Phiên bản hiện tại chỉ hoạt động với các tình huống mặt đơn, hướng về phía trước. Cuộc hội thoại nhiều người, kết xuất toàn thân và nền phức tạp không được hỗ trợ.

Khả NăngTrạng Thái
Kết xuất mặt đơnĐược hỗ trợ (1080p, 40fps)
Kiểm soát biểu hiện cảm xúcĐược hỗ trợ (10+ trạng thái cảm xúc)
Tổng hợp giọng nói theo thời gian thựcĐược hỗ trợ (song công)
Cảnh nhiều ngườiKhông được hỗ trợ
Kết xuất toàn thânKhông được hỗ trợ
Nền phức tạpHạn chế (chỉ nền tĩnh)
Triển khai ngoại tuyến/cạnhKhông khả dụng (chỉ API đám mây)

Yêu cầu chỉ có đám mây có nghĩa là độ trễ phụ thuộc vào chất lượng mạng. Tavus báo cáo khoảng 600ms đầu cuối trong điều kiện tối ưu, nhưng hiệu suất trong thế giới thực sẽ khác nhau. Đối với các ứng dụng nhạy cảm với độ trễ như các cuộc gọi khách hàng trực tiếp, triển khai cạnh cuối cùng sẽ trở nên cần thiết.

Bức Tranh Lớn Hơn

Phoenix-4 đến vào một điểm uốn. Không gian video AI được kết xuất trước đầy đủ, với hàng chục mô hình cạnh tranh về độ phân giải, thời lượng và kiểu dáng. Nhưng video hội thoại theo thời gian thực gần như trống rỗng. Tavus phải đối mặt với cuộc cạnh tranh trực tiếp hạn chế, với hầu hết các lựa chọn thay thế là các lớp phủ đồng bộ môi đơn giản thay vì các hệ thống kết xuất cảm xúc đầy đủ.

Câu hỏi là liệu kiến trúc ba mô hình có thể mở rộng quy mô. Chạy Raven-1, Sparrow-1 và Phoenix-4 đồng thời yêu cầu tính toán đáng kể. Ngay bây giờ, quá trình tính toán đó nằm trong đám mây của Tavus. Mang nó gần cạnh hơn hoặc tối ưu hóa nó cho phần cứng của người tiêu dùng sẽ mở ra các tình huống triển khai hoàn toàn mới.

Đối với ngành công nghiệp video AI rộng lớn hơn, Phoenix-4 báo hiệu rằng ranh giới tiếp theo không chỉ là video tốt hơn. Nó là video như một giao diện thời gian thực, nơi AI không tạo nội dung cho bạn mà còn giao tiếp với bạn.

💡
Để biết thêm về cách các mô hình video AI phát triển kiến trúc của chúng, hãy xem phần phân tích của chúng tôi về bộ biến áp khuếch tán và sự chuyển dịch hướng tới mô hình thế giới.

Phoenix-4 có sẵn thông qua Tavus API. Tạo bộ đôi kỹ thuật số yêu cầu tải lên video hai phút. Chi tiết giá có sẵn trên cổng thông tin dành cho nhà phát triển của họ.

Alexis
AlexisAI EngineerAI Author

Kỹ sư AI đến từ Lausanne, kết hợp chiều sâu nghiên cứu với đổi mới thực tiễn. Chia thời gian giữa kiến trúc mô hình và những đỉnh núi Alps.

View profile →

Bạn thích những gì vừa đọc?

Biến ý tưởng của bạn thành video AI có độ dài không giới hạn chỉ trong vài phút.

Bài viết liên quan

Tiếp tục khám phá với các bài viết liên quan này

Bạn thích bài viết này chứ?

Khám phá thêm nhiều thông tin hữu ích và cập nhật nội dung mới nhất của chúng tôi.