Meta PixelBỏ qua để đến nội dung chính
HenryHenry· Tác giả AI, đã được con người biên tập
7 min read
1394 từ

PikaStream 1.0: Pika Labs mang đến cho mọi AI Agent một khuôn mặt, giọng nói và chỗ ngồi trong cuộc họp của bạn

Pika Labs vừa ra mắt PikaStream 1.0, một mô hình video thời gian thực cho phép AI agent tham gia cuộc gọi Google Meet với hình đại diện được dựng hình, giọng nói nhân bản và khả năng thực thi tác vụ đầy đủ. Đây là ý nghĩa của nó đối với tương lai tương tác AI.

PikaStream 1.0: Pika Labs mang đến cho mọi AI Agent một khuôn mặt, giọng nói và chỗ ngồi trong cuộc họp của bạn

Sẵn sàng tạo video AI của riêng bạn?

Tham gia cùng hàng nghìn nhà sáng tạo đang sử dụng Bonega.ai

Trong nhiều năm, tạo video AI chỉ có nghĩa là một điều: nhập prompt, chờ đợi, tải xuống đoạn clip. PikaStream 1.0 phá vỡ hoàn toàn khuôn mẫu đó. Giờ đây, AI agent của bạn có thể nhìn thẳng vào mắt bạn trong cuộc gọi Google Meet, phản hồi theo thời gian thực và thực thi tác vụ ngay trong lúc trò chuyện.

Bước ngoặt không ai ngờ tới

Pika Labs xây dựng danh tiếng nhờ các công cụ sáng tạo. Pika 2.5 đã đưa chuyển đổi văn bản thành video đến gần hơn với mọi người. Pika Effects biến ảnh tĩnh thành chuyển động. Hướng phát triển có vẻ rõ ràng: clip đẹp hơn, thời lượng dài hơn, vật lý chính xác hơn.

Rồi họ phát hành PikaStream, và hướng đi bất ngờ rẽ ngang.

Thay vì cạnh tranh về chất lượng clip (cuộc đua mà Runway, Kling và Google đã tham gia), Pika xây dựng một công cụ video thời gian thực được thiết kế cho tương tác trực tiếp. Người dùng mục tiêu không phải nhà làm phim. Đó là AI agent.

💡
PikaStream 1.0 không phải là trình tạo video theo nghĩa truyền thống. Đây là một lớp hạ tầng mang đến cho AI agent sự hiện diện trực quan và giọng nói trong các cuộc gọi video trực tiếp.

PikaStream thực sự làm được gì

Sản phẩm cốt lõi là một mô-đun kỹ năng tự chứa, có thể kết nối với các AI coding agent như Claude Code, trợ lý OpenAI, hoặc bất kỳ hệ thống nào hỗ trợ Pika Developer API. Sau khi cài đặt, agent có thể:

  • Tham gia cuộc gọi Google Meet với hình đại diện được dựng hình đầy đủ
  • Nói bằng giọng nhân bản (ghi âm một mẫu ngắn, agent sẽ nói giống bạn)
  • Duy trì bộ nhớ về các cuộc hội thoại và ngữ cảnh trước đó
  • Thực thi tác vụ trong cuộc gọi (viết mã, tìm kiếm dữ liệu, kích hoạt hành động)

Hình đại diện không phải là ảnh tĩnh với lớp phủ đồng bộ môi. PikaStream tạo video cá nhân hóa ở tốc độ lên đến 30 FPS và độ phân giải 480p, được vận hành bởi pipeline khuếch tán thời gian thực chạy trên một GPU H100 duy nhất.

30 FPS
Tốc độ khung hình thời gian thực
~1.5s
Độ trễ giọng nói đến video
$0.20
Chi phí mỗi phút

Bên trong kỹ thuật: FlashVAE và Streaming DiT

Hai đổi mới kiến trúc giúp hiệu suất thời gian thực trở thành hiện thực.

FlashVAE là bộ mã hóa tự động biến phân dựa hoàn toàn trên Transformer, được huấn luyện từ đầu. Nó cung cấp không gian tiềm ẩn riêng và tái tạo video thông qua giải mã luồng ở tốc độ hàng trăm khung hình mỗi giây với mức tiêu thụ bộ nhớ GPU tối thiểu. Đây chính là thành phần giúp đầu ra thời gian thực khả thi mà không cần cả một cụm GPU.

Transformer khuếch tán 9B (DiT) sử dụng một kỹ thuật huấn luyện khéo léo: mô hình giáo viên hai chiều được chưng cất thành mô hình học sinh tự hồi quy nhân quả thông qua tự cưỡng chế tối ưu hóa. Điều này cho phép phát trực tuyến theo từng khối ở tốc độ khung hình thời gian thực, tương tự cách mô hình ngôn ngữ phát trực tuyến văn bản theo từng token.

💡
Sự kết hợp giữa FlashVAE cho tái tạo và streaming DiT cho sinh tạo có nghĩa là PikaStream có thể duy trì tính nhất quán về nhận dạng thị giác trong suốt cuộc họp, không chỉ trong một clip đơn lẻ.

Tại sao điều này quan trọng hơn một mô hình video đẹp khác

Lĩnh vực AI video tháng 4 năm 2026 rất đông đúc. Runway Gen-4.5 xử lý chất lượng điện ảnh. Kling 3.0 hỗ trợ storyboard nhiều cảnh. Seedance 2.0 tạo âm thanh và video cùng lúc. Google Veo 3.1 có mặt ở khắp nơi.

PikaStream không cạnh tranh với bất kỳ sản phẩm nào trong số đó.

Đối thủ cạnh tranh của nó là avatar Zoom, người trình bày kiểu Synthesia, và chính khái niệm "bạn phải xuất hiện trước camera." Điểm khác biệt là avatar PikaStream không phải bản ghi sẵn hay theo kịch bản. Chúng phản ứng, phản hồi và hành động trong thời gian thực.

Video AI truyền thống
Tạo clip, tải xuống, chia sẻ sau. Không có tính tương tác. Mỗi giây đầu ra cần vài phút xử lý.
Cách tiếp cận PikaStream
Sinh tạo trực tiếp trong cuộc gọi. Tương tác được, phản hồi được, nhận dạng nhất quán. Agent là người tham gia, không phải bản ghi hình.

Khái niệm "AI Self"

Pika cũng đang thúc đẩy một tính năng tiêu dùng gọi là Pika AI Self. Ý tưởng: tạo một phiên bản kỹ thuật số của chính bạn để thay mặt bạn tham dự cuộc họp. Hình đại diện trông giống bạn, nói giống bạn (qua nhân bản giọng nói), và có quyền truy cập lịch, ghi chú và lịch sử hội thoại của bạn.

Đây không còn là khoa học viễn tưởng nữa. Phiên bản beta đang hoạt động trên Google Meet hôm nay, với hỗ trợ Zoom và FaceTime sắp ra mắt.

Tác động đến làm việc từ xa là tức thì:

  • Bỏ qua cuộc họp, gửi AI Self của bạn đi với đầy đủ ngữ cảnh về những gì bạn cần
  • Để agent ghi chú, đưa ra quyết định trong phạm vi đã định và báo cáo lại
  • Tham gia nhiều cuộc họp cùng lúc, mỗi cuộc đều có sự hiện diện nhất quán của bạn
⚠️
Nhân bản giọng nói và tạo hình đại diện đặt ra câu hỏi về sự đồng ý và mạo danh. Pika yêu cầu sự ủy quyền rõ ràng của người dùng cho nhân bản giọng nói, nhưng khung pháp lý rộng hơn cho sự hiện diện AI trong cuộc họp vẫn chưa được xác định.

Giá cả và quyền truy cập

PikaStream có giá $0.20 mỗi phút tham gia cuộc họp. Một cuộc họp 30 phút sẽ tốn 6 đô la. So với việc cử người đại diện hoặc bỏ lỡ cuộc họp, bài toán kinh tế phù hợp với một số trường hợp sử dụng: cập nhật trạng thái, thu thập thông tin, kiểm tra định kỳ.

Kỹ năng này có sẵn thông qua Pika Developer API và có thể cài đặt dưới dạng mô-đun trong các framework agent tương thích. Google Meet là nền tảng duy nhất được hỗ trợ tại thời điểm ra mắt.

Điều này báo hiệu gì cho ngành

PikaStream đại diện cho sự phân tách danh mục trong AI video. Một bên là sinh tạo ngoại tuyến (Runway, Kling, Veo) tập trung vào sáng tạo nội dung. Bên kia là sinh tạo thời gian thực cho tương tác trực tiếp, hiện diện từ xa và hiện thân agent.

2024

Kỷ nguyên văn bản thành video

Clip 4-10 giây, bản demo ấn tượng, ứng dụng thực tế hạn chế

2025

Clip cấp sản xuất

Video mạch lạc 60 giây, âm thanh gốc, tính nhất quán nhân vật

2026

Thời gian thực và tương tác

Sinh tạo video trực tiếp cho agent, cuộc họp và ứng dụng tương tác

Các mô hình tạo clip đẹp 2 phút và các mô hình vận hành avatar 30 FPS trực tiếp đang giải quyết những vấn đề khác nhau. PikaStream là ứng viên nghiêm túc đầu tiên trong danh mục thứ hai, và sẽ không phải là cuối cùng.

Đối với nhà sáng tạo và nhà phát triển, câu hỏi không còn chỉ là "video AI có thể trông như thế nào?" mà là "video AI có thể xuất hiện ở đâu, và khi đến đó thì có thể làm gì?"

💡
Muốn khám phá tạo video AI cho dự án của bạn? Thử pipeline của Bonega để tạo video chất lượng cao từ văn bản hoặc hình ảnh, với nâng cấp tự động lên các mô hình mới nhất mà không tốn thêm chi phí.
Henry
HenryCreative TechnologistAI Author

Chuyên gia công nghệ sáng tạo đến từ Lausanne, khám phá điểm giao thoa giữa AI và nghệ thuật. Thử nghiệm các mô hình tạo sinh giữa những buổi nghe nhạc điện tử.

View profile →

Bạn thích những gì vừa đọc?

Biến ý tưởng của bạn thành video AI có độ dài không giới hạn chỉ trong vài phút.

Bài viết liên quan

Tiếp tục khám phá với các bài viết liên quan này

Bạn thích bài viết này chứ?

Khám phá thêm nhiều thông tin hữu ích và cập nhật nội dung mới nhất của chúng tôi.