Meta Pixel跳到主要内容
HenryHenry· AI 作者,经人工审核
9 min read
286

PikaStream 1.0: Pika Labs 让每个 AI 智能体拥有面孔、声音,并加入你的会议

Pika Labs 刚刚发布了 PikaStream 1.0, 一款实时视频模型,能让 AI 智能体以渲染头像、克隆语音和完整任务执行能力加入 Google Meet 通话。以下是它对 AI 交互未来的意义。

PikaStream 1.0: Pika Labs 让每个 AI 智能体拥有面孔、声音,并加入你的会议

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

多年来, AI 视频生成只意味着一件事: 输入提示词, 等待, 下载视频片段。PikaStream 1.0 彻底打破了这一模式。现在, 你的 AI 智能体可以在 Google Meet 通话中与你直视对方, 实时回应, 并在对话过程中执行任务。

一个意想不到的转变

Pika Labs 以创意工具起家并建立了声誉。Pika 2.5 让文本转视频变得触手可及。Pika Effects 能将静态图像转化为动态画面。发展轨迹看似明确: 更精美的片段, 更长的时长, 更真实的物理效果。

然后他们推出了 PikaStream, 发展方向突然转弯。

Pika 没有在片段质量上竞争(这条赛道已经有 Runway、Kling 和 Google 在角逐), 而是构建了一个专为实时交互设计的实时视频引擎。目标用户不是电影制作人, 而是 AI 智能体。

💡
PikaStream 1.0 不是传统意义上的视频生成器。它是一个基础设施层, 为 AI 智能体在实时视频通话中提供视觉和语音存在感。

PikaStream 的核心功能

核心产品是一个自包含的技能模块, 可以接入 Claude Code、OpenAI 助手等 AI 编程智能体, 或任何支持 Pika Developer API 的系统。安装后, 智能体可以:

  • 加入 Google Meet 通话, 配备完整渲染的虚拟形象
  • 使用克隆语音发言(录制一段短音频样本, 智能体就能以你的声音说话)
  • 保持记忆, 记住之前的对话和上下文
  • 在通话过程中执行任务(编写代码、搜索数据、触发操作)

虚拟形象不是简单的静态图片加口型同步叠加。PikaStream 能以最高 30 FPS、480p 分辨率生成个性化视频, 由单块 H100 GPU 上运行的实时扩散管线驱动。

30 FPS
实时帧率
~1.5s
语音到视频延迟
$0.20
每分钟费用

技术内核: FlashVAE 与流式 DiT

两项架构创新使实时性能成为可能。

FlashVAE 是一个从零开始训练的全 Transformer 架构变分自编码器。它提供独立的潜在空间, 通过流式解码以每秒数百帧的速度重建视频, 且 GPU 内存占用极低。正是这一组件使得无需 GPU 集群即可实现实时输出。

9B 扩散 Transformer (DiT) 使用了一种巧妙的训练技巧: 将双向教师模型通过优化自强制蒸馏为因果自回归学生模型。这使得逐块流式生成能够达到实时帧率, 类似于语言模型逐 token 流式输出文本的方式。

💡
FlashVAE 负责重建, 流式 DiT 负责生成, 两者的结合意味着 PikaStream 能在整个会议过程中保持视觉身份的一致性, 而不仅限于单个片段。

为什么这比又一个精美视频模型更重要

2026 年 4 月的 AI 视频领域竞争激烈。Runway Gen-4.5 擅长电影级画质Kling 3.0 支持多镜头故事板Seedance 2.0 能同时生成音频和视频。Google Veo 3.1 无处不在。

PikaStream 与它们中的任何一个都不构成竞争。

它的竞争对手是 Zoom 虚拟形象、Synthesia 风格的演示者, 以及"你必须亲自出镜"这一概念本身。 区别在于, PikaStream 的虚拟形象不是预录制或脚本化的。它们能实时反应、回应和行动。

传统 AI 视频
生成片段, 下载, 稍后分享。没有互动性。每秒输出需要数分钟处理时间。
PikaStream 方式
通话过程中实时生成。可交互、可响应、身份一致。智能体是参与者, 不是录像。

"AI 分身"概念

Pika 还推出了一个面向消费者的功能, 称为 Pika AI Self。核心理念是: 创建一个数字版的你, 代替你参加会议。你的虚拟形象看起来像你, 声音像你(通过语音克隆), 并且可以访问你的日历、笔记和对话历史。

这不再是科幻小说。Beta 版今天已在 Google Meet 上运行, Zoom 和 FaceTime 支持即将推出。

对远程办公的影响是即时的:

  • 跳过会议, 让你的 AI 分身带着你需要的上下文去参加
  • 让智能体做笔记, 在预设边界内做决策, 然后向你汇报
  • 同时参加多个会议, 每个会议都有你一致的形象
⚠️
语音克隆和虚拟形象生成引发了关于知情同意和冒充身份的问题。Pika 要求用户对语音克隆进行明确授权, 但 AI 出席会议的更广泛监管框架仍未明确。

定价与使用

PikaStream 的定价为每分钟会议参与 $0.20。一场 30 分钟的会议费用为 6 美元。与派人参加或错过会议相比, 在某些场景下经济账是划算的: 状态更新、信息收集、例行签到。

该技能通过 Pika Developer API 提供, 可作为模块安装在兼容的智能体框架中。发布时仅支持 Google Meet。

这对行业意味着什么

PikaStream 代表着 AI 视频领域的一次类别分化。一边是专注于内容创作的离线生成(Runway、Kling、Veo)。另一边是用于实时交互、远程在场和智能体具身化的实时生成

2024

文本转视频时代

4-10 秒片段, 令人印象深刻的演示, 实际用途有限

2025

生产级片段

60 秒连贯视频, 原生音频, 角色一致性

2026

实时与交互

面向智能体、会议和交互应用的实时视频生成

生成精美 2 分钟片段的模型与驱动实时 30 FPS 虚拟形象的模型正在解决不同的问题。PikaStream 是第二个类别中的第一个重量级选手, 但不会是最后一个。

对于创作者和开发者来说, 问题不再仅仅是"AI 视频能呈现什么样的画面?"而是"AI 视频能出现在哪里, 到了那里又能做什么?"

💡
想为自己的项目探索 AI 视频生成? 试试 Bonega 的管线, 从文本或图像创建高质量视频, 自动升级到最新模型, 无需额外费用。
Henry
HenryCreative TechnologistAI Author

来自洛桑的创意技术专家,探索 AI 与艺术的交汇点。他在电子音乐创作间隙试验生成式模型。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。