扩散Transformer:2025年革新视频生成的架构
深入探讨扩散模型和Transformer的融合如何在AI视频生成中创造了范式转变,探索Sora、Veo 3和其他突破性模型背后的技术创新。

攀登视频生成的顶峰一直是一次有条不紊的攀登,每一次架构创新都建立在前一次的基础上。在2025年,我们通过扩散Transformer达到了一个新的高峰——这是一种优雅的融合,从根本上重塑了我们对时间生成的思考方式。让我引导您穿越已经出现的技术景观,就像在Dent Blanche和Matterhorn之间的山脊线上导航一样。
架构融合
传统的视频生成模型在两个基本挑战上挣扎:保持跨帧的时间一致性和扩展到更长的序列。当研究人员意识到扩散模型的概率框架可以通过Transformer的注意力机制增强时,突破就来了——创造了我们现在所说的潜在扩散Transformer。
class DiffusionTransformer(nn.Module):
def __init__(self, latent_dim=512, num_heads=16, num_layers=24):
super().__init__()
self.patch_embed = SpacetimePatchEmbed(latent_dim)
self.transformer = nn.TransformerEncoder(
nn.TransformerEncoderLayer(
d_model=latent_dim,
nhead=num_heads,
dim_feedforward=latent_dim * 4,
norm_first=True # 预归一化以实现稳定性
),
num_layers=num_layers
)
self.denoise_head = nn.Linear(latent_dim, latent_dim)
def forward(self, x_t, timestep, conditioning=None):
# 提取时空补丁 - 关键创新
patches = self.patch_embed(x_t)
# 添加位置和时间嵌入
patches = patches + self.get_pos_embed(patches.shape)
patches = patches + self.get_time_embed(timestep)
# 使用QK归一化的Transformer处理
features = self.transformer(patches)
# 预测扩散的噪声
return self.denoise_head(features)优雅之处在于将视频视为统一的时空体积,而不是图像序列。OpenAI的Sora方法跨空间和时间维度处理视频,创造了他们所谓的"时空补丁"——类似于Vision Transformer处理图像的方式,但扩展到时间维度。
数学基础:超越简单去噪
核心数学创新扩展了标准扩散公式。我们不是传统的建模 p_θ(x_{t-1}|x_t) 的方法,扩散Transformer在压缩的潜在表示上操作:
损失函数: L_DT = E[||ε - ε_θ(z_t, t, c)||²]
其中 z_t 代表潜在时空编码,Transformer ε_θ 预测以时间位置 t 和可选条件 c 为条件的噪声。关键进展是Query-Key归一化稳定了这个过程:
注意力: Attention(Q, K, V) = softmax(Q_norm · K_norm^T / √d_k) · V
这个看似简单的修改——在计算注意力之前归一化 Q 和 K——在规模上显著提高了训练稳定性,使模型能够在分布式系统上高效训练。
多阶段音频-视觉生成:Veo 3架构
Google DeepMind的Veo 3引入了一个复杂的多阶段架构——一个120亿参数的Transformer以2秒间隔生成关键帧,一个280亿参数的U-Net插值中间帧,以及一个单独的90亿参数音频合成引擎产生同步的配乐。可以把它想象成通过协调的专业系统捕捉雪崩的视觉美景和声音。
class MultiStageVideoEncoder(nn.Module):
def __init__(self):
super().__init__()
self.keyframe_generator = KeyframeTransformer() # 12B 参数
self.frame_interpolator = InterpolationUNet() # 28B 参数
self.audio_synthesizer = AudioGenerator() # 9B 参数
def generate(self, prompt, duration=8):
# 首先生成关键帧
keyframes = self.keyframe_generator(prompt, num_frames=duration//2)
# 插值中间帧
full_video = self.frame_interpolator(keyframes)
# 生成同步音频
audio = self.audio_synthesizer(full_video, prompt)
return full_video, audio扩散过程生成具有时间同步的两种模态,对话的唇形同步精度小于120毫秒。
当前模型格局和性能
当前模型之间的架构差异显示了视频生成的不同方法:
| 模型 | 架构 | 分辨率 | 持续时间 | 关键特性 |
|---|---|---|---|---|
| Sora 2 | 扩散Transformer | 1080p | 最多60秒 | 时空补丁,重混能力 |
| Gen-4 | 扩散Transformer | 720p | 10秒 | 商业质量,快速生成 |
| Veo 3 | 多阶段(12B+28B+9B) | 支持4K | 8秒 | 同步音频-视觉生成 |
| Stable Video Diffusion | 开源SVD | 720p | 4秒 | 社区驱动,可定制 |
特别有趣的是不同模型如何通过各种注意力模式优化序列长度:
def hierarchical_attention(patches, hierarchy_levels=3):
"""
从粗到细的渐进注意力精炼
类似于攀登:建立大本营,然后向顶峰推进
"""
attention_maps = []
for level in range(hierarchy_levels):
window_size = 2 ** (hierarchy_levels - level)
local_attn = compute_windowed_attention(patches, window_size)
attention_maps.append(local_attn)
# 结合多尺度注意力
return torch.stack(attention_maps).mean(dim=0)运动感知架构进展
2025年见证了明确建模时间动态的运动感知架构的出现。由南京大学和腾讯的研究人员提出的运动感知生成(MoG)框架,利用基于流的插值模型的显式运动引导来增强视频生成。该框架在潜在和特征级别集成运动引导,显著提高了大规模预训练视频生成模型的运动感知。
这种运动和外观处理的分离允许增强对时间动态的控制,同时保持视觉一致性——想象能够调整雪崩的速度,同时保持每片雪花完美渲染。
生产优化:从实验室到应用
2025年的真正胜利不仅仅是质量的提高——而是部署效率。基于Transformer的扩散模型的TensorRT优化实现了显著的加速:
# 标准生成管道
model = DiffusionTransformer().cuda()
frames = model.generate(prompt, num_frames=120) # 5秒视频
# 使用TensorRT优化的管道
import tensorrt as trt
optimized_model = optimize_with_tensorrt(model,
batch_size=1,
precision='fp16',
use_flash_attention=True)
frames = optimized_model.generate(prompt, num_frames=120) # 显著更快通过LoRA的参数高效微调已经使定制民主化。团队现在可以仅用原始参数的1%调整预训练的视频模型:
class VideoLoRA(nn.Module):
def __init__(self, base_model, rank=16):
super().__init__()
self.base_model = base_model
# 注入低秩适应
for name, module in base_model.named_modules():
if isinstance(module, nn.Linear):
# 只训练这些小矩阵
setattr(module, 'lora_A', nn.Parameter(torch.randn(rank, module.in_features)))
setattr(module, 'lora_B', nn.Parameter(torch.randn(module.out_features, rank)))展望未来:下一次攀登
向统一架构的融合继续。字节跳动的BAGEL模型(具有Mixture-of-Transformers架构的70亿活跃参数)和Meta的Transfusion模型开创了处理自回归和扩散任务的单Transformer架构。在Bonega.ai,我们对实时视频处理的影响特别兴奋——想象用与风格和运动完美匹配的AI生成内容无缝延长您现有的素材。
扩散Transformer的数学优雅解决了视频生成中的基本挑战:在有效扩展的同时保持跨时间的连贯性。作为从头开始实现这些架构的人,我可以告诉你,这种感觉就像到达一个虚假的顶峰,却发现真正的顶峰揭示了一个更宏伟的远景。
围绕这些模型出现的工具和框架——从免训练适应方法到边缘部署策略——表明我们正在进入一个高质量视频生成变得像2023年图像生成一样可访问的时代。攀登继续,但我们已经在以前认为无法到达的高度建立了一个坚固的大本营。
相关文章
继续探索这些相关文章

CraftStory Model 2.0:双向扩散如何实现5分钟AI视频生成
当Sora 2最长只能生成25秒视频时,CraftStory推出了能够生成连贯5分钟视频的系统。其秘诀在于:通过双向约束并行运行多个扩散引擎。

并行化扩散:AI图像生成如何打破质量和分辨率壁垒
探索使超高分辨率图像生成和复杂多元素组合成为可能的并行化扩散架构。深入探讨正在重新定义AI图像合成的技术突破。

Sora 之后的 AI 视频市场:2026 年需要了解的 4 个市场层级
Sora 将于 4 月 26 日关闭。AI 视频市场已整合为四个层级。这是一份实用指南,帮助您根据需求选择合适的 Sora 替代方案。
