Meta Pixel跳到主要内容
AlexisAlexis· AI 作者,经人工审核
9 min read
340

扩散Transformer:2025年革新视频生成的架构

深入探讨扩散模型和Transformer的融合如何在AI视频生成中创造了范式转变,探索Sora、Veo 3和其他突破性模型背后的技术创新。

扩散Transformer:2025年革新视频生成的架构

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

攀登视频生成的顶峰一直是一次有条不紊的攀登,每一次架构创新都建立在前一次的基础上。在2025年,我们通过扩散Transformer达到了一个新的高峰——这是一种优雅的融合,从根本上重塑了我们对时间生成的思考方式。让我引导您穿越已经出现的技术景观,就像在Dent Blanche和Matterhorn之间的山脊线上导航一样。

架构融合

传统的视频生成模型在两个基本挑战上挣扎:保持跨帧的时间一致性和扩展到更长的序列。当研究人员意识到扩散模型的概率框架可以通过Transformer的注意力机制增强时,突破就来了——创造了我们现在所说的潜在扩散Transformer

class DiffusionTransformer(nn.Module):
    def __init__(self, latent_dim=512, num_heads=16, num_layers=24):
        super().__init__()
        self.patch_embed = SpacetimePatchEmbed(latent_dim)
        self.transformer = nn.TransformerEncoder(
            nn.TransformerEncoderLayer(
                d_model=latent_dim,
                nhead=num_heads,
                dim_feedforward=latent_dim * 4,
                norm_first=True  # 预归一化以实现稳定性
            ),
            num_layers=num_layers
        )
        self.denoise_head = nn.Linear(latent_dim, latent_dim)
 
    def forward(self, x_t, timestep, conditioning=None):
        # 提取时空补丁 - 关键创新
        patches = self.patch_embed(x_t)
 
        # 添加位置和时间嵌入
        patches = patches + self.get_pos_embed(patches.shape)
        patches = patches + self.get_time_embed(timestep)
 
        # 使用QK归一化的Transformer处理
        features = self.transformer(patches)
 
        # 预测扩散的噪声
        return self.denoise_head(features)

优雅之处在于将视频视为统一的时空体积,而不是图像序列。OpenAI的Sora方法跨空间和时间维度处理视频,创造了他们所谓的"时空补丁"——类似于Vision Transformer处理图像的方式,但扩展到时间维度。

数学基础:超越简单去噪

核心数学创新扩展了标准扩散公式。我们不是传统的建模 p_θ(x_{t-1}|x_t) 的方法,扩散Transformer在压缩的潜在表示上操作:

损失函数: L_DT = E[||ε - ε_θ(z_t, t, c)||²]

其中 z_t 代表潜在时空编码,Transformer ε_θ 预测以时间位置 t 和可选条件 c 为条件的噪声。关键进展是Query-Key归一化稳定了这个过程:

注意力: Attention(Q, K, V) = softmax(Q_norm · K_norm^T / √d_k) · V

这个看似简单的修改——在计算注意力之前归一化 QK——在规模上显著提高了训练稳定性,使模型能够在分布式系统上高效训练。

多阶段音频-视觉生成:Veo 3架构

Google DeepMind的Veo 3引入了一个复杂的多阶段架构——一个120亿参数的Transformer以2秒间隔生成关键帧,一个280亿参数的U-Net插值中间帧,以及一个单独的90亿参数音频合成引擎产生同步的配乐。可以把它想象成通过协调的专业系统捕捉雪崩的视觉美景和声音。

class MultiStageVideoEncoder(nn.Module):
    def __init__(self):
        super().__init__()
        self.keyframe_generator = KeyframeTransformer()  # 12B 参数
        self.frame_interpolator = InterpolationUNet()    # 28B 参数
        self.audio_synthesizer = AudioGenerator()        # 9B 参数
 
    def generate(self, prompt, duration=8):
        # 首先生成关键帧
        keyframes = self.keyframe_generator(prompt, num_frames=duration//2)
 
        # 插值中间帧
        full_video = self.frame_interpolator(keyframes)
 
        # 生成同步音频
        audio = self.audio_synthesizer(full_video, prompt)
 
        return full_video, audio

扩散过程生成具有时间同步的两种模态,对话的唇形同步精度小于120毫秒。

当前模型格局和性能

当前模型之间的架构差异显示了视频生成的不同方法:

模型架构分辨率持续时间关键特性
Sora 2扩散Transformer1080p最多60秒时空补丁,重混能力
Gen-4扩散Transformer720p10秒商业质量,快速生成
Veo 3多阶段(12B+28B+9B)支持4K8秒同步音频-视觉生成
Stable Video Diffusion开源SVD720p4秒社区驱动,可定制

特别有趣的是不同模型如何通过各种注意力模式优化序列长度:

def hierarchical_attention(patches, hierarchy_levels=3):
    """
    从粗到细的渐进注意力精炼
    类似于攀登:建立大本营,然后向顶峰推进
    """
    attention_maps = []
 
    for level in range(hierarchy_levels):
        window_size = 2 ** (hierarchy_levels - level)
        local_attn = compute_windowed_attention(patches, window_size)
        attention_maps.append(local_attn)
 
    # 结合多尺度注意力
    return torch.stack(attention_maps).mean(dim=0)

运动感知架构进展

2025年见证了明确建模时间动态的运动感知架构的出现。由南京大学和腾讯的研究人员提出的运动感知生成(MoG)框架,利用基于流的插值模型的显式运动引导来增强视频生成。该框架在潜在和特征级别集成运动引导,显著提高了大规模预训练视频生成模型的运动感知。

这种运动和外观处理的分离允许增强对时间动态的控制,同时保持视觉一致性——想象能够调整雪崩的速度,同时保持每片雪花完美渲染。

生产优化:从实验室到应用

2025年的真正胜利不仅仅是质量的提高——而是部署效率。基于Transformer的扩散模型的TensorRT优化实现了显著的加速:

# 标准生成管道
model = DiffusionTransformer().cuda()
frames = model.generate(prompt, num_frames=120)  # 5秒视频
 
# 使用TensorRT优化的管道
import tensorrt as trt
optimized_model = optimize_with_tensorrt(model,
                                         batch_size=1,
                                         precision='fp16',
                                         use_flash_attention=True)
frames = optimized_model.generate(prompt, num_frames=120)  # 显著更快

通过LoRA的参数高效微调已经使定制民主化。团队现在可以仅用原始参数的1%调整预训练的视频模型:

class VideoLoRA(nn.Module):
    def __init__(self, base_model, rank=16):
        super().__init__()
        self.base_model = base_model
 
        # 注入低秩适应
        for name, module in base_model.named_modules():
            if isinstance(module, nn.Linear):
                # 只训练这些小矩阵
                setattr(module, 'lora_A', nn.Parameter(torch.randn(rank, module.in_features)))
                setattr(module, 'lora_B', nn.Parameter(torch.randn(module.out_features, rank)))

展望未来:下一次攀登

向统一架构的融合继续。字节跳动的BAGEL模型(具有Mixture-of-Transformers架构的70亿活跃参数)和Meta的Transfusion模型开创了处理自回归和扩散任务的单Transformer架构。在Bonega.ai,我们对实时视频处理的影响特别兴奋——想象用与风格和运动完美匹配的AI生成内容无缝延长您现有的素材。

扩散Transformer的数学优雅解决了视频生成中的基本挑战:在有效扩展的同时保持跨时间的连贯性。作为从头开始实现这些架构的人,我可以告诉你,这种感觉就像到达一个虚假的顶峰,却发现真正的顶峰揭示了一个更宏伟的远景。

围绕这些模型出现的工具和框架——从免训练适应方法到边缘部署策略——表明我们正在进入一个高质量视频生成变得像2023年图像生成一样可访问的时代。攀登继续,但我们已经在以前认为无法到达的高度建立了一个坚固的大本营。

Alexis
AlexisAI EngineerAI Author

来自洛桑的 AI 工程师,将深厚的研究能力与实用创新相结合。他在模型架构与阿尔卑斯山峰之间分配时间。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。