Meta Pixel跳至主要內容
DamienDamien· AI 作者,經人工審閱
13 min read
741

LTX-2:透過開源在消費級 GPU 上實現原生 4K AI 影片生成

Lightricks 發布 LTX-2,具有原生 4K 影片生成和同步音訊功能,在競爭對手仍鎖定於 API 的情況下提供消費級硬體上的開源存取,儘管存在重要的性能權衡。

LTX-2:透過開源在消費級 GPU 上實現原生 4K AI 影片生成

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

LTX-2:透過開源在消費級 GPU 上實現原生 4K AI 影片生成

開源革命

Lightricks 於 2025 年 10 月發布了 LTX-2,引入了在消費級 GPU 上運行的原生 4K 影片生成和同步音訊。雖然 OpenAI 的 Sora 2 和 Google 的 Veo 3.1 仍然鎖定在 API 存取背後,但 LTX-2 採取了不同的路徑,計劃完全開源發布。

4K
原生解析度
50 FPS
最高速度
100%
開源

該模型建立在 2024 年 11 月的原始 LTX Video 和 2025 年 5 月的 130 億參數 LTXV 模型之上,創建了一個可供個人創作者使用的影片生成工具系列。

LTX 模型系列演進

2024 年 11 月

原始 LTX Video

在高端硬體上兩秒內生成五秒的影片。768×512 解析度的基線模型。

2025 年 5 月

LTXV 13B

130 億參數模型,具有增強的品質和能力

2025 年 10 月

LTX-2 發布

原生 4K 解析度,最高 50 FPS,具有同步音訊生成

原生 4K 優勢
細節保留更優越——原生生成在整個動作過程中保持一致的品質。沒有困擾升頻畫面的人工銳化瑕疵。
性能權衡
10 秒的 4K 片段在 RTX 4090 上需要 9-12 分鐘,相比之下在 RTX 3090 上需要 20-25 分鐘。在更高解析度下,生成時間大幅增加。
# LTX 模型系列規格
ltx_video_original = {
    "resolution": "768x512",  # 基礎模型
    "max_duration": 5,  # 秒
    "fps": range(24, 31),  # 24-30 FPS
    "diffusion_steps": 20,
    "h100_time": "5 秒影片需 4 秒",
    "rtx4090_time": "5 秒影片需 11 秒"
}
 
ltx2_capabilities = {
    "resolution": "最高 3840x2160",  # 原生 4K
    "max_duration": 10,  # 已確認秒數,60 秒實驗性
    "fps": "最高 50",
    "synchronized_audio": True,
    "rtx4090_4k_time": "10 秒需 9-12 分鐘"
}

技術架構:實踐中的擴散 Transformer

🏗️

統一框架

LTX-Video 為影片生成實作了擴散 Transformer(DiT),在單一框架內整合多種能力——文字轉影片、圖像轉影片和影片延伸。該架構雙向處理時間資訊,有助於保持影片序列的一致性。

優化擴散

該模型根據品質要求以 8-20 個擴散步驟運作。較少的步驟(8)可實現更快的草稿生成,而 20-30 個步驟可產生更高品質的輸出。不需要無分類器引導——減少記憶體和計算。

🎛️

多模態條件

同時支援多種輸入類型:文字提示、用於風格轉移的圖像輸入、用於控制動畫的多個關鍵影格,以及用於延伸的現有影片。

開源策略和可及性

💡影片 AI 民主化

LTX-2 的開發反映了一個深思熟慮的策略,旨在使影片 AI 民主化。雖然競爭對手透過 API 限制存取,但 Lightricks 提供了多種存取途徑。

  • GitHub 儲存庫:完整的實作程式碼
  • Hugging Face Hub:與 Diffusers 函式庫相容的模型權重
  • 平台整合:Fal.ai、Replicate、ComfyUI 支援
  • LTX Studio:直接瀏覽器存取以進行實驗

符合倫理的訓練數據

這些模型是在來自 Getty Images 和 Shutterstock 的授權資料集上訓練的,確保了商業可行性——這是與在具有不明確版權狀態的網路抓取資料上訓練的模型的重要區別。

# 使用 Diffusers 函式庫的 LTX-Video
from diffusers import LTXVideoPipeline
import torch
 
# 使用記憶體優化初始化
pipe = LTXVideoPipeline.from_pretrained(
    "Lightricks/LTX-Video",
    torch_dtype=torch.float16
).to("cuda")
 
# 使用可配置步驟生成
video = pipe(
    prompt="山景在日出時的空拍視圖",
    num_inference_steps=8,  # 快速草稿模式
    height=704,
    width=1216,
    num_frames=121,  # 30fps 下約 4 秒
    guidance_scale=1.0  # 不需要 CFG
).frames

硬體要求和實際性能

⚠️硬體考量

實際性能在很大程度上取決於硬體配置。根據您的特定需求和預算選擇您的設定。

入門級(12GB VRAM)
GPU:RTX 3060、RTX 4060 - 能力:24-30 FPS 的 720p-1080p 草稿 - 使用案例:原型製作、社交媒體內容 - 限制:無法處理 4K 生成
專業級(24GB+ VRAM)
GPU:RTX 4090、A100 - 能力:原生 4K,沒有妥協 - 性能:9-12 分鐘內 10 秒 4K - 使用案例:需要最高品質的製作工作
11s
RTX 4090 (768p)
4s
H100 (768p)
9-12min
RTX 4090 (4K)
性能現實檢查
  • 768×512 基線:RTX 4090 上 11 秒(相比 H100 上 4 秒)
  • 4K 生成:即使在高端顯示卡上也需要仔細的記憶體管理
  • 品質 vs 速度:使用者必須在快速低解析度或慢速高解析度輸出之間做出選擇

為內容創作者提供的先進功能

影片延伸能力

LTX-2 支援雙向影片延伸,對專注於內容操作的平台很有價值:

# 影片延伸的生產管線
from ltx_video import LTXPipeline
 
pipeline = LTXPipeline(model="ltx-2", device="cuda")
 
# 生成初始片段
initial = pipeline.generate(
    prompt="機器人探索古代遺跡",
    resolution=(1920, 1080),
    duration=5
)
 
# 使用關鍵影格指導延伸
extended = pipeline.extend_video(
    video=initial,
    direction="forward",
    keyframes=[
        {"frame": 150, "prompt": "機器人發現神器"},
        {"frame": 300, "prompt": "神器啟動"}
    ]
)

這種延伸能力與像 Bonega.ai 這樣的影片操作平台很好地對齊,可以在保持視覺一致性的同時擴展內容。

💡同步音訊生成

LTX-2 在影片創建期間生成音訊,而不是作為後期處理。該模型將聲音與視覺動作對齊——快速移動觸發相應的音訊重音,創造自然的視聽關係,無需手動同步。

當前競爭分析(2025 年 11 月)

LTX-2 獨特優勢
唯一具有原生 4K 的開源模型 - 在消費級硬體上運行——無 API 費用 - 完全本地控制和隱私 - 可針對特定工作流程自訂
LTX-2 權衡
生成時間比雲端解決方案慢 - 基線解析度(768×512)低於競爭對手 - 需要大量本地 GPU 投資 - 1080p 的品質無法與 Sora 2 匹敵
🔒

OpenAI Sora 2

發布:2025 年 9 月 30 日

  • 25 秒帶音訊影片
  • 1080p 原生,出色的細節
  • ChatGPT Pro 訂閱
  • 僅雲端處理
🎭

SoulGen 2.0

發布:2025 年 11 月 23 日

  • 動作準確性:MPJPE 42.3mm
  • 視覺品質:SSIM 0.947
  • 需要雲端處理
🌐

Google Veo 3.1

發布:2025 年 10 月

  • 8 秒基礎,可延伸至 60 秒+
  • TPU 基礎設施上的高品質
  • 具有速率限制的 API 存取
🔓

LTX-2

發布:2025 年 10 月

  • 50 FPS 的原生 4K
  • 開源,本地運行
  • 10 秒基礎,60 秒實驗性

實際實作考量

何時 LTX-2 有意義
隱私關鍵需要本地處理的應用 - 無使用成本的無限生成 - 需要模型修改的自訂工作流程 - 研究和實驗 - 具有高容量需求的長期生產
何時考慮替代方案
需要快速周轉的時間敏感製作 - 需要一致 1080p+ 品質的專案 - 有限的本地 GPU 資源 - 一次性生成,API 成本可接受 - 需要即時企業支援

開源生態系統影響

🌟

社群創新

LTX 模型催生了廣泛的社群發展,展示了開源 AI 的力量。

  • 用於視覺工作流程創建的 ComfyUI 節點
  • 針對特定風格和使用案例的微調變體
  • 針對 AMD 和 Apple Silicon 的優化專案
  • 適用於各種程式語言的整合函式庫
📝不斷增長的生態系統

這種生態系統增長展示了開源發布的價值,即使完整的 LTX-2 權重仍在等待公開可用(時間表待官方公告)。

未來發展和路線圖

近期

完整權重發布

供社群使用的完整 LTX-2 模型權重(日期未指定)

2026

擴展能力

生成超過 10 秒,為消費級 GPU 提高記憶體效率

未來

社群驅動演進

行動優化、即時預覽、增強控制和專業變體

結論:理解權衡

獨特的方法

LTX-2 提供了一種獨特的 AI 影片生成方法,優先考慮可及性而非峰值性能。對於從事影片延伸和操作的創作者和平台,儘管存在限制,它仍提供了有價值的能力。

主要優勢
完全本地控制和隱私 - 無使用限制或經常性成本 - 可針對特定工作流程自訂 - 原生 4K 生成能力 - 開源靈活性
重要限制
生成時間以分鐘計,而非秒 - 基礎解析度低於競爭對手 - 4K 的高 VRAM 要求 - 1080p 的品質無法與 Sora 2 或 Veo 3.1 匹敵
🎯

做出選擇

LTX 模型與專有替代方案之間的選擇取決於特定優先事項。對於實驗工作、隱私敏感內容或無限生成需求,LTX-2 提供了無與倫比的價值。對於需要 1080p 最高品質的時間關鍵製作,雲端 API 可能更合適。

民主化很重要

隨著 AI 影片生成在 2025 年的成熟,我們看到一個健康的生態系統正在出現,既有開放的也有封閉的解決方案。LTX-2 的貢獻不在於在每個指標上超越專有模型,而在於確保專業影片生成工具對所有創作者保持可及性,無論預算或 API 存取如何。這種民主化,即使有權衡,也擴大了影片 AI 中創意表達和技術創新的可能性。

Damien
DamienAI DeveloperAI Author

來自里昂的 AI 開發者,熱愛將複雜的 ML 概念化為簡單易懂的做法。不在除錯模型時,你會發現他騎車穿梭於隆河河谷。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。