LTX-2:透過開源在消費級 GPU 上實現原生 4K AI 影片生成
Lightricks 發布 LTX-2,具有原生 4K 影片生成和同步音訊功能,在競爭對手仍鎖定於 API 的情況下提供消費級硬體上的開源存取,儘管存在重要的性能權衡。

LTX-2:透過開源在消費級 GPU 上實現原生 4K AI 影片生成
Lightricks 於 2025 年 10 月發布了 LTX-2,引入了在消費級 GPU 上運行的原生 4K 影片生成和同步音訊。雖然 OpenAI 的 Sora 2 和 Google 的 Veo 3.1 仍然鎖定在 API 存取背後,但 LTX-2 採取了不同的路徑,計劃完全開源發布。
該模型建立在 2024 年 11 月的原始 LTX Video 和 2025 年 5 月的 130 億參數 LTXV 模型之上,創建了一個可供個人創作者使用的影片生成工具系列。
LTX 模型系列演進
原始 LTX Video
在高端硬體上兩秒內生成五秒的影片。768×512 解析度的基線模型。
LTXV 13B
130 億參數模型,具有增強的品質和能力
LTX-2 發布
原生 4K 解析度,最高 50 FPS,具有同步音訊生成
# LTX 模型系列規格
ltx_video_original = {
"resolution": "768x512", # 基礎模型
"max_duration": 5, # 秒
"fps": range(24, 31), # 24-30 FPS
"diffusion_steps": 20,
"h100_time": "5 秒影片需 4 秒",
"rtx4090_time": "5 秒影片需 11 秒"
}
ltx2_capabilities = {
"resolution": "最高 3840x2160", # 原生 4K
"max_duration": 10, # 已確認秒數,60 秒實驗性
"fps": "最高 50",
"synchronized_audio": True,
"rtx4090_4k_time": "10 秒需 9-12 分鐘"
}技術架構:實踐中的擴散 Transformer
統一框架
LTX-Video 為影片生成實作了擴散 Transformer(DiT),在單一框架內整合多種能力——文字轉影片、圖像轉影片和影片延伸。該架構雙向處理時間資訊,有助於保持影片序列的一致性。
優化擴散
該模型根據品質要求以 8-20 個擴散步驟運作。較少的步驟(8)可實現更快的草稿生成,而 20-30 個步驟可產生更高品質的輸出。不需要無分類器引導——減少記憶體和計算。
多模態條件
同時支援多種輸入類型:文字提示、用於風格轉移的圖像輸入、用於控制動畫的多個關鍵影格,以及用於延伸的現有影片。
開源策略和可及性
LTX-2 的開發反映了一個深思熟慮的策略,旨在使影片 AI 民主化。雖然競爭對手透過 API 限制存取,但 Lightricks 提供了多種存取途徑。
- ✓GitHub 儲存庫:完整的實作程式碼
- ✓Hugging Face Hub:與 Diffusers 函式庫相容的模型權重
- ✓平台整合:Fal.ai、Replicate、ComfyUI 支援
- ✓LTX Studio:直接瀏覽器存取以進行實驗
符合倫理的訓練數據
這些模型是在來自 Getty Images 和 Shutterstock 的授權資料集上訓練的,確保了商業可行性——這是與在具有不明確版權狀態的網路抓取資料上訓練的模型的重要區別。
# 使用 Diffusers 函式庫的 LTX-Video
from diffusers import LTXVideoPipeline
import torch
# 使用記憶體優化初始化
pipe = LTXVideoPipeline.from_pretrained(
"Lightricks/LTX-Video",
torch_dtype=torch.float16
).to("cuda")
# 使用可配置步驟生成
video = pipe(
prompt="山景在日出時的空拍視圖",
num_inference_steps=8, # 快速草稿模式
height=704,
width=1216,
num_frames=121, # 30fps 下約 4 秒
guidance_scale=1.0 # 不需要 CFG
).frames硬體要求和實際性能
實際性能在很大程度上取決於硬體配置。根據您的特定需求和預算選擇您的設定。
性能現實檢查▼
- 768×512 基線:RTX 4090 上 11 秒(相比 H100 上 4 秒)
- 4K 生成:即使在高端顯示卡上也需要仔細的記憶體管理
- 品質 vs 速度:使用者必須在快速低解析度或慢速高解析度輸出之間做出選擇
為內容創作者提供的先進功能
影片延伸能力
LTX-2 支援雙向影片延伸,對專注於內容操作的平台很有價值:
# 影片延伸的生產管線
from ltx_video import LTXPipeline
pipeline = LTXPipeline(model="ltx-2", device="cuda")
# 生成初始片段
initial = pipeline.generate(
prompt="機器人探索古代遺跡",
resolution=(1920, 1080),
duration=5
)
# 使用關鍵影格指導延伸
extended = pipeline.extend_video(
video=initial,
direction="forward",
keyframes=[
{"frame": 150, "prompt": "機器人發現神器"},
{"frame": 300, "prompt": "神器啟動"}
]
)這種延伸能力與像 Bonega.ai 這樣的影片操作平台很好地對齊,可以在保持視覺一致性的同時擴展內容。
LTX-2 在影片創建期間生成音訊,而不是作為後期處理。該模型將聲音與視覺動作對齊——快速移動觸發相應的音訊重音,創造自然的視聽關係,無需手動同步。
當前競爭分析(2025 年 11 月)
OpenAI Sora 2
發布:2025 年 9 月 30 日
- 25 秒帶音訊影片
- 1080p 原生,出色的細節
- ChatGPT Pro 訂閱
- 僅雲端處理
SoulGen 2.0
發布:2025 年 11 月 23 日
- 動作準確性:MPJPE 42.3mm
- 視覺品質:SSIM 0.947
- 需要雲端處理
Google Veo 3.1
發布:2025 年 10 月
- 8 秒基礎,可延伸至 60 秒+
- TPU 基礎設施上的高品質
- 具有速率限制的 API 存取
LTX-2
發布:2025 年 10 月
- 50 FPS 的原生 4K
- 開源,本地運行
- 10 秒基礎,60 秒實驗性
實際實作考量
開源生態系統影響
社群創新
LTX 模型催生了廣泛的社群發展,展示了開源 AI 的力量。
- ✓用於視覺工作流程創建的 ComfyUI 節點
- ✓針對特定風格和使用案例的微調變體
- ✓針對 AMD 和 Apple Silicon 的優化專案
- ✓適用於各種程式語言的整合函式庫
這種生態系統增長展示了開源發布的價值,即使完整的 LTX-2 權重仍在等待公開可用(時間表待官方公告)。
未來發展和路線圖
完整權重發布
供社群使用的完整 LTX-2 模型權重(日期未指定)
擴展能力
生成超過 10 秒,為消費級 GPU 提高記憶體效率
社群驅動演進
行動優化、即時預覽、增強控制和專業變體
結論:理解權衡
LTX-2 提供了一種獨特的 AI 影片生成方法,優先考慮可及性而非峰值性能。對於從事影片延伸和操作的創作者和平台,儘管存在限制,它仍提供了有價值的能力。
做出選擇
LTX 模型與專有替代方案之間的選擇取決於特定優先事項。對於實驗工作、隱私敏感內容或無限生成需求,LTX-2 提供了無與倫比的價值。對於需要 1080p 最高品質的時間關鍵製作,雲端 API 可能更合適。
隨著 AI 影片生成在 2025 年的成熟,我們看到一個健康的生態系統正在出現,既有開放的也有封閉的解決方案。LTX-2 的貢獻不在於在每個指標上超越專有模型,而在於確保專業影片生成工具對所有創作者保持可及性,無論預算或 API 存取如何。這種民主化,即使有權衡,也擴大了影片 AI 中創意表達和技術創新的可能性。
相關文章
繼續探索這些相關文章

在本地執行AI視頻:LTX-2、RTX和ComfyUI在2026年
使用LTX-2和ComfyUI在自己的GPU上生成4K AI視頻。無需訂閱、無需雲端、無需數據隱私顧慮。以下是開始所需的所有資訊。

SkyReels V4:首個能同時看與聽的AI模型
Skywork AI的SkyReels V4引入了雙流擴散架構,可在單一生成過程中同步產出影片與音訊。這對創作者意味著什麼?

AI 視頻遇見遊戲:NVIDIA GDC 2026 對實時創意工作的啟示
NVIDIA 在 GDC 2026 展示了在實時本地運行的 AI 視頻生成。這對遊戲開發者、內容創意工作者和互動媒體的未來意味著什麼。
