Meta Pixel跳至主要內容
DamienDamien· AI 作者,經人工審閱
14 min read
565

在本地執行AI視頻:LTX-2、RTX和ComfyUI在2026年

使用LTX-2和ComfyUI在自己的GPU上生成4K AI視頻。無需訂閱、無需雲端、無需數據隱私顧慮。以下是開始所需的所有資訊。

在本地執行AI視頻:LTX-2、RTX和ComfyUI在2026年

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

在過去的一年裡,基於雲的AI視頻生成器主導了業界討論。Sora、Veo、Runway,它們都需要月度訂閱、將視頻上傳到第三方伺服器、依賴於我們無法控制的網際網路速度。但一場更寧靜的革命一直在桌面端悄悄進行。這場革命把控制權交還給了使用者。

由Lightricks與NVIDIA合作開發的開源模型LTX-2,現在可在單個消費級GPU上生成長達4K 50禎每秒的20秒視頻。無需雲端。無需訂閱。資料永不離開你的裝置。

在2026年CES上,NVIDIA展示了LTX-2在新型RTX 50系列上的原生執行,效果令觀眾驚嘆。這不是研究演示。這是生產就緒的本地視頻生成,速度與雲服務相當。

讓我為你詳細介紹這意味著什麼、需要什麼,以及如何設定。

為什麼本地AI視頻生成很重要

在深入技術設定之前,讓我解釋為什麼在本地執行AI視頻不僅僅是愛好者的偏好。它解決了真實問題。

雲端生成

月度訂閱(20-100美元/月)、資料上傳到第三方伺服器、依賴網際網路、尖峰時段生成隊列、自訂選項有限

本地生成

一次性硬體投資、完整資料隱私、離線可用、無隊列時間、使用LoRA訓練完整模型自訂、無限生成次數

對於處理客戶素材的工作室來說,隱私不是選擇項。對於網際網路速度緩慢地區的創作者來說,雲生成是不切實際的。對於每月生成數百個視頻片段的任何人來說,訂閱的數學計算很快就說不通了。

所需條件:硬體要求

以下是誠實的分析。本地生成需要相當的硬體,但可能不像你想的那麼極端。

RTX 4060
最小GPU
RTX 5090
最優GPU
8 GB
最小顯存
24 GB
推薦顯存
組件最小推薦最優
GPURTX 4060(8 GB)RTX 4090(24 GB)RTX 5090(32 GB)
RAM16 GB32 GB64 GB
儲存50 GB可用SSD空間200 GB NVMe500 GB NVMe
作業系統Windows 10/11、LinuxUbuntu 22.04+Ubuntu 22.04+
💡
如果你已經擁有RTX 3060 12 GB或更好的GPU,你可以立即開始生成AI視頻。RTX 30系列通過LTX-2引入的NVFP8精度格式獲得2倍速度提升和40% 顯存減少。

GPU效能對比

代際之間的效能差距很大。以下是NVIDIA在2026年CES上展示的資料:

GPU720p(5秒片段)1080p(5秒片段)4K(5秒片段)顯存使用
RTX 3060 12 GB~45秒~90秒不支援11 GB
RTX 4060 8 GB~30秒~60秒不支援7.5 GB
RTX 4090 24 GB~8秒~15秒~45秒18 GB
RTX 5090 32 GB~3秒~6秒~15秒20 GB

RTX 50系列通過原生NVFP4量化實現3倍加速,將模型權重精度降低一半,而不影響品質。這與讓大語言模型在消費級硬體上可用的技巧相同,現在應用於視頻擴散。

AI視頻生成GPU基準對比,包括RTX 3060、4060、4090和5090效能
RTX 3060、4060、4090和5090 GPU代次跨越的5秒720p片段生成時間

LTX-2:有什麼特別之處

LTX-2不僅是「另一個開源模型」。它代表了消費級硬體可能性的根本轉變。

🎬

高達4K 50禎每秒的20秒生成

無需超分辨率技巧的原生高分辨率生成。模型直接輸出4K。
🔊

內置音訊生成

與視頻同步生成的音效和環境音。無需單獨的音訊模型。
🎯

多關鍵禎控制

在整個序列中指定多個參考禎。模型在它們之間插值,具有物理感知的運動。
🧩

基於LoRA的自訂

在你自己的素材上訓練輕量級適配器(LoRA),以建立個性化風格、角色或環境美學。
💻

ComfyUI整合

在NVIDIA GPU上最佳化40%的拖放工作流節點。基本使用無需命令列。

與雲服務的對比

讓我具體說明本地生成與大型雲平台相比能做什麼和不能做什麼。

功能LTX-2(本地)Sora 2Veo 3.1Runway Gen-4.5
最大分辨率4K1080p4K1080p
最大時長20秒20秒8秒10秒
音訊內置單獨原生單獨
隱私完整雲端雲端雲端
月度成本$0$20-200$20-50$15-100
自訂完全(LoRA)有限有限中等
速度(1080p、5秒)6-60秒(取決於GPU)30-120秒15-60秒20-90秒

折衷是明確的:雲服務提供更精細的輸出,設定更少,而本地生成給你控制、隱私和零邊際成本。要深入瞭解這些雲平台的對比,請參閱我們的Sora 2 vs Runway vs Veo 3比較

使用ComfyUI設定LTX-2:逐步指南

以下是實際的操作步驟。我假設你有一個至少8 GB顯存的NVIDIA GPU和最新的驅動程式。

第1步:安裝ComfyUI

ComfyUI是擴散模型的基於節點的可視介面。可以把它想像成虛幻引擎藍圖系統,但用於AI生成工作流。

# 複製ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
 
# 建立虛擬環境
python -m venv venv
source venv/bin/activate  # Linux/Mac
# venv\Scripts\activate   # Windows
 
# 安裝依賴項
pip install -r requirements.txt
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124

第2步:下載LTX-2模型

# 導覽至模型目錄
cd models/checkpoints
 
# 下載LTX-2(約15 GB)
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-0.safetensors
 
# 下載VAE
cd ../vae
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-vae.safetensors

第3步:安裝LTX-2 ComfyUI擴充套件

cd ../../custom_nodes
git clone https://github.com/Lightricks/ComfyUI-LTXVideo.git
cd ComfyUI-LTXVideo
pip install -r requirements.txt

第4步:啟動並生成

# 返回ComfyUI根目錄
cd ../..
python main.py --listen 127.0.0.1 --port 8188

在瀏覽器中開啟http://127.0.0.1:8188。載入擴充套件示例資料夾中的LTX-2工作流,輸入你的提示詞,然後按一下「佇列提示」。

💡
RTX 30/40系列使用者:在模型載入器節點中啟用NVFP8量化選項。這樣可以減少40%的顯存使用,而品質影響可以忽略不計。RTX 50系列使用者應該使用NVFP4以獲得最大速度。

最佳化你的設定

基本設定工作後,以下是會產生真實差異的調優技巧。

顯存管理

本地生成的最大瓶頸是顯存。以下是如何最大化你擁有的:

  • 啟用模型卸載(將未使用的層移到系統RAM)
  • 使用針對你的GPU生成的NVFP8/NVFP4量化
  • 關閉瀏覽器標籤和其他佔用GPU的應用程式
  • 在顯示設定中將Windows設定為「硬體加速GPU排程」
  • 考慮Linux雙系統啟動(GPU利用率比Windows提升5-10%)

批處理工作流

對於需要生成許多片段的創作者,ComfyUI支援批處理佇列。在JSON檔案中設定你的提示詞,將它們連接到批處理載入器節點,讓你的GPU夜間工作。我在RTX 4090上生成過200多個片段。

LoRA訓練自訂風格

這是本地生成真正閃耀的地方。你可以在50-100禎參考素材上訓練LoRA適配器,在RTX 4090上花費約30分鐘。結果是一個輕量級檔案(通常100-300 MB),將模型偏向你的特定視覺風格、角色外觀或環境美學。

# LoRA訓練命令示例
python train_lora.py \
  --model ltx-video-2-0.safetensors \
  --data ./my_reference_frames/ \
  --output ./loras/my_style.safetensors \
  --steps 1000 \
  --lr 1e-4 \
  --rank 32

成本計算

讓我用具體數字來說明這個問題。假設你是自由視頻創作者,每月生成100個5秒的視頻片段。

方案月度成本年度成本隱私
Sora 2 Pro$100/月$1,200/年雲端
Runway Standard$76/月$912/年雲端
Veo(Google AI Pro)$50/月$600/年雲端
LTX-2 + RTX 4090~$15/月(電力)~$180/年完整

RTX 4090在建議零售價為1600美元,儘管由於停產,當前市場價格徘徊在2500-2800美元。每月使用雲服務生成100個片段,即使按市場價格計算,GPU在18-24個月內就能收回成本,之後你僅需支付電力成本。

對於高產量創作者來說,本地生成不僅僅是隱私選擇。這是一個在第一年內就能收回成本的財務決定。

接下來會發生什麼

本地AI視頻生成的軌跡正在加速。需要關注的三個發展:

2026年第一季度

LTX-2.1發布

預期改善時間相干性和音訊品質。Lightricks暗示原生唇部同步功能。

2026年第二季度

NVIDIA Rubin平台

具有專用視頻生成矽的下一代GPU架構。對於擴散工作負載,預期相對當前RTX 50系列提升5-10倍。

2026年下半年

Meta Mango(可能開源)

如果Meta遵循其LLaMA模式,Mango可能成為最有能力的開源視頻模型,進一步提升本地生成品質。

總結

雲AI視頻服務是優秀的產品。Sora、Veo、Runway,它們都以最小設定提供令人印象深刻的結果。但它們伴隨著許多創作者開始認為無法接受的折衷:經常性成本、隱私顧慮、網際網路依賴和自訂限制。

帶有ComfyUI的LTX-2在NVIDIA RTX GPU上不是妥協。這是一個不同的範式。一個你擁有整個管道的範式,從模型權重到最終輸出。設定需要一個下午。學習曲線是真實的但可管理的。而且結果,特別是4K與最新最佳化,真正與雲替代方案競爭。

如果你有RTX GPU在遊戲會話之間吃灰,給它一份第二份工作。你可能會驚訝於它的能力。

💡

相關閱讀: 瞭解更多關於開源AI視頻運動的內容,請查看開源AI視頻革命以及我們之前的LTX-2原生4K生成深度潛水。對更廣泛的格局感興趣?請參閱AI視頻的$10革命:預算工具如何挑戰巨頭

Damien
DamienAI DeveloperAI Author

來自里昂的 AI 開發者,熱愛將複雜的 ML 概念化為簡單易懂的做法。不在除錯模型時,你會發現他騎車穿梭於隆河河谷。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。