在本地執行AI視頻:LTX-2、RTX和ComfyUI在2026年
使用LTX-2和ComfyUI在自己的GPU上生成4K AI視頻。無需訂閱、無需雲端、無需數據隱私顧慮。以下是開始所需的所有資訊。

由Lightricks與NVIDIA合作開發的開源模型LTX-2,現在可在單個消費級GPU上生成長達4K 50禎每秒的20秒視頻。無需雲端。無需訂閱。資料永不離開你的裝置。
在2026年CES上,NVIDIA展示了LTX-2在新型RTX 50系列上的原生執行,效果令觀眾驚嘆。這不是研究演示。這是生產就緒的本地視頻生成,速度與雲服務相當。
讓我為你詳細介紹這意味著什麼、需要什麼,以及如何設定。
為什麼本地AI視頻生成很重要
在深入技術設定之前,讓我解釋為什麼在本地執行AI視頻不僅僅是愛好者的偏好。它解決了真實問題。
月度訂閱(20-100美元/月)、資料上傳到第三方伺服器、依賴網際網路、尖峰時段生成隊列、自訂選項有限
一次性硬體投資、完整資料隱私、離線可用、無隊列時間、使用LoRA訓練完整模型自訂、無限生成次數
對於處理客戶素材的工作室來說,隱私不是選擇項。對於網際網路速度緩慢地區的創作者來說,雲生成是不切實際的。對於每月生成數百個視頻片段的任何人來說,訂閱的數學計算很快就說不通了。
所需條件:硬體要求
以下是誠實的分析。本地生成需要相當的硬體,但可能不像你想的那麼極端。
| 組件 | 最小 | 推薦 | 最優 |
|---|---|---|---|
| GPU | RTX 4060(8 GB) | RTX 4090(24 GB) | RTX 5090(32 GB) |
| RAM | 16 GB | 32 GB | 64 GB |
| 儲存 | 50 GB可用SSD空間 | 200 GB NVMe | 500 GB NVMe |
| 作業系統 | Windows 10/11、Linux | Ubuntu 22.04+ | Ubuntu 22.04+ |
GPU效能對比
代際之間的效能差距很大。以下是NVIDIA在2026年CES上展示的資料:
| GPU | 720p(5秒片段) | 1080p(5秒片段) | 4K(5秒片段) | 顯存使用 |
|---|---|---|---|---|
| RTX 3060 12 GB | ~45秒 | ~90秒 | 不支援 | 11 GB |
| RTX 4060 8 GB | ~30秒 | ~60秒 | 不支援 | 7.5 GB |
| RTX 4090 24 GB | ~8秒 | ~15秒 | ~45秒 | 18 GB |
| RTX 5090 32 GB | ~3秒 | ~6秒 | ~15秒 | 20 GB |
RTX 50系列通過原生NVFP4量化實現3倍加速,將模型權重精度降低一半,而不影響品質。這與讓大語言模型在消費級硬體上可用的技巧相同,現在應用於視頻擴散。

LTX-2:有什麼特別之處
LTX-2不僅是「另一個開源模型」。它代表了消費級硬體可能性的根本轉變。
高達4K 50禎每秒的20秒生成
內置音訊生成
多關鍵禎控制
基於LoRA的自訂
ComfyUI整合
與雲服務的對比
讓我具體說明本地生成與大型雲平台相比能做什麼和不能做什麼。
| 功能 | LTX-2(本地) | Sora 2 | Veo 3.1 | Runway Gen-4.5 |
|---|---|---|---|---|
| 最大分辨率 | 4K | 1080p | 4K | 1080p |
| 最大時長 | 20秒 | 20秒 | 8秒 | 10秒 |
| 音訊 | 內置 | 單獨 | 原生 | 單獨 |
| 隱私 | 完整 | 雲端 | 雲端 | 雲端 |
| 月度成本 | $0 | $20-200 | $20-50 | $15-100 |
| 自訂 | 完全(LoRA) | 有限 | 有限 | 中等 |
| 速度(1080p、5秒) | 6-60秒(取決於GPU) | 30-120秒 | 15-60秒 | 20-90秒 |
折衷是明確的:雲服務提供更精細的輸出,設定更少,而本地生成給你控制、隱私和零邊際成本。要深入瞭解這些雲平台的對比,請參閱我們的Sora 2 vs Runway vs Veo 3比較。
使用ComfyUI設定LTX-2:逐步指南
以下是實際的操作步驟。我假設你有一個至少8 GB顯存的NVIDIA GPU和最新的驅動程式。
第1步:安裝ComfyUI
ComfyUI是擴散模型的基於節點的可視介面。可以把它想像成虛幻引擎藍圖系統,但用於AI生成工作流。
# 複製ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
# 建立虛擬環境
python -m venv venv
source venv/bin/activate # Linux/Mac
# venv\Scripts\activate # Windows
# 安裝依賴項
pip install -r requirements.txt
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124第2步:下載LTX-2模型
# 導覽至模型目錄
cd models/checkpoints
# 下載LTX-2(約15 GB)
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-0.safetensors
# 下載VAE
cd ../vae
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-vae.safetensors第3步:安裝LTX-2 ComfyUI擴充套件
cd ../../custom_nodes
git clone https://github.com/Lightricks/ComfyUI-LTXVideo.git
cd ComfyUI-LTXVideo
pip install -r requirements.txt第4步:啟動並生成
# 返回ComfyUI根目錄
cd ../..
python main.py --listen 127.0.0.1 --port 8188在瀏覽器中開啟http://127.0.0.1:8188。載入擴充套件示例資料夾中的LTX-2工作流,輸入你的提示詞,然後按一下「佇列提示」。
最佳化你的設定
基本設定工作後,以下是會產生真實差異的調優技巧。
顯存管理
本地生成的最大瓶頸是顯存。以下是如何最大化你擁有的:
- ✓啟用模型卸載(將未使用的層移到系統RAM)
- ✓使用針對你的GPU生成的NVFP8/NVFP4量化
- ✓關閉瀏覽器標籤和其他佔用GPU的應用程式
- ✓在顯示設定中將Windows設定為「硬體加速GPU排程」
- ✓考慮Linux雙系統啟動(GPU利用率比Windows提升5-10%)
批處理工作流
對於需要生成許多片段的創作者,ComfyUI支援批處理佇列。在JSON檔案中設定你的提示詞,將它們連接到批處理載入器節點,讓你的GPU夜間工作。我在RTX 4090上生成過200多個片段。
LoRA訓練自訂風格
這是本地生成真正閃耀的地方。你可以在50-100禎參考素材上訓練LoRA適配器,在RTX 4090上花費約30分鐘。結果是一個輕量級檔案(通常100-300 MB),將模型偏向你的特定視覺風格、角色外觀或環境美學。
# LoRA訓練命令示例
python train_lora.py \
--model ltx-video-2-0.safetensors \
--data ./my_reference_frames/ \
--output ./loras/my_style.safetensors \
--steps 1000 \
--lr 1e-4 \
--rank 32成本計算
讓我用具體數字來說明這個問題。假設你是自由視頻創作者,每月生成100個5秒的視頻片段。
| 方案 | 月度成本 | 年度成本 | 隱私 |
|---|---|---|---|
| Sora 2 Pro | $100/月 | $1,200/年 | 雲端 |
| Runway Standard | $76/月 | $912/年 | 雲端 |
| Veo(Google AI Pro) | $50/月 | $600/年 | 雲端 |
| LTX-2 + RTX 4090 | ~$15/月(電力) | ~$180/年 | 完整 |
RTX 4090在建議零售價為1600美元,儘管由於停產,當前市場價格徘徊在2500-2800美元。每月使用雲服務生成100個片段,即使按市場價格計算,GPU在18-24個月內就能收回成本,之後你僅需支付電力成本。
接下來會發生什麼
本地AI視頻生成的軌跡正在加速。需要關注的三個發展:
LTX-2.1發布
預期改善時間相干性和音訊品質。Lightricks暗示原生唇部同步功能。
NVIDIA Rubin平台
具有專用視頻生成矽的下一代GPU架構。對於擴散工作負載,預期相對當前RTX 50系列提升5-10倍。
總結
雲AI視頻服務是優秀的產品。Sora、Veo、Runway,它們都以最小設定提供令人印象深刻的結果。但它們伴隨著許多創作者開始認為無法接受的折衷:經常性成本、隱私顧慮、網際網路依賴和自訂限制。
帶有ComfyUI的LTX-2在NVIDIA RTX GPU上不是妥協。這是一個不同的範式。一個你擁有整個管道的範式,從模型權重到最終輸出。設定需要一個下午。學習曲線是真實的但可管理的。而且結果,特別是4K與最新最佳化,真正與雲替代方案競爭。
如果你有RTX GPU在遊戲會話之間吃灰,給它一份第二份工作。你可能會驚訝於它的能力。
相關閱讀: 瞭解更多關於開源AI視頻運動的內容,請查看開源AI視頻革命以及我們之前的LTX-2原生4K生成深度潛水。對更廣泛的格局感興趣?請參閱AI視頻的$10革命:預算工具如何挑戰巨頭。
相關文章
繼續探索這些相關文章

SkyReels V4:首個能同時看與聽的AI模型
Skywork AI的SkyReels V4引入了雙流擴散架構,可在單一生成過程中同步產出影片與音訊。這對創作者意味著什麼?

AI 視頻遇見遊戲:NVIDIA GDC 2026 對實時創意工作的啟示
NVIDIA 在 GDC 2026 展示了在實時本地運行的 AI 視頻生成。這對遊戲開發者、內容創意工作者和互動媒體的未來意味著什麼。

2026年3月AI海嘯:7天12個模型終結雲端時代
2026年3月見證了AI視頻模型發布歷史上最密集的爆發。在短短一週內發布了十多個新模型,最大的故事不是任何單個發布,而是本地生成現在與雲端相當。

