Meta PixelSalta al contingut principal
DamienDamien· Autoria d’IA, revisada per humans
11 min read
2067 paraules

Genereu vídeo amb IA localment: LTX-2, RTX i ComfyUI el 2026

Creeu vídeo en 4K amb IA a la vostra GPU. Sense subscripcions, sense núvol, sense preocupacions per la privacitat de dades. Aquí teniu tot el que necessiteu per començar.

Genereu vídeo amb IA localment: LTX-2, RTX i ComfyUI el 2026

Preparat per crear els teus propis vídeos amb IA?

Uneix-te a milers de creadors que utilitzen Bonega.ai

Els generadors de vídeo amb IA basats en el núvol han dominat la conversa durant l'últim any. Sora, Veo, Runway, tots exigeixen subscripcions mensuals, pugen els vostres vídeos a servidors de tercers i depenen de velocitats d'Internet que la majoria de nosaltres no podem controlar. Però una revolució silenciosa s'ha estat construint a la banda de l'escriptori. Una que us torna a posar al seient del conductor.

El model de codi obert LTX-2, desenvolupat per Lightricks en col·laboració amb NVIDIA, genera fins a 20 segons de vídeo 4K a 50 FPS en una única GPU de consumidor. Sense núvol. Sense subscripció. Sense dades que surten de la vostra màquina.

A la CES 2026, NVIDIA va demostrar LTX-2 funcionant de manera nativa al nou RTX 50 Series, i els resultats van deixar l'audiència sense paraules. No era una demostració d'investigació. Eren generació de vídeo local llesta per a producció, funcionant a velocitats que rivalitzen amb els serveis en núvol.

Deixeu que us expliqui què significa això, què necessiteu i com configurar-ho.

Per què la generació local de vídeo amb IA és important

Abans de sumergirnos en la configuració tècnica, deixeu que us expliqui per què executar vídeo amb IA localment no és només una preferència de dilettant. Resol problemes reals.

Generació al núvol

Subscripcions mensuals ($20-100/mes), dades pujades a servidors de tercers, depenent d'Internet, cues de generació durant hores punta, opcions de personalització limitades

Generació local

Inversió de maquinari única, privacitat completa de dades, funciona sense connexió, sense temps d'espera, personalització completa del model amb entrenament LoRA, generacions il·limitades

Per a estudis que treballen amb vídeos de clients, la privacitat no és opcional. Per a creadors de regions amb Internet lent, la generació al núvol és impràctica. I per a qualsevol que generi centenars de clips al mes, les matemàtiques de la subscripció molt ràpidament deixen de tenir sentit.

Què necessiteu: Requisits de maquinari

Aquí és el resum honest. La generació local requereix maquinari decent, però probablement no tant extrem com penseu.

RTX 4060
GPU mínima
RTX 5090
GPU òptima
8 GB
VRAM mínim
24 GB
VRAM recomanada
ComponentMínimRecomanatÒptim
GPURTX 4060 (8 GB)RTX 4090 (24 GB)RTX 5090 (32 GB)
RAM16 GB32 GB64 GB
Emmagatzematge50 GB SSD lliure200 GB NVMe500 GB NVMe
SOWindows 10/11, LinuxUbuntu 22.04+Ubuntu 22.04+
💡
Si ja teniu una RTX 3060 12 GB o millor, podeu començar a generar vídeo amb IA avui. La sèrie RTX 30 obté un augment de velocitat de 2x i una reducció de VRAM del 40% mitjançant el format de precisió NVFP8 introduït amb LTX-2.

Comparació de rendiment de GPU

La diferència de rendiment entre generacions és dramàtica. Aquí és el que NVIDIA va demostrar a la CES 2026:

GPU720p (clip de 5 s)1080p (clip de 5 s)4K (clip de 5 s)Ús de VRAM
RTX 3060 12 GB~45 segons~90 segonsNo suportat11 GB
RTX 4060 8 GB~30 segons~60 segonsNo suportat7.5 GB
RTX 4090 24 GB~8 segons~15 segons~45 segons18 GB
RTX 5090 32 GB~3 segons~6 segons~15 segons20 GB

La sèrie RTX 50 aconsegueix el seu augment de velocitat de 3x mitjançant quantització NVFP4 nativa, reduint a la meitat la precisió dels pesos del model sense pèrdua de qualitat visible. Este és el mateix truc que va fer pràctiques LLM en maquinari de consumidor, ara aplicat a la difusió de vídeo.

Comparativa de referència GPU per a la generació de vídeo amb IA que mostra el rendiment RTX 3060, 4060, 4090 i 5090
Temps de generació per a un clip 720p de 5 segons en totes les generacions GPU de NVIDIA

LTX-2: Què el fa especial

LTX-2 no és simplement "un altre model de codi obert". Representa un canvi fonamental en el que és possible en el maquinari de consumidor.

🎬

Fins a 20 segons a 4K 50 FPS

Generació de vídeo d'alta resolució nativa sense trucs de superresolució. El model emet 4K directament.
🔊

Generació d'àudio integrada

Efectes de so sincronitzats i àudio ambient generat juntament amb el vídeo. No és necessari un model de so separat.
🎯

Control multi-fotograma clau

Especifiqueu múltiples marcs de referència en tota la seqüència. El model interpola entre ells amb moviment conscient de la física.
🧩

Personalització basada en LoRA

Entrenar adaptadors lleugers (LoRA) en el vostre propi material de video per crear estils personalitzats, aparences de personatges o estètica ambiental.
💻

Integració de ComfyUI

Nodes de flux de treball optimitzats d'arrossegament i descenso 40% en GPU de NVIDIA. Cap línia de comandament necessària per a ús bàsic.

Comparació amb serveis al núvol

Deixeu que sigui específic sobre el que la generació local pot i no pot fer en comparació amb les grans plataformes en núvol.

CaracterísticaLTX-2 (local)Sora 2Veo 3.1Runway Gen-4.5
Resolució màxima4K1080p4K1080p
Durada màxima20 segons20 segons8 segons10 segons
ÀudioIntegratSeparatNatiuSeparat
PrivacitatCompletNúvolNúvolNúvol
Cost mensual$0$20-200$20-50$15-100
PersonalitzacióComplet (LoRA)LimitatLimitatModerat
Velocitat (1080p, 5 s)6-60 s (depenent de GPU)30-120 s15-60 s20-90 s

El compromís és clar, els serveis al núvol ofereixen resultats més perfeccionats amb menys configuració, mentre que la generació local us dona control, privacitat i costos marginals zero per generació. Per a una mirada més profunda a com aquestes plataformes en núvol es comparen, consulteu la nostra comparació Sora 2 vs Runway vs Veo 3.

Configuració de LTX-2 amb ComfyUI: pas a pas

Aquí teniu el recorregut pràctic. Assumeixo que teniu una GPU NVIDIA amb almenys 8 GB de VRAM i un controlador recent instal·lat.

Pas 1: Instal·leu ComfyUI

ComfyUI és una interfície visual basada en nodes per a models de difusió. Penseu-hi com el sistema Blueprint del Unreal Engine, però per a fluxos de treball de generació d'IA.

# Clonar ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
 
# Crear un entorn virtual
python -m venv venv
source venv/bin/activate  # Linux/Mac
# venv\Scripts\activate   # Windows
 
# Instal·lar dependències
pip install -r requirements.txt
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124

Pas 2: Descarregueu el model LTX-2

# Navegar al directori de models
cd models/checkpoints
 
# Descarregueu LTX-2 (aproximadament 15 GB)
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-0.safetensors
 
# Descarregueu el VAE
cd ../vae
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-vae.safetensors

Pas 3: Instal·leu l'extensió ComfyUI LTX-2

cd ../../custom_nodes
git clone https://github.com/Lightricks/ComfyUI-LTXVideo.git
cd ComfyUI-LTXVideo
pip install -r requirements.txt

Pas 4: Iniciar i generar

# Torneu a la raïz de ComfyUI
cd ../..
python main.py --listen 127.0.0.1 --port 8188

Obriu http://127.0.0.1:8188 al vostre navegador. Carregeu el flux de treball LTX-2 de la carpeta d'exemple de l'extensió, escriviu el vostre indicatiu i feu clic a "Queue Prompt."

💡
Per als usuaris de la sèrie RTX 30/40: habiliteu l'opció de quantització NVFP8 al node del carregador de models. Això redueix el ús de VRAM en un 40% amb un impacte negligible en la qualitat. Els usuaris de la sèrie RTX 50 haurien d'utilitzar NVFP4 per a la velocitat màxima.

Optimitzeu la vostra configuració

Després que la configuració bàsica funcioni, aquí els trucs de sintonització que marquen una diferència real.

Gestió de VRAM

El coll de botella més gran per a la generació local és VRAM. Aquí teniu com maximitzar el que teniu:

  • Habiliteu la descàrrega del model (mou les capes no utilitzades a RAM del sistema)
  • Utilitzeu quantització NVFP8/NVFP4 per a la vostra generació de GPU
  • Tanqueu les pestanyes del navegador i altres aplicacions que consumeixen GPU
  • Establiu Windows a "Planificació de GPU accelerada per maquinari" a la configuració de pantalla
  • Considereu una arrancada doble de Linux (millor ús de GPU del 5-10% vs Windows)

Flux de treball de processament per lots

Per als creadors que necessiten generar molts clips, ComfyUI admet cues de lots. Establiu les vostres indicacions a un fitxer JSON, connecteu-les a un node carregador de lots i deixeu que la vostra GPU treballi tota la nit. He generat més de 200 clips en una sessió nocturna única a RTX 4090.

Entrenament LoRA per a estils personalitzats

Aquí és on la generació local realment brilla. Podeu entrenar un adaptador LoRA en 50-100 fotogrames de material de referència en aproximadament 30 minuts en un RTX 4090. El resultat és un fitxer lleuger (normalment 100-300 MB) que desvia el model cap a l'estil visual específic, aparences de personatges o estètica ambiental.

# Ordre d'entrenament LoRA exemple
python train_lora.py \
  --model ltx-video-2-0.safetensors \
  --data ./my_reference_frames/ \
  --output ./loras/my_style.safetensors \
  --steps 1000 \
  --lr 1e-4 \
  --rank 32

Càlcul de costos

Deixeu que posi números concrets en aquest. Suposem que sou un creador de vídeo autònom que genera 100 clips de cinc segons al mes.

AbordatgeCost mensualCost anualPrivacitat
Sora 2 Pro$100/mes$1.200/anyNúvol
Runway estàndard$76/mes$912/anyNúvol
Veo (Google AI Pro)$50/mes$600/anyNúvol
LTX-2 + RTX 4090~$15/mes (electricitat)~$180/anyComplet

Una RTX 4090 costa aproximadament $1.600 a MSRP, encara que els preus actuals del mercat oscil·len més a prop de $2.500-2.800 degut a la producció descontinuada. A 100 clips al mes utilitzant serveis al núvol, fins i tot al preu de mercat, la GPU es paga a si mateixa en 18-24 mesos, i després generareu pel cost de l'electricitat.

Per als creadors d'alt volum, la generació local no és només una opció de privacitat. Es tracta d'una decisió financera que es paga a si mateixa dins del primer any.

Què ve a continuació

La trajectòria de la generació local de vídeo amb IA s'accelera. Tres desenvolupaments a tenir en compte:

Q1 2026

Llançament de LTX-2.1

Es preveuen millores en la coherència temporal i la qualitat de l'àudio. Lightricks ha suggerit capacitats natives de sincronització de llavis.

Q2 2026

Plataforma NVIDIA Rubin

Arquitectura GPU de la següent generació amb silici dedicat a la generació de vídeo. Es preveuen millores de 5-10x sobre els treballs de difusió actual de la sèrie RTX 50.

H2 2026

Meta Mango (potencialment codi obert)

Si Meta segueix el seu patró LLaMA, Mango podria convertir-se en el model de vídeo de codi obert més capaç disponible, impulsant encara més la qualitat de la generació local.

La línia de base

Els serveis de vídeo amb IA al núvol són productes excel·lents. Sora, Veo, Runway, tots ofereixen resultats impressionants amb una configuració mínima. Però venen amb compromisos que molts creadors comencen a trobar inacceptables: costos recurrents, preocupacions sobre privacitat, dependència d'Internet i personalització limitada.

LTX-2 amb ComfyUI en una GPU NVIDIA RTX no és un compromís. Es tracta d'un paradigma diferent. Un on sou propietaris de tota la canonada, des dels pesos del model fins a la producció final. La configuració dura una tarda. La corba d'aprenentatge és real però manejable. Els resultats, especialment en 4K amb les últimes optimitzacions, són genuïnament competitius amb alternatives al núvol.

Si teniu una GPU RTX recollint pols entre sessions de jocs, doneu-li una segona feina. Us podria sorprendre el que pot fer.

💡

Lectures relacionades: Per a més informació sobre el moviment de vídeo amb IA de codi obert, consulteu la nostra revolució de vídeo amb IA de codi obert i la nostra anterior immersió profunda a generació nativa 4K LTX-2. Interessat en el panorama més ampli? Consulteu la revolució de $10 del vídeo amb IA: com les eines pressupostàries desafien els gegants.

Damien
DamienAI DeveloperAI Author

Desenvolupador d’IA de Lió que gaudeix transformant conceptes complexos d’ML en receptes senzilles. Quan no depura models, el trobaràs recorrent amb bicicleta la vall del Roine.

View profile →

T’ha agradat el que has llegit?

Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.

Articles relacionats

Continua explorant amb aquestes publicacions relacionades

T’ha agradat aquest article?

Descobreix més idees i mantén-te al dia amb el nostre contingut més recent.