AI Video Lokaal Maken: LTX-2, RTX en ComfyUI in 2026
Genereer 4K AI-video op je eigen GPU met LTX-2 en ComfyUI. Geen abonnementen, geen cloud, geen privacy-zorgen. Hier is alles wat je nodig hebt om te starten.

Het open-source model LTX-2, ontwikkeld door Lightricks in samenwerking met NVIDIA, genereert nu tot 20 seconden 4K-video op 50 FPS op een enkele consumer-GPU. Geen cloud. Geen abonnement. Geen data die je computer verlaat.
Op CES 2026 toonde NVIDIA LTX-2 nativiteit op de nieuwe RTX 50 Series, en de resultaten lieten het publiek sprakeloos achter. Dit was geen onderzoeksdemo. Dit was videogeneratie klaar voor productie, draaiend op snelheden die cloudservices evenaren.
Laat me je uitleggen wat dit betekent, wat je nodig hebt en hoe je dit instelt.
Waarom lokale AI-videogeneratie belangrijk is
Voordat we in de technische setup duiken, wil ik uitleggen waarom AI-video lokaal maken niet alleen een hoebbykeuze is. Het lost echte problemen op.
Maandelijkse abonnementen (20-100 euro/maand), data geüpload naar servers van derden, internetafhankelijk, generatiewachtrijen tijdens piekuren, beperkte aanpassingsopties
Eenmalige hardware-investering, volledige gegevensprivacy, werkt offline, geen wachttijden, volledige modelaanpassing met LoRA-training, onbeperkt genereren
Voor studios die met clientmaterialen werken, is privacy niet optioneel. Voor makers in regio's met trage internet is cloud-generatie onpraktisch. En voor iedereen die honderden clips per maand genereert, stopt de wiskunde van abonnementen heel snel uit te maken.
Wat Je Nodig Hebt: Hardware-vereisten
Hier is de eerlijke uitsplitsing. Lokale generatie vereist degelijke hardware, maar waarschijnlijk niet zo extreem als je denkt.
| Onderdeel | Minimum | Aanbevolen | Optimaal |
|---|---|---|---|
| GPU | RTX 4060 (8 GB) | RTX 4090 (24 GB) | RTX 5090 (32 GB) |
| RAM | 16 GB | 32 GB | 64 GB |
| Opslag | 50 GB vrije SSD | 200 GB NVMe | 500 GB NVMe |
| OS | Windows 10/11, Linux | Ubuntu 22.04+ | Ubuntu 22.04+ |
GPU-prestatievergelijking
Het prestatiekloof tussen generaties is dramatisch. Dit is wat NVIDIA op CES 2026 heeft aangetoond:
| GPU | 720p (5s clip) | 1080p (5s clip) | 4K (5s clip) | VRAM-gebruik |
|---|---|---|---|---|
| RTX 3060 12 GB | ~45 seconden | ~90 seconden | Niet ondersteund | 11 GB |
| RTX 4060 8 GB | ~30 seconden | ~60 seconden | Niet ondersteund | 7.5 GB |
| RTX 4090 24 GB | ~8 seconden | ~15 seconden | ~45 seconden | 18 GB |
| RTX 5090 32 GB | ~3 seconden | ~6 seconden | ~15 seconden | 20 GB |
De RTX 50 Series bereikt zijn 3x versnelling via native NVFP4-kwantisering, waardoor de precisie van modelgewichten wordt gehalveerd zonder zichtbaar kwaliteitsverlies. Dit is dezelfde truuc die LLM's praktisch maakte op consumer-hardware, nu toegepast op videodiffusie.

LTX-2: Wat Maakt Het Bijzonder
LTX-2 is niet gewoon "nog een open-source model". Het vertegenwoordigt een fundamentele verschuiving in wat mogelijk is op consumer-hardware.
Tot 20 Seconden op 4K 50 FPS
Ingebouwde audiogeneratie
Besturing Multi-Keyframe
LoRA-gebaseerde aanpassing
ComfyUI-integratie
Hoe Het Zich Verhoudt tot Cloudservices
Laat me specifiek zijn over wat lokale generatie wel en niet kan doen in vergelijking met grote cloudplatforms.
| Functie | LTX-2 (Lokaal) | Sora 2 | Veo 3.1 | Runway Gen-4.5 |
|---|---|---|---|---|
| Maximale resolutie | 4K | 1080p | 4K | 1080p |
| Maximale duur | 20 seconden | 20 seconden | 8 seconden | 10 seconden |
| Audio | Ingebouwd | Afzonderlijk | Ingebouwd | Afzonderlijk |
| Privacy | Volledig | Cloud | Cloud | Cloud |
| Maandkosten | 0 euro | 20-200 euro | 20-50 euro | 15-100 euro |
| Aanpassing | Volledig (LoRA) | Beperkt | Beperkt | Matig |
| Snelheid (1080p, 5s) | 6-60s (GPU-afhankelijk) | 30-120s | 15-60s | 20-90s |
Het compromis is duidelijk: cloudservices bieden meer gepolijste output met minder setup, terwijl lokale generatie je controle, privacy en nulkosten per generatie geeft. Voor een dieper kijkje naar hoe deze cloudplatforms zich verhouden, zie onze Sora 2 vs Runway vs Veo 3 vergelijking.
LTX-2 Instellen met ComfyUI: Stap voor Stap
Hier is de praktische uitleg. Ik ga ervan uit dat je een NVIDIA GPU hebt met minstens 8 GB VRAM en een recent stuurprogramma geïnstalleerd.
Stap 1: Installeer ComfyUI
ComfyUI is een op knooppunten gebaseerde visuele interface voor diffusiemodellen. Zie het als het Unreal Engine Blueprint-systeem, maar voor AI-generatie workflows.
# Clone ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
# Maak een virtuele omgeving
python -m venv venv
source venv/bin/activate # Linux/Mac
# venv\Scripts\activate # Windows
# Installeer afhankelijkheden
pip install -r requirements.txt
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124Stap 2: Download LTX-2 Model
# Navigeer naar de modellenmap
cd models/checkpoints
# Download LTX-2 (ongeveer 15 GB)
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-0.safetensors
# Download de VAE
cd ../vae
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-vae.safetensorsStap 3: Installeer de LTX-2 ComfyUI-extensie
cd ../../custom_nodes
git clone https://github.com/Lightricks/ComfyUI-LTXVideo.git
cd ComfyUI-LTXVideo
pip install -r requirements.txtStap 4: Start en Genereer
# Terug naar ComfyUI-root
cd ../..
python main.py --listen 127.0.0.1 --port 8188Open http://127.0.0.1:8188 in je browser. Laad de LTX-2-workflow vanuit de exempelmappen van de extensie, typ je prompt en klik op "Queue Prompt".
Jouw Setup Optimaliseren
Nadat de basissetup werkt, zijn hier de optimalisatietrucs die een echt verschil maken.
VRAM-beheer
De enige grootste bottleneck voor lokale generatie is VRAM. Dit is hoe je maximaal van wat je hebt:
- ✓Schakel modeloffloading in (verplaatst ongebruikte lagen naar systeemRAM)
- ✓Gebruik NVFP8/NVFP4-kwantisering voor je GPU-generatie
- ✓Sluit browsertabbladen en andere GPU-hongerige applicaties
- ✓Stel Windows in op "Hardware-versnelde GPU-planning" in beeldscherminstellingen
- ✓Overweeg een Linux dual-boot (5-10% beter GPU-gebruik versus Windows)
Batch-verwerkingsworkflow
Voor makers die veel clips moeten genereren, ondersteunt ComfyUI batchqueuing. Stel je prompts in een JSON-bestand in, verbind ze met een batch loader-knooppunt en laat je GPU 's nachts werken. Ik heb meer dan 200 clips in één nachtelijke sessie op een RTX 4090 gegenereerd.
LoRA-training voor aangepaste stijlen
Dit is waar lokale generatie echt schittert. Je kunt een LoRA-adapter trainen op 50-100 frames referentiebeelden in ongeveer 30 minuten op een RTX 4090. Het resultaat is een lichtgewicht bestand (meestal 100-300 MB) dat het model naar jouw specifieke visuele stijl, karakteruiterlijkheden of omgeving-esthetica stuurt.
# Voorbeeld LoRA-trainingsopdracht
python train_lora.py \
--model ltx-video-2-0.safetensors \
--data ./my_reference_frames/ \
--output ./loras/my_style.safetensors \
--steps 1000 \
--lr 1e-4 \
--rank 32De Kostencalculatie
Laat me concrete getallen geven. Stel je bent een freelance videograaf die 100 clips van vijf seconden per maand genereert.
| Benadering | Maandkosten | Jaarkosten | Privacy |
|---|---|---|---|
| Sora 2 Pro | 100 euro/maand | 1.200 euro/jaar | Cloud |
| Runway Standard | 76 euro/maand | 912 euro/jaar | Cloud |
| Veo (Google AI Pro) | 50 euro/maand | 600 euro/jaar | Cloud |
| LTX-2 + RTX 4090 | ~15 euro/maand (elektriciteit) | ~180 euro/jaar | Volledig |
Een RTX 4090 kost ongeveer 1.600 euro tegen MSRP, hoewel huidige marktprijzen dicht bij 2.500-2.800 euro liggen vanwege beëindigde productie. Op 100 clips per maand met cloudservices, zelfs tegen marktprijs betaalt de GPU zich binnen 18-24 maanden terug, en dan genereer je voor elektriciteitskosten.
Wat Komt Er Volgende
De baan van lokale AI-videogeneratie versnelt. Drie ontwikkelingen om in het oog te houden:
LTX-2.1 Release
Verwachte verbeteringen in temporele coherentie en audiokwaliteit. Lightricks heeft gehinsd naar ingebouwde lip-sync-mogelijkheden.
NVIDIA Rubin Platform
GPU-architectuur van volgende generatie met dedicated videogeneratiesilicon. Verwacht 5-10x verbetering ten opzichte van huidige RTX 50 Series voor diffusieworkloads.
Meta Mango (Mogelijk Open Source)
Als Meta zijn LLaMA-patroon volgt, Mango zou het meest capabele open-source videomodel kunnen worden, wat lokale generatiekwaliteit verder verbetert.
De Onderste Regel
Cloud AI-videoservices zijn uitstekende producten. Sora, Veo, Runway, ze leveren allemaal indrukwekkende resultaten met minimale setup. Maar ze komen met compromissen die veel makers nu onaanvaardbaar vinden: terugkerende kosten, privacyzorgen, internetafhankelijkheid en beperkte aanpassing.
LTX-2 met ComfyUI op een NVIDIA RTX GPU is geen compromis. Het is een ander paradigma. Een waar je de volledige pipeline bezit, van modelgewichten tot eindresultaat. De setup duurt een middag. De leercurve is reëel maar beheersbaar. En de resultaten, vooral in 4K met de nieuwste optimalisaties, zijn echt competitief met cloudalternatieven.
Als je een GPU hebt die stof verzamelt tussen gamesessies, geef het een tweede baan. Je zou verrast kunnen zijn wat het kan doen.
Gerelateerde lezingen: Voor meer over de open-source AI-videobeweging, zie De Open-Source AI-Videorevolatie en onze eerdere diepgaande analyse van LTX-2 native 4K-generatie. Geïnteresseerd in het bredere landschap? Zie AI Video''s $10 Revolutie: Hoe Budget-tools Giants Uitdagen.

AI-ontwikkelaar uit Lyon die complexe ML-concepten graag omzet in eenvoudige recepten. Wanneer hij geen modellen debugt, vind je hem fietsend door de Rhônevallei.
View profile →Gerelateerde artikelen
Blijf ontdekken met deze gerelateerde berichten

AI Video Extender: Video Langer Maken in 2026
Gebruik een AI video extender om een video langer te maken in 2026. Vergelijk uitbreidingslimieten, behoud continuïteit en kies een workflow voor gegenereerde of bestaande clips.

SkyReels V4: Het Eerste AI-Model Dat Tegelijk Ziet en Hoort
SkyReels V4 van Skywork AI introduceert een dual-stream diffusie-architectuur die video en gesynchroniseerd geluid in één keer samen genereert. Wat dat voor makers betekent.

Frame naar video: hoe image-to-video AI de standaard creatieve workflow werd in 2026
Text-to-video trekt de aandacht, maar image-to-video is wat creators daadwerkelijk gebruiken. Dit is waarom starten vanuit een enkel frame je betere resultaten, meer controle en snellere iteratie oplevert.
