Meta PixelPereiti prie pagrindinio turinio
DamienDamien· DI autorius, peržiūrėjo žmogus
9 min read
1636 žodžiai

Leiskite AI vaizdo įrašams vietoje: LTX-2, RTX ir ComfyUI 2026 m.

Sukurkite 4K AI vaizdo įrašus savame GPU. Be prenumeratos, be debesų, be duomenų privatumo baimės. Čia visos, ko jums reikia, norint pradėti.

Leiskite AI vaizdo įrašams vietoje: LTX-2, RTX ir ComfyUI 2026 m.

Pasiruošę kurti savo DI vaizdo įrašus?

Prisijunkite prie tūkstančių kūrėjų, naudojančių Bonega.ai

Debesų pagrindu dirbtinio intelekto vaizdo generatoriai pastarąjį metą dominavo diskusiją. Sora, Veo, Runway, jie visi reikalauja mėnesio prenumeratos, įkelia jūsų vaizdo žurnalus į trečiųjų šalių serverius ir priklauso nuo interneto greičio, kurį dauguma mūsų negali kontroliuoti. Bet rami revoliucija buvo statoma darbalaukio pusėje. Tas, kuris jus grąžina į valdymo sėdynę.

Atviros šaltinio modelis LTX-2, kurį sukūrė Lightricks bendradarbiaudama su NVIDIA, dabar generuoja iki 20 sekundžių 4K vaizdo 50 FPS viename vartotojo GPU. Nėra debesų. Nėra prenumeratos. Nėra duomenų, išeinančių iš jūsų mašinos.

Prie CES 2026 NVIDIA demonstravo LTX-2, bėgant vietoje naujame RTX 50 Series, ir rezultatai palikė auditorija neišsikalbusios. Tai nebuvo tyrimo demonstracija. Tai buvo gamybai paruošta vietinė vaizdo generacija, besileidžianti greičiais, kurie konkuruoja su debesų paslaugomis.

Leiskite man jums paeiti per tai, ką tai reiškia, ko jums reikia ir kaip tai nustatyti.

Kodėl vietinė dirbtinio intelekto vaizdo generacija yra svarbi

Prieš pasinerdami į techninę sąranką, leiskite man paaiškinti, kodėl vaizdo žurnalų vietinė kurapija nėra tik mėgėjo pasirinkimas. Tai sprendžia tikras problemas.

Debesų generacija

Mėnesio prenumerata ($20-100/mėn), duomenys įkelti į trečiųjų šalių serverius, interneto priklausomybė, generacijos eilės piko valandomis, ribotos tinkinimo parinktys

Vietinė generacija

Vienkartinis aparatūros investavimas, visiškas duomenų privatumas, veikia neprisijungus, nėra laukimo laiko, visa modelio tinkinimas su LoRA trenimu, neribotas generacijos

Studioms, tvarkančioms kliento vaizdo žurnalus, privatumas nėra pasirinkimasai. Kūrėjams regionuose su lėtu internetu debesų generacija yra nepraktiška. O kiekvienam, kas generuoja šimtus klipų per mėnesį, prenumeratos matematika greitai nebėra prasmė.

Ką jums reikia: aparatūros reikalavimai

Čia sąžininga išrašymas. Vietinė generacija reikalingos priimtinos aparatūros, bet tikriausiai ne tokios ekstremaus, kaip manote.

RTX 4060
Minimali GPU
RTX 5090
Optimali GPU
8 GB
Min VRAM
24 GB
Rekomenduojamas VRAM
KomponentasMinimaliRekomenduojamaOptimali
GPURTX 4060 (8 GB)RTX 4090 (24 GB)RTX 5090 (32 GB)
RAM16 GB32 GB64 GB
Saugykla50 GB laisva SSD200 GB NVMe500 GB NVMe
OSWindows 10/11, LinuxUbuntu 22.04+Ubuntu 22.04+
💡
Jei jau turite RTX 3060 12 GB ar geresnę, šiandien galite pradėti generuoti AI vaizdo žurnalus. RTX 30 Series gauna 2x greičio padidėjimą ir 40% VRAM sumažėjimą per NVFP8 tikslumo formatą, pristatytas su LTX-2.

GPU našumo palyginimas

Našumo skirtumas tarp kartų yra dramatiškas. Čia yra tai, ką NVIDIA demonstravo CES 2026:

GPU720p (5s santrumpa)1080p (5s santrumpa)4K (5s santrumpa)VRAM naudojimas
RTX 3060 12 GB~45 sekundės~90 sekundžiųNepalaikoma11 GB
RTX 4060 8 GB~30 sekundžių~60 sekundžiųNepalaikoma7.5 GB
RTX 4090 24 GB~8 sekundžių~15 sekundžių~45 sekundžių18 GB
RTX 5090 32 GB~3 sekundes~6 sekundžių~15 sekundžių20 GB

RTX 50 Series gauna 3x greičio padidėjimą per vietinę NVFP4 kvantizaciją, perpus mažindama modelio svorių tikslumą be pastebimo kokybės praradimo. Tai toks pat triukas, kuris padarė LLM praktiškus vartotojo aparatūroje, dabar taikomas vaizdo difuzijai.

GPU etalonas AI vaizdo generacijai, rodant RTX 3060, 4060, 4090 ir 5090 našumą
Generacijos laikas 5 sekundžių 720p klipui NVIDIA GPU kartose

LTX-2: Kas jį daro specialų

LTX-2 nėra tiesiog „dar vienas atvirojo kodo modelis". Tai rodo fundamentalų poslinkį tame, kas įmanoma vartotojo aparatūroje.

🎬

Iki 20 sekundžių 4K 50 FPS

Vietinė aukštos raiškos vaizdo generacija be super-raiškos gudrybių. Modelis tiesiogiai išveda 4K.
🔊

Integruota garso generacija

Sinchronizuoti garso efektai ir aplinkos garsas, sugeneruoti kartu su vaizdu. Nereikalingas atskiras garso modelis.
🎯

Multi-keyframe kontrolė

Nurodykite kelis atskaitos kadrus visoje sekoje. Modelis interpoliuoja tarp jų su fizikos atmetimu.
🧩

LoRA pagrindu pagrindas

Treniruokite lengvus adapterius (LoRA) savame vaizde, norėdami kurti suasmenintuą stilius, personažo išvaizdą ar aplinkos estetiką.
💻

ComfyUI integracija

Vilkite ir numeskite darbo srauto mazgus, optimizuotus 40% NVIDIA GPU. Jokia komandinė eilutė nereikalinga pagrindiniam naudojimui.

Palyginimas su debesų paslaugomis

Leiskite man būti konkretus dėl to, ką vietinė generacija gali ir negali daryti, palyginti su didžiais debesų platformomis.

SavybėLTX-2 (vietinė)Sora 2Veo 3.1Runway Gen-4.5
Maksimali raiška4K1080p4K1080p
Maksimali trukmė20 sekundžių20 sekundžių8 sekundžių10 sekundžių
GarsasIntegruotasAtskirasVietinėAtskiras
PrivatumasPilnaiDebesysDebesysDebesys
Mėnesio išlaidos$0$20-200$20-50$15-100
TinkinimasPilnai (LoRA)RibojamaRibojamaVidutinis
Greitis (1080p, 5s)6-60s (GPU priklausomas)30-120s15-60s20-90s

Kompromisas yra aiškus, debesų paslaugos siūlo labiau nupoliruotus rezultatus su mažiau nustatymo, o vietinė generacija suteikia jums kontrolę, privatumą ir nulinę ribinę išlaidą vienai generacijai. Norėdami giliau pažvelgti, kaip šios debesų platformos lyginamos, žiūrėkite mūsų Sora 2 vs Runway vs Veo 3 palyginimas.

LTX-2 nustatymas naudojant ComfyUI: žingsnis po žingsnio

Čia praktinis vadovas. Esu numanęs, kad turite NVIDIA GPU su bent 8 GB VRAM ir neseniai įdiegtu tvarkdariu.

1 žingsnis: Įdiekite ComfyUI

ComfyUI yra mazgu pasiskirstytas vizualinis sąsaja difuzijos modeliams. Galvokite apie tai kaip Unreal Engine Blueprint sistemą, bet dirbtinio intelekto generacijos darbo srautams.

# Klonuoti ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
 
# Kurti virtualią aplinką
python -m venv venv
source venv/bin/activate  # Linux/Mac
# venv\Scripts\activate   # Windows
 
# Įdiekite priklausomybes
pip install -r requirements.txt
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu124

2 žingsnis: Atsisiųskite LTX-2 modelį

# Eiti į modelio direktoriją
cd models/checkpoints
 
# Atsisiųskite LTX-2 (maždaug 15 GB)
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-0.safetensors
 
# Atsisiųskite VAE
cd ../vae
wget https://huggingface.co/Lightricks/LTX-Video-2/resolve/main/ltx-video-2-vae.safetensors

3 žingsnis: Įdiekite LTX-2 ComfyUI plėtinį

cd ../../custom_nodes
git clone https://github.com/Lightricks/ComfyUI-LTXVideo.git
cd ComfyUI-LTXVideo
pip install -r requirements.txt

4 žingsnis: Paleisti ir generuoti

# Grįžti į ComfyUI šaknį
cd ../..
python main.py --listen 127.0.0.1 --port 8188

Atidarykite http://127.0.0.1:8188 savo naršyklėje. Įkelkite LTX-2 darbo srautą iš plėtinio pavyzdžio aplanko, įveskite jūsų raginimą ir spustelėkite "Queue Prompt."

💡
RTX 30/40 Series vartotojams: įjunkite NVFP8 kvantizacijos parinktį modelio šaltinio mazge. Tai sumažina VRAM naudojimą 40% su nežyminčiu kokybės praradimu. RTX 50 Series vartotojai turėtų naudoti NVFP4 maksimaliam greičiui.

Optimizuokite savo sąranką

Kai pagrindinis nustatymas yra suktas, čia yra derinimo triukai, kurie daro tikrą skirtumą.

VRAM valdymas

Didžiausias vienas didžiausias butelis vietinei generacijai yra VRAM. Čia galite maksimalizuoti tai, ką turite:

  • Įjunkite modelio iškrovimą (pastumia nevadintas sluoksnius į sistemos RAM)
  • Naudokite NVFP8/NVFP4 kvantizaciją jūsų GPU generacijai
  • Uždarykite naršyklės skirtukus ir kitas GPU-badrias programas
  • Nustatykite „Windows" į „Aparatūrą pagreitintą GPU planavimą" displėjo nustatymuose
  • Apsvarstykite Linux dvigubo bei paleidimo (5-10% geresnę GPU panaudojimą vs Windows)

Paketo apdorojimo darbo srautas

Kūrėjams, kuriems reikia generuoti daug klipų, ComfyUI palaiko paketo eilę. Nustatykite savo ragus JSON faile, sujunkite juos su paketo šaltinio mazgu ir leiskite jūsų GPU dirbti per naktį. Esu sugeneravęs 200+ klipų per vieną nakties sesiją RTX 4090.

LoRA mokymas tinkiniams stiliums

Čia vietinė generacija tikrai blizga. Galite mokyti LoRA adapterį 50-100 atskaitos medžiagos kadrų per maždaug 30 minučių RTX 4090. Rezultatas yra lengvas failas (dažniausiai 100-300 MB), kuris šalioja modelį į jūsų specifinį vizualinį stilių, personažo išvaizdą ar aplinkos estetiką.

# LoRA treniravimo komando pavyzdys
python train_lora.py \
  --model ltx-video-2-0.safetensors \
  --data ./my_reference_frames/ \
  --output ./loras/my_style.safetensors \
  --steps 1000 \
  --lr 1e-4 \
  --rank 32

Kaštų skaičiavimas

Leiskite man sudėti konkrečius skaičius į tai. Tarkime, jūs esate laisvas vaizdo kūrėjas, generuojantis 100 penkių sekundžių trukmės klipų per mėnesį.

MetodasMėnesio išlaidosMetinės išlaidosPrivatumas
Sora 2 Pro$100/mėn$1,200/metaiDebesys
Runway Standard$76/mėn$912/metaiDebesys
Veo (Google AI Pro)$50/mėn$600/metaiDebesys
LTX-2 + RTX 4090~$15/mėn (elektra)~$180/metaiPilnai

RTX 4090 kainuoja apie $1,600 MSRP, nors dabartinės rinkos kainos slenka arčiau $2,500-2,800 dėl sustabdytos gamybos. Šimtui klipų per mėnesį naudojant debesų paslaugas, net rinkos kainoje GPU atmoka save per 18-24 mėnesius, ir tada jūs generuojate už elektros išlaidas.

Didelės apimties kūrėjams vietinė generacija nėra tik privatumo pasirinkimas. Tai yra finansinis sprendimas, kuris atmoka save per pirmą metą.

Kas ateina toliau

Vietinės dirbtinio intelekto vaizdo generacijos trajektorija greitėja. Trys plėtotės, kurias reikia stebėti:

Q1 2026

LTX-2.1 leidimas

Tikimasi laiko koherencijos ir garso kokybės patobulinimų. Lightricks yra pasiūlęs apie vietines lūpų sinchronizacijos galimybes.

Q2 2026

NVIDIA Rubin platforma

Kitos kartos GPU architektūra su dedikuotu vaizdo generacijos silicio. Tikimasi 5-10x pagerinimas per dabartinį RTX 50 Series difuzijos darbus.

H2 2026

Meta Mango (gali būti atvirojo šaltinio)

Jei Meta laikaisi savo LLaMA modelio, Mango galėtų tapti galingiausia atviro šaltinio vaizdo modeliu, dar labiau padidindamas vietinės generacijos kokybę.

Apačios linija

Debesų dirbtinio intelekto vaizdo paslaugos yra puikūs produktai. Sora, Veo, Runway, jie visi teikia nuostabius rezultatus su minimalia nustatymu. Tačiau jie atsiranda su kompromisais, kurie daugeliui kūrėjų pradeda būti nepriimtini: pasikartojanti išlaidos, privatumo baimės, interneto priklausomybė ir ribota pritaikymas.

LTX-2 su ComfyUI NVIDIA RTX GPU nėra kompromisas. Tai yra kitoks paradigma. Tai, kur jūs turite visą vamzdynę, nuo modelio svorių iki galutinio išėjimo. Nustatymas užtrunka popietę. Mokymosi kreivė yra reali, bet valgyma. Ir rezultatai, ypač 4K naudojant naujausią optimizaciją, yra tikrai konkurencingi su debesų alternatyvomis.

Jei turite RTX GPU, kuris žvagžda tarp žaidimo sesijų, suteikite jai antrą darbą. Jūs galite būti nustebinti, ką tai gali padaryti.

💡

Susiję skaitymai: Daugiau apie atvirojo šaltinio dirbtinio intelekto vaizdo judėjimą, žiūrėkite mūsų Atvirojo šaltinio AI vaizdo revoliucija ir mūsų ankstyvą giliąją duobę LTX-2 vietinė 4K generacija. Suinteresuota platesne peizažu? Žiūrėkite AI Video $10 revoliucija: kaip biudžeto įrankiai iššaukia gigantus.

Damien
DamienAI DeveloperAI Author

DI kūrėjas iš Liono, mėgstantis sudėtingas mašininio mokymosi sąvokas paversti paprastais receptais. Kai netaiso modelių klaidų, jį rasite važinėjantį dviračiu Ronos slėnyje.

View profile →

Patiko tai, ką perskaitėte?

Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.

Susiję straipsniai

Tęskite pažintį su šiais susijusiais įrašais

Patiko šis straipsnis?

Atraskite daugiau įžvalgų ir sekite naujausią mūsų turinį.