Meta PixelSalta al contingut principal
DamienDamien· Autoria d’IA, revisada per humans
6 min read
1113 paraules

Helios: El Model de 14B que Executa Video AI en Temps Real en Maquinari de Consumidor

La Universitat de Pequín, ByteDance i Canva Helios genera vídeos AI d'una durada minuta a 19.5 FPS amb només 6GB VRAM, i és completament de codi obert.

Helios: El Model de 14B que Executa Video AI en Temps Real en Maquinari de Consumidor

Preparat per crear els teus propis vídeos amb IA?

Uneix-te a milers de creadors que utilitzen Bonega.ai

La barrera més gran per a la generació de vídeos AI en temps real sempre ha estat la potència de computació. Helios, un nou model de 14 mil milions de paràmetres de la Universitat de Pequín, ByteDance i Canva, acabat de trencar aquesta barrera. S'executa a 19.5 fotogrames per segon en una única H100, genera vídeos de fins a 60 segons i només necessita aproximadament 6GB de VRAM amb descàrrega de grups. I està llicenciat per Apache 2.0.

Per què Helios és Important

La majoria de models de vídeo AI et obliguen a triar: qualitat o velocitat. Els models grans com Veo 3.1 o Runway Gen-4.5 produeixen resultats impressionants, però s'executen en clusters de núvol i cobren per segon. Els models més petits caben en GPU de consumidor però produeixen una qualitat notablement feble. Helios rebutja aquesta opció.

14B
Paràmetres
19.5
FPS a una única H100
~6GB
VRAM amb descàrrega de grups
60s
Durada màxima de vídeo

La clau: Helios és un model de difusió autorregresiu que genera vídeos fotograma per fotograma de forma contínua, en lloc de netejar un vídeo sencer alhora. Això significa que pot començar a produir fotogrames immediatament mentre continua generant la resta. Sense esperar a que s'acabin els clips.

Com Funciona

Els models de difusió tradicionals processen tot el vídeo simultàniament. Envies una indicació, esperes minuts i obtens un clip complet. Helios pren un enfocament completament diferent.

Difusió TradicionalHelios (Difusió Autorregresiva)
Processa tots els fotogrames alhoraGenera fotograma per fotograma
Requeriments alts de VRAMÚs constant de VRAM
Sortida només quan està completament terminaProdueix sortida en temps real
La qualitat es degrada amb la duradaQualitat consistent a qualsevol durada

El model utilitza un mecanisme d'atenció temporal bidirecional que permet que cada fotograma nou es refereixi tant al context passada com al futur dins d'una finestra lliscant. Això evita la desviació de qualitat que típicament afecta els models de vídeo autorregressius, on els fotogrames posteriors perden gradualment coherència amb els anteriors.

💡
Helios aconsegueix vídeos de durada minuta (fins a 1.452 fotogrames) sense confiar en trucs de KV-cache o hacks anti-desviació. L'arquitectura en si mateixa manté la coherència.

L'Angle del Maquinari de Consumidor

Aquí és on les coses es posen pràctiques. Amb descàrrega de grups, Helios pot executar-se en maquinari amb aproximadament 6GB de VRAM. Això el col·loca directament en territori RTX 4060 Ti, una tarjeta que costa al voltant de $400.

Compara amb la generació basada en el núvol:

MètodeCost per minut de vídeoMaquinari necessari
Cloud API (Sora, Veo)$2-8 per generacióCap (núvol)
Helios (local, H100)~$0.15 en electricitatH100 ($25,000+)
Helios (local, RTX 4060 Ti)~$0.01 en electricitatRTX 4060 Ti (~$400)

El compromís amb les GPU de consumidor és velocitat. En una RTX 4060 Ti, no aconseguiràs 19.5 FPS. Espera més a prop de 2-3 FPS, que encara significa un vídeo de 60 segons en ben menys de 10 minuts. Per a la generació local, privada i il·limitada, això és compel·lent.

Comparatives que Recolzen les Afirmacions

Helios no només afirma que té rendiment en temps real. Obtén puntuacions competitives en comparatives estàndard de qualitat de vídeo.

💡
A VBench, Helios coincideix o supera models amb comptats de paràmetres similars en qualitat de moviment, coherència temporal i puntuació estètica. Els resultats complets de la comparativa estan disponibles al paper (arXiv:2603.04379).

L'equip de recerca, una col·laboració entre la Universitat de Pequín, ByteDance i Canva, va provar específicament contra:

  • CogVideoX (13B paràmetres): Helios coincideix en qualitat amb generació 5-10x més ràpida
  • Pyramid Flow (base autorregresiva): Helios produeix sortida més coherent temporalment
  • Open-Sora v1.2: Helios genera clips més llargs i més coherents

La comparativa crítica és amb models en l'interval de 1-2B paràmetres, com LTX-2 i variants de CogVideo més petits. Helios s'executa a velocitats similars mentre produeix sortida que sembla que provingui d'un model molt més gran.

El que Pots Fer amb Això

Helios no és una curiositat de recerca. És una eina pràctica que pots instal·lar i executar avui.

  • Generació de text a vídeo fins a 60 segons
  • Animació d'imatge a vídeo a partir d'un fotograma de referència
  • Sortida de transmissió en temps real (comença a veure mentre generes)
  • Llicència Apache 2.0 (ús comercial permès)
  • Descàrrega de grups per a suport GPU de consumidor

La llicència Apache 2.0 és significativa. A diferència de molts models de pes obert que restringeixen l'ús comercial, Helios explícitament la permet. Això obri la porta perquè desenvolupadors independents, petits estudis i startups construeixin productes sobre el model sense tarifes de llicència.

La Imatge Més Gran

Helios canvia la forma en què abortam l'accessibilitat dels vídeos AI. La generació anterior de models de vídeo "oberts" o bé requeria maquinari empresarial o produïa resultats que semblaven notablement perjor que els seus homòlegs al núvol.

Generació en el Núvol
Sense necessitat d'inversió en maquinari, sortida de qualitat més alta, models actualitzats constantment
Generació Local (Helios)
Cost zero per generació, privacitat total, sense límits de tarifa, llicència amigable amb el comerç, capaç de funcionar sense connexió

Per a professionals que generen centenars d'iteracions per projecte, l'economia canvia significativament. Una GPU de $400 es paga per si sola després d'aproximadament 200-300 generacions al núvol. Per a equips que experimenten amb vídeo AI en productes, la naturalesa il·limitada de la generació local elimina la dubtança per experimentar.

Vam cobrir l'ecosistema de generació local creixent en la nostra guia per executar vídeo AI localment, i Helios s'encaixa directament en aquest flux de treball. També es basa en la trencament de generació en temps real que vam escriure sobre TurboDiffusion, prenent el concepte més lluny amb un model molt més gran.

Què Vé Després

L'equip de Helios ja ha suggerit treballs futurs en generació audiovisual i capacitats de control interactiu. Si els mateixos guanys d'eficiència s'apliquen, podríem veure generació de vídeo en temps real, controlable, d'àudio inclusiu en maquinari de consumidor cap a finals de 2026.

De moment, Helios està disponible a GitHub sota Apache 2.0. Si tens una GPU NVIDIA amb 6GB+ VRAM i vols experimentar amb generació de vídeo AI local genuïnament competitiva, aquest és el punt d'entrada més fort disponible.

💡

Lectura relacionada: Veurà com els models de codi obert estan tancant la bretxa amb les plataformes propietàries, o explora l'enfocament de LTX-2 per a la generació nativa de 4K en GPU de consumidor.

Damien
DamienAI DeveloperAI Author

Desenvolupador d’IA de Lió que gaudeix transformant conceptes complexos d’ML en receptes senzilles. Quan no depura models, el trobaràs recorrent amb bicicleta la vall del Roine.

View profile →

T’ha agradat el que has llegit?

Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.

Articles relacionats

Continua explorant amb aquestes publicacions relacionades

T’ha agradat aquest article?

Descobreix més idees i mantén-te al dia amb el nostre contingut més recent.