Helios: 14B-modellen som kör AI-video i realtid på konsumuthårdvara
Helios från Peking University, ByteDance och Canva genererar minutlånga AI-videor vid 19,5 FPS med bara 6GB VRAM, och det är helt öppen källkod.

Varför Helios är viktigt
De flesta AI-videomodeller tvingar dig att välja: kvalitet eller hastighet. Stora modeller som Veo 3.1 eller Runway Gen-4.5 producerar fantastiska resultat, men körs på molnkluster och debiterar per sekund. Mindre modeller passar på konsumentgrafikkort men producerar märkbart svagare resultat. Helios avvisar detta val.
Nyckelinnsikten: Helios är en autoregressiv diffusionsmodell som genererar video bild-för-bild på ett direktuppspelningssätt, snarare än att avbrusera hela videon på en gång. Det betyder att den kan börja mata ut bilder omedelbar medan den fortfarande genererar resten. Ingen väntan på fullständig klipperering.
Hur det fungerar
Traditionella diffusionsmodeller bearbetar en hel video samtidigt. Du skickar en prompt, väntar minuter och får ett komplett klipp. Helios tar ett fundamentalt annorlunda tillvägagångssätt.
| Traditionell diffusion | Helios (Autoregressiv diffusion) |
|---|---|
| Bearbeta alla bilder samtidigt | Generera bild-för-bild |
| Höga minneskrav | Konstant minnesanvändning |
| Output endast när helt klart | Strömma output i realtid |
| Kvaliteten försämras med längden | Konsekvent kvalitet vid vilken längd som helst |
Modellen använder en tvåriktatad temporal uppmärksamhetsmekanism som gör att varje ny bild kan referera både tidigare och framtida sammanhang inom ett glidande fönster. Detta förhindrar den kvalitetsdrift som typiskt plågar autoregressiva videomodeller, där senare bilder gradvis förlorar samstämmighet med tidigare.
Konsumuthårdvara-vinkeln
Här blir det praktiskt. Med gruppöverföring kan Helios köra på hårdvara med ungefär 6GB VRAM. Det placerar det direkt i RTX 4060 Ti-territorium, ett grafikkort som kostar omkring $400.
Jämför det med molnbaserad generering:
| Metod | Kostnad per minut video | Hårdvara som behövs |
|---|---|---|
| Molnöver (Sora, Veo) | $2-8 per generering | Ingen (moln) |
| Helios (lokalt, H100) | ~$0,15 i elektricitet | H100 ($25 000+) |
| Helios (lokalt, RTX 4060 Ti) | ~$0,01 i elektricitet | RTX 4060 Ti (~$400) |
Kompromisspriset med konsumentgrafikkort är hastigheten. På en RTX 4060 Ti slår du inte 19,5 FPS. Förvänta dig snarare 2-3 FPS, vilket fortfarande innebär en 60-sekunders video på väl under 10 minuter. För lokal, privat, obegränsad generering är det övertygande.
Benchmarks som stöder påståendena
Helios gör inte bara krav på realtidsprestanda. Den presterar konkurrenskraftigt på standardvideoqualitetsbenchmarks.
Forskargruppen, ett samarbete mellan Peking University, ByteDance och Canva, testade specifikt mot:
- CogVideoX (13B parametrar): Helios matchar kvaliteten med 5-10x snabbare generering
- Pyramid Flow (autoregressiv baslinje): Helios producerar mer temporalt konsistent resultat
- Open-Sora v1.2: Helios genererar längre, mer sammanhängande klipp
Den kritiska jämförelsen är med modeller i 1-2B-parameterserien, som LTX-2 och mindre CogVideo-varianter. Helios körs med liknande hastigheter medan den producerar resultat som verkar komma från en mycket större modell.
Vad du faktiskt kan göra med det
Helios är inte en forskningsnöje. Det är ett praktiskt verktyg som du kan installera och köra idag.
- ✓Text-till-video-generering upp till 60 sekunder
- ✓Bild-till-video-animering från en referensram
- ✓Direktuppspelning av realtidsdata (börja titta medan du genererar)
- ✓Apache 2.0-licens (kommersiell användning tillåten)
- ✓Gruppöverföring för konsumentgrafikortsstöd
Apache 2.0-licensen är betydelsefull. Till skillnad från många modeller med öppen vikt som begränsar kommersiell användning tillåter Helios det uttryckligen. Detta öppnar dörren för oberoende utvecklare, små studior och startups att bygga produkter ovanpå modellen utan licensgebyrerna.
Den större bilden
Helios förändrar hur vi närmar oss AI-videotillgänglighet. Den tidigare generationen av "öppna" videomodeller krävde antingen företagshårdvara eller producerade resultat som såg märkbart sämre ut än deras molnmotsvarigheter.
För proffs som genererar hundratals iterationer per projekt skiftar ekonomin betydligt. Ett $400 grafikkort betalar sig själv efter omkring 200-300 molngenereringer. För team som experimenterar med AI-video i produkter tar den obegränsade karaktären av lokal generering bort tveksamheten att experimentera.
Vi täckte det växande lokala genereringsekosystemet i vår guide till att köra AI-video lokalt, och Helios passar direkt in i detta arbetsflöde. Det bygger också på realtidsgeneringsgenombrott som vi skrev om med TurboDiffusion, vilket tar begreppet längre med en mycket större modell.
Vad kommer näst
Helios-teamet har redan antytt uppföljararbete på audiovisuell generering och interaktiv kontrollmöjligheter. Om samma effektivitetsvinster gäller kan vi se realtids, kontrollerbar, audioinkluderande videogenerering på konsumuthårdvara senast 2026.
För närvarande är Helios tillgänglig på GitHub under Apache 2.0. Om du har ett NVIDIA-grafikkort med 6GB+ VRAM och vill experimentera med genuint konkurrenskraftig lokal AI-videogenerering är detta den starkaste startpunkten tillgänglig.
Relaterad läsning: Se hur modeller med öppen källkod minskar gapet med proprietära plattformar, eller utforska LTX-2s tillvägagångssätt för naturlig 4K-generering på konsumentgrafikkort.

AI-utvecklare från Lyon som älskar att omvandla komplexa ML-koncept till enkla recept. När han inte felsöker modeller hittar du honom cyklande genom Rhônedalen.
View profile →Relaterade artiklar
Fortsätt utforska med dessa relaterade inlägg

ByteDance Vidi2: AI som förstår video som en redigerare
ByteDance har gjort Vidi2 öppen källkod, en modell med 12 miljarder parametrar som förstår videoinnehåll tillräckligt bra för att automatiskt redigera timmar av material till polerade klipp. Den driver redan TikTok Smart Split.

SkyReels V4: Den Första AI-Modellen Som Ser och Hör Samtidigt
Skywork AI:s SkyReels V4 introducerar en dual-stream diffusionsarkitektur som genererar video och synkroniserat ljud tillsammans i en enda passering. Vad det betyder för kreatörer.

Seedance 2.0 landar i CapCut, och Hollywood är inte nöjt
ByteDance lanserade just sin kontroversiella AI-videomodell i CapCut, dagar efter att Sora lades ner. Här är varför det spelar roll, och varför Hollywood slår tillbaka.