하루 1,500만 달러의 문제: AI 영상 경제학이 2026년 생존을 결정하는 이유
Sora는 OpenAI가 중단하기 전까지 하루 1,500만 달러를 소비했습니다. 진짜 문제는 누가 최고의 AI 영상 모델을 만드느냐가 아닙니다. 누가 그것을 운영할 여력이 있느냐입니다.

Sora를 무너뜨린 숫자들
OpenAI가 6개월간 감추려 했던 경제 구조를 살펴보겠습니다.
Sora는 2025년 9월 소비자 가격으로 출시되었습니다. API를 통한 720p 영상 생성 비용은 초당 약 0.10달러였습니다. 최고 사용량 시기에는 매일 수백만 명의 사용자가 클립을 생성했습니다. GPU 추론 비용(주로 NVIDIA H100 클러스터에서 실행)은 요청마다 선형적으로 증가했습니다.
수익 대비 비용 비율은 참담했습니다. Sora의 전체 기간 총 수익은 약 210만 달러로 추정됩니다. 운영 비용은 약 27억 달러였습니다. 이것은 비즈니스 모델이 아닙니다. 벤처 캐피탈을 산업적 규모로 소진한 시연이었을 뿐입니다.
영상 생성이 이미지 생성보다 본질적으로 비싼 이유
이것이 Sora만의 문제가 아닌 이유를 이해하려면, 이미지와 영상 생성 사이의 컴퓨팅 격차를 파악해야 합니다.
DALL-E 3이나 Stable Diffusion XL 같은 모델로 이미지 한 장을 생성하려면 H100에서 약 10-30초의 GPU 시간이 필요합니다. 24fps로 5초 영상을 생성하려면 120프레임을 생성해야 하며, 각 프레임 간의 시간적 일관성 제약으로 인해 단순한 병렬화가 어렵습니다. 영상 확산 트랜스포머의 어텐션 메커니즘은 시퀀스 길이에 대해 이차적으로 확장됩니다.
| 생성 유형 | 출력당 GPU 초 | H100 대략 비용 |
|---|---|---|
| 단일 이미지 (1024x1024) | 10-30초 | $0.003-$0.01 |
| 5초 영상 (720p, 24fps) | 300-600초 | $0.10-$0.20 |
| 10초 영상 (1080p, 24fps) | 900-2400초 | $0.30-$0.80 |
| 60초 영상 (1080p, 24fps) | 5400-14400초 | $1.80-$4.80 |

이미지와 영상 사이의 격차는 5배나 10배가 아닙니다. 출력당 30-100배의 컴퓨팅이 필요합니다. 텍스트 생성에서는 KV 캐싱과 투기적 디코딩이 추론 비용을 크게 줄였지만, 영상 생성에는 비용을 한 자릿수 이상 줄이는 동등한 최적화가 아직 없습니다.
비용 위기를 극복하기 위한 세 가지 전략
AI 영상 생성을 제공하는 모든 기업이 이 동일한 근본적 문제에 직면하고 있습니다. 하지만 그 대응 전략은 크게 다릅니다.
전략 1: 보조금을 지급하고 기도하기 (VC 방식)
이것이 Sora의 전략이었습니다. 원가 이하로 가격을 책정하고, 사용자를 확보한 뒤, 수익화는 나중에 생각하는 방식입니다. 닷컴 버블 시대부터 경제학 교수들이 예측해온 그대로의 결말을 맞이했습니다.
여전히 이 방식으로 운영하는 기업들이 있습니다. Pika, Luma, Runway 모두 추정 컴퓨팅 비용보다 훨씬 낮은 가격으로 서비스를 제공하고 있습니다. 비용 하락 속도가 수익 성장 필요성보다 빠를 것이라는 것이 그들의 베팅입니다.
리스크는 자명합니다. GPU 비용이 충분히 빠르게 떨어지지 않거나, 사용자 증가가 최적화 이득보다 빠르다면, 이 기업들은 Sora와 같은 벽에 부딪힐 것입니다.
전략 2: 비용을 하드웨어로 전가하기 (NVIDIA/오픈소스 방식)
이것이 Helios, Wan 2.2, LTX-2.3, 그리고 소비자 GPU에 최적화된 모든 오픈소스 모델의 배경에 있는 전략입니다.
논리는 세련됩니다. 비싼 클라우드 인프라를 운영하는 대신, 컴퓨팅 비용을 사용자의 하드웨어로 전가하는 것입니다. RTX 4090은 1,599달러로 한 번만 구매하면 됩니다. 이후 모든 영상 생성은 한계 비용 면에서 "무료"입니다(전기료 제외).
Helios는 ByteDance와 북경대학교가 개발한 140억 파라미터 모델로, 단일 H100에서 60초 영상을 19.5 FPS로 생성할 수 있음을 보여주었습니다. 더 중요한 것은, 최적화된 오픈소스 모델들이 소비자용 RTX 5090 하드웨어에서 실시간 생성에 근접하고 있다는 점입니다.
| 모델 | 필요 하드웨어 | 생성 속도 | 품질 등급 |
|---|---|---|---|
| Helios 14B | 1x H100 (또는 RTX 5090) | 19.5 FPS (실시간) | 프로페셔널 |
| Wan 2.2 14B | 1x RTX 4090 | ~3 FPS | 프로페셔널 |
| LTX-2.3 | 1x RTX 4090 | ~5 FPS (4K) | 프로페셔널 |
| PixVerse R1 | 1x RTX 3090 | ~2 FPS | 소비자 |
이 전략의 한계는 분명합니다. 하이엔드 GPU를 보유한 사용자만 대상으로 합니다. 의미 있는 시장이긴 하지만, Sora를 인기 있게 만든 일반 크리에이터들은 제외됩니다.
전략 3: 플랫폼 집약 (Adobe/Google 방식)
이것이 재정적으로 가장 지속 가능한 접근법입니다. 생성 비용 전체를 부담하는 대신, 여러 모델 제공업체에 요청을 라우팅하는 마켓플레이스가 되는 것입니다.
Adobe Firefly는 현재 30개 이상의 모델을 통합하고 있으며, 다양한 제공업체의 모델을 호스팅합니다. Google Flow는 Veo를 서드파티 모델과 통합합니다. CapCut은 Seedance 2.0을 내장했습니다. 세 경우 모두 플랫폼이 마진을 취하고 모델 제공업체가 컴퓨팅 비용을 부담합니다.
Adobe가 이 방향에서 가장 유리한 위치에 있습니다. Premiere Pro와 After Effects가 이미 전문 영상 편집 시장을 지배하고 있기 때문입니다. 기존 워크플로에 AI 생성을 추가하는 것은 자연스러운 확장이며, Adobe는 사용자가 이미 지불하고 있는 Creative Cloud 구독 내 프리미엄 기능으로 가격을 책정할 수 있습니다.
인프라 비용 곡선
핵심 질문은 GPU 비용이 소비자용 AI 영상을 실현 가능하게 만들 만큼 충분히 빠르게 하락하느냐입니다.
NVIDIA의 Blackwell 아키텍처(B200, GB200)는 추론 워크로드에서 H100 대비 약 2-3배 더 나은 가격 대비 성능을 제공합니다. 차세대 Rubin 아키텍처는 추가로 2-3배의 개선을 약속합니다. 둘 다 예상대로 실현된다면, 2028년까지 10초 영상 생성 비용이 0.50달러에서 약 0.05달러로 떨어질 수 있습니다.
이 타임라인이 중요합니다. 보조금 가격으로 자금을 소진하는 기업들은 하드웨어 개선이 비즈니스 모델을 구해줄 때까지 2-3년을 더 버텨야 합니다. 모든 기업이 그때까지 버틸 수 있는 것은 아닙니다.
크리에이터에게 주는 의미
AI 영상 플랫폼을 선택하는 크리에이터에게, 경제적 측면은 기능만큼 중요합니다.
- ✓수익성 있는 모회사의 지원을 받는 플랫폼(Google, Adobe, ByteDance)이 장기적으로 더 안전한 선택입니다
- ✓로컬에서 실행하는 오픈소스 모델은 특정 기업에 대한 의존을 제거합니다
- ✓저가에 "무제한" 생성을 제공하는 스타트업이 가장 위험합니다
- ✓비용이 안정될 때까지 기다렸다가 워크플로를 확정하는 것은 합리적이지만, 얼리어답터의 이점을 놓치게 됩니다
Sora의 중단은 우연한 사건이 아니었습니다. 첫 번째 도미노였습니다. AI 영상 생성의 경제적 현실은 가혹하며, 살아남는 기업은 생성 문제에 대한 창의적 해결책만이 아니라 비용 문제에 대한 창의적 해결책을 찾은 기업이 될 것입니다.
더 큰 그림
컴퓨팅의 모든 주요 전환기에는 기술은 작동하지만 경제성이 따라오지 못하는 단계가 있었습니다. 클라우드 컴퓨팅은 AWS가 그것을 수익 창출 기계로 만들기 전까지 수년간 적자였습니다. 스트리밍 영상은 Netflix가 자리를 잡기 전까지 수십억 달러의 손실을 냈습니다. AI 영상 생성은 바로 그 같은 고통스러운 중간 단계에 있습니다.
이번에 다른 점은 속도입니다. 하드웨어 개선 곡선이 클라우드나 스트리밍 시대보다 더 가파릅니다. NVIDIA는 18-24개월마다 새로운 아키텍처를 출시하며 FLOP당 비용을 실질적으로 줄이고 있습니다. 모델 효율성 연구는 증류부터 Mixture of Experts, Helios의 컨텍스트 압축 같은 아키텍처 혁신에 이르기까지, 소프트웨어 측면에서 컴퓨팅 요구량을 줄이고 있습니다.
제 예측으로는 2027년 말까지 클라우드 인프라에서 10초짜리 1080p 영상을 생성하는 비용이 0.10달러 미만으로 떨어질 것입니다. 그 가격대에서는 비즈니스 모델이 성립합니다. 문제는 어떤 기업이 그때까지 살아남을 수 있느냐입니다.
AI 영상 스타트업의 묘지는 곧 붐빌 것입니다. 하지만 기술 자체는 사라지지 않습니다. 경제성이 따라잡기를 기다리고 있을 뿐입니다.

연구의 깊이와 실용적 혁신을 결합하는 로잔 출신 AI 엔지니어입니다. 모델 아키텍처와 알프스 봉우리 사이에서 시간을 나눕니다.
View profile →관련 글
관련 게시물을 통해 계속 살펴보세요

Sora 종료. OpenAI가 AI 동영상 생성에서 완전히 철수합니다.
OpenAI가 Sora 앱을 폐쇄하고 디즈니 계약을 파기하며 로보틱스로 전환합니다. 가장 주목받았던 AI 동영상 제품은 겨우 6개월 만에 막을 내렸습니다. 크리에이터가 지금 당장 해야 할 일은 무엇일까요?

하나의 동영상, 천 명의 시청자: AI 개인화가 2026년 동영상 마케팅을 재정의하는 방법
AI 동영상 개인화를 통해 브랜드는 단일 개념에서 수천 개의 맞춤형 동영상 변형을 생성할 수 있습니다. 일괄적인 접근에서 개인 맞춤형으로의 전환이 마케팅을 영원히 어떻게 변화시키는지 알아보세요.

AI 비디오 품질 고원: 모든 모델이 동일하게 보일 때, 정말 중요한 것은 무엇인가?
최고 AI 비디오 모델이 거의 동일한 품질로 수렴했습니다. 진정한 경쟁은 이제 생태계, 워크플로우, 창의적 제어에 관한 것입니다.
