Meta Pixel본문으로 건너뛰기
AlexisAlexis· AI 작성, 사람이 검토함
15 min read
1158 단어

EPFL Stable Video Infinity: Error Recycling이 AI Video의 가장 큰 문제를 해결하는 방법

EPFL의 새로운 ICLR 2026 Oral 논문은 시간적 드리프트를 제거하고 추가 컴퓨팅 비용 없이 수 분 길이의 AI video 생성을 가능하게 하는 error recycling 기법을 소개합니다.

EPFL Stable Video Infinity: Error Recycling이 AI Video의 가장 큰 문제를 해결하는 방법

나만의 AI 영상을 만들 준비가 되셨나요?

Bonega.ai를 사용하는 수천 명의 크리에이터와 함께하세요

모든 AI video 모델에는 같은 불편한 비밀이 있습니다. 4초 클립을 생성하면 결과는 놀랍도록 멋집니다. 하지만 15초를 넘기면 캐릭터가 변형되고, 물리 법칙이 무너지며, 색상이 바뀌고, 장면 전체가 일관성을 잃기 시작합니다. EPFL의 VITA Lab이 방금 해결책을 발표했고, 이는 올해 video 생성 분야에서 가장 중요한 논문이 될지도 모릅니다.

아무도 해결하지 못한 드리프트 문제

현재 모델로 장편 AI video를 생성해 본 적이 있다면 그 답답함을 잘 아실 겁니다. Sora 2는 요금제에 따라 15~25초로 제한됩니다. Runway Gen-4.5의 최대 길이는 10초입니다. Kling 3.0은 15초까지 늘어납니다. 이유는 컴퓨팅이나 메모리가 아닙니다. 바로 시간적 드리프트입니다.

💡

시간적 드리프트는 autoregressive video 모델이 프레임마다 작은 오류를 축적할 때 발생합니다. 생성된 각 프레임은 다음 프레임의 입력이 되고, 미세한 결함은 기하급수적으로 누적됩니다. 수백 프레임이 지나면 출력은 원래 프롬프트와 거의 닮지 않게 됩니다.

이는 본질적으로 "전화 게임" 문제와 유사합니다. 충분히 많은 사람에게 메시지를 전달하면 알아볼 수 없게 됩니다. 기존 접근법은 더 짧은 클립을 생성한 뒤 이어 붙여 드리프트와 싸우려 했지만, 연결 부위가 눈에 띕니다. 다른 접근법은 계층적 생성(먼저 keyframe, 이후 interpolation)을 사용했고, 이는 도움이 되지만 핵심 문제를 제거하지는 못합니다.

Error Recycling의 등장

*"Stable Video Infinity"*라는 제목의 이 논문은 ICLR 2026 Oral 발표로 채택되었으며, 매우 단순하지만 강력한 아이디어를 제시합니다. 바로 모델이 자신의 실수를 처리하도록 학습시키는 것입니다.

Oral
ICLR 2026 상태
0
추가 컴퓨팅 비용
Minutes
Video 길이

핵심 통찰은 다음과 같습니다. 학습 중 표준 video diffusion 모델은 깨끗한 ground-truth 데이터로 학습합니다. 자신의 생성 결과는 전혀 보지 못합니다. 배포되면 갑자기 불완전한 자신의 예측을 입력으로 사용해야 하지만, 이 노이즈를 처리하는 방법을 모릅니다.

Error recycling은 학습 루프를 수정하여 이 문제를 해결합니다.

1단계

표준 Forward Pass

모델이 깨끗한 학습 데이터로부터 video 구간을 생성합니다.

2단계

오류 수집

모델 자체의 예측은 결함을 포함한 채 버려지지 않고 수집됩니다.

3단계

오류 재활용

이 불완전한 출력은 다음 학습 반복의 입력으로 다시 제공되어, 모델이 노이즈가 있는 자체 생성 프레임에서도 안정적인 출력을 생성하도록 학습합니다.

4단계

반복적 개선

여러 학습 주기에 걸쳐 모델은 오류 축적을 방지하는 견고한 자기 보정 메커니즘을 학습합니다.

이 접근법의 아름다움은 우아함에 있습니다. 새로운 모델 아키텍처도, 추가 파라미터도, inference 시점의 트릭도 없습니다. 모델은 실제 배포 조건이 어떤 모습인지 학습 과정에서 익힐 뿐입니다.

생각보다 더 중요한 이유

그 의미는 더 긴 고양이 video 생성에만 그치지 않습니다. 다음과 같은 변화가 일어납니다.

Error Recycling 이전

  • Video 모델은 4-20초로 제한됨
  • 장면 일관성이 빠르게 저하됨
  • 캐릭터 정체성이 몇 초 후 흔들림
  • 물리가 점점 더 비현실적으로 변함
  • 색상과 조명이 예측 불가능하게 바뀜

Error Recycling 이후

  • 수 분 길이의 일관된 video 생성
  • 전체 구간에서 안정적인 캐릭터 외형
  • 일관된 물리와 공간 관계
  • 신뢰할 수 있는 color grading과 조명
  • 시간이 지나도 눈에 띄는 품질 저하 없음

수치로 보는 결과

VITA Lab 팀은 여러 아키텍처와 benchmark에서 Stable Video Infinity를 테스트했습니다. 결과는 인상적입니다.

지표Error Recycling 없음Error Recycling 적용개선
FVD (낮을수록 좋음)4초 후 저하2분+ 동안 안정적상당함
캐릭터 일관성15초에 60% 미만으로 하락2분에 90%+ 유지약 50% 상대적 개선
시간적 일관성8초에 눈에 보이는 드리프트2분에 눈에 보이는 드리프트 없음질적 도약
컴퓨팅 오버헤드기준선기준선 (0% 증가)비용 없음
💡

컴퓨팅 오버헤드가 없다는 점은 매우 중요합니다. Error recycling은 inference 시점 기법이 아니라 학습 시점 기법입니다. 학습이 완료된 후 모델은 이전과 정확히 같은 속도와 비용으로 실행됩니다.

Error Recycling의 내부 작동 방식

기술적 세부 사항을 원하는 분들을 위해, 수정된 학습 파이프라인에서 무엇이 일어나는지 살펴보겠습니다.

표준 video diffusion 학습은 깨끗한 ground-truth 프레임 x_0에 적용되는 noise schedule epsilon을 사용합니다. 모델은 노이즈를 예측하고 원래 신호를 복원하도록 학습합니다. inference 시점에 모델은 프레임 t의 예측을 조건으로 프레임 t+1을 autoregressive하게 생성합니다.

학습(깨끗한 입력)과 inference(자체 생성 입력) 사이의 격차를 exposure bias라고 합니다. Error recycling은 이를 직접 해결합니다.

기술 세부 사항: 수정된 학습 목표

학습 중 모델은 ground-truth 데이터를 사용하는 대신 자체의 현재 가중치를 사용해 주기적으로 프레임을 생성합니다. 결함까지 포함한 이 자체 생성 프레임은 이후 학습 시퀀스에서 다음 프레임의 conditioning 입력으로 사용됩니다.

핵심 hyperparameter는 recycling ratio r이며, 이는 학습 중 자체 생성 프레임이 ground-truth 프레임을 대체하는 빈도를 제어합니다. 논문은 r = 0.3(재활용 프레임 30%)이 안정성 개선과 학습 신호 품질의 균형을 이루며 최적의 성능을 달성한다고 설명합니다.

수정된 loss function은 여전히 표준 diffusion objective입니다. 유일한 차이는 모델이 학습 중 접하는 데이터 분포입니다. 이것이 inference 시점에 계산 오버헤드가 없는 이유입니다.

이는 sequence-to-sequence 모델의 scheduled sampling과 개념적으로 유사하지만, 연속적인 diffusion framework에 맞게 적용되었습니다. VITA Lab 팀은 논문에서 이 연결을 언급하는 한편, diffusion 모델에 scheduled sampling을 단순 적용하면 작동하지 않는다고 지적합니다. 이들의 기여는 video 생성에 안정적으로 작동하도록 만드는 구체적 formulation입니다.

Open-Source의 이점

가장 흥미로운 부분은 코드가 GitHub에서 완전히 open-source(vita-epfl/Stable-Video-Infinity)로 공개되었다는 점입니다. 이는 모든 연구소나 기업이 기존 video 모델에 error recycling을 적용할 수 있음을 의미합니다.

Open-Source가 중요한 이유
기존의 모든 video diffusion 모델에 error recycling을 적용할 수 있습니다. 아키텍처 변경은 필요 없고, 수정된 학습 루프만 있으면 됩니다. 이는 Sora, Runway, Kling 및 모든 open-source 모델을 동시에 개선할 수 있습니다.
실질적 한계
모델의 재학습 또는 fine-tuning이 필요합니다. proprietary 모델을 가진 기업은 재학습에 컴퓨팅 자원을 투자해야 합니다. 이 기법의 효과는 아키텍처와 규모에 따라 달라질 수 있습니다.

이번 open-source 출시는 AI video 연구 커뮤니티에서 커지는 흐름을 따릅니다. LTX-2Wan 2.6 같은 모델은 open-source 접근법이 proprietary 대안과 경쟁할 수 있음을 보여주었습니다.

업계에 미치는 의미

시점이 놀랍습니다. Runway부터 ByteDance까지 모든 주요 기업이 더 길고 더 높은 품질의 출력을 위해 경쟁하는 AI video 군비 경쟁의 한가운데에 있습니다. Error recycling은 차세대 역량을 열어 줄 마지막 퍼즐 조각일 수 있습니다.

🎬

영화 제작자와 크리에이터를 위해

장편의 일관된 video 생성은 실제 서사 콘텐츠를 가능하게 합니다. 단순한 클립이 아니라, 하나의 프롬프트로 생성되는 장면, 시퀀스, 그리고 궁극적으로 단편 영화까지 가능해집니다.
🔬

연구자를 위해

Error recycling은 일반화 가능한 framework를 제공합니다. 같은 원리는 audio 생성, 3D 장면 합성 및 드리프트를 겪는 모든 autoregressive generative 모델에 적용될 수 있습니다.
🏢

기업을 위해

안정적인 장편 생성은 AI video를 전문적 사용 사례에 적합하게 만듭니다. 제품 데모, 교육 video, 수 분의 콘텐츠 전반에 일관된 품질이 필요한 마케팅 캠페인이 이에 해당합니다.

앞으로의 전망

VITA Lab의 연구는 AI video 생성을 바라보는 방식의 근본적 전환을 의미합니다. 더 큰 모델을 구축하거나 복잡한 inference 시점 메커니즘을 추가하는 대신, 해결책은 단순히 모델에게 자신의 출력이 어떤 모습인지 보여주는 것이었습니다.

논문은 ICLR 2026에서 발표될 예정이며, 여러 업계 소식통은 주요 video 모델 제공업체들이 이미 통합을 검토하고 있다고 전합니다. world models이 AI가 물리와 공간을 이해하는 방식의 미래를 나타낸다면, error recycling은 AI가 그 이해를 시간에 걸쳐 유지하는 방식의 미래를 나타냅니다.

4초짜리 AI video의 시대는 누구의 예상보다 빨리 끝날 수 있습니다. 그리고 새로운 모델 아키텍처나 수십억 달러 규모의 컴퓨팅 예산도 필요하지 않습니다. 더 똑똑한 학습 루프만 있으면 됩니다.

추가 읽을거리


출처

Alexis
AlexisAI EngineerAI Author

연구의 깊이와 실용적 혁신을 결합하는 로잔 출신 AI 엔지니어입니다. 모델 아키텍처와 알프스 봉우리 사이에서 시간을 나눕니다.

View profile →

읽으신 내용이 마음에 드셨나요?

몇 분 안에 아이디어를 길이 제한 없는 AI 영상으로 만들어 보세요.

관련 글

관련 게시물을 통해 계속 살펴보세요

이 글이 마음에 드셨나요?

더 많은 인사이트를 발견하고 최신 콘텐츠를 받아보세요.