← 블로그로
Ai약 12 분 읽기

SparkDiffusion, 720p 영상 생성 시간을 79분에서 18초로 단축

게시일 2026년 10월 2일
SparkDiffusion, 720p 영상 생성 시간을 79분에서 18초로 단축

생성하는 데 약 4,769초가 걸렸던 720p 영상이 이제 단일 RTX 5090에서 약 18초 만에 생성됩니다. 이 결과를 이끌어낸 베이징대학교, 칭화대학교, 알리바바 연구진은 코드를 SparkDiffusion으로 오픈소스로 공개했으며, 약 265배의 속도 향상은 단순히 완료 시간을 앞당기는 수준을 넘어 파이프라인이 할 수 있는 일 자체를 바꾸는 종류의 숫자입니다.

이 주장은 그것이 어떻게 달성되었는지와 대조해 볼 가치가 있습니다. 그렇게 큰 속도 향상은 보통 숨은 단서를 감추고 있기 때문입니다. SparkDiffusion은 각각 따로 성숙해 온 세 가지 기법을 결합합니다: 희소 어텐션(sparse attention), 소수 스텝 증류(few-step distillation), FP8 양자화입니다. 희소 어텐션은 확산 비디오 모델이 일반적으로 대부분의 시간을 쏟는 전체 어텐션 행렬 계산을 피합니다. 소수 스텝 증류는 모델이 일반적인 수십 단계보다 훨씬 적은 디노이징 단계로 좋은 샘플에 도달하도록 훈련합니다. FP8은 연산의 수치 정밀도를 낮춥니다. 이들을 겹치면 영상당 산술 연산량이 급감합니다.

파란색과 흰색 빛의 궤적이 가로지르는 실리콘 웨이퍼의 극단적 클로즈업, 매우 큰 속도 향상을 암시함

그 별표가 여전히 중요한 이유

희소 어텐션과 소수 스텝 증류는 둘 다 약간의 품질을 많은 속도와 맞바꾸며, 이것을 배포하는 사람에게 정직한 질문은 품질이 어디에 자리 잡느냐입니다. 단일 소비자용 카드에서 265배라는 수치는 인상적이며, 이를 만들어내는 동일한 방법은 미세한 디테일을 부드럽게 만들거나 모션 일관성을 떨어뜨릴 수 있습니다. 논문은 속도 향상을 보고합니다. 결과물이 전문가 검토를 통과하는지는 스튜디오가 신뢰하기 전에 실행할 테스트입니다.

그런 단서에도 불구하고 방향은 중요합니다. 비디오 생성은 데이터센터 워크로드로 가격이 매겨져 왔습니다. 합리적인 시간에 렌더링하려면 클러스터가 필요한 720p 클립은 모든 팀을 API로 몰아넣고, 이는 비용 모델을 남의 손에 쥐여줍니다. 한 GPU에서 렌더 시간을 몇 초로 낮추면 경제성이 바뀝니다. 반복이 저렴해지고, 저렴한 반복이야말로 생성기를 실제로 탐색할 수 있는 도구로 바꿔 줍니다.

다른 각도에서 본 같은 이야기

SparkDiffusion만 비디오 비용을 공격하는 것이 아닙니다. NVIDIA의 Sana 프로젝트는 모든 생성기의 저해상도 출력을 선명한 2K 또는 4K 비디오로 바꾸는 원스텝 비디오 정제 모델 SoL-Refiner를 공개했으며, 엔드투엔드로 8.91배 더 빠르다고 보고했습니다. 이 설계는 SparkDiffusion이 하는 일과 상호 보완적입니다. SparkDiffusion은 생성을 가속하고, SoL-Refiner는 다듬기를 가속합니다. 둘을 합치면 비싼 모델이 더 적게 하고 저렴한 정제기가 마무리하는 2단계 파이프라인을 가리킵니다.

한편 품질 최전선은 계속 움직입니다. Artificial Analysis는 약 1,000개의 프롬프트에 걸친 68,000개 이상의 인간 선호 투표로 구축된 AA-Video-T2V v2.0 벤치마크를 출시했으며, 모든 모델을 1080p에서 평가합니다. Wan 3.0은 분당 12달러에 Elo 1157로 리더보드 1위를 차지했고, 20개 카테고리 순위 중 10개에서 1위를 차지했습니다. 그 12달러라는 숫자가 이야기의 나머지 절반입니다. 어떤 모델이 세계 최고일 수 있지만, 매 분이 프리랜서 요율의 상당 부분을 차지한다면 규모에서 사용할 수 없습니다.

18초 만에 영상을 생성한다는 것의 의미

79분과 18초의 차이는 같은 워크플로의 더 나은 버전이 아닙니다. 다른 워크플로입니다. 79분에서는 크리에이터가 신중하게 계획하고, 프롬프트에 확신을 갖고, 기다립니다. 반복이 충분히 비싸서 아껴서 합니다. 18초에서는 시도해 봅니다. 열 가지 변형을 생성하고, 나란히 보고, 두 개를 남깁니다. 도구는 지시하는 대상에서 대화하는 대상으로 바뀌며, 이러한 상호작용의 전환이 보통 품질을 여는 계기가 되지, 기본 모델이 아닙니다.

같은 일이 이미지 생성에서 일어났습니다. 좋은 이미지가 몇 분 걸리던 시절에는 사람들이 신중하게 프롬프트를 쓰고 각 생성을 하나의 결정으로 대했습니다. 몇 초로 줄어들자 대충 프롬프트를 쓰고, 넓게 생성하고, 선택하기 시작했습니다. 품질의 상한은 크게 오르지 않았지만 사용 가능한 결과물의 하한은 올라갔습니다. 선택이 많은 변동성을 흡수하기 때문입니다. SparkDiffusion이 이미지에 빠른 샘플러가 했던 일을 비디오에 해낸다면, 그 효과는 어떤 단일 클립이 극적으로 더 좋아지는 것이 아니라 팀이 얼마나 자주 생성하는지에서 먼저 나타날 것입니다.

하드웨어 단서도 있고, 작지 않습니다. 18초라는 수치는 최상급 소비자용 카드인 RTX 5090 기준입니다. 대부분의 스튜디오가 실제로 보유한 중급 GPU에서 같은 파이프라인을 돌리면 더 느릴 것이고, 기준선 대비 속도 향상은 덜 극적으로 보일 수 있습니다. 하지만 계획을 세우는 데 중요한 것은 방향입니다. 기반 하드웨어의 가격은 소프트웨어 효율이 높아지는 동시에 떨어지고 있기 때문입니다. 두 힘 모두 같은 방향으로 밀고 있습니다.

진짜 경쟁은 초당 경제성

두 측면을 합쳐 보면 비디오 생성 경쟁은 순수한 품질 경쟁이라기보다 비용 경쟁처럼 보입니다. 한쪽에서는 모델이 계속 좋아지고 초당 비용은 더 비싸집니다. 다른 쪽에서는 연구 커뮤니티가 같은 작업을 더 저렴한 실리콘에서 더 짧은 시간에 실행할 방법을 계속 찾아냅니다. 대부분의 실제 프로젝트에서 승자는 상대방에 비해 더 빠르게 움직이는 쪽입니다.

여기에는 이미지 생성 세계를 반향하는 패턴이 있습니다. 최전선 모델이 등장하고 높은 점수를 받고 프리미엄 가격으로 책정됩니다. 그러면 오픈 웨이트 프로젝트가 같은 작업이 대부분 엔지니어링 문제임을 보여주고 가격이 붕괴합니다. 비디오는 컴퓨팅 요구량이 더 높아서 그 궤적을 따라오는 속도가 느렸지만, SparkDiffusion과 SoL-Refiner는 그것이 시작되고 있다는 첫 신뢰할 만한 신호입니다.

콘텐츠 팀에 실질적인 결과는 비디오 생성의 구축 대 구매 결정이 더 이상 명확하지 않다는 것입니다. 6개월 전에는 API에 비용을 지불하는 것이 유일하게 감당 가능한 경로였습니다. 단일 GPU가 사용 가능한 720p를 몇 초 만에 렌더링할 수 있다면, 꾸준한 볼륨이 있는 팀에게는 파이프라인을 소유하는 것이 합리적으로 보이기 시작합니다. 적어도 최종본이 필요할 때만 유료 서비스로 보내는 러프 패스에는 말입니다.

지켜볼 것들

세 가지가 이것이 얼마나 중요한지를 결정할 것입니다. 첫째, 가속된 출력의 품질이 논문 자체 샘플이 아니라 독립 테스트에서 견디는지 여부입니다. 둘째, 오픈소스 코드가 결과의 RTX 5090에서만큼 대부분의 팀이 실제로 보유한 소비자용 카드에서도 깔끔하게 실행되는지 여부입니다. 셋째, 최전선 연구소들이 더 공격적인 가격으로 대응하는지 여부입니다. 만약 그렇게 한다면 로컬에서 실행할 유인이 다시 줄어들기 때문입니다.

지금으로서 의미 있는 변화는 개념적입니다. 비디오 생성은 서비스에서 직접 실행할 수 있는 소프트웨어로 재분류되고 있습니다. 이 재분류는 이미지 모델을 API 호출에서 로컬 ComfyUI 워크플로로 바꾼 것과 같은 재분류이며, 대개 같은 방식으로 끝나는 경향이 있습니다. 최전선이 맨 위에 있고, 그 아래에서 대부분의 작업을 수행하는 넓고 저렴하며 충분히 좋은 층이 있습니다.

관련 글