← 블로그로
Ai약 14 분 읽기

Kling VIDEO O1, 영상 생성을 레퍼런스 시스템으로 전환하다

게시일 2026년 10월 7일
Kling VIDEO O1, 영상 생성을 레퍼런스 시스템으로 전환하다

--- title: Kling VIDEO O1, 영상 생성을 레퍼런스 시스템으로 전환하다 slug: kling-video-o1-turns-video-generation-into-a-reference-system meta_title: Kling VIDEO O1, 레퍼런스를 인터페이스로 만들다 meta_description: 콰이쇼우의 Kling VIDEO O1은 텍스트, 이미지, 영상, 키프레임, 레퍼런스를 어떤 조합으로든 받아들이고, 한 클립의 요소를 다른 클립으로 가져올 수 있게 합니다. category: ai tags: Kling VIDEO O1,Kuaishou,영상 생성,레퍼런스 시스템,키프레임,멀티모달,Veo 3.1,Runway Aleph,일관성 ---

콰이쇼우의 영상 부문은 지난 한 달 동안 쉴 새 없이 결과물을 내놓았다. Kling 4.0은 테스터에게 먼저 공개된 뒤 더 넓은 출시 기간을 얻었다. 이제 VIDEO O1이 등장하는데, 이는 거의 카테고리 전환에 가깝다. 하나의 모델이 텍스트, 이미지, 영상 클립, 키프레임, 캐릭터 레퍼런스를 입력으로 받고, 이 모두를 단일 요청의 상호 교환 가능한 구성 요소로 취급한다.

회사가 붙인 명칭은 “통합 멀티모달”이다. 실제 사용법은 더 간단히 말할 수 있다. 클립 세 개를 첨부하고 이렇게 쓰면 된다. 첫 번째 영상에서 캐릭터를, 두 번째 영상에서 카메라 움직임을 가져와 둘 다 세 번째 영상에 넣고, 스타일을 픽셀 아트로 바꿔라.

1년 전이라면 이 단일 요청에 세 개의 개별 도구와 중간 파일의 신중한 내보내기가 필요했을 것이며, 각 단계마다 압축 과정이 추가되고 캐릭터가 흐트러질 가능성이 생겼다.

올인원 레퍼런스가 실제로 주는 것

캐릭터와 소품의 일관성은 AI 영상에서 고질적인 문제였다. 초기 우회 방법은 모델을 연쇄적으로 연결하는 것이었고, 이는 각 단계에 비용을 지불하고 그 사이에 누적된 드리프트를 감수해야 함을 뜻했다. Kling의 접근은 그 연쇄를 단일 생성으로 접어 넣어, 레퍼런스 이미지, 키프레임, 스타일 방향이 한 번에 해결된다.

Kling 자체 수치에 따르면 O1은 이미지 레퍼런스 작업에서 구글 Veo 3.1의 “Ingredients to Video” 기능을 상대로 247퍼센트의 승률을, 변환 작업에서 Runway Aleph를 상대로 230퍼센트를 기록했다. 이는 내부 평가이므로 방향성 정도로 받아들여야 한다. 더 검증 가능한 능력 주장도 있다. 여러 피사체가 각각 고정되어야 하는 그룹 장면을 하나의 혼합 평균이 아니라 피사체별로 처리한다.

영상 길이는 3초에서 10초까지 조정 가능해, 모델이 결정하는 대로 받아들이는 대신 샷의 호흡을 잡을 수 있다. 내부적으로 회사는 긴 멀티모달 컨텍스트를 갖춘 멀티모달 트랜스포머와, 트랜스포머 내부에서 텍스트·시각·오디오 신호를 융합하는 “멀티모달 시각 언어”라는 새 내부 포맷을 설명한다. 내장된 사고 연쇄 추론은 생성된 움직임이 물리적으로 그럴듯하게 유지되도록 하는 역할을 한다.

나열된 생성 유형은 이 카테고리가 별도 도구로 쪼개 왔던 모든 것을 체크리스트처럼 보여준다. 텍스트-투-비디오, 이미지-투-비디오, 비디오-투-비디오, 키프레임-투-비디오, 다중 이미지-투-비디오, 레퍼런스-투-비디오-투-비디오가 그것이다. 각각 예전에는 하나의 제품이었다. O1의 주장은 이것들이 하나의 시스템의 모드라는 것이다.

인터페이스가 벤치마크보다 중요한 이유

흥미로운 점은 O1이 비교에서 이긴다는 것 자체보다, 모델의 입력 표면이 더 중요한 변화라는 데 있다. 이제 입력은 재사용 가능한 자산의 라이브러리다. 여러 각도로 만든 캐릭터는 각 프롬프트마다 다시 설명하는 대신 이름으로 첨부하는 요소가 된다. 카메라 움직임은 형용사로 근사하는 대신 클립에서 빌려오는 것이 된다.

옅은 린넨 표면 위에 놓인, 슬레이트 패널이 완전히 비어 있고 아무 표시도 없는 빈 나무 영화 클래퍼보드

이는 워크플로의 형태를 바꾼다. 이미지 모델 다음 비디오 모델, 그다음 편집기로 이어지며 각 단계마다 비용이 드는 선형 체인이 더 적은 단계로 접힌다. 또한 이 도구의 대상도 바뀐다. 포스트프로덕션 팀은 트래킹과 마스킹 작업 대신 자연어 지시를 받고, 광고 팀은 모든 샷을 처음부터 다시 만들지 않고도 촬영을 대체할 방법을 얻는다.

인터페이스의 나머지 절반은 어휘다. 요소를 이름으로 첨부한다는 것은 팀이 단 하나의 샷 프롬프트를 쓰기 전에 캐릭터의 명칭을 합의하고, 캠페인 전반에서 그 이름을 재사용할 수 있다는 뜻이다. 같은 것을 형용사로 근사하는 방식은 한 번은 통하지만 수정할 때마다 어려워진다. 모두가 좋아한 버전을 만들어낸 형용사 조합이 무엇이었는지 기록이 없기 때문이다.

공급업체 문서도 전문 사용 사례를 비슷한 용어로 설명한다. AI 영화 제작은 요소 라이브러리에 의존해 촬영 전반에서 캐릭터와 소품을 일관되게 유지한다. 광고와 패션은 가상 런웨이를 포함한 로케이션 작업의 대체물로 사용한다. 포스트프로덕션은 이전에는 프레임별 로토스코핑이 필요했던 변경을 수행하는 데 사용한다.

여기에는 자기 선택 효과가 있다. 이렇게 많은 입력 유형을 가진 모델은 초보자에게 더 친절한 것이 아니라, 이미 원하는 바를 아는 사람에게 더 친절하다. 처음 실행 경험을 최적화하는 데 2년을 써온 카테고리에게는 의미 있는 전환이다.

레퍼런스 시스템이 대체하는 것

이 전환을 이해하는 가장 명확한 방법은 팀이 약한 모델을 중심으로 무엇을 구축했는지 보는 것이다. 일관성 파이프라인은 조립 라인이었다. 캐릭터 시트를 생성하고, 이를 이미지 프롬프트로 모든 샷에 넣고, 애니매틱을 생성한 뒤, 애니매틱에서 가져온 시작 프레임으로 각 샷을 다시 생성한다. 각 단계는 이전 단계가 충분한 컨텍스트를 앞으로 전달하지 못했기 때문에 존재했다.

O1의 레퍼런스 시스템은 그 단계들이 존재했던 이유를 겨냥한다. 모델이 그룹 장면에서 캐릭터의 정체성을 유지하면서 동시에 별도 클립에서 카메라 움직임을 가져올 수 있다면, 그 단계 중 일부는 필수가 아니라 선택이 된다. 선택적 단계야말로 예산이 실제로 움직이는 곳이다. 한계를 전제로 구축된 파이프라인은 한계가 완화되었다고 해서 사라지지 않기 때문이다.

같은 논리가 샷 시퀀싱에도 적용된다. 기존 푸티지를 바탕으로 이전 또는 다음 샷을 생성하는 프로그램은 클립 라이브러리를 장면에 더 가까운 것으로 바꾼다. 이미 타임라인에서 작업하는 편집자는 그 가치를 알아볼 것이다. 대체 앵글을 시도하는 비용이 재촬영에서 생성으로 떨어진다.

트레이드오프는 실재한다

Kling은 O1이 Sora 2나 Veo 3.1보다 학습 곡선이 가파르다고 말한다. 어떤 기능이든 유용해지기 전에 이해해야 할 기능이 더 많기 때문이다. 이는 더 표현력이 풍부한 인터페이스의 표준 비용이다. 무엇이든 레퍼런스로 받아들이는 모델은 무엇을 레퍼런스로 삼을지 결정하라고 요구한다.

회사는 O1에서 사운드 문제를 해결하지 않았다. 플랫폼의 오디오 생성을 담당하는 모델은 Kling 2.6이며, 동기화된 대사, 음악, 음향 효과를 갖춘다. 따라서 완전한 제작에는 여전히 두 모델을 짝지어야 한다. 하나는 시각 언어용, 다른 하나는 사운드트랙용이다. Kling의 2.6 마케팅은 소리를 보고 시각을 듣는다는 개념에 기대는데, 이는 O1 밖에 존재하는 능력에 대한 적절한 설명이다.

가격도 플랫폼이 어디에 자리 잡고 싶은지 반영한다. Kling이 공개한 초당 크레딧은 오디오 없는 720p에서 6크레딧, 오디오가 있는 1080p에서 12크레딧으로 올라가며, 플랫폼은 무료 생성에도 적용되는 상업적 사용 정책을 홍보한다. 전문 워크플로에 위치한 모델치고는 진입점이 충분히 낮아, 작은 팀이 본격 도입 전에 테스트할 수 있다.

앞으로 지켜볼 것

O1의 레퍼런스 시스템이 통제된 데모 밖에서도 버티는지다. 일관성 주장은 짧은 클립과 짧은 세션에서는 살아남는 경향이 있지만, 프로젝트가 몇 주간 이어지고 수십 개의 요소가 쌓이면 저하된다. 요소 라이브러리 개념은 요소가 그 기간 동안 안정적으로 유지될 때만 빛을 발한다.

콰이쇼우는 이미 4.0이 30초 네이티브 생성과 최대 10개의 키프레임을 제공한다고 말했다. O1의 레퍼런스 레이어가 그 한계와 경쟁하지 않고 결합된다면, 두 모델은 “얼마나 긴가”와 “누구의 얼굴인가”라는 질문을 모두 커버한다. 그 조합이야말로 스튜디오가 기다려온 것이다.

단기 경쟁 구도도 중요하다. Gemini Omni 1.1 Flash는 Arena에서 1516으로 텍스트-투-비디오 1위를 차지하고 있고, MiniMax H3는 이미지-투-비디오를 이끌며, Wan 3.0은 Artificial Analysis의 비디오 보드 정상에 있다. O1은 빈 들판에 들어가는 것이 아니다. O1의 차별점은 리더보드 순위가 아니라 입력 표면이며, 팀들이 그 위에 요소 라이브러리를 구축한 뒤에는 대체하기 더 어려운 것이다.

관련 글