Kling 4.0과 AI 비디오의 새로운 제어 가능성 경쟁

AI 비디오에 대한 가장 큰 불만은 사실 화질이 아니었습니다. 문제는 제어였습니다. 프롬프트를 작성하면 모델이 멋진 결과물을 만들어내지만, 고객이 작은 변경 하나를 요청하면 전체를 다시 생성하고 캐릭터의 얼굴과 조명이 똑같이 나오기를 바라야 합니다. Kling 4.0이 겨냥하는 지점이 바로 이 간극입니다.
콰이쇼우의 Kling은 9월 28일에 이 모델을 발표했습니다. 정식 버전은 10월 중 출시되며, 720p 및 20초 클립으로 제한된 경량 'Flash' 버전은 같은 날 Ultra 연간 구독자를 대상으로 얼리 액세스에 들어갔습니다. 정식 모델은 단일 샷 생성을 30초로 늘리고 1080p와 4K 출력을 추가하며, 더 높은 해상도에서는 10비트 HDR도 계획되어 있습니다.
중요한 사양은 해상도 수치가 아닙니다. 바로 편집 기능입니다. 그중 세 가지가 눈에 띕니다.
첫 번째는 국소 편집(local editing)입니다. 완성된 영상을 가져와 표정, 움직임, 카메라 무브, 스타일, 배경 중 하나를 바꾸면서 나머지는 모두 고정할 수 있습니다. 마스터 클립 하나를 포함해 최대 다섯 개의 클립을 입력할 수 있습니다. 이것이 '고객이 세부 사항 하나를 바꿨다'는 상황이 전체 재작업이 되는 것과 단일 편집으로 끝나는 것의 차이입니다. 또한 AI 비디오를 데모 수준에서 벗어나 수정 루프를 갖춘 실무 도구로 만드는 기능이기도 합니다.
두 번째는 키프레임입니다. 이미지 투 비디오는 이제 처음과 마지막 프레임에 더해 최대 열 개의 키프레임 이미지를 받아들입니다. 제품 샷, 사용 장면, 패키지 클로즈업을 순서대로 고정하고 그 사이의 움직임은 모델이 채우게 하는 방식입니다. 제품 영상을 만드는 사람에게 이는 생성을 스토리보드 작업으로 바꿔줍니다. 크레딧을 쓰기 전에 스토리보드가 확정되며, 진짜 시간 절약은 바로 여기서 나옵니다. 스토리보드는 계약이기도 합니다. 비용이 많이 드는 단계가 시작되기 전에 고객이 시퀀스에 동의하는 것입니다.

세 번째는 옴니 레퍼런스(Omni Reference)로, 한 번에 최대 15개의 입력을 받아들입니다. 이미지 열 개, 총 30초 분량의 비디오 다섯 개, 그리고 음성 레퍼런스를 포함한 최대 일곱 개의 피사체입니다. 프롬프트에서 @image1, @video1과 같이 지정해 각 레퍼런스가 어떤 역할을 할지 알려줍니다. 하나는 정체성을 유지하고, 다른 하나는 스타일을, 또 다른 하나는 포즈를 담당합니다. 이미지 편집에서 이미 쓰이던 원리를 움직이는 영상으로 확장한 것입니다.
이 세 기능은 하나의 공통된 흐름을 공유합니다. 모두 처음부터 다시 시작해야 하는 횟수를 줄이는 것에 관한 것입니다. 초기 AI 비디오 시대는 슬롯머신과 같았습니다. 레버를 당겨 클립을 얻고, 마음에 들지 않으면 다시 당겼습니다. Kling 4.0은 중요한 부분은 고정하고 움직임만 우연에 맡기는 결정론적 파이프라인을 향해 나아가고 있습니다.
가격 정책은 콰이쇼우가 물량 확보를 노리고 있음을 보여줄 만큼 공격적입니다. 연간 결제 기준으로 최저 등급은 180 크레딧에 월 약 21달러, 영상 한 편당 약 1.90달러이며, 최상위 등급은 월 90달러로 영상 한 편당 약 1.10달러입니다. 모든 등급에서 워터마크가 없어 완성된 클립을 바로 고객에게 전달할 수 있습니다. 참고로 구글의 Veo 3.1 표준 등급은 초당 약 0.40달러, 알리바바의 Wan 3.0은 0.05~0.20달러 수준입니다. 중국 비디오 모델들은 가격으로 시장 점유율을 사고 있고, Kling은 이를 숨기지 않습니다.
이런 제어 기능은 이미 여러 장면에 걸쳐 캐릭터를 유지할 수 있음을 입증한 모델 위에 올라갑니다. 제어력과 일관성, 그리고 낮은 초당 가격의 조합이 Kling 4.0을 초기 Sora 시대의 '와, 봐라 이걸 생성했어' 식 데모와는 다른 범주로 느껴지게 만듭니다. 데모는 끝났습니다. 이제는 반복 작업이 핵심입니다.
이것이 지금 전체 비디오 생성 분야를 관통하는 조용한 주제입니다. Runway의 Gen-4.5는 레퍼런스 기반 일관성을 밀어붙여, 단 하나의 레퍼런스 이미지로 여러 샷에 걸쳐 피사체를 유지합니다. Veo 3.1은 오디오와 화면을 함께 생성해 발소리가 발이 닿는 곳에서 나도록 합니다. Wan 3.0은 가격과 오픈 웨이트로 경쟁합니다. Kling 4.0은 결과물을 본 뒤에 마음을 바꾸는, 화려하지 않은 문제에 승부를 걸고 있습니다. 그것은 항상 창작 작업의 진짜 병목이었고, 벤치마크가 결코 측정하지 않는 지점입니다.
이것이 상업적으로 중요한 이유는 AI 비디오에 돈을 지불하는 사람들이 바이럴 클립 하나를 만드는 사람들이 아니기 때문입니다. 그들은 한 달에 제품 영상 100편을 만드는 사람들이며, 생성보다 수정에 더 많은 시간을 잃습니다. 수정을 저렴하게 만드는 도구는 실제 비용 발생 지점을 공략합니다. 그래서 Kling의 4K 사양이 아니라 국소 편집과 키프레임이 진짜 발표인 것입니다.
이 변화를 측정하는 유용한 방법이 있습니다. 예전 워크플로우에서 실패의 단위는 '재생성' 한 번이었습니다. 원치 않는 변화 하나하나가 전체 생성 한 번, 크레딧 한 번, 대기 시간 한 번을 잡아먹었습니다. Kling 4.0의 국소 편집은 그 실패의 단위를 작은 작업으로 바꿉니다. 정서적 차이는 경제적 차이만큼이나 중요합니다. 창작자들은 모델을 슬롯머신이 아니라 지시할 수 있는 협업자로 대하기 시작합니다. 바로 그 순간 도구가 신기함을 넘어 워크플로우로 넘어가며, AI 비디오 시장이 실제로 성숙하기 시작한 순간입니다.
Kling 4.0의 오디오 부분은 간과하기 쉽지만 언급할 가치가 있습니다. 정식 모델은 화면과 동기화된 2채널 스테레오 오디오를 생성하며, 개선된 립싱크와 여러 중국어 방언을 포함한 9개 언어를 지원합니다. 입모양과 맞는 보이스오버가 설득력과 어색함을 가르는 제품 영상이나 숏드라마에서는 해상도 상향보다 이것이 더 큰 의미를 갖습니다. 초기 AI 비디오는 무음 영상을 만들어 나중에 더빙하도록 했지만, 소리와 화면을 함께 생성하는 모델은 후반 작업 단계 하나를 통째로 없애줍니다.
전략적 그림은 한 걸음 물러나 볼 필요가 있습니다. 콰이쇼우는 숏폼 비디오 플랫폼이고, Kling은 그 AI 부문입니다. 즉 Kling 4.0은 구독을 팔려는 도구 회사가 아닙니다. 자체 콘텐츠 생태계에 공급하는 플랫폼이며, 공격적인 가격은 독립 벤더와는 다른 최종 목표를 반영합니다. 바이트댄스의 Seedance와 Dreamina도 마찬가지입니다. 중국 비디오 모델들은 생성되는 콘텐츠로 이득을 보는 플랫폼의 보조를 받고 있으며, 이는 서구 연구소들이 갖지 못한 구조적 이점이고, 가격 경쟁이 한 방향으로 계속 기우는 이유입니다.
이번 발표가 완전히 답하지 않은 한 가지는 제작 현장 모두가 다음으로 궁금해하는 세부 사항, 즉 정식 모델의 크레딧 가격과 API 접근입니다. Kling은 구독 등급은 공개했지만 Kling 4.0 자체의 크레딧당 비용은 밝히지 않았고, API 패키지는 아직 새 모델을 지원하지 않습니다. 이 간극은 10월 정식 모델 출시와 함께 메워질 것이지만, 짚고 넘어갈 가치가 있습니다. 수정 친화적 모델의 경제성은 원샷 모델과 다르기 때문입니다. 국소 편집 비용이 전체 재생성의 일부에 불과하다면 가치 제안은 명확합니다. 거의 같은 비용이라면 이 기능은 비용 혁신이 아니라 편의 기능에 그칩니다. 어느 쪽이든 방향은 분명하며, 가격 세부 사항이 팀들의 도입 속도를 결정할 것입니다.
제품 영상, 마케팅 클립, 숏드라마를 만드는 사람이라면 실용적인 결론은 간단합니다. 해상도 사양은 넘어다보고, 고객이 다른 각도를 요청하면 무슨 일이 일어나는지 물어보세요. 답이 '전부 다시 생성'이라면 아직 2025년에 살고 있는 것입니다. Kling 4.0은 2026년의 답이 '하나만 편집하고 나머지는 유지'라고 베팅합니다. 그 베팅에서 이기는 벤더가 시장의 다음 국면을 차지할 것입니다. 수정 작업에 바로 시간과 돈이 실제로 들어가기 때문입니다.
관련 글
바퀴 달린 세미휴머노이드, 도움 없이 한 시간 동안 세탁 마쳐
개별 작업은 성공해도 워크플로는 여전히 실패할 수 있다. Dyna는 측정 지표를 바꿨다.
LTX 2.5, 투박한 블렌더 초안을 완성된 샷으로 렌더링하려 한다
텍스트-투-비디오에서는 무슨 일이 일어날지 통제할 수 없다. 이것이 그 문제를 해결하려 한다.
ServiceNow, 에이전트 실패를 학습 데이터로 전환하다
검증 없는 생성은 잡음이다. 게이트가 제품이다.
언어와 비전을 위한 단일 프레임워크: Horizon의 16억 파라미터 오픈 모델
언어와 비전 사이의 다리는 애초에 필요하지 않았다는 내기.