Dolphin AI, 의상 일관성 유지하며 대본을 멀티샷 영상으로 전환

긴 클립은 장면과 다릅니다. 바로 이 차이에서 대부분의 AI 영상 도구가 여전히 발목을 잡히며, 새로 등장한 한 서비스가 이 문제를 정면으로 해결하려 합니다.
인도 소셜 플랫폼 Eloelo가 만든 Dolphin AI는 9월 29일 뭄바이에서 열린 FICCI FRAMES 2026에서 공개되었습니다. 10월 4일 기준으로 얼리 액세스 상태이며 공개 대기자 명단을 받고 있습니다. 제안은 좁고 구체적입니다: 대본을 넣으면 컷마다 등장인물과 의상, 장소가 일관되게 유지되는 멀티샷 영상을 돌려받습니다. 한 번의 생성으로 최대 60초 클립을 만들며, 음성과 음악, 편집 지점이 영상에 동기화됩니다.
왜 멀티샷이 어려운가
짧은 길이에서는 좋은 샷 하나를 생성하는 문제는 대체로 해결되었습니다. 하지만 같은 장면에 속하는 샷 다섯 개를 생성하는 것은 그렇지 않습니다. 각 샷을 독립적으로 렌더링하는 모델은 두 컷 전에 재킷이 어땠는지, 창문이 방의 어느 쪽에 있었는지 기억하지 못합니다. 연속성이 깨지고, 관객은 즉시 알아차립니다.
Dolphin은 이를 단일 모델 호출이 아니라 에이전트 워크플로로 접근합니다. 대본에서 샷 목록을 계획한 다음, 각 등장인물과 장소에 중요한 참조를 시퀀스 전체에 걸쳐 고정합니다. 회사는 또한 리캐스팅을 제공해 전체 영상을 다시 생성하지 않고도 연기자를 바꿀 수 있으며, 특정 카메라 무브가 필요한 샷을 위한 모션 컨트롤도 제공합니다.
이 도구는 인도 언어의 립싱크를 지원하는데, 이는 출시 지역을 고려한 의도적 선택입니다. 범용 모델은 영어를 잘 다루고 다른 언어는 부차적으로 취급합니다. 인도 언어 지원을 갖춰 출시되는 도구는 우선 현지 크리에이터 시장을 겨냥하고 있습니다.
비교해 보면
연속성 문제는 Dolphin만의 것이 아니며, 오늘날 대안들이 무엇을 하는지 정확히 짚을 가치가 있습니다. Runway의 Multi-Shot 모드는 약 10초 길이의 시퀀스를 만들며 종종 오디오가 기본으로 없습니다. Pika는 이제 스토리보드와 사운드 디자인을 갖춘 최대 약 30초의 멀티샷 작업을 지원합니다. Luma의 Dream Machine은 일반적으로 클립을 5~10초 범위로 제한합니다. Dolphin의 주장은 오디오와 연속성을 함께 처리하는 더 긴 단일 패스 출력이며, 데모 릴 밖에서도 유지된다면 현재 옵션들보다 한 걸음 더 나아간 것입니다.
유지되는지가 미해결 질문입니다. 회사 데모는 최상의 결과를 위해 편집됩니다. 독립 테스트가 샷 수가 늘고 러닝타임이 1분에 가까워질 때 등장인물의 의상이 얼마나 자주 흔들리는지 보여줄 것입니다.
통합 관점
Dolphin은 MCP 서버와 명령줄 인터페이스를 제공해 다른 도구가 생성을 직접 트리거할 수 있게 합니다. 이는 들리는 것보다 중요합니다. 대본 작성, 에셋 관리, 리뷰를 위한 파이프라인을 이미 운영하는 스튜디오는 파일을 웹 앱으로 내보냈다가 다시 가져오는 대신, 해당 시스템 내부에서 Dolphin을 호출할 수 있습니다. 가격은 구독 + 크레딧 모델을 따르며, 인도 가격은 아직 발표되지 않았고 약관에는 Starter, Pro, Creator 티어가 명시되어 있습니다.
에이전트 방식이라는 표현은 워크플로 불만에도 답합니다. 편집자는 영상이 필요하고, 그만큼 자주 처음부터 다시 시작하지 않고 수정할 수 있는 버전도 필요합니다. 재생성 없는 리캐스팅과 단일 샷에 대한 모션 컨트롤은 모두 첫 생성보다 수정을 겨냥합니다. 바로 그 부분이 파이프라인에서 시간이 실제로 소요되는 곳입니다.
연속성을 뒷받침하는 워크플로
컷 전체에서 등장인물을 일관되게 유지하려면 보통 참조 세트를 구축해야 합니다. 에이전트는 대본과 첫 생성 샷에서 중요한 세부 사항을 추출한 다음, 이후 모든 샷에 대한 제약 조건으로 유지합니다. 재킷에는 색상과 재단이 있습니다. 방에는 한쪽에 창문이, 다른 쪽에 문이 있습니다. 이것들이 고정되면 이후 생성이 흔들릴 여지가 줄고, 재촬영 없이 영상을 조립할 수 있습니다.
어려운 경우는 참조 자체가 바뀌는 때입니다. 장면 중간에 코트를 벗는 등장인물, 또는 한 번도 생성된 적 없는 두 각도에서 보이는 장소는 시스템이 무엇이 여전히 일관되고 무엇이 실제로 바뀌었는지 판단하게 만듭니다. 여기서 계획 단계가 제값을 하며, 더 단순한 “각 샷을 따로 생성” 도구가 무너지는 지점입니다.
Dolphin은 또한 사용자가 생성 후 연기자를 리캐스팅할 수 있게 하는데, 이는 등장인물 정체성이 연기와 별도로 추적된다는 뜻입니다. 그 분리가 수정을 저렴하게 만듭니다. 정체성과 모션이 독립적으로 저장되면 하나를 바꿔도 다른 하나를 재구축할 필요가 없습니다.

컴플라이언스 계층
인도 크리에이터를 겨냥한 무엇이든 공개 규칙을 다뤄야 하며, Dolphin의 자료도 그렇게 말합니다. YouTube는 사실적인 콘텐츠가 합성 미디어를 사용할 때 라벨을 요구하며, 반복적인 미공개는 제재를 받습니다. 인도 광고 규제 기관은 AI 생성 광고에 대한 라벨링 규칙 초안을 마련했고, 중개자는 불법 콘텐츠에 관한 인도 IT 규칙을 따라야 합니다. 도구와 함께 제공되는 지침은 사용자에게 합성 샷을 공개하고, 초상권 허가를 확보하고, 모델 라이선스를 추적하고, 감사를 위해 프롬프트 기록을 보관하라고 알려줍니다.
그 지침은 이번 출시에서 가장 화려하지 않은 부분이며 아마도 가장 중요한 부분일 것입니다. 이를 건너뛰는 크리에이터가 계정 제한을 받는 사람들입니다.
인도 출시가 중요한 이유
인도는 세계에서 가장 큰 크리에이터 시장 중 하나이며, 그 결과물의 대부분은 글로벌 영상 모델이 제대로 다루지 못하는 언어로 되어 있습니다. 현지에서 만들어지고 현지 언어 지원과 현지 가격을 갖춘 도구는 대형 스튜디오가 우선순위에 두지 않은 공백을 채우고 있습니다. Dolphin의 연속성이 유지된다면, 그동안 소외되어 온 시장에서 의미 있는 점유율을 차지할 수 있습니다.
가격 질문은 여전히 열려 있습니다. 인도 가격은 발표되지 않았고, 지금까지 언급된 티어는 일반적입니다. 크리에이터가 완성된 1분당 얼마를 내는지가 이 도구가 전문가용 옵션인지 취미용인지 결정할 것입니다. 비교 가능한 글로벌 도구는 생성된 초당 크레딧으로 과금하며, 재시도 후 사용 가능한 샷당 실질 비용은 종종 표시 가격의 몇 배입니다. Dolphin도 같은 기준으로 평가받을 것입니다.
인재 관점도 있습니다. 회사 자체 자료는 혜택을 보는 역할로 AI 비디오 편집자, 프롬프트 주도 스토리 프로듀서, 브랜드 스토리텔러, 에이전시 크리에이티브를 지목하며, 멀티샷 일관성을 보여주는 릴을 만들라는 지침을 제공합니다. 이는 이 도구가 연속성이 깨지면 재촬영과 마감일 초과로 이어지는 클라이언트 작업에 사용할 사람들을 겨냥하고 있다는 신호입니다.
지켜볼 것
Dolphin이 지역 출시 이상인지 보여줄 두 가지 신호가 있습니다. 첫째는 전체 60초에 가까운 클립에 대한 독립적 연속성 테스트입니다. 둘째는 이미 파이프라인을 갖춘 스튜디오가 MCP와 CLI 통합을 채택하는지인데, 이는 장난감과 도구의 차이이기 때문입니다.
인도 시장 관점은 실재합니다. 현지 언어 지원과 현지 컴플라이언스 지침을 갖춘 현지 도구는 영어 우선 제품을 출시하는 글로벌 모델이 갖지 못한 이점이 있습니다. 그 이점이 빠르게 움직이는 분야와 맞닥뜨려도 살아남을지는 앞으로 몇 달이 말해줄 것입니다.
관련 글
Agility Digit 5, 단순한 스펙 시트가 아닌 안전성 입증 자료와 함께 출시되다
창고 현장은 실험실이 아니다. 관문은 인증이지 데모가 아니다.
프론티어 에이전트가 연구 워크플로의 30퍼센트를 완료했다. 그 숫자가 핵심이다.
에이전트는 연구를 운영할 수 있다. 절차를 새로 고안하는 일은 아직 요원하다.
Figure AI, 판매할 제품도 없이 35억 달러어치 컴퓨팅을 확보하다
베팅의 핵심은 일반화가 컴퓨팅 문제라는 것이다. 업계는 아직 결론을 내리지 못했다.
OpenAI, 마침내 이미지 API에 투명 배경 추가
파이프라인에서 한 단계를 통째로 없애는 작은 기능.