투 프레임 방식: 처음 및 마지막 프레임 보간이 AI 영상 기획을 어떻게 바꾸었나

Google은 10월 9일 Veo 3.1의 처음 및 마지막 프레임을 영상으로 변환하는 기능을 업데이트했습니다. 두 장의 스틸 이미지, 즉 시작 프레임과 종료 프레임을 업로드하면 모델이 그 사이의 움직임을 생성합니다. 출력은 네이티브 오디오와 함께 최대 4K 60fps이며, 9:16 세로 형식을 지원하고, 캐릭터와 스타일 일관성을 유지하기 위해 3~4장의 참조 이미지를 받습니다.
그 자체로만 보면 사소한 추가 기능처럼 들립니다. 하지만 실제로는 사람들이 장면을 계획하는 방식을 바꿉니다. 정말로 중요한 두 가지 결정을 프로세스의 앞단으로 되돌려 놓기 때문입니다.
프롬프트만 사용하는 영상의 문제
지난 2년의 대부분 동안 AI 영상은 슬롯머신처럼 작동했습니다. 문단을 하나 쓰고, 기다린 뒤, 무언가가 나오는 것을 지켜봤습니다. 결과물은 게시하기에는 충분히 좋은 경우가 많았지만, 작품에 배치하기에 충분한 경우는 드물었습니다. 캐릭터가 흐트러지거나 카메라가 이상하게 움직이면 프롬프트를 고쳐 쓰고 다시 시도했습니다.
창작자들은 이를 우회하는 방법을 익혔습니다. 강한 스틸 이미지를 생성한 다음 모델에 애니메이션을 요청했습니다. 이것이 이미지 투 비디오입니다. 이 방식은 시작 프레임을 고정했지만, 장면이 어디서 끝나는지는 아무도 통제하지 못했습니다. 클립은 힘이 빠지거나, 아무도 요청하지 않은 결말을 만들어내는 경향이 있었습니다.
양쪽 끝을 정의하면 그러한 추측의 상당 부분이 사라집니다. 관객이 어디를 보기 시작하고 어디를 보며 끝낼지 직접 결정합니다. 모델의 역할은 더 좁아집니다. 두 지점을 연결하는 것입니다.
스토리보드 사고가 돌아온 이유
애니메이션 스튜디오는 한 세기 동안 이렇게 작업해 왔습니다. 애니메이터는 키 포즈를 하나 그리고, 또 다른 키 포즈를 그린 다음, 그 사이의 그림을 채웁니다. 기술은 모든 프레임을 그리는 데 있는 것이 아니라 포즈를 선택하는 데 있습니다. AI 영상은 다른 경로를 통해 같은 분업에 도달하고 있습니다.
이것은 Veo만의 특징이 아닙니다. 제어 가능성 경쟁은 수개월째 심화되어 왔습니다. Kling 4.0은 10개의 키프레임과 30초 네이티브 클립과 함께 출시되었습니다. Seedance 2.5는 기존 영상을 새로운 카메라 앵글로 다시 촬영할 수 있습니다. Wan 3.0은 분당 약 12달러에 Elo 1157로 Artificial Analysis의 AA-Video-T2V v2.0 벤치마크 1위에 올랐습니다. 10월 7일 공개된 Vidu의 Q4 프리뷰는 초당 약 0.014달러에서 시작하며 최대 15개의 이미지 참조를 받습니다. 가장 강력한 모델들의 공통점은 원시 품질보다 얼마나 정밀하게 조종할 수 있는지에 더 가깝습니다.

실제로 작동하는 설정은 어떤 모습인가
투 프레임 방식은 두 프레임을 연결할 가치가 있을 때만 성과를 냅니다. 몇 가지 습관이 도움이 됩니다.
이전 클립의 스크린샷 대신 이미지 모델로 프레임을 생성하세요. 양쪽 끝에서 구도, 조명, 의상을 통제하고 싶을 것입니다. Google의 Veo는 얼굴이나 제품이 전환 과정에서도 유지되도록 참조 이미지를 받는데, 이는 참조가 처음부터 일관될 때만 작동합니다.
카메라 움직임은 단순하게 유지하세요. 보간은 푸시 인, 풀 백, 리빌, 느린 드리프트를 잘 처리합니다. 단일 클립 안에서 하드 컷을 요청하면 어려움을 겪습니다. 보간할 컷이 없기 때문입니다. 장면에 컷이 필요하다면 두 개의 클립을 만드세요.
오디오 계획을 장면에 맞추세요. Veo 3.1은 네이티브 오디오를 합성하므로 환경음과 단순한 효과에 유용합니다. 장면에 특정 대사나 라이선스 트랙이 필요하다면 생성된 사운드와 싸우기보다 나중에 추가할 계획을 세우세요.
이 방식을 이야기의 비트를 담당하는 장면에 아껴 사용하세요. 2초짜리 전환에 잘 만든 두 프레임을 쓸 이유는 없습니다. 관객이 변화를 알아차려야 하는 곳에 사용하세요.
두 개의 추가 프레임에 실제로 드는 비용
프레임 단위로 계획하는 것은 가격표가 붙은 결정이며, 그 가격은 1년 전보다 지금 파악하기 더 쉽습니다. 영상 시장은 초당 비용을 낮추기 위해 계속 경쟁해 왔습니다. 10월 7일 공개된 Vidu의 Q4 프리뷰는 초당 약 0.014달러에서 시작하며 최대 15개의 이미지 참조를 받습니다. 10월 8일 API에 추가된 xAI의 Grok Imagine Video 1.5 Lite는 480p에서 초당 0.02달러, 1080p에서 0.14달러로 책정되어 있습니다. HeyGen의 새 범용 비디오 모델은 10월 프로모션 요금으로 초당 1센트에 출시되었습니다. Elo 1157로 Artificial Analysis 비디오 벤치마크 1위를 차지한 Wan 3.0은 분당 약 12달러로 책정되어 있으며, 이는 초당 20센트에 해당합니다.
여기서 두 가지가 따라옵니다. 첫째, 이제 생성 자체가 비싼 부분인 경우는 드뭅니다. 몇 초의 보간된 움직임은 달러가 아니라 센트가 듭니다. 둘째, 희소한 자원은 프레임입니다. 강한 스틸 이미지 두 장을 생성하고 선택하는 데는 사람의 시간이 들며, API가 저렴해진다고 그 시간이 저렴해지지는 않습니다. 경제성은 볼륨이 아니라 계획에 보상을 줍니다. 이는 프롬프트만 쓰는 도구가 사람들을 훈련시킨 방식과 정반대입니다.
실제 작업에서 통하는 워크플로
다음은 모든 것을 바꾸지 않고도 이 방식이 소규모 제작에 맞아떨어지는 방법입니다. 콘셉트에서 시작해 장면이 반드시 달성해야 할 단일 비트를 정하세요. 시작 프레임과 종료 프레임을 이미지로 만들고, 같은 참조를 사용해 얼굴, 의상, 소품이 일치하게 하세요. 보간을 생성한 다음, 구조를 보기 위해 한 번, 세부 사항을 보기 위해 한 번 시청하세요. 움직임이 잘못 흐르면 프롬프트가 아니라 프레임을 고치세요. 모델이 실제로 읽는 것은 프레임이기 때문입니다. 장면에 따라 오디오를 추가하거나 교체하세요. 그런 다음 시퀀스에 잘라 넣고 맥락 속에서 판단하세요. 혼자서는 인상적으로 보이는 클립도 옆 클립들과 나란히 놓으면 느리게 느껴질 수 있기 때문입니다.
여기서의 규율은 모든 수정이 주사위를 굴리는 일이 아니라 이야기에 관한 결정이라는 점입니다. 이것이 사람들이 이 기능을 처음 써볼 때 놓치는 부분입니다. 지름길처럼 느껴지지만, 1세대 AI 영상 도구가 사람들이 건너뛰게 만들었던 프리프로덕션을 조용히 되살립니다.
일반 카메라가 여전히 이기는 지점
이 모든 내용이 촬영이 구식이라고 주장하는 것은 아닙니다. 보간은 양쪽 끝이 강력하고 그 사이의 움직임이 단순할 때 가장 강합니다. 이는 많은 제품 샷, 전환, 타이틀 카드, 분위기 있는 설정 프레임을 포괄합니다. 반대로 현실이 구체적이고 예측 불가능한 일을 할 때 가장 약합니다. 전속력으로 달리는 실제 말, 반응하는 군중, 진짜처럼 보여야 하는 방식으로 조리되는 음식 등이 그렇습니다. 그런 경우에는 카메라와 유능한 편집자가 여전히 논쟁을 끝냅니다.
합리적인 입장은 시시합니다. 통제가 중요하고 움직임을 알 수 있는 곳에는 보간을 사용하고, 장면이 실제여야 하는 곳에는 카메라를 사용하세요. 대부분의 현업 창작자는 같은 프로젝트에 둘 다를 사용하게 되며, 그 혼합은 타협이 아닙니다. 그것은 그저 제작입니다.
솔직한 한계
보간은 여전히 보간입니다. 두 프레임이 사람이 완전히 한 바퀴 도는 모습이나 액체가 형태를 바꾸는 것처럼 물리적으로 복잡한 중간 상태를 암시한다면, 모델은 무언가를 만들어낼 것이고 그것이 항상 옳지는 않을 것입니다. 암시된 움직임은 카메라가 그럴듯하게 기록할 수 있는 범위 안에 두세요.
또한 비용을 끌어올립니다. 잘 다듬은 스틸 두 장에 생성된 클립까지 더하면 프롬프트 하나보다 작업량이 많습니다. 현재 시장의 초당 가격을 고려하면 1년 전보다 더 저렴하지만, 계획 시간은 실제로 듭니다. 이 방식은 이미 장면 단위로 생각하는 사람들에게 보상을 줍니다.
그리고 중간은 여전히 보장되지 않습니다. 이 기능이 실제로 파는 것은 해결된 문제가 아니라 더 작은 탐색 공간입니다. 그것은 의미 있는 진전입니다. 이제 쓸 만한 클립과 기억에 남는 클립의 차이는 대부분 선택하는 프레임에 달려 있으며, 그것은 사람이 내리는 결정입니다.
앞으로 지켜볼 것
같은 패턴이 퍼질 것으로 예상됩니다. 한 주요 모델이 프레임을 기본 입력으로 취급하면 경쟁자들도 따르는 경향이 있으며, 흥미로운 질문은 누구의 보간이 이음새에서 가장 자연스러워 보이는가가 됩니다. 중간 키프레임을 추가할 수 있는 도구를 주목하세요. 그러면 감독들은 타임라인을 벗어나지 않고도 세 번째 앵커를 얻을 수 있습니다.
지금으로서 실용적인 교훈은 화려하지 않습니다. AI 영상을 만든다면 프롬프트를 주요 창작 행위로 취급하는 것을 멈추세요. 먼저 프레임을 만들고, 이야기를 전하는 두 장을 고르고, 그 사이의 여정은 모델이 처리하게 하세요.
관련 글
Decagon의 PACT 프로토콜, '동의'를 표준으로 만들려 한다
Decagon은 개인 에이전트의 신원과 고객이 부여한 권한을 검증하는 프로토콜을 오픈소스로 공개했다. 지루한 배관이지만, 에이전트 경제가 작동할지를 결정한다.
AI '재회' 물결: 중국이 아직 어떻게 느껴야 할지 정하지 못한 논쟁
AI 추모 영상이 세상을 떠난 공인을 중국의 화면으로 데려와 수십만 개의 좋아요를 모았다. 그리고 반발이 왔다. 쟁점은 '동의'였다.
애플이 오픈 멀티모달 모델을 공개했지만 거의 아무에게도 알리지 않았다
연구 우선의 이번 릴리스는 주류 시야를 조용히 지나갔다. 그러나 세밀한 시각 그라운딩은 애플의 AI 스택이 어디로 가는지 말해 준다.
OpenCut과 '오픈소스 CapCut'의 순간
무료 MIT 라이선스 영상 편집기가 GitHub 트렌드를 계속 오르고, 로드맵에는 AI 에이전트용 MCP 서버가 들어 있다. AI 미디어를 둘러싼 도구가 모델을 따라잡고 있다.