← 블로그로
Ai약 12 분 읽기

이번 주, 에이전트들이 단편 영화를 연출하기 시작했다. 병목은 품질 관리로 옮겨갔다.

게시일 2026년 10월 6일
이번 주, 에이전트들이 단편 영화를 연출하기 시작했다. 병목은 품질 관리로 옮겨갔다.

한 개발자가 10월 5일, 단일 RTX 5090에서 실행된 14개 에이전트 파이프라인이 애니메이션 단편 The Clockwork Moth를 처음부터 끝까지 제작했다고 밝혔다. 약 10분의 파이프라인 시간 동안 9개 장면에 걸친 106개 샷을 처리했으며, 반복 등장하는 네 캐릭터에 대해 19개의 장면 상태가 있었다. 자동화 QA는 102개 검사 중 102개를 통과했다. 에셋 번들은 2.4GB였다. 툴체인은 공개되지 않았다.

흥미로운 부분은 런타임과 거의 관련이 없다. 눈에 띄는 것은 개발자가 어려운 문제가 어디에 있었다고 말했는지이다. 바로 샷 전반에 걸쳐 캐릭터 정체성을 일관되게 유지하는 것과 품질 관리를 자동화하는 것이다. 첫 프레임이 아니다.

그 판단은 같은 주의 두 번째 프로젝트와도 맞아떨어진다. 한 레딧 사용자가 DOGNAPPED를 공개했다. 이는 오픈소스 Video Builder 노드 위에 구축된 ComfyUI 환경 안에서 Claude Code를 실행한 Claude가 거의 전부 제작한 3분 길이의 말하는 개 코미디다. 인간은 브리프, 실제 개 두 마리의 참조 사진, 도구를 제공했다. Claude는 이야기를 쓰고, 세 번째 개 캐릭터를 만들어내고, 장소와 캐릭터 참조를 생성하고, 샷 지시가 포함된 22장면 시나리오를 쓰고, 모든 장면을 MiniMax H3를 통해 영상, 음성, 음향 효과로 렌더링하고, MiniMax Music 3로 스코어를 작곡하고, 영화를 편집했다. 렌더링에는 약 4시간 30분이 걸렸다.

그런 다음 모델은 자체적으로 재촬영을 진행했다. QA 루프는 모든 대사를 대본과 대조해 전사하고, 음성 피치를 확인하고, 프레임과 컷을 검토하고, 프레임 정확도의 오디오-비디오 싱크 검사를 실행했다. 강아지들이 옹알거리거나 개들이 카메라를 응시한 장면은 다시 촬영했다.

어두운 붉은 조명의 암실에서 클립에 매달린 노출되지 않은 빈 필름 한 줄

QA 루프가 핵심인 이유

설득력 있는 단일 샷을 생성하는 것은 데모가 일상적일 만큼 충분히 해결된 문제다. 하지만 106개의 샷을 조립하면서 동일한 캐릭터가 모든 샷에서 같은 캐릭터처럼 보이게 하는 것은 그렇지 않다.

정체성 드리프트는 장편 AI 영상을 망가뜨리는 실패 모드다. 캐릭터를 단독으로 잘 렌더링하는 모델도 샷마다 얼굴, 의상, 헤어라인을 바꾸곤 하는데, 이는 각 생성이 분포에서 새로 뽑아내는 것이기 때문이다. 일반적인 해결책은 참조 컨디셔닝, 특정 캐릭터로 학습된 LoRA, 수동 선택이다. 이들 모두는 파이프라인이 제거해야 할 바로 그 지점에 인간 노동을 추가한다.

자동화 QA는 나머지 절반이다. 영상을 만들어내지만 좋은 출력과 나쁜 출력을 구분하지 못하는 파이프라인은 검토 부담을 사람에게 떠넘긴다. 그리고 100개의 샷을 검토하는 사람은 이 접근 전체가 없애려 했던 병목이다. DOGNAPPED 워크플로는 대본을 검증 오라클로 바꿔 이 문제를 해결했다. 각 대사를 전사하고, 쓰인 내용과 비교하고, 피치를 확인하고, 싱크를 확인하고, 실패를 표시하고, 다시 렌더링한다. 이는 사람이 모든 것을 시청할 필요가 없는 "수용 가능"에 대한 프로그램적 정의다.

이번 주 전반에 걸친 패턴

여러 프로젝트가 같은 형태에 도달했다. 사용자 konte는 Claude Code를 총괄 프로듀서로 만들어 단일 RTX 5090에서 2분 54초짜리 뮤직비디오를 생성했다. 61개 샷, 342개 작업, 약 2시간의 인간 개입과 약 4시간 30분의 생성이 걸렸다. 샷은 곡의 템포와 비트에 맞춰 작성되어 컷이 음악에 맞아떨어졌다.

또 다른 경로는 텍스트-투-비디오를 완전히 건너뛰었다. Claude Opus 5.5가 모든 프레임과 모든 음악에 대한 코드를 작성해 I Have Never Seen the Sun이라는 단편을 제작했으며, 프롬프트는 3~5분 길이의 페스티벌 출품용 작품으로 구성됐다.

마지막 접근은 이 분야의 실제 분할을 보여준다. 코드로 생성한 모션은 결정론적이다. 420번 프레임이 잘못 보이면 코드를 바꾸고 420번 프레임을 다시 렌더링하면 된다. 확산 영상은 확률론적이다. 샷이 잘못되면 다시 뽑고 운에 맡겨야 한다. 키네틱 타이포그래피, UI 애니메이션, 차트, 로고 리빌 같은 설계된 모션에는 결정론적 경로가 더 강하다. 사실적인 인간, 유기적인 연기, 현실 세계의 물리에는 확산 모델이 여전히 승리하는데, 코드는 한 번도 모델링한 적 없는 것을 시뮬레이션할 수 없기 때문이다.

이 변화를 뒷받침하는 도구

이 프로젝트들의 공통점은 생성 파이프라인에 연결된 코딩 에이전트다. Video Builder 노드, 맞춤형 ComfyUI 그래프, API를 통해 오픈 모델을 호출하는 에이전트 스킬은 언어 모델에게 개발자가 가질 법한 것과 동일한 렌더링 접근 권한을 부여한다. 모델 자체가 비디오 모델일 필요는 없다. 비디오 모델을 구동하는 코드를 작성하고 실행할 수 있으면 된다.

그래서 비용 구조가 그렇게 보인다. 한 공개된 세션에서 한 창작자는 7,000개가 넘는 Midjourney 이미지와 Suno 트랙을 Claude Opus 5.5에 넣고 약 2시간 동안 자율 창작 세션을 실행했으며 비용은 약 6.80달러였다. DOGNAPPED 프로젝트에서 지배적인 비용은 API 호출이 아니라 로컬 렌더링 시간이었다. 기본 모델이 오픈 웨이트이고 오케스트레이션이 코드라면 실험의 한계 비용은 급감한다.

역량에는 2차 효과가 있다. 사람에게 남은 작업은 타임라인을 조작하거나 렌더를 눈으로 확인하는 일에서 벗어나, 자동 검사기가 출력이 기준을 충족했는지 판단할 수 있을 만큼 브리프를 정확히 명시하는 쪽으로 이동했다. 이번 주에 출시된 모든 프로젝트는 어딘가에 수용 기준을 인코딩한다. 파이프라인은 "더 좋게 만들어"라는 식으로 반복할 수 없기 때문이다.

아직 작동하지 않는 것

데모들은 자신의 한계에 대해 솔직하며, 한계는 일관된다. 캐릭터 정체성은 몇 개의 샷에서는 유지되지만 수십 개의 샷에서는 흐트러진다. 그래서 참조 컨디셔닝과 캐릭터별 어댑터가 표준이다. 장기 구조는 취약하다. 30초 동안 일관돼 보이는 영화도 3분쯤에는 공간적 또는 시간적 일관성을 잃을 수 있다. 또한 자동화 QA는 검사하라고 지시받은 것만 확인할 수 있다. 즉 대사와 싱크를 검증하는 파이프라인은 아무도 검사를 작성하지 않은 연속성 오류가 있는 장면을 기꺼이 통과시킬 것이다.

이런 제약은 이번 주에 출시된 프로젝트들이 왜 단편이었는지 설명한다. 작은 출연진과 단순한 장소를 가진 3분 코미디는 다룰 수 있는 문제다. 수십 명의 캐릭터, 바뀌는 의상, 복잡한 스테이징이 있는 장편은 그렇지 않다. 적어도 아직은, 자동화가 절약하려 했던 것보다 훨씬 많은 출력을 사람이 검토하지 않고서는 말이다.

제작 예산에 미치는 변화

경제성은 특정한 방식으로 바뀌고 있다. 단편 영화가 몇 달러의 컴퓨팅 비용과 오후 한나절의 오케스트레이션으로 끝난다면, 제약은 돈이 아니라 브리프의 명확성이 된다. 살아남는 인간의 기여는 자신이 무엇을 원하는지 알고, 에이전트가 검증할 수 있을 만큼 정확하게 말할 수 있는 것이다.

이것은 거버넌스 질문도 제기한다. 시나리오를 쓰고, 렌더링하고, 자신의 출력을 판단하고, 실패한 장면을 재촬영하는 에이전트는 사람이 루프에 없는 상태에서 창작 결정을 내리고 있다. QA 루프는 출력을 더 신뢰할 수 있게 만들지만, 동시에 모델 자체의 기준이 "완료"가 어떤 모습인지 정의한다는 뜻이기도 하다.

이번 주의 프로젝트들은 데모이며, 툴체인은 일부 공개되지 않았다. 하지만 방향은 일관된다. 생성은 저렴하고, 오케스트레이션이 제품이며, 파이프라인이 유용한지를 결정하는 것은 파이프라인이 실패했을 때를 알아차릴 수 있는지 여부다.

관련 글