← 블로그로
Ai약 12 분 읽기

Gemini Omni 1.1 Flash는 네 번의 요청을 연결해 40초짜리 샷을 만들었다. 제품은 바로 워크플로다.

게시일 2026년 10월 5일
Gemini Omni 1.1 Flash는 네 번의 요청을 연결해 40초짜리 샷을 만들었다. 제품은 바로 워크플로다.

Google의 Gemini Omni 1.1 Flash는 평가하기 묘한 제품이다. 모델 자체가 새로운 것이 아니기 때문이다. 이 모델은 2026년 8월 27일 gemini-omni-1.1-flash라는 ID로 정식 출시(GA)되었고, 이전 프리뷰 엔드포인트는 9월 30일자로 종료되었다. 생성 기능을 둘러싼 모든 것이 바뀌었지만, 생성 품질은 대체로 예전 수준에 머물러 있다.

기능 목록은 제작 체크리스트처럼 읽힌다. 장면 확장(Scene extension)은 이제 최대 10초의 이전 컨텍스트를 분석하는데, Google은 이를 마지막 1초만 참조하던 이전 모델에서의 도약이라고 설명한다. 영상은 10초 단위로 확장되며 누적 최대 40초까지 이어진다. 첫 프레임·마지막 프레임 제어를 통해 개발자는 샷의 양 끝을 지정하고 그 사이의 움직임을 생성할 수 있으며, 카메라 궤도 이동, 줌 전환, 이음새가 보이지 않는 루프를 겨냥한다. 360p 초안 모드는 표준 720p 대비 3분의 1 비용으로 최대 60% 더 빠르게 생성한다. 최종 출력은 1080p 또는 4K로 업스케일된다. 캐릭터와 장면 일관성을 위해 최대 3초의 영상을 참조 자료로 제공할 수 있다.

확장 기능은 주의 깊게 읽어야 한다. 마케팅이 이 부분을 두루뭉술하게 넘어가기 때문이다. 40초짜리 Omni 클립은 단일 40초 생성이 아니라, 각각 마지막 10초를 컨텍스트로 사용하는 네 번의 연쇄 요청으로 만들어진다. 개별 생성 결과는 여전히 3~10초 사이에 머문다. 이 차이는 지연 시간과 추론 비용을 산출물에 맞춰 계산해야 하는 사람에게 중요하며, 40초 샷이 실용적인지 아니면 그저 가능하기만 한 것인지를 가르는 세부 사항이다.

어두운 탁자 위에 따뜻한 빛이 비치는 채 세워진 금속 필름 릴 한 개

가격 구조는 반복 작업을 유도하도록 설계됐다

Google의 가격 구조는 초안 작업에 보상을 준다. API 가격은 입력 토큰 100만 개당 1.50달러, 영상 출력 토큰 100만 개당 17.50달러이며, 720p 영상 1초당 5,792토큰으로 청구된다. 이는 초당 약 0.10달러, 분당 약 6달러에 해당한다. 10초 클립 기준으로 티어 사다리는 360p 약 0.30달러에서 720p 1.00달러, 1080p 1.50달러, 4K 3.00달러로 올라간다.

이러한 격차는 우연이 아니다. 360p 초안과 4K 마스터 사이의 차이는 10배에 달하며, 이는 저해상도 티어에서 저렴하게 반복하고 최종 테이크에만 비용을 지불하는 작업 방식으로 팀들을 밀어 넣는다. 대부분의 사람들이 영상 생성에 가져온 습관과 비교해 보라. 프롬프트를 쓰고, 기다리고, 결과를 보고, 프롬프트를 다시 쓰고, 주사위를 굴릴 때마다 정가를 지불하는 방식이다. Google은 두 번째 행동을 워크플로에서 가격으로 밀어내고 있다.

접점도 비교해 볼 필요가 있다. 배포가 균등하지 않기 때문이다. Google은 전체 기능 세트를 개발자 대상이자 API로 사용 가능한 것으로 규정한다. 다섯 가지 기능이 AI Studio, Gemini API, Gemini Enterprise Agent Platform을 통해 개발자에게 제공되는 반면, Gemini 앱의 소비자 대상 배포는 장면 확장에만 국한된다. 같은 모델이 AI Plus, Pro, Ultra 구독자를 위한 Google Flow 안에 들어가 있고, YouTube Shorts Remix와 YouTube Create 앱에서는 무료다. 하나의 모델, 다섯 개의 접근 등급, 그중 네 개는 흥미로운 기능을 받지 못한다.

40초 샷의 산술

연쇄 확장은 샷의 비용 구조를 바꾸며, 그 변화는 선형이 아니다.

3~10초짜리 단일 생성은 저렴하고 빠르다. 40초 시퀀스는 직렬로 이어진 네 번의 요청이며, 각각 독립적으로 실패할 수 있다. 세 번째 요청이 연속성을 깨뜨리는 테이크를 만들어냈다면, 40초를 다시 생성하지는 않는다. 깨진 구간의 첫 프레임부터 다시 생성한 뒤 그 이후의 모든 것을 다시 연쇄해야 하며, 실수의 비용은 시퀀스 내 위치에 따라 배로 늘어난다. 처음 10초는 다시 만들기 저렴하다. 마지막 10초는 비싸다. 다시 만든다는 것이 그 이후의 모든 것을 다시 만든다는 뜻이기 때문이다.

이것이 키프레임 제어를 지지하는 실질적 논거다. 시작 프레임과 종료 프레임을 지정할 수 있으면 각 구간이 양 끝에 검증 단계가 있는 경계가 명확한 문제로 바뀐다. 시퀀스 전체를 보면서 연속성이 유지됐기를 바라는 방식으로 판단하는 대신, 팀은 해당 구간이 원래 도달해야 할 프레임에 도달했는지 확인할 수 있다. 카메라 궤도 이동이나 줌 전환의 경우, 이것은 자유로운 프롬프트보다 훨씬 검증 가능한 작업 단위다.

360p 초안 티어도 같은 논리에 들어맞는다. 40초 시퀀스를 6달러가 아니라 약 1달러에 프로토타이핑하면 반복 작업이 감당할 만해지고, 1080p나 4K로의 업스케일은 별개의, 의도적인 단계가 된다. Google이 사실상 내놓은 것은 가격표에 검수 관문이 내장된 제작 파이프라인이다.

벤치마크가 지금 말해주는 것

Gemini Omni 1.1 Flash는 Arena의 텍스트-투-비디오 보드에서 1516으로 1위이며, 자사의 전작 Gemini Omni Flash(1513)를 간발의 차로 앞선다. Arena가 새 모델에 부여한 순위 범위는 1~4위로, 이는 두 모델이 신뢰구간 안에서 동점이라는 것을 완곡하게 표현한 것이다.

다른 곳의 리더보드 상황은 출시 보도가 시사한 것보다 덜 후하다. 이 모델은 2026년 7월 중순까지 Artificial Analysis의 네 개 보드를 모두 석권했다. 그 석권은 끝났다. 재구성된 텍스트-투-비디오 보드에서 10월 초 기준 Gemini Omni Flash 1.1은 오디오 포함 8위, 무음 8위이며, Arena의 이미지-투-비디오 보드에서는 MiniMax H3에 이어 2위다. Artificial Analysis는 자사 텍스트-투-비디오 보드에서 1.1 Flash를 직접 평가하지 않았는데, 그 보드에서는 구형 Flash 모델이 선두이고 Alibaba의 Wan 3.0과 MiniMax H3가 바짝 뒤따른다.

이는 빠르게 움직이는 카테고리에서 흔한 결과이며, 워크플로 추가 기능의 가치를 깎아내리지는 않는다. 다만 이번 출시를 정직하게 규정하자면 Google이 원시 출력 품질이 아니라 제어 가능성과 가격 티어로 경쟁하고 있다는 뜻이고, 리더보드는 더 이상 이 모델이 승리하는 장소가 아니다.

이번 출시가 해결하지 못한 두 가지

네이티브 동기화 오디오는 확인되지 않았다. Google의 출시 자료는 영상과 함께 사운드트랙을 생성하는 기능을 자세히 설명하지 않으며, 오디오 출력은 이후 릴리스에서 제공될 예정이라고만 적혀 있다. 입력 오디오는 출시 시점에 음성 레퍼런스로 제한된다. 그런 이름을 가진 any-to-any 모델 패밀리치고 오디오 출력의 부재는 두드러지는 공백이며, 특히 사운드가 결과물의 절반을 차지하는 숏폼 콘텐츠를 만드는 팀에게 그렇다.

두 번째는 길이다. 네 번의 연쇄 요청으로 조립한 40초는 실제 기능이며, 동시에 내러티브 영상 포맷이 곧바로 부딪히는 상한이기도 하다. Google은 출시일 없이 상위 모델인 Gemini Omni Pro를 예고했으며, 확장 메커니즘은 더 긴 샷으로 가는 길이 단일한 더 긴 생성이 아니라 더 나은 컨텍스트 처리에 있음을 시사한다.

모든 출력에는 기본적으로 SynthID 워터마킹과 C2PA Content Credentials가 적용되며, 종료된 프리뷰 엔드포인트는 더 이상 Google의 모델 목록에 나타나지 않는다. Google은 이제 Veo 3.1 프리뷰 엔드포인트보다 Omni 1.1을 권장하는데, 이는 주목할 만한 내부적 교대다. Veo 3.1은 여전히 현행 플래그십 Veo이며, Veo 4는 발표되지 않았다.

실제로 무엇으로 만들 것인가

이번 출시를 유용하게 읽는 방법은 제품의 정체성이 바뀌었다고 보는 것이다. 10초 클립을 만들어내는 영상 모델은 신기함을 위한 생성기다. 10초의 이전 컨텍스트를 분석하고, 시작과 끝 프레임을 받아들이고, 3분의 1 가격에 360p로 초안을 만들고, 4K로 업스케일하는 모델은 타임라인 안에 넣을 수 있는 부품이다.

그것이 제작 팀이 계획을 세울 수 있는 생성형 영상의 모습이며, 흥미로운 엔지니어링이 프롬프트 작성에서 파이프라인 설계로 옮겨가는 버전이다. 이번 출시에서는 클립보다 조립이 더 중요하다.

관련 글