메타, 미드저니의 이미지·영상 기술 라이선스… 그 이유가 말해주는 것

이번 주 보도에 따르면 메타가 미드저니의 AI 이미지 및 영상 기술을 라이선스하고 있다. 메타의 최고 AI 책임자(CAIO) 알렉산더 왕은 게시물에서 미드저니를 공개적으로 치켜세우며, 이 팀이 “기술적·미학적 탁월함의 진정한 성과”를 이뤄냈다고 평가했다.
메타는 이미 자체 이미지 생성기와 영상 편집기를 보유하고 있다. 이번 라이선스 계약은 모델을 갖는 것과 사람들이 실제로 선택하는 모델을 갖는 것이 다르다는 사실을 인정한 셈이다.
메타가 사들이는 것
메타가 주목하는 미드저니의 역량은 구체적이다. V7은 지난 6월 기본 이미지 생성 모델이 되었으며, 이전 버전보다 텍스트 프롬프트를 훨씬 지능적으로 처리하는 완전히 새로운 아키텍처로 설명된다. 회사는 생성된 이미지를 짧은 애니메이션 클립으로 바꿔주는 V1 영상 모델도 출시했다. 이후 미드저니는 표준 요금제 구독자까지 영상 생성을 확대했고, 설정과 CLI 파라미터를 통한 배치 생성 옵션을 추가했으며, 창작 레퍼런스를 정리하는 무드보드(Moodboards) 페이지를 선보였다.
자산은 미학적 명성이다. 미드저니는 2022년부터 이미지 생성 시장에서 특별한 위치를 차지해 왔다. 통제 가능성이 가장 높은 모델도, 가장 저렴한 모델도, 텍스트 렌더링을 가장 잘하는 모델도 아니었지만, 기본 출력물이 아름답다고 평가받는 모델은 늘 미드저니였다. 독립적인 순위도 이를 반영하는데, 이 모델은 그에 상응하는 비용 구조와 함께 미학적 선두주자로 평가되어 왔다.
이런 명성에는 생각보다 신비롭지 않은 기술적 해석이 있다. 미드저니의 강점은 기본 샘플링 동작, 즉 부정 프롬프트도, 스타일 수정자도, 파라미터 조정도 없는 순수한 프롬프트에서 사용자가 얻는 출력에 있는 것으로 보인다. 대부분의 모델은 사용자가 매력적인 결과를 향해 방향을 잡아줘야 한다. 조종하지 않은 출력이 이미 매력적인 모델은 사용자가 익히기 정말 어려운 기술을 대신해 준다. 실무자들이 이를 품질이 아니라 취향(taste)이라고 부르는 이유다.
메타 입장에서 내부적으로 구축하기 어려운 것은 바로 그 명성이다. 연구소는 벤치마크를 만족시키는 모델을 학습시킬 수 있다. 그러나 특정 커뮤니티가 기본값으로 선호하는 출력을 내놓는 모델을 학습시키는 것은 다른 문제이며, 미드저니가 해결한 것이 바로 그 문제다.
자체 모델을 가진 회사가 왜 라이선스를 사는가
메타는 이미지 생성 도구와 영상 편집기를 공개한 바 있다. 이미지당 약 1센트 가격으로 광고주를 겨냥한 자체 이미지 모델 뮤즈(Muse)도 있는데, 이번 사이클에서 상당한 반응을 얻은 것으로 전해졌다.
문제는 순수한 역량이 아니라 경쟁 포지셔닝의 격차다. 비교 대상은 OpenAI의 소라(Sora)와 구글의 베오(Veo)이며, 메타가 던지는 질문은 자사 스택이 품질에서 이들과 경쟁할 수 있는지이지, 결과물을 만들 수 있는지가 아니다.
라이선스는 시점(timing) 문제를 해결한다. 메타는 이른바 ‘초지능(Superintelligence) 연구소’를 향해 나아가고 있으며, 이는 수년이 걸리는 작업이다. 두 회사의 연결은 이미 활발했다. 메타는 스케일 AI에 148억 달러를 투자했고, 그 거래의 일환으로 왕이 최고 AI 책임자가 되었으며, 경쟁 연구소에서 선임 인재를 끌어오는 대규모 채용도 진행됐다. 다만 그 프로그램이 즉시 만들어내지 못하는 것은 미학으로 승부하는 소비자용 창작 제품이다.
그래서 메타는 연구 프로그램이 돌아가는 동안 미학 레이어를 사들이는 것이다. 자본과 격차를 동시에 가진 기업에게는 전형적인 수순이며, 메타가 자사 모델의 위치를 어떻게 보고 있는지를 꽤 솔직하게 드러내는 신호다.
라이선스 물결에 담긴 더 깊은 패턴
자사 기술을 대형 플랫폼에 포장해 파는 회사는 미드저니만이 아니다.
같은 주에 앤스로픽은 스타트업 프로그램을 확대해 기업용 무료 접근 권한을 제공하고, 엔지니어 교육을 위한 1억 달러 규모의 프런티어 아카데미를 출범시켰다. 구글은 나노 바나나 2.1을 검색, 광고, 소비자용 Gemini 앱으로 옮겼다. 크리에이티파이(Creatify)와 헤이젠(HeyGen)은 모두 MiniMax의 오픈웨이트 H3를 후속 학습(post-training)해 상업용 모델을 만들었고, 헤이젠의 경우 초당 1센트에 범용 영상 모델을 출시했다.
두 가지 뚜렷한 전략이 보인다. 하나는 수직 통합이다. 모델도, 제품도, 유통도 직접 갖는 것으로 구글이 택한 길이다. 다른 하나는 전문화와 라이선스다. 좁은 영역에서 탁월한 무언가를 만들고 남의 유통망에 파는 것으로, 미드저니와 크리에이티파이, 헤이젠이 여기에 해당한다.
이 구도에서 미드저니의 위치는 특이하다. 브랜드가 역량 벤치마크가 아니라 취향 위에 세워져 있기 때문이다. 벤치마크 순위는 만료된다. 반면 커뮤니티 안에서 한 번 자리 잡은 취향은 좀처럼 사라지지 않는다. 동시에 확장하기는 더 어렵다. 미적 선호는 특정 커뮤니티의 기준에 묶여 있고, 그 기준은 시장마다 갈라지기 때문이다.
앞으로 지켜볼 것
이 계약이 무언가를 만들어낼지 가늠할 세 가지 지점이 있다.
메타가 이 기술로 실제 무엇을 출시하는지다. 라이선스한 모델이 정체성을 유지한 채 메타 서비스 안에 등장하는 것과, 그 역량이 뮤즈에 흡수되는 것은 전혀 다른 결과이며, 보도자료에서는 이 둘이 쉽게 뒤섞인다.
미드저니의 미학이 메타의 규모 요구사항을 견뎌낼 수 있는지다. 미드저니의 출력은 커뮤니티가 수년에 걸쳐 다듬어 온 특정 미의 기준에 맞춰져 있다. 미적 판단이 아니라 전환율을 목표로 하는 광고 소재용으로 이를 재포맷하는 것은, 가치의 원천을 잃을 수 있는 번역 작업이다.
그리고 이 계약이 임시방편인지 영구적인 포지션인지다. 왕은 이번 협력을 “미드저니와 더 긴밀하게 협력하는 것”이라고 표현했다. 메타의 자체 연구 프로그램이 18개월 안에 따라잡는다면 라이선스는 징검다리가 된다. 그렇지 않다면 메타는 크리에이티브 스택의 미학 레이어를 훨씬 작은 회사에 사실상 아웃소싱한 셈이 되는데, 이는 운영은 가능하지만 전략적으로는 불편한 구조다.
임시방편보다 더 흥미로운 시나리오도 있다. 메타의 서비스는 수십억 사용자와 막대한 광고주 기반 앞에 크리에이티브 도구를 놓는다. 현재 미드저니의 미학과 메타의 유통을 결합한 제품은 미드저니에도, 메타에도 없다. 두 회사가 실제로 그것을 만든다면, 결과물은 OpenAI나 구글이 내놓는 어떤 것과도 시장에서 확연히 다른 위치를 갖는 이미지·영상 도구가 될 것이며, 그 우위는 벤치마크 점수가 아니라 기본 채택(default adoption)에서 나올 것이다.
이것이 긍정적 시나리오다. 부정적 시나리오는 이렇다. 플랫폼 기업 내부의 대형 라이선스 계약은 플랫폼의 필요에 맞춰 귀결되는 경향이 있고, 작은 회사를 라이선스할 가치가 있게 만든 그 특정한 품질이 가장 먼저 희생된다. 인수합병이 디자인 도구의 개성을 삼켜버리는 모습을 지켜본 사람이라면 이 패턴이 익숙할 것이다.
이미지 생성에서 무엇이 해자(moat)인가
더 넓게 보면 이미지 생성에서 무엇이 해자(moat)로 인정되는가에 대한 이야기다. 벤치마크는 분기마다 바뀌고, 오픈웨이트 모델은 몇 달 만에 격차를 좁힌다. 그렇게 빨리 움직이지 않는 것은 무엇이 보기 좋은지에 대한 커뮤니티의 판단과, 그로부터 축적된 선호 데이터다. 이 자산은 처음부터 미드저니의 것이었고, 이제는 훨씬 더 많은 연산력을 가진 회사가 다시 구축하는 대신 빌리기로 결정한 대상이 되었다.
다른 이들에게 주는 교훈은 어디서 경쟁할 것인가에 관한 것이다. 순수한 역량으로 프런티어 연구소를 이기려는 것은 갈수록 비싸지는 학습 연산과의 경주다. 특정하고 방어 가능한 미학이나 워크플로 포지션을 구축한 뒤 남의 유통망에 파는 것은 더 느린 길이고 천장도 낮지만, 다음 모델이 나올 때 살아남을 확률은 훨씬 높다.
이 구도에서 미드저니의 위치는 특이하다. 연산력을 더한다고 확장되지 않는 단 하나의 것을 팔고 있으니, 협상 테이블에서는 강한 패다. 동시에 이 자산은 유한하다. 취향은 그것이 적용되는 용도에 따라 희석될 수 있고, 라이선스 계약은 통제권을 상대방에게 넘겨주기 때문이다.
관련 글
AssemblyAI, 실시간 음성 지연 시간을 91밀리초로 단축했다. 이 숫자가 중요한 이유
음성의 제약은 결코 단어 오류율이 아니었다. 그것은 턴 테이킹이었다.
Google의 Nano Banana 2.1은 플래그십이 아닌 기능 드롭이다
중간 등급 릴리스는 연구소가 대부분의 사용자가 실제로 무엇을 필요로 한다고 생각하는지 알려주며, 이는 플래그십보다 더 유용한 신호다.
동영상 광고 스택은 전문 모델들로 분화했고, Boreal-H3가 그 이유를 보여준다
시네마틱 품질과 반복 처리량은 서로 다른 제품이며, 하나의 생성 레이어가 둘 모두에서 앞설 수는 없다.
OpenAI가 AI에서 도출한 수학 결과 722건을 공개했다. 수학자들은 누가 공을 인정받는지 묻고 있다.
증명 보조기는 논증이 따라 나오는지 검사할 뿐, 그 논증이 누군가 생각하는 바로 그 논증인지는 검사하지 않는다.