왜 모든 AI 얼굴은 똑같아 보이는가, 그리고 시청자들이 이제 그것을 싫어하기 시작한 이유

AI 드라마 붐에서 계속 반복되는 장면이 있다. 시청자가 스크롤하다가 클립을 보고, 좋아요를 누르고, 그러다 이 작품의 남자 주인공이 지난 작품, 그 전 작품의 남자 주인공과 똑같은 얼굴이라는 걸 알아차린다. 같은 얼굴형, 같은 헤어스타일, 같은 가르마. 비교 스크린샷은 바이럴이 됐고, 그 반응에는 중국 인터넷 은어로 이름이 붙었다. 생리적 혐오다.
모든 AI 얼굴이 같은 얼굴로 수렴하는 이유는 미스터리가 아니다. 그것은 통계다. 비디오 모델은 프레임마다 얼굴을 일관되게 유지해야 하는데, 대칭적이고 결점 없고 특징 없는 얼굴이 프레임 간 깜빡임을 일으키는 미세한 오류를 견디는 허용치가 가장 높다. 개별적인 특징, 삐뚤어진 코, 점, 비대칭 눈은 모델이 같은 얼굴을 1초에 서른 번 다시 렌더링할 때 정확히 깨지는 것들이다. 그래서 모델은 '안전한' 얼굴, 즉 학습한 모든 얼굴의 평균인 얼굴을 찾는다. 그 결과 나오는 것은 한 연구자가 통계적 '평균-최적 해'라고 부른 것이다.
경제 논리도 같은 방향으로 밀어붙인다. 생성형 비디오는 초당 과금되고, 개별 얼굴을 맞춤화한다는 것은 프롬프트를 반복하고, 특징을 고정하고, 미세 표정을 프레임 단위로 보정하는 일을 뜻하며, 이는 시간을 두 배로 늘린다. 매일 업로드 일정을 쫓는 대부분의 팀은 그 모든 과정을 건너뛰고 공용 얼굴 라이브러리가 있는 히트 템플릿을 재사용한다. 심지어 암시장도 있다. 학습용으로 쓰인다는, 권리를 침해한 것으로 추정되는 드라마 클립 2만 개 묶음이 1달러도 안 되는 가격에 팔린다. 학습 데이터 자체가 같은 몇몇 출처에서 끌어온 것이라면, 그것이 만들어내는 얼굴이 서로 닮을 수밖에 없다.
그 결과는 얼굴이 완벽하고 서로 바꿔 쓸 수 있는 콘텐츠 카테고리다. 칭화대 언론학 교수는 이 문제를 오래 남을 말로 정리했다. 알고리즘은 미모 점수를 계산할 수 있지만 인간 인격의 두께는 계산할 수 없다. 결점이야말로 핵심이다. 주근깨, 약간의 비대칭, 누군가 진짜로 웃을 때 눈가가 접히는 방식, 피곤할 때 눈썹이 풀리는 방식. 이런 것들이 한 사람과 다른 사람을 구별하게 해주는 것이고, 매끄러움에 최적화된 모델이 정확히 깎아내는 것들이다.

여기에는 진화적 논증도 숨어 있다. 인간은 정체성과 감정을 읽기 위해 얼굴을 읽도록 설계되어 있고, 사람들을 구별하기 위해 작은 차이에 의존한다. 구별되는 표식이 없는 표준화된 얼굴은 언캐니 밸리와 같은 경보를 울린다. 얼굴로 인식될 만큼 인간에 가깝지만, 뭔가 잘못됐다고 느껴질 만큼 다르다. 그 혐오는 속물근성이 아니다. 거의 인간처럼 보이지만 완전히는 아닌 것에 대한 지각적 반응이다.
같은 역학이 모델이 정체성 자체를 다루는 방식에서도 나타난다. AI '배우'는 자율신경계를 가진 사람이 아니라 표정 분포에 대한 통계적 적합이다. 진짜 얼굴은 생리와 상황 때문에 움직인다. 피곤한 사람의 눈썹은 특정한 방식으로 풀리고, 진심으로 즐거운 사람은 눈가가 접힌다. 모델은 이런 것을 근사할 수 있지만 그것을 스스로 만들어낼 수는 없고, 그 차이는 시청자가 이름 붙일 수 없어도 감지하는 미묘한 평면성으로 드러난다. 그것은 연기와 렌더링의 차이다.
동질화가 얼마나 진행됐는지 보여주는 구체적인 데이터 지점이 있다. 보도에 따르면 수만 개의 숏드라마 클립을 담은 학습 자료 묶음이, 허가 없이 긁어모은 것으로 추정되며, 1달러 미만에 팔린다. 학습 데이터가 그렇게 협소하고 그렇게 광범위하게 재사용되면, 그것이 만들어내는 얼굴은 수렴할 수밖에 없다. 그 똑같음은 취향의 우연이 아니다. 저렴한 물량에 최적화된 공급망의 하류 결과다.
이것은 단지 미학적 불평이 아니다. 상업적 문제가 되고 있다. 모든 쇼가 같은 쇼처럼 보이면 아무것도 기억에 남지 않고, 새로움에 기대어 사는 카테고리는 똑같음 위에서 죽는다. 중국 규제 당국은 이미 캐릭터 개성을 자체 점수 항목으로 삼는 품질 표준을 초안하고 있는데, 이는 업계가 다음 경쟁의 물결이 어디에 있을 것으로 보는지에 대한 명확한 신호다. 자기 캐릭터들을 구별하지 못하는 카테고리는 왜 누구든 계속 봐야 하는지를 알아내지 못한 카테고리다.
이 모든 것 아래에는 숏드라마를 훨씬 뛰어넘어 적용되는 더 깊은 요점이 있다. 생성형 AI는 평균 쪽으로 기운다. 평균이 가장 안전한 선택이고, 가장 안전한 선택이야말로 확률 모델이 내도록 학습된 것이기 때문이다. 인간의 창의성은 특수한 쪽으로 기운다. 특수한 선택만이 눈에 띄기 때문이다. 이 둘 사이의 싸움은 지금 실시간으로, 거대한 규모로, 대부분의 서구 관찰자들이 보고 있지 않은 인터넷의 한 구석에서 벌어지고 있다.
이것이 미학을 넘어 중요한 이유는 더 큰 문화적 질문을 미리 보여주기 때문이다. 가장 저렴하고 가장 쉬운 콘텐츠가 모두 같은 모습, 같은 얼굴, 같은 목소리로 수렴한다면, 인터넷은 하나의 통계적 평균을 스스로에게 비춰주는 거울의 방이 된다. 그 수렴에 맞서는 사람들, 삐뚤어진 코, 사투리, 계획에 없던 멈춤을 고집하는 사람들은 향수를 부르는 게 아니다. 그들은 문화를 가질 만한 것으로 만드는 바로 그 무엇을 지키고 있는 것이다.
더 넓은 AI 슬롭(slop) 문제와의 평행은 정확하다. Deezer는 하루에 7만 5천 곡의 AI 노래가 업로드된다고 보고한다. 미국 신문 감사에서는 새 기사의 9퍼센트가 AI 생성으로 표시되었다. 공통점은 편집 의도 없이 돌린 생성 도구가 유능하지만 서로 바꿔 쓸 수 있는 결과물의 홍수를 만들어낸다는 것이다. AI 얼굴은 음악, 텍스트, 이미지를 동시에 재편하고 있는 현상의 가장 시각적으로 거슬리는 예시일 뿐이다.
해법은 모델을 덜 매끄럽게 만드는 것이 아니다. 모델의 기본값을 완성품으로 취급하는 것을 멈추는 것이다. 캐릭터 개성은 캐스팅 디렉터가 캐스트를 설계하듯이 의도적으로 설계되어야 한다. 도구는 이미 이를 지원한다. 참조 이미지, 키프레임, 특징 고정. 빠진 것은 추가 시간을 쓰려는 의지다. 붐의 경제학은 속도에 보상을 주기 때문이다. 평균적인 얼굴에 저항하는 창작자들이 새로움이 사라진 뒤에도 관객을 남겨둘 사람들이다. 그것이 이 판돈이고, 성숙해지는 모든 매체가 창작자에게 강요하는 같은 판돈이다. 특수해져라, 아니면 평균 속으로 사라져라.
압력이 이미 바뀌고 있다고 생각할 이유가 있다. 물량에 보상함으로써 붐을 키운 플랫폼들이 이제는 차별성에 보상하기 시작하고 있다. 서로 바꿔 쓸 수 있는 얼굴로 가득한 피드는 리텐션 문제이기 때문이다. 품질 표준이 하나의 지렛대이고, 알고리즘이 또 다른 지렛대다. 플랫폼이 똑같음에 보상을 주기를 멈추면 경제학이 뒤집히고, 캐릭터 디자인 근육을 키운 팀들이 승리할 위치에 서게 된다. AI 얼굴은 사라지지 않는다. 사라지는 것은 기본값으로 이길 수 있다는 생각이며, 그것은 정말로 볼 만한 무언가를 만들고 싶어 하는 모든 사람에게 건강한 발전이다.
관련 글
15초 클립에서 5분 영화로: 1인 크리에이터가 스튜디오가 되다
제안은 더 예쁜 클립에서 완성된 작품으로 옮겨갔습니다. AI 비디오의 진짜 시장은 단편 드라마가 아니라 측정 가능한 수익을 내는 이커머스 비디오일 수 있습니다.
AI 슬롭 경제: 하루 75,000곡과 완벽하게 평범한 콘텐츠의 시대
AI는 생산을 거의 무료로 만들었고, 인터넷은 괜찮지만 잊히는 콘텐츠로 가득 찼다. 이제 희소한 자원은 콘텐츠가 존재해야 할 이유다.
중국 AI 드라마 붐: 8개월 만에 43만 편의 숏드라마, 90%는 기계가 제작
불과 2년 전만 해도 거의 존재하지 않았던 카테고리가 이제는 산업 파이프라인이다. AI 비디오는 데모에서 수익화 사업으로 이동했고, 그것은 중국에서 가장 먼저 일어났다.
AI 슬롭에서 네이티브 투명도로: 이미지 생성의 1년, 네 가지 전환
올해 이미지 생성은 성장했습니다. 완성된 그림에서 조합 가능한 에셋으로의 이동은 대부분이 놓친 이정표입니다.