EmbeddingGemma 2, 사진·오디오·비디오 검색을 스마트폰으로 가져오다

10월 6일, Google DeepMind는 EmbeddingGemma 2를 공개했습니다. 7억 4천만 개의 파라미터를 가진 이 모델은 텍스트, 코드, 이미지, 오디오, 비디오를 모두 하나의 공유된 수학적 공간에 배치합니다. 중요한 숫자는 크기가 아닙니다. 이 정도로 작은 모델이 스마트폰에서 실행될 수 있다는 점이며, 이는 자신의 미디어에 대한 검색이 기기 밖으로 아무것도 나가지 않고도 이루어질 수 있음을 의미합니다.
임베딩은 사람들이 매일 사용하는 많은 것들 뒤에 있는 조용한 기계 장치입니다. 임베딩 모델은 콘텐츠 조각을 숫자 목록으로 바꾸는데, 비슷한 것들이 서로 가까이 위치하도록 배열합니다. 검색 엔진이 "how do I fix a leaky faucet"과 "repair a dripping tap"이 같은 주제라는 것을 아는 방식입니다. 추천 시스템이 다음에 무엇을 보여줄지 결정하는 방식이기도 합니다. 지금까지 이미지, 오디오, 비디오 전반에서 이를 잘 수행하려면 보통 데이터를 서버로 보내고 왕복 비용을 지불해야 했습니다.
모든 것을 위한 하나의 공간
EmbeddingGemma 2를 흥미롭게 만드는 것은 '공유된'이라는 단어입니다. 많은 모델이 하나의 모달리티를 잘 처리합니다: 여기서는 텍스트, 저기서는 이미지. 공유 공간이란 하나의 모델이 문장을 사진과, 사진을 오디오 조각과, 비디오 프레임을 글로 된 설명과 비교할 수 있다는 뜻입니다. Google이 제시한 실제 예시는 음성 메모로 검색해 특정 비디오 클립을 찾는 것입니다. 기억나는 것을 오디오로 설명하면 시스템이 일치하는 영상을 찾아냅니다.
이런 종류의 교차 모달 검색은 클라우드 서비스에서 이미 한동안 존재해 왔습니다. 새로운 것은 크기입니다. 7억 4천만 파라미터에서 이 모델은 스마트폰에 들어갈 만큼 작고, 이는 프라이버시 방정식을 뒤집습니다. 검색이 로컬에서 실행되면 사진, 오디오, 비디오는 기기를 떠나지 않습니다. 검색 가능하게 만들기 위해 개인 미디어를 클라우드 서비스에 업로드하는 것을 망설였던 사람이라면, 이는 계산을 바꿔놓습니다.

온디바이스가 계속 작은 전투에서 이기는 이유
여기에는 하나의 모델을 넘어서는 패턴이 있습니다. 지난 한 해 동안, 작고 유능한 모델들이 꾸준히 등장하면서 예전에는 데이터 센터가 필요했던 작업들을 사람들이 이미 소유한 기기로 옮겨왔습니다. Google 자체의 Gemma 라인도 이 방향으로 나아갔고, 다른 연구소들도 특정 작업에 맞춘 소형 모델로 뒤를 따랐습니다. 매력은 프라이버시만이 아닙니다. 지연 시간, 오프라인 가용성, 비용입니다. 스마트폰에서 실행되는 검색은 즉시 답하고 비행기에서도 작동합니다.
이 변화는 누가 만들 수 있는지도 바꿉니다. 기능이 클라우드에 있으면 개발자는 계정, 예산, 네트워크가 필요합니다. 기기에서 실행되면 개발자는 모델 파일과 약간의 재치만 있으면 됩니다. 이전에는 어색했던 특정 종류의 제품이 가능해집니다: 외부로 데이터를 보내지 않는 개인 사진 정리 앱, 신호 없이 작동하는 현장 도구, 오디오와 이미지를 로컬에서 색인하는 메모 앱. 어느 것도 화려하지 않으며, 각각은 같은 조용한 진전에 의존합니다. 즉, 스마트폰에 들어갈 만큼 작은 모델이 이제 실제 작업에 신뢰할 수 있을 만큼 좋아졌다는 것입니다.
개발자에게 이것은 특정한 문을 엽니다: 절대 기기를 떠나지 않는 검색 증강 생성(RAG). 자신의 문서를 사용해 모델이 질문에 답하게 하는 기법인 RAG는 보통 관련 구절을 먼저 찾기 위해 임베딩 모델에 의존합니다. 그 임베딩 단계가 로컬에서 실행될 수 있다면, 로컬 어시스턴트는 네트워크 호출 없이 파일과 미디어에 관한 질문에 답할 수 있습니다. 규제 산업이나 민감한 자료를 다루는 사람에게 이는 허용되는 도구와 그렇지 않은 도구의 차이입니다.
아무도 무시해서는 안 되는 트레이드오프
작은 모델은 큰 모델이 아니며, 그 격차는 어려운 사례의 정확도에서 드러납니다. 훨씬 더 많은 파라미터를 가진 호스팅 임베딩 모델은 일반적으로 더 나은 결과를 검색합니다. 특히 지저분하고 모호하거나 특이한 콘텐츠에서 그렇습니다. 애플리케이션이 거의 항상 최상위 결과를 정확히 얻는 데 의존한다면, 스마트폰에서 실행되는 7억 4천만 파라미터 모델로는 충분하지 않을 수 있으며, 실제 데이터로 테스트한 후 결정해야 합니다.
두 번째 한계는 모델이 하지 않는 일입니다. EmbeddingGemma 2는 검색 및 정리 도구이지 생성기가 아닙니다. 이미지나 비디오를 만들 수 없습니다. 이미 가지고 있는 것을 찾도록 도와줄 뿐입니다. 업계의 관심이 생성에 고정되어 있을 때 이 구분은 중요합니다. 왜냐하면 화려하지 않은 검색 및 검색 계층이 종종 생성 기능을 애초에 쓸 만하게 만드는 요소이기 때문입니다.
실용적인 제약도 있습니다. 큰 개인 라이브러리를 색인하는 데는 저장 공간과 에너지가 들고, 스마트폰은 둘 다 무한하지 않습니다. 7억 4천만 파라미터 모델은 AI 모델로서는 작지만 스마트폰 앱으로서는 큽니다. 따라서 개발자는 언제 실행할지, 얼마나 색인할지 신중하게 고려해야 합니다. 어느 것도 치명적인 문제는 아닙니다. 기능이 즉각적으로 느껴지는지, 배터리 소모처럼 느껴지는지를 결정하는 세부 사항입니다.
다국어 지원도 눈여겨볼 만합니다. 여러 언어와 여러 미디어 유형을 아우르는 공유 공간은 라이브러리가 다양할수록 더 가치가 있습니다. 세 나라에서 찍은 사진, 두 언어로 된 음성 메모, 세 번째 언어로 된 문서를 가진 사람은 정돈된 단일 언어 컬렉션을 가진 사람보다 교차 모달 검색에서 훨씬 더 많은 이점을 얻습니다. 글로벌 제품에게는 그것이 핵심입니다. 개인에게는 가장 잘 정리된 폴더에서 작동하는 기능과 사람들이 실제로 물건을 저장하는 지저분한 현실에서 작동하는 기능의 차이입니다.
이것이 앞으로의 길에 대해 말하는 것
이번 릴리스를 읽는 가장 유용한 방법은 멀티모달 AI가 어디로 향하는지를 보여주는 표지로 보는 것입니다. 생성이 헤드라인을 차지하지만, 일상 경험을 형성할 모델은 종종 정리하고 검색하고 연결하는 더 작은 모델입니다. 기억나는 것을 설명해 자신의 사진, 오디오, 비디오를 검색할 수 있게 하면서 아무것도 업로드하지 않는 모델은 소박하게 들리는 능력이지만 폭넓은 영향력을 지닙니다.
또한 생성만으로는 채울 수 없는 공백을 메웁니다. 생성 기능은 제품의 절반에 불과합니다. 나머지 절반은 바꾸고 싶은 것을 찾는 것입니다. 수천 장의 사진을 스크롤하며 하나를 찾아본 사람이라면 그 공백을 느껴봤을 것입니다. 공유 임베딩 공간은 불가능한 검색을 한 문장으로 바꿉니다: 설명하면 일치하는 항목이 나타납니다. 이는 종이 위에서는 작은 편의이고 실제로는 큰 편의입니다. 라이브러리를 소유하는 것과 그것을 사용할 수 있는 것의 차이이기 때문입니다.
이 패턴이 유지된다면, 내년에는 더 많은 작업이 기기로 돌아올 것입니다. 각 작업은 현재 서버가 필요한 것들을 오프라인에서, 손 안에서, 자신의 조건으로 작동하는 것으로 조금씩 옮깁니다. EmbeddingGemma 2는 그 방향으로의 한 걸음이며 조용한 걸음입니다. 조용한 것들이 종종 오래 남습니다.
관련 글
Decagon의 PACT 프로토콜, '동의'를 표준으로 만들려 한다
Decagon은 개인 에이전트의 신원과 고객이 부여한 권한을 검증하는 프로토콜을 오픈소스로 공개했다. 지루한 배관이지만, 에이전트 경제가 작동할지를 결정한다.
AI '재회' 물결: 중국이 아직 어떻게 느껴야 할지 정하지 못한 논쟁
AI 추모 영상이 세상을 떠난 공인을 중국의 화면으로 데려와 수십만 개의 좋아요를 모았다. 그리고 반발이 왔다. 쟁점은 '동의'였다.
애플이 오픈 멀티모달 모델을 공개했지만 거의 아무에게도 알리지 않았다
연구 우선의 이번 릴리스는 주류 시야를 조용히 지나갔다. 그러나 세밀한 시각 그라운딩은 애플의 AI 스택이 어디로 가는지 말해 준다.
OpenCut과 '오픈소스 CapCut'의 순간
무료 MIT 라이선스 영상 편집기가 GitHub 트렌드를 계속 오르고, 로드맵에는 AI 에이전트용 MCP 서버가 들어 있다. AI 미디어를 둘러싼 도구가 모델을 따라잡고 있다.