EmbeddingGemma 2 met la recherche de photos, d'audio et de vidéo sur votre téléphone

Le 6 octobre, Google DeepMind a publié EmbeddingGemma 2, un modèle de 740 millions de paramètres qui prend du texte, du code, des images, de l'audio et de la vidéo et les place tous dans un même espace mathématique partagé. Le chiffre qui compte n'est pas la taille. C'est qu'un modèle aussi petit puisse tourner sur un téléphone, ce qui signifie que la recherche dans vos propres médias peut se faire sans que rien ne quitte l'appareil.
Les embeddings sont la mécanique discrète derrière beaucoup de choses que les gens utilisent au quotidien. Un modèle d'embedding transforme un contenu en une liste de nombres, agencés de sorte que les éléments similaires se retrouvent proches les uns des autres. C'est ainsi qu'un moteur de recherche sait que « comment réparer un robinet qui fuit » et « réparer un robinet qui goutte » parlent du même sujet. C'est aussi ainsi que les systèmes de recommandation décident quoi vous montrer ensuite. Jusqu'à présent, bien faire cela à travers images, audio et vidéo impliquait généralement d'envoyer les données à un serveur et de payer l'aller-retour.
Un seul espace pour tout
Ce qui rend EmbeddingGemma 2 intéressant, c'est le mot « partagé ». Beaucoup de modèles gèrent bien une seule modalité : le texte ici, les images là. Un espace partagé signifie qu'un seul modèle peut comparer une phrase à une photo, une photo à un extrait audio, ou une image vidéo à une description écrite. L'exemple pratique que Google propose est de trouver un clip vidéo précis en effectuant une recherche avec une note vocale. Vous décrivez ce dont vous vous souvenez, en audio, et le système trouve la séquence correspondante.
Ce type de recherche intermodale existe dans les services cloud depuis un certain temps. Ce qui est nouveau, c'est la taille. Avec 740 millions de paramètres, le modèle est assez petit pour un téléphone, ce qui inverse l'équation de la confidentialité. Si la recherche s'exécute localement, vos photos, votre audio et votre vidéo ne quittent jamais l'appareil. Pour quiconque a hésité à téléverser des médias personnels vers un service cloud juste pour les rendre interrogeables, cela change le calcul.

Pourquoi l'exécution sur l'appareil continue de gagner de petites batailles
Il y a ici un schéma qui dépasse un seul modèle. Au cours de l'année écoulée, un flux constant de petits modèles capables a déplacé des tâches qui nécessitaient autrefois un centre de données vers des appareils que les gens possèdent déjà. La gamme Gemma de Google elle-même a poussé dans cette direction, et d'autres laboratoires ont suivi avec de petits modèles ajustés pour des tâches spécifiques. L'attrait ne réside pas seulement dans la confidentialité. C'est la latence, la disponibilité hors ligne et le coût. Une recherche qui s'exécute sur le téléphone répond instantanément et fonctionne dans un avion.
Ce changement modifie aussi qui peut construire. Quand une capacité vit dans le cloud, un développeur a besoin d'un compte, d'un budget et d'un réseau pour l'utiliser. Quand elle s'exécute sur l'appareil, un développeur a besoin d'un fichier de modèle et d'un peu d'ingéniosité. Certains types de produits deviennent possibles qui étaient auparavant malcommodes : un organisateur de photos personnel qui ne communique jamais avec l'extérieur, un outil de terrain qui fonctionne sans signal, une application de prise de notes qui indexe localement votre audio et vos images. Aucun de ces produits n'est tape-à-l'œil, et chacun dépend de la même avancée discrète : un modèle assez petit pour un téléphone est désormais assez bon pour qu'on lui fasse confiance pour du vrai travail.
Pour les développeurs, cela ouvre une porte précise : la génération augmentée par récupération qui ne quitte jamais la machine. Le RAG, la technique qui consiste à faire répondre un modèle à des questions à partir de vos propres documents, dépend normalement d'un modèle d'embedding pour trouver d'abord les passages pertinents. Si cette étape d'embedding peut s'exécuter localement, alors un assistant local peut répondre à des questions sur vos fichiers et vos médias sans appel réseau. Pour les secteurs réglementés, ou pour quiconque manipule des données sensibles, c'est la différence entre un outil autorisé et un outil qui ne l'est pas.
Le compromis que personne ne devrait ignorer
Un petit modèle n'est pas un grand modèle, et l'écart se voit sur la précision dans les cas difficiles. Un modèle d'embedding hébergé avec bien plus de paramètres donnera généralement de meilleurs résultats de récupération, en particulier sur des contenus désordonnés, ambigus ou inhabituels. Si votre application dépend de l'obtention du meilleur résultat presque à chaque fois, un modèle de 740 millions de paramètres fonctionnant sur un téléphone peut ne pas suffire, et vous devriez le tester sur vos données réelles avant de vous engager.
La deuxième limite est ce que le modèle ne fait pas. EmbeddingGemma 2 est un outil de recherche et d'organisation, pas un générateur. Il ne peut pas créer une image ou une vidéo. Il peut vous aider à trouver celles que vous avez déjà. Cette distinction compte alors que l'attention du secteur est fixée sur la génération, car la couche ingrate de recherche et de récupération est souvent ce qui rend une fonctionnalité générative utilisable en premier lieu.
Il y a aussi des contraintes pratiques. Indexer une grande bibliothèque personnelle demande du stockage et de l'énergie, et les téléphones ne sont infinis ni sur l'un ni sur l'autre. Un modèle de 740 M est petit pour un modèle d'IA et grand pour une application mobile, donc les développeurs devront réfléchir à quand il s'exécute et à la quantité de contenu qu'il indexe. Aucune de ces contraintes n'est rédhibitoire. Ce sont les détails qui décident si une fonctionnalité semble instantanée ou ressemble à une dévoration de batterie.
Le multilinguisme mérite aussi une mention. Un espace partagé qui couvre de nombreuses langues et de nombreux types de médias est d'autant plus précieux que votre bibliothèque est variée. Quelqu'un qui a des photos de trois pays, des notes vocales dans deux langues et des documents dans une troisième bénéficie bien plus de la recherche intermodale que quelqu'un avec une collection bien rangée et monolingue. Pour un produit mondial, c'est tout l'intérêt. Pour un individu, c'est la différence entre une fonctionnalité qui marche sur votre dossier le mieux organisé et une qui marche sur la réalité désordonnée de la façon dont les gens enregistrent réellement les choses.
Ce que cela dit de la route à venir
La façon la plus utile de lire cette publication est d'y voir un marqueur de la direction que prend l'IA multimodale. La génération fait les gros titres, mais les modèles qui façonneront l'expérience quotidienne sont souvent les plus petits, ceux qui organisent, récupèrent et connectent. Un modèle qui vous permet de rechercher vos propres photos, audio et vidéos en décrivant ce dont vous vous souvenez, sans rien téléverser, est une capacité d'apparence modeste à la portée étendue.
Il comble aussi un vide que la génération seule ne peut pas combler. Une fonctionnalité générative n'est qu'une moitié de produit ; l'autre moitié consiste à trouver la chose que l'on veut modifier. Quiconque a fait défiler des milliers de photos pour en trouver une a ressenti ce vide. Un espace d'embedding partagé transforme une recherche impossible en une phrase : décrivez-la, et les éléments correspondants remontent. C'est une petite commodité sur le papier et une grande en pratique, car c'est la différence entre posséder une bibliothèque et pouvoir l'utiliser.
Si la tendance se maintient, l'année prochaine ramènera davantage de tâches sur l'appareil. Chacune déplace un peu plus de ce qui nécessite actuellement un serveur vers quelque chose qui fonctionne hors ligne, dans votre main, selon vos conditions. EmbeddingGemma 2 est un pas dans cette direction, et un pas discret. Les pas discrets sont souvent ceux qui durent.
Articles associés
Le protocole PACT de Decagon veut faire du consentement un standard
Decagon a ouvert un protocole pour verifier l'identite d'un agent personnel et les permissions qu'un client lui a accordees. C'est de la plomberie, et elle decide si l'economie des agents fonctionne.
La vague des retrouvailles par IA : un debat que la Chine n'arrive pas a trancher
Des films hommage par IA ont ramene des figures disparues sur les ecrans chinois et recolte des centaines de milliers de likes. Puis la controverse est arrivee, et elle portait sur le consentement.
Apple a publie un modele multimodal ouvert et n'en a presque rien dit
Cette sortie axee sur la recherche a glisse sous les radars grand public, mais son ancrage visuel tres fin dit beaucoup de la direction de la pile IA d'Apple.
OpenCut et le moment du CapCut open source
Un editeur video gratuit sous licence MIT grimpe sans cesse dans les tendances GitHub, et sa feuille de route inclut un serveur MCP pour agents IA. Les outils autour des medias IA rattrapent les modeles.