← Retour au blog
AiEnviron 8 min de lecture

Gemini 3.5 Live Translate de Google supprime la pause

Publié le 7 oct. 2026
Gemini 3.5 Live Translate de Google supprime la pause

La traduction en direct a toujours été un exercice à tour de rôle. Vous parlez, le système attend que vous ayez fini, réfléchit, puis relit le résultat. La pause est brève, mais elle change la conversation, car les deux interlocuteurs s'arrêtent pour laisser travailler la machine. Le nouveau Gemini 3.5 Live Translate de Google est conçu pour supprimer cette pause.

Le modèle, annoncé ce mois-ci, est un modèle audio de parole à parole, et non un pipeline de transcription auquel on aurait greffé un synthétiseur. Il écoute en continu et traduit au fil de la parole, décidant instant par instant s'il doit attendre davantage de contexte ou avancer immédiatement pour rester synchronisé. En pratique, il suit le locuteur avec quelques secondes de retard et poursuit sans s'arrêter, si bien que la conversation ne cale pas à chaque phrase.

Google met en avant trois capacités qui le distinguent des systèmes précédents. Il détecte plus de 70 langues de lui-même, sans réglage de langue à configurer au préalable. Il préserve le ton, le rythme et la hauteur de la voix du locuteur, de sorte que la sortie ressemble encore à la personne qui parle plutôt qu'à un présentateur neutre. Et il tient bon face à un audio bruyant et imprévisible, la condition que la plupart des démonstrations de traduction évitent.

Le compromis inscrit dans le modèle

La traduction continue comporte un choix de conception que les systèmes à tour de rôle évitent. Traduire une phrase trop tôt donne une réponse rapide bâtie sur la moitié de l'information, et traduire trop tard brise le sentiment de conversation en direct. Le modèle de Google équilibre les deux instant par instant, pesant si attendre un temps améliorera la sortie face au coût de prendre davantage de retard sur le locuteur. Cette décision est invisible pour l'utilisateur et déterminante pour savoir si le résultat semble utilisable.

La préservation de la hauteur et du débit ajoute un second cas d'usage à celui de la conversation en direct. Si une voix peut passer d'une langue à l'autre sans changer d'identité, un seul enregistrement devient un doublage dans toutes les langues prises en charge : c'est la même promesse que Microsoft a attachée à ses nouveaux modèles vocaux, et la raison pour laquelle les studios de doublage observent ce domaine de près. Réussissez l'accent et le minutage, et la sortie cesse de ressembler à une traduction.

Où il fait son apparition

Le lancement se déploie simultanément sur trois fronts. Les développeurs y ont accès via la Gemini Live API et Google AI Studio, en aperçu public. Les utilisateurs professionnels bénéficient d'un aperçu privé dans Google Meet ce mois-ci. Le grand public le trouve dans l'application Google Traduction sur Android et iOS, partout dans le monde — un public bien plus large que le segment des développeurs, signe que Google traite cela comme un produit et non comme une démo de recherche.

C'est du côté développeurs que se trouve le travail intéressant. Live Translate traite l'audio comme un flux, ce qui permet de l'intégrer à des appels multilingues, des réunions, des cours et des diffusions en direct sans construire la couche de traduction de zéro. Des partenaires d'intégration, dont Agora, Fishjam, LiveKit, Pipecat et Vision Agents, ont déjà mis en place la plomberie média temps réel : le développeur s'occupe donc surtout de l'interface et de la logique produit plutôt que du transport.

Grab teste le modèle sur un problème précis et mesurable. Les conducteurs et les passagers ne partagent souvent pas la même langue, et la transition au point de prise en charge est précisément le moment où les malentendus coûtent cher. Grab traite plus de 10 millions d'appels vocaux par mois : même une petite amélioration sur ces appels vaut la peine d'être recherchée.

Pourquoi le continu l'emporte sur le tour de rôle

La latence n'est qu'une partie de la différence entre traduction à tour de rôle et traduction continue. Les systèmes à tour de rôle ont besoin d'un signal indiquant qu'une phrase est terminée, ce qui est facile dans une démo scénarisée et difficile dans la parole réelle, où les gens s'interrompent, se répètent, coupent la parole et changent de langue en pleine pensée. Un système qui attend une frontière nette soit la manque, soit retarde la réponse. Un système qui génère en continu peut suivre le locuteur à travers tout cela.

Cette conception change aussi la finalité de la sortie. Si la traduction arrive avec quelques secondes de retard et dans la voix du locuteur, vous pouvez la laisser active pendant une réunion et la laisser tourner comme un fond sonore plutôt que de lire des sous-titres. Les sous-titres vous demandent de regarder ; l'audio vous demande d'écouter. Dans les conversations où le contact visuel compte, entendre l'autre dans votre langue pendant qu'il continue de parler est une expérience différente de celle qui consiste à voir le texte défiler sous son visage.

La préservation du ton et de la hauteur de voix fait plus de travail qu'il n'y paraît. Une voix traduite qui conserve la cadence du locuteur d'origine porte une information qu'une voix synthétique plate perd : l'hésitation, l'emphase, la différence entre une plaisanterie et une menace. Une traduction automatique qui efface tout cela peut être techniquement exacte et pourtant se tromper sur l'intention.

Le plancher a bougé deux fois en une semaine

Live Translate est arrivé dans un mois chargé pour la voix. Microsoft a livré trois modèles le 1er octobre, dont MAI-Transcribe-2-Streaming, qui commence à produire du texte en un peu plus de 100 millisecondes et gère 60 langues avec bascule automatique entre elles, et MAI-Voice-2.1, qui parle 23 langues sur 26 locales et conserve une identité vocale unique lorsqu'il change de langue. Sota Labs a publié Saydi, un assistant de réunion couvrant plus de 68 langues qui s'intègre à Google Meet, Zoom et Teams via une extension de navigateur.

Mettez les pièces côte à côte et la forme de la concurrence devient claire. Microsoft vend les oreilles et la bouche comme des éléments séparés que les développeurs assemblent. Google livre un modèle unique qui assure les deux sens de la conversation et le place d'abord devant le grand public. Les deux font baisser la latence du premier son et les deux mettent en avant une voix cohérente d'une langue à l'autre comme fonction phare, car c'est ce qui fait qu'un appel traduit ressemble à un appel.

Ce qui reste difficile

Les chiffres de couverture linguistique sont faciles à publier et difficiles à vérifier. Un modèle qui détecte plus de 70 langues ne les traduit pas toutes aussi bien, et la différence se voit dans le vocabulaire spécialisé, les idiomes et les noms propres. L'histoire de Google Traduction est édifiante à cet égard : le produit est sur le marché depuis deux décennies et traite plus d'un billion de mots par mois, et il peine encore sur un contexte qu'un interprète humain tient pour acquis.

La question plus difficile est celle du consentement et de l'identité. Un modèle qui reproduit votre voix dans une langue que vous ne parlez pas est utile, et c'est aussi un outil pour vous faire dire des choses que vous n'avez pas dites. Microsoft encadre le clonage vocal par des vérifications d'approbation et de consentement. Google n'a pas publié de détail équivalent pour Live Translate, et l'aperçu privé dans Meet suggère que l'entreprise cherche encore où placer la limite.

Il y a aussi la question de ce qu'il advient de l'audio. Une couche de traduction en direct installée au cœur d'une réunion voit tout ce qui se dit, ce qui transforme un outil en archive. Combien de temps cet audio est conservé, qui peut l'interroger et s'il sert à entraîner quoi que ce soit en aval : voilà les questions que les acheteurs en entreprise posent avant de l'activer.

Rien de tout cela n'arrête le basculement. Une traduction qui tourne en continu, dans la voix du locuteur, sur un téléphone déjà dans votre poche, fait passer la fonctionnalité du statut de chose que l'on ouvre séparément à celui de chose simplement active. La pause était le dernier signe évident qu'une machine se trouvait dans la pièce. Google vient de la rendre facultative.

Articles associés