L'IA a enfin appris à orthographier : pourquoi la percée du rendu du texte compte

Pendant la majeure partie de l'ère des images par IA, il existait un moyen fiable de repérer une image générée. Regardez le texte dans le cadre. Un panneau de rue indiquait « PHARNACY ». Une devanture de magasin affichait « CLSOED ». Une couverture de magazine était couverte de lettres qui ressemblaient à de l'anglais de loin et se dissolvaient en charabia de près.
Cette époque touche à sa fin. Au cours de l'année 2026, les grands modèles d'images ont corrigé le rendu du texte, et la réaction de la communauté a été plus forte que n'importe quel résultat de benchmark.
Ce qui a changé
Le texte dans les images est difficile pour une raison précise. Un modèle de diffusion ne « sait » pas ce que signifient les lettres. Il apprend des motifs visuels, et un mot n'est qu'un motif de traits. Pendant longtemps, les modèles ont pu approximer la forme d'un mot sans comprendre la séquence des caractères, d'où un charabia à l'apparence convaincante.
Les nouveaux modèles abordent cela différemment. GPT Image 2, Nano Banana Pro de Google et les nouveaux modèles open source traitent tous le texte comme quelque chose à raisonner, et non à simplement approximer. Résultat : un modèle peut désormais rendre un titre, une étiquette, un panneau ou une capture d'écran complète d'interface utilisateur avec les lettres dans le bon ordre et l'orthographe correcte.
L'amélioration est apparue rapidement. Lorsque @PlayingGodAGI a publié deux images de test en 2026, la communauté a fortement réagi. L'une était un diagramme anatomique où chaque muscle, os et nerf était étiqueté avec précision, conforme au manuel. L'autre était une capture d'écran de la page d'accueil de YouTube où les éléments d'interface, les vignettes vidéo et le texte du titre s'affichaient sans distorsion. Son résumé : « Cela élimine le dernier défaut des images générées par l'IA. »

Ce que cela débloque
Les conséquences pratiques vont bien au-delà de « les images sont simplement plus belles maintenant ».
La première, c'est la signalétique et l'image de marque. Un modèle qui orthographie correctement peut produire une maquette de devanture, une étiquette de produit ou une image marketing comportant le nom de la marque. Avant, il fallait qu'un designer corrige le texte à la main. Désormais, cela fait partie de la génération.
La deuxième, c'est la conception d'interfaces. Rendre une interface utilisateur crédible, avec des libellés et une mise en page corrects, est une capacité réellement utile pour le prototypage. Le test de la capture d'écran YouTube est important car il montre qu'un modèle peut reconstruire une interface réelle, riche en texte, sans la déformer.
La troisième, c'est le travail multilingue. Lorsque le blogueur japonais @masahirochaen a testé GPT Image 2 sur du texte japonais et a constaté que les kana et les kanji étaient rendus correctement, cela a changé le sens de « rendu du texte ». Il ne s'agit pas seulement d'orthographe anglaise. C'est de la composition typographique multilingue, ce qui ouvre des marchés où les modèles précédents étaient essentiellement inutiles.
Reddit a remarqué spécifiquement le point multilingue. Un commentateur a fait remarquer que « les kanji et les katakana sont tous deux valides », une phrase qui aurait été absurde il y a deux ans.
Comment les modèles y sont parvenus
La raison pour laquelle le texte était difficile mérite d'être comprise, car elle explique pourquoi la correction s'est produite d'un seul coup.
Un modèle de diffusion génère des pixels à partir de bruit, guidé par une invite textuelle. Pendant longtemps, il n'avait pas de véritable représentation des « lettres » en tant qu'unités discrètes. Il apprenait que certains motifs de traits ressemblent à des mots, et il reproduisait la forme sans suivre la séquence. C'est pourquoi l'ancien texte d'IA semblait correct de loin et faux de près.
Le changement est venu de deux directions. Les modèles ont appris à traiter le texte comme un concept à part entière plutôt que comme une simple texture, et ils ont été entraînés sur beaucoup plus d'exemples de texte réel en contexte. Panneaux, étiquettes, captures d'écran, couvertures de livres. Une fois que les données d'entraînement ont inclus suffisamment de vrais exemples, les modèles ont cessé de deviner et ont commencé à orthographier.
Le résultat n'est pas une percée unique, mais un seuil franchi. Le texte est passé de « non résolu » à « en grande partie résolu » en environ un an, et la communauté a remarqué exactement quand cela s'est produit.
Le problème de la détection devient plus difficile
Il y a un revers qui ne reçoit pas assez d'attention. La percée du texte rend les images d'IA plus difficiles à identifier, et cela a de vraies conséquences.
Pendant des années, le moyen le plus simple de repérer un faux était de lire le texte qu'il contenait. Un document falsifié, une capture d'écran truquée, une étiquette de produit fabriquée : les lettres les trahissaient. Ce raccourci a maintenant disparu pour les modèles de pointe, ce qui signifie que la détection doit se déplacer vers des signaux plus subtils, des incohérences d'éclairage, des impossibilités physiques, ou les métadonnées et le filigrane intégrés par les plateformes.
Les modèles eux-mêmes échouent encore sur la logique physique. Le reflet d'un Rubik's Cube, la trajectoire balistique d'un canon à TNT, une carte qui ne se précise pas quand on zoome. Ce sont les nouveaux indices, et ils sont plus difficiles à repérer pour un observateur occasionnel qu'un mot mal orthographié.
C'est aussi pourquoi le filigrane et la provenance comptent plus que jamais. Si vous ne pouvez pas repérer une image générée en la lisant, vous avez besoin que la plateforme vous dise qu'elle est générée. SynthID de Google et des systèmes similaires sont le filet de sécurité, et la percée du texte les rend plus importants, pas moins.
Ce qui n'est pas encore résolu
Quelques mises en garde honnêtes.
Le texte court est presque résolu, mais le texte dense reste la frontière. Lors d'un test de septembre 2026, les huit modèles de pointe ont correctement orthographié une étiquette de produit de deux mots et un titre promotionnel. Les différences portent désormais sur la mise en page et les longues chaînes. Un menu ou une infographie contenant un paragraphe de texte est encore là où les erreurs apparaissent, et le conseil de relire chaque élément public reste valable.
Midjourney, notamment, reste faible sur les longues chaînes de texte. Un mot unique stylisé, ça va. Un titre de plusieurs mots commence à se dégrader. Si votre travail est fortement typographique, Midjourney n'est pas l'outil adapté.
Et il y a un problème de second ordre dont on commence à parler : un texte trop bien rendu. Un modèle capable de rendre une interface utilisateur réaliste ou un graphique d'actualité convaincant facilite aussi la fabrication de quelque chose qui semble faire autorité. La percée du texte est une arme à double tranchant, et elle atterrit au milieu d'un débat en cours sur la détection, le filigrane et la provenance.
L'essentiel
Le raccourci « l'IA ne sait pas faire les mains, l'IA ne sait pas faire le texte » est mort. Les mains ont été corrigées en premier. Le texte était le problème le plus difficile, et il est désormais en grande partie résolu pour les cas courants qui embarrassaient les gens.
Cela ne signifie pas que chaque image générée est digne de confiance. Cela signifie que les indices se sont déplacés vers quelque chose de plus subtil, et que les personnes qui comptaient sur « regardez l'orthographe » comme astuce de détection ont besoin d'une nouvelle méthode. Pour tous les autres, cela signifie simplement que les images se sont améliorées et qu'une grande partie du travail manuel de nettoyage a discrètement disparu.
Articles associés
La pile open-source d'images IA se reconstruit, un workflow à la fois
Workflow1111 recrée AUTOMATIC1111 avec 73 nœuds et 11 pipelines. Ce que la reconstruction par la communauté signifie pour la génération d'images locale.
Les chiffres derrière la génération d'images par IA : une chute de prix de 99 % a dévoré la photographie de stock
Taille du marché, disruption de la photo de stock, chiffres d'adoption et flux de travail hybride, expliqués par les statistiques.
La prochaine frontière de l'IA : transformer une seule image fixe en scène animée
Comment le problème de la physique a été résolu, les arrivées open source et quels outils image-vers-vidéo sont réellement utilisables aujourd'hui.
Comment choisir les outils chinois de génération d'images par IA en septembre 2026 : comparatif Jimeng, Tongyi Wanxiang,
Comparatif détaillé de Jimeng, Tongyi Wanxiang, Kling, Doubao et LiblibAI : qualité d'image, compréhension du chinois, droits commerciaux et quotas gratuits, pour choisir l'outil adapté à vos besoins.