L'URL canonique est la version d'une page que vous désignez comme la bonne adresse, quand la même page est joignable par plusieurs chemins. Vous la déclarez dans le <head>, le moteur regroupe les variantes, il indexe celle que vous avez choisie. Le mécanisme est stable depuis 2012 et il fonctionne.

Il fonctionne sur l'index. La question que personne ne pose, c'est de savoir quelle adresse sort de l'autre côté, quand un moteur génératif vous cite.

Le 13 septembre 2026, j'ai posé deux questions à ChatGPT, Perplexity et Gemini, recherche web activée, et relevé chaque URL qu'ils citaient. Puis j'ai visité ces URL une par une et lu la balise rel="canonical" que la page déclare. ChatGPT a cité 11 adresses ; sur les neuf dont j'ai pu lire la balise, aucune n'était la forme canonique déclarée par la page. Perplexity en a servi 28 sur 36 à l'identique. Gemini n'a produit aucune URL du tout.

Ce que la SERP « url canonique » raconte, et de quand elle date

Relevé du 13 septembre 2026 sur Google France, requête « url canonique », 260 recherches par mois, concurrence faible, difficulté 6. Les termes voisins portent le total du champ autour de 660 recherches mensuelles : « url canonical » 140, « balise canonique » 110, « balise canonical » 70, « canonical seo » 50, « rel canonical » 30.

Neuf résultats organiques. Deux pages de documentation Google, une fiche Wikipédia, et six contenus d'agences ou d'éditeurs : seo.fr, Let's Clic, Adimeo, le Blog du Modérateur, Foxglove, IONOS. Trois d'entre eux datent de 2024. Les six autres sont plus récents, et aucun ne traite du versant génératif : ils expliquent la syntaxe, les cas d'usage, les pièges classiques. Le Blog du Modérateur est le seul à sortir de la définition, avec un angle sur les canoniques que Google ignore, ce qui reste une question d'index.

Un détail vaut d'être relevé. Cette SERP est surmontée d'un AI Overview, et les questions associées commencent par « C'est quoi canonical ? ». Le moteur qui répond en haut de page est précisément celui dont le comportement de citation n'est documenté nulle part dans les neuf pages en dessous.

Ce que dit la norme, et ce dont elle parle

La balise canonique n'est pas une invention de Google au sens strict, c'est une RFC. La RFC 6596, « The Canonical Link Relation », publiée en avril 2012, catégorie Informational, signée M. Ohye et J. Kupke, deux ingénieurs de Google.

Elle est courte : 1 687 mots. J'y ai compté les termes qui décrivent son périmètre. Le mot « crawl » y apparaît 0 fois. Le mot « index » y apparaît 2 fois. L'expression « search engine » y apparaît 3 fois, et sa formulation mérite d'être citée exactement, parce qu'elle est plus permissive qu'on ne le croit : la norme parle d'« applications such as search engines », les moteurs de recherche comme exemple d'application, pas comme destinataire exclusif.

Ce que ces applications sont censées faire de la déclaration est écrit noir sur blanc : « Index content only from the target IRI ». Indexer. L'effet visé par la norme est un effet d'indexation, et l'indexation est une opération qui consiste à choisir une adresse à retenir dans un catalogue.

Un moteur génératif qui vous cite ne fait pas cela. Il récupère un document, en extrait un passage, et affiche une référence. Rien dans la chaîne ne suppose qu'il choisisse une adresse de préférence à une autre, puisqu'il n'entretient pas de catalogue d'adresses uniques à la sortie.

Ce que la documentation de Google ajoute, et ce qu'elle n'ajoute pas

Google consacre deux pages à la question : celle qui explique le choix de l'URL canonique, et celle qui explique comment la déclarer. Je les ai récupérées, débarrassées des scripts et des balises, et comptées.

Le mot « canonical » y apparaît 52 fois sur la première, 114 fois sur la seconde. Le sujet est donc traité en profondeur. Les mentions du versant génératif, elles, demandent une précaution : le comptage brut trouve 6 occurrences de « generative » et 9 de « AI » sur chaque page, ce qui laisserait croire à un traitement du sujet.

En affichant le contexte de chacune, il n'en reste rien. Les six « generative » sont des entrées du menu latéral, du type « Optimizing for generative AI search » ou « Generative AI fundamentals », et le neuvième « AI » est un lien de pied de page vers Google AI. Zéro occurrence dans le corps des deux pages. « AI Overview » n'y figure pas une seule fois, « chatbot » non plus.

C'est le piège de comptage que j'ai appris à mes dépens sur ce blog : un grep brut sur une page de documentation compte la navigation du site autant que le texte. La règle vaut aussi en sens inverse, et je l'applique ici. Le fait que Google ne relie pas ses pages canoniques à ses surfaces génératives n'établit pas que la canonicalisation soit sans effet sur ces surfaces. Cela établit que Google ne l'annonce pas.

Ce que les éditeurs de moteurs génératifs n'écrivent pas

Même méthode sur la documentation technique des trois éditeurs, celle qui décrit leurs robots et leur façon de récupérer les pages.

Document Longueur du texte « canonical » « crawl »
OpenAI, page Bots 94 771 caractères 0 11
Anthropic, robots et crawlers 57 225 caractères 0 2
Perplexity, documentation des robots 349 626 caractères 0 dans le corps 65

Les deux occurrences de « canonical » trouvées chez Perplexity sont des métadonnées de sa propre page, pas du texte de documentation. Le témoin « crawl » montre que ces documents parlent bien de récupération de pages, et abondamment : ils décrivent leurs agents, leurs plages d'adresses IP, leur respect du robots.txt. Aucun des trois ne prend d'engagement, ni même ne mentionne l'existence d'une balise dont le métier est de désigner l'adresse à retenir.

L'ironie mérite une ligne. En récupérant cette page de documentation, je suis tombé sur un cas d'école : docs.perplexity.ai/guides/bots répond 308 et redirige vers docs.perplexity.ai/docs/resources/perplexity-crawlers. L'adresse par laquelle j'y accédais n'était pas la bonne, elle survit par une redirection. Nous y reviendrons, c'est exactement le motif que j'ai mesuré ensuite.

L'expérience : 47 citations, deux questions, trois moteurs

Le protocole est volontairement simple, pour qu'il soit rejouable.

Deux questions posées en français, choisies dans deux registres différents pour éviter qu'un effet de sujet n'explique le résultat. La première est définitionnelle : « Qu'est-ce qu'une URL canonique en SEO et comment la déclarer ? ». La seconde est commerciale : « Quels sont les meilleurs outils de suivi de citations dans les moteurs IA en 2026 ? ». Les deux se terminent par « cite tes sources ».

Trois moteurs, recherche web activée : ChatGPT sur gpt-5.4, Perplexity sur sonar, Gemini sur gemini-2.5-flash.

Pour chaque URL citée, deux relevés. Le code HTTP renvoyé sans suivre les redirections, et la valeur de l'attribut href de la balise rel="canonical" déclarée par la page d'arrivée. La règle de comparaison est énoncée avant le comptage : une citation est conforme si la chaîne de caractères citée est identique à la chaîne déclarée en canonique. Une page qui ne déclare aucune canonique est comptée à part, pas comme un écart. Une page qui bloque ma requête est comptée comme non mesurable, pas comme une absence.

Total : 47 citations exploitables, 11 chez ChatGPT et 36 chez Perplexity.

Moteur Citations Comparables Identiques à la canonique Écarts Sans canonique Non mesurable
ChatGPT 11 9 0 9 1 1
Perplexity 36 30 28 2 4 2

Gemini ne figure pas dans ce tableau : n'ayant produit aucune URL, il n'offre rien à comparer. J'y reviens plus bas.

Les trois lignes racontent trois histoires différentes, et il faut les prendre séparément.

ChatGPT réécrit l'adresse avant de la citer

Le résultat est net, et sa cause est mécanique : ChatGPT ajoute ?utm_source=openai à chaque URL qu'il cite. Onze citations sur onze, sur les deux questions, réparties sur huit hôtes différents. Aucune page ne déclare cette forme en canonique, évidemment, puisque le paramètre est fabriqué par le moteur au moment de citer.

Neutralisons ce paramètre pour voir ce qu'il reste. Sept des neuf citations comparables deviennent alors conformes, ce qui est un bon score. Mais deux écarts subsistent, et ils sont plus intéressants que le paramètre publicitaire.

Le premier est un écart d'hôte. ChatGPT cite www.siftly.ai/blog/tools-measure-citation-rates..., et la page déclare en canonique siftly.ai/blog/tools-measure-citation-rates..., sans le www. Les deux répondent 200. C'est le partage www contre domaine nu, la variante la plus ancienne du problème, et elle survit intacte dans une citation de 2026. C'est aussi la même mécanique que celle décrite dans mon article sur le choix entre sous-domaine et sous-répertoire : l'hôte est une unité que les moteurs traitent séparément.

Le second est plus curieux. ChatGPT cite la documentation Google à l'adresse consolidate-duplicate-urls?authuser=2. Le paramètre authuser est le sélecteur de compte Google : il désigne lequel des comptes connectés au navigateur consulte la page, et sa numérotation commence à zéro. La page répond 200 pour un visiteur anonyme et déclare une canonique sans paramètre. Ce paramètre n'avait aucune raison de figurer dans une citation, et il montre par quelle sorte de page la récupération est passée.

Un dernier détail sur ChatGPT, qui résume tout. Dans une même réponse, il cite la même page de documentation Google sous trois formes différentes : avec ?hl=fr, avec ?authuser=2, et sans paramètre. La balise canonique existe précisément pour que ces trois formes n'en fassent qu'une. Elle n'a rien empêché, parce qu'elle ne s'adresse pas à cette couche.

Perplexity cite juste, sauf quand l'adresse a déménagé

Perplexity donne l'URL telle qu'il l'a trouvée, sans y ajouter quoi que ce soit. Vingt-huit citations sur trente-six correspondent exactement à la canonique déclarée, soit 78 %. C'est le moteur le plus fidèle des trois sur ce critère.

Les deux écarts se ressemblent comme deux gouttes d'eau, et ce ne sont pas des écarts de paramètre.

Perplexity cite ahrefs.com/blog/fr/balise-canonique/. Cette adresse répond 301 et redirige vers ahrefs.com/fr/blog/balise-canonique/. Les deux segments ont été inversés lors d'une refonte, et c'est bien la nouvelle adresse que la page déclare en canonique.

Perplexity cite seo.london/fr/canonical-url/. Cette adresse répond 301 et redirige vers seo.london/fr/url-canonique/. Le slug a été traduit, et c'est la version traduite qui est canonique.

Dans les deux cas, le moteur nomme une adresse qui n'est plus l'adresse de la page. Dans les deux cas, le lien fonctionne quand même, uniquement parce que la redirection est toujours en place. C'est la démonstration en direct de ce que j'écrivais sur les redirections 301 le 3 septembre : une redirection a désormais un second métier, rattraper les adresses périmées que les moteurs continuent de produire, et ce métier n'a pas de date de fin. Si Ahrefs avait retiré sa redirection après le délai d'un an que recommande Google, la citation de Perplexity mènerait aujourd'hui à une page 404.

Que ce soit le blog d'Ahrefs qui serve d'exemple n'est pas une pique. C'est le contraire : un éditeur d'outils SEO, sur un article qui explique la balise canonique, cité à une adresse qui n'est plus la sienne. Si cela arrive là, cela arrive partout.

Gemini ne cite pas d'URL

Le troisième cas est d'une autre nature. Gemini n'a produit aucune adresse exploitable.

Ce qu'il affiche comme source, c'est un nom de domaine enregistrable : « google.com », « seo.fr », « ionos.fr », « adimeo.com ». Pas de chemin, pas de page. Et ce que l'API renvoie derrière chacun de ces libellés, ce sont neuf liens vertexaisearch.cloud.google.com/grounding-api-redirect/ suivis d'une chaîne opaque, qui ne répondent pas hors de la session d'API qui les a produits.

La question de la conformité canonique ne se pose donc pas chez Gemini : il n'y a pas d'URL à comparer. Ce n'est pas une bonne nouvelle, c'est une nouvelle différente. Chez ChatGPT votre adresse est citée mais réécrite ; chez Gemini votre adresse n'est pas citée du tout, seul votre domaine l'est, et le lecteur ne peut pas savoir quelle page a été lue.

Ce que ça change pour votre site

Quatre conséquences, de la plus mécanique à la plus stratégique.

Toutes les formes d'URL de vos pages doivent répondre 200, pas seulement la canonique. C'est le renversement pratique de cet article. En SEO, la bonne pratique consiste à concentrer les signaux sur une adresse et à laisser les variantes se faire absorber. Dans la couche de citation, vous ne choisissez pas la forme qui sera servie au lecteur : un paramètre ajouté par le moteur, une majuscule, un www, un ancien slug. Chacune de ces formes est une porte d'entrée réelle, et chacune doit fonctionner.

Ne retirez jamais une redirection. Les deux écarts mesurés chez Perplexity sont des adresses qui ne survivent que par une 301. Le délai d'un an recommandé par Google est calibré sur le recrawl, un processus qui se termine ; la mémoire d'un moteur, elle, ne se recrawle pas.

Le paramètre utm_source=openai est une donnée, pas une nuisance. Puisque ChatGPT signe chacune de ses citations, vos journaux serveur et votre outil d'analyse contiennent déjà la liste exacte des pages qu'il cite et qui reçoivent des visites. C'est le trafic référent généré par les moteurs IA sous sa forme la plus lisible, et il suffit de segmenter dessus. Pensez simplement à vérifier que ce paramètre n'ouvre pas chez vous une variante non suivie de la page.

Surveillez les adresses citées, pas seulement les mentions. Un outil de suivi des citations vous dit si votre marque apparaît. Il faut lire un cran plus bas : quelle URL exactement, sous quelle forme, et cette forme répond-elle encore. Un moteur qui vous cite à une adresse morte vous fait plus de mal qu'un moteur qui ne vous cite pas.

Un mot sur ma propre maison, parce que le contrôle vaut pour tout le monde. En vérifiant les variantes d'URL de ce blog, je constate que la production répond correctement. La version sans barre oblique finale redirige en 308. Le paramètre utm_source est absorbé, et la canonique reste propre. Le domaine nu n'a aucun enregistrement DNS, donc aucun hôte en double de ce côté. Mais l'adresse technique agencegeoparis.pages.dev sert bien le site entier en 200, avec un robots.txt qui autorise explicitement les robots d'IA. Elle déclare correctement la canonique du domaine de production. Et d'après ce que cet article vient de mesurer, cette déclaration ne garantit rien sur la couche de citation. Le correctif n'est pas une balise, c'est de ne pas servir l'hôte en double.

Ce que cet article n'affirme pas

Trois réserves, parce que le sujet se prête aux raccourcis.

Je n'affirme pas que la balise canonique soit inutile, ni même affaiblie. Elle fait ce que la RFC 6596 décrit, sur le périmètre que la RFC décrit, et ce périmètre est l'indexation. Mon article du 14 août sur le contenu dupliqué le concluait à partir des documents ; j'y écrivais qu'aucun éditeur ne prenait d'engagement sur la canonicalisation et que rien ne garantissait donc le contraire. Ce qui manquait, c'était la mesure. La voici.

Je n'affirme pas non plus que les moteurs ignorent la balise. Un écart de forme entre l'URL citée et la canonique déclarée prouve que l'affichage de la référence n'applique pas la canonicalisation. Il ne dit rien de ce qui se passe en amont, dans la sélection des documents, où la balise joue peut-être un rôle que personne ne publie.

Enfin, 47 citations sur deux questions et trois moteurs, ce n'est pas un échantillon représentatif du web. Le résultat ChatGPT est robuste parce qu'il est mécanique : 11 sur 11, sur deux sujets sans rapport, avec une cause visible. Le taux de 78 % de Perplexity est indicatif, et je serais surpris qu'il se reproduise au chiffre près. Les cinq pages du corpus qui ne déclarent aucune balise canonique, dont deux sites SEO français, rappellent au passage que le socle n'est pas posé partout.

Ce qu'il faut retenir

Le SEO a raison sur son terrain. Une URL canonique bien déclarée regroupe les variantes, consolide les signaux et désigne la page à indexer. Rien dans ces relevés ne contredit cela, et la RFC de 2012 tient toujours.

Mais la balise répond à la question « quelle adresse retenir », et un moteur génératif pose une autre question : « quelle adresse afficher ». Les deux ont été confondues tant qu'il n'existait qu'une seule couche. Elles se sont séparées, et une seule des deux dispose encore d'un levier.

Les mesures du 13 septembre 2026 disent où en est chacun des trois moteurs. ChatGPT cite votre adresse et la réécrit systématiquement, jusqu'à faire apparaître trois formes de la même page dans une seule réponse. Perplexity cite votre adresse fidèlement, sauf quand elle a déménagé, auquel cas seule votre redirection empêche le lien de mourir. Gemini ne cite pas votre adresse du tout.

La conclusion pratique tient en une phrase : vous ne choisissez plus l'URL par laquelle on vous atteint, alors faites en sorte qu'elles fonctionnent toutes.

Chez Orbite, nous auditons ce que les moteurs génératifs citent réellement, forme d'URL comprise. Si vous préparez une refonte, ou si vous voulez savoir sous quelle adresse vous êtes cité aujourd'hui : parlons de votre visibilité générative.