Ahrefs a analysé 174 048 pages à l'origine de 560 346 AI Overviews de Google en décembre 2025, et n'a trouvé presque aucun lien entre le nombre de mots et le fait d'être cité. La corrélation était de 0,04, statistiquement proche de zéro. Pourtant, le monde du marketing de recherche continue de répéter le même conseil : écrire 2 000, 3 000, parfois 10 000 mots si l'on veut qu'un moteur IA vous cite. Cette habitude survit parce qu'elle emprunte au SEO classique, où les pages plus longues corrélaient autrefois, de façon lâche, avec la profondeur thématique et le classement. Les moteurs génératifs ne classent pas des pages entières. Ils synthétisent une réponse à partir de fragments, et la position d'un fragment dans cette réponse compte plus que la longueur de la page qui l'entoure.
Ce qu'Ahrefs a découvert en examinant 174 000 citations
Dans l'étude d'Ahrefs sur 174 048 pages citées, la longueur moyenne était de 1 282 mots, et cette longueur variait à peine avec la probabilité de citation : la corrélation de Spearman entre le nombre de mots et l'apparition dans un AI Overview était de 0,04. Plus de la moitié des citations, 53,4 %, concernaient des pages de moins de 1 000 mots. Seulement 16 % provenaient de pages dépassant 2 000 mots. La position à l'intérieur de l'aperçu racontait la même histoire. Les sources classées en première position comptaient en moyenne 1 270 mots ; les sources classées de la quatrième à la dixième position en comptaient en moyenne 1 690, un écart trop faible pour bâtir une stratégie de contenu dessus.
La variation observée provenait du type de contenu, pas de la longueur. Les pages de type liste affichaient une médiane de 315 mots, les pages produit ou service 317, les articles complets 1 166, et les transcriptions audio 1 226. La majorité du contenu cité se situe bien en dessous du seuil de 2 000 mots que vise habituellement le conseil du « guide complet », une habitude qui avait plus de sens à l'époque où le SEO classique récompensait des signaux de profondeur qu'un robot pouvait compter. Cela rejoint ce que VizibleAI a écrit sur le contenu axé sur la réponse directe : un paragraphe citable est celui qui répond complètement à une question précise, pas celui qu'on a étoffé pour paraître exhaustif.
Position-Adjusted Word Count : l'indicateur que les chercheurs ont construit à la place
Le Position-Adjusted Word Count d'une réponse pondère chaque source citée selon la précocité de son apparition dans la réponse générée, et non selon la longueur totale de la page vers laquelle elle renvoie.
C'est la définition qui sous-tend le Position-Adjusted Word Count, introduite dans l'article fondateur sur la Generative Engine Optimization publié par des chercheurs de Princeton et de l'IIT Delhi, Pranjal Aggarwal, Vishvak Murahari et leurs collègues, dans leur étude GEO. Les auteurs ont construit GEO-bench, un benchmark de 10 000 requêtes réelles d'utilisateurs réparties sur 25 domaines, divisé en 8 000 requêtes d'entraînement, 1 000 de validation et 1 000 de test, précisément parce qu'une métrique de classement de recherche classique s'effondre dès qu'une seule réponse mélange et cite plusieurs sources à la fois. La métrique dévalue une source de façon exponentielle plus elle apparaît tard dans la réponse synthétisée, ce qui explique pourquoi c'est le PAWC, et non le nombre de mots brut, que les expériences d'optimisation de l'article ont réellement mesuré.
Les techniques qui ont fait la différence, et celle qui n'a rien changé
En testant neuf techniques d'optimisation de contenu sur GEO-bench, les chercheurs ont constaté que trois d'entre elles apportaient les plus forts gains de PAWC : l'ajout de citations, l'ajout de statistiques, et la citation de sources, chacune produisant une hausse de visibilité pondérée par la position d'environ 30 à 40 %. L'optimisation de la fluidité, qui consiste à resserrer la grammaire et la lisibilité sans changer le fond, apportait un gain plus modeste de 15 à 30 %. Le bourrage de mots-clés, la seule technique directement héritée des anciennes habitudes du SEO, produisait une amélioration minime, voire négative.
Ces trois techniques de tête partagent un trait commun : chacune ajoute une information nouvelle et vérifiable plutôt que de reformuler ce qui figure déjà sur la page. Une citation est nouvelle. Une statistique sourcée est nouvelle. Une source nommée est nouvelle. La longueur n'a jamais été la variable qui comptait ; la densité d'information, si, et cela rejoint ce que VizibleAI a constaté côté récupération dans son article sur la façon dont les moteurs IA découpent le contenu : les moteurs fragmentent les pages en passages avant même de regarder la longueur totale, si bien que la véritable unité de compétition d'une page est le passage, pas l'article.
Là où la recherche est contestée
L'article GEO n'est pas sans critiques. Dans son analyse critique de l'étude, l'analyste SEO Tylor Hermanson souligne que les trois techniques les plus performantes consistaient toutes à ajouter du contenu nouveau à une page, alors que la plupart des techniques les plus faibles se contentaient de modifier le texte existant, ce qui rend difficile de distinguer « cette technique précise fonctionne » de « ajouter n'importe quelle information nouvelle et unique fonctionne ». Il signale aussi que les chercheurs ont autorisé des statistiques et des citations fabriquées de toutes pièces dans leurs prompts de test, une approche qui gonfle probablement les résultats d'une façon que du contenu réel ne peut pas reproduire, puisqu'une citation ou une statistique authentique existe généralement déjà ailleurs, à un endroit qu'un modèle a déjà vu. Les deux remarques sont fondées, et elles plaident pour traiter les chiffres de 30 à 40 % comme une indication de tendance plutôt que comme une garantie valable sur n'importe quel site.
Ce qui distingue le contenu cité en 2026, au-delà du nombre de mots
Une analyse distincte du traqueur de visibilité IA OtterlyAI, portant sur plus d'un million de citations à travers ChatGPT, Perplexity et les AI Overviews de Google en janvier et février 2026, aboutit à la même conclusion sous un angle différent. Le contenu éditorial, de type analyse, domine les citations sur toutes les plateformes couvertes par le rapport, devant le contenu publié par les marques elles-mêmes. Les pages utilisant du balisage schema et un découpage clair du contenu obtenaient trois à cinq fois plus de citations que les pages n'utilisant ni l'un ni l'autre. Les auteurs du rapport sont directs sur la hiérarchie : une page bien écrite qu'un robot d'indexation IA ne peut ni analyser ni atteindre ne sert à rien, quelle que soit sa longueur.
Cela concorde avec un constat que VizibleAI a déjà traité côté stratégie de contenu dans son article sur la cannibalisation de contenu et les citations IA : ajouter davantage de pages, ou davantage de mots à une page existante, ne remplace pas le fait de rendre le contenu déjà en place plus facile à extraire et à vérifier.
Ce que cela signifie pour votre calendrier éditorial
Rien de tout cela ne rend la longueur sans intérêt. Certains sujets ont réellement besoin de plus d'explications, et raccourcir une page pour atteindre un objectif de format court arbitraire est aussi une forme de remplissage. Le constat est plus étroit que cela : la longueur n'est pas le levier à actionner. Si une page n'est pas citée, ajouter une statistique nommée avec sa source en lien, une citation réelle, ou une affirmation précise et vérifiable, fera bouger un indicateur comme le PAWC plus sûrement que doubler le nombre de mots.
Un audit GEO qui note une page sur ces facteurs, plutôt que sur un objectif de nombre de mots, est un meilleur usage du temps d'un calendrier éditorial qu'une énième réécriture de guide ultime.
Questions fréquemment posées
Un contenu plus long est-il mieux classé dans les AI Overviews ?
Non. L'analyse d'Ahrefs de décembre 2025 sur 174 048 pages citées a trouvé une corrélation de Spearman de seulement 0,04 entre le nombre de mots et la citation, ce qui équivaut à une absence de lien. Plus de la moitié des citations, 53,4 %, concernaient des pages de moins de 1 000 mots, et seulement 16 % provenaient de pages de plus de 2 000 mots.
Qu'est-ce que le Position-Adjusted Word Count ?
Le Position-Adjusted Word Count (PAWC) est un indicateur issu de l'article GEO fondateur de Princeton et de l'IIT Delhi. Il pondère une source citée selon la précocité de son apparition dans une réponse générée par IA, à l'aide d'une fonction de décroissance exponentielle, plutôt que selon la longueur brute de la page vers laquelle elle renvoie.
Quels changements de contenu améliorent réellement les taux de citation IA ?
En testant sur le benchmark GEO-bench, les chercheurs ont constaté que l'ajout de citations, l'ajout de statistiques et la citation de sources produisaient chacun une hausse de visibilité pondérée par la position d'environ 30 à 40 %, les plus forts gains parmi toutes les techniques testées. L'optimisation de la fluidité apportait un gain plus modeste de 15 à 30 %, et le bourrage de mots-clés produisait des résultats minimes, voire négatifs.
Existe-t-il un nombre de mots idéal pour un contenu cité par l'IA ?
Pas de nombre fixe. Ahrefs a constaté que le contenu cité comptait en moyenne environ 1 282 mots, mais les médianes varient fortement selon le type de contenu : environ 315 mots pour les pages de type liste ou produit, contre plus de 1 100 mots pour les articles complets. Adaptez la longueur à ce que le sujet exige, pas à un chiffre cible.
Quelle est la fiabilité des chiffres de 30 à 40 % de gain de visibilité issus de l'article GEO ?
Il faut les considérer comme des indications de tendance plutôt que des valeurs exactes. La critique de l'analyste SEO Tylor Hermanson note que les techniques les plus performantes ajoutaient toutes de l'information nouvelle à une page, et que les prompts de test de l'étude autorisaient des statistiques et des citations fabriquées, deux éléments qui gonflent probablement les gains mesurés par rapport à du contenu réel.
Sur quoi les équipes de contenu devraient-elles optimiser à la place du nombre de mots ?
L'extractibilité : le fait qu'une page contienne une information précise, vérifiable et citable, positionnée là où l'étape de récupération d'un moteur génératif peut la trouver et l'intégrer dans une réponse, plutôt que d'optimiser pour la longueur ou la couverture de mots-clés comme le récompensait autrefois le SEO classique.



