WeAreFlowAnalyser mon site
Stratégie éditoriale

Pourquoi tous les contenus en ligne se ressemblent, et comment s'en différencier

L’équipe WeAreFlow21 septembre 20268 min de lectureScoré 94/100 par Flow
94/100
Indice de complétude
Visibilité
Attractivité
Citabilité IA
Qualité

Ce que vous devez retenir

  • Un modèle sans accès à ce que vous savez se rabat sur ce qui est public. Il produit un contenu correct, lisible, et interchangeable avec celui de vos concurrents.
  • Dans 61,7 % des cas où un moteur génératif utilise une page comme source, le nom de la marque n'apparaît pas dans la réponse (Semrush et Kevin Indig, juin 2026).
  • La dilution n'est pas un défaut de qualité mais un défaut d'alimentation : la matière d'entrée est la même pour tout le marché.
  • Le test du logo retiré : si une page reste publiable telle quelle sur le site d'un concurrent une fois votre nom ôté, elle appartient à votre catégorie, pas à vous.
  • Deux intrants privés font la différence : une base de connaissance qui porte votre ton et l'ADN de votre marque, et une bibliothèque de sources que vous avez sélectionnées vous-même.
61,7 %
des citations où la page sert de source sans que la marque soit nommée (Semrush et Kevin Indig, juin 2026)
3 à 7
sources présentées dans une réponse générative (Arcep et PEReN, étude IMPACTIA, 2026)
21 à 50 %
de variance de complexité d'écriture en moins après passage par un modèle (Nature Human Behaviour, 2026)
65 %
de recours à l'IA pour la création de contenu texte (Infopro Digital, 235 décideurs français, terrain fin 2025)

Un modèle qui n'a pas accès à ce que vous savez se rabat sur ce qui est public. Il produit alors un contenu correct, lisible, et interchangeable avec celui de vos concurrents, qui utilisent les mêmes outils, souvent via les mêmes prestataires.

La dilution ne vient pas d'un défaut de qualité. Elle vient d'un défaut d'alimentation.

Longtemps, cela n'a coûté que de l'image. Une étude publiée en juin 2026 chiffre ce que cela coûte désormais : dans 61,7 % des cas où un moteur génératif s'appuie sur une page pour composer sa réponse, le nom de la marque n'apparaît nulle part dans cette réponse. Le contenu sert. L'entreprise n'est pas nommée.

Cet article examine ce que produit un modèle qu'on n'alimente pas, pourquoi le phénomène a changé d'échelle, ce qu'il coûte dans un espace de citation devenu étroit, comment reconnaître dans vos pages ce qui vous appartient vraiment, et quels intrants donner à un modèle pour que vos contenus cessent d'être interchangeables.

Ce que trouve un modèle mal alimenté : exactement ce que trouvent vos concurrents

Quand vous commandez un contenu sans fournir autre chose qu'un sujet, le modèle va chercher ce qu'il trouve. Et ce qu'il trouve sur votre marché, vos concurrents le trouvent aussi : la documentation publique du secteur que vous avez alimentée autant qu'eux, les articles déjà bien classés qui ont fixé la manière de traiter la question, les pages de vos concurrents souvent mieux structurées que les vôtres pour être reprises, et les prises de parole sectorielles écrites pour ne fâcher personne.

Le texte qui en sort est juste. Il est aussi la moyenne de tout ce qui précède.

Le phénomène se mesure. Une étude publiée dans Nature Human Behaviour en 2026, portant sur plus de 880 000 textes, établit que la réécriture d'un corpus par un modèle réduit de 21 à 50 % la variance de sa complexité d'écriture. Les textes ne deviennent pas mauvais, c'est l'écart entre eux qui se referme.

L'effet n'est pas universel. Des travaux présentés à la conférence ACL en juillet 2025, sur un corpus de presse en ligne anglophone, ne détectent aucune homogénéisation dans les mesures de diversité lexicale. Ce qui converge est la façon dont un texte est construit, et non le vocabulaire qu'il emploie.

Un modèle bien outillé et mal alimenté ne produit donc pas un mauvais texte. Il produit la moyenne de votre marché.

La production a quitté la rédaction : 65 % des organisations écrivent avec un modèle

Le problème ne se règle plus en formant une équipe, parce que cette équipe n'écrit plus seule.

Le baromètre marketing B2B d'Infopro Digital, mené auprès de 235 décideurs français du 15 septembre au 18 octobre 2025, mesure un recours à l'IA pour la création de contenu texte à 65 %. La capacité de production s'est répartie sur le marketing, les ventes, le produit, et sur les prestataires qui emploient les mêmes outils.

Chacun de ces endroits refait le même geste : ouvrir un modèle, lui donner un sujet, et se contenter de ce qu'il sait déjà. Personne ne dispose, à cet instant, de ce que l'entreprise a compris de son marché.

Forrester relève d'ailleurs, dans son enquête State of B2B Content menée en 2025, que la première difficulté des décideurs du contenu n'est pas d'écrire, mais l'inefficacité de la création et de la révision, faute de système partagé.

La compétence rédactionnelle est parfois en cause. Mais ce qui manque aux organisations pour produire un contenu qui n'appartient qu'à elles est leur base de connaissance, et cette base doit rester privée.

Votre page sert de source sans citer votre marque !

L'étude Ghost Citations, publiée le 9 juin 2026 par Semrush avec Kevin Indig, a relevé 3 981 apparitions de domaines sur 115 requêtes, dans quatorze pays et sur quatre moteurs. Dans 61,7 % des cas, la page servait bien de source au moteur, sans que le nom de la marque apparaisse dans la réponse.

Deux réserves valent d'être posées : Semrush commercialise des outils de visibilité générative, et ne publie pas les dates de collecte de ses données.

Une citation fantôme désigne ce cas précis : le moteur s'appuie sur votre page pour composer sa réponse, et n'indique pas d'où elle vient.

Le mécanisme se comprend sans l'étude. Un moteur nomme une source quand la nommer apporte quelque chose à la réponse. Un texte qui dit ce que disent quinze autres textes fournit l'information sans donner de raison d'en créditer l'auteur.

Votre production alimente alors le marché plutôt que votre marque. Elle travaille, et elle travaille pour la catégorie.

Trois à sept places par réponse : les LLM ne pardonnent pas la ressemblance

L'espace dans lequel cet arbitrage se joue est étroit, et il est documenté. L'étude IMPACTIA, menée par le Pôle d'expertise de la régulation numérique avec l'Arcep de février à septembre 2025, a interrogé Mistral, Gemini et Perplexity par leurs interfaces de programmation : huit cents questions posées vingt fois à chaque service, deux cent mille citations recueillies et vérifiées.

Le nombre de sources présentées dans une réponse y est compris entre trois et sept. Dans le même échantillon, 72 % des noms de domaine ne sont cités qu'entre une et dix fois, ce qui signifie que l'essentiel du web figure dans le corpus sans jamais peser dans les réponses.

Se distinguer ne suffit pas à être cité. La citation dépend aussi de l'autorité sur un champ, de la structure du texte, de la cohérence de l'entité et de signaux qui ne vous appartiennent pas. Mais dans un espace de trois à sept places, ressembler à tout le monde retire la seule raison qu'un moteur aurait de retenir votre page plutôt qu'une autre.

Produire davantage de la même matière ne fait donc pas gagner de place. Cela nourrit un corpus que vous partagez avec vos concurrents.

Le test du logo retiré : reconnaître ce qui vous appartient vraiment

Il existe un contrôle simple, et vous pouvez le passer sur n'importe laquelle de vos pages : retirez-en votre nom, votre logo et vos références clients. Si le texte reste exact et publiable tel quel sur le site d'un concurrent, il ne vous appartient pas. Il appartient à votre catégorie.

Ce contrôle désigne aussi, par soustraction, ce qui constitue une matière propre. Un modèle ne la trouvera nulle part parce qu'elle n'est publiée nulle part :

Vos propres mesures

ce que vous avez constaté sur vos clients, vos campagnes, votre parc.

Vos cas documentés

avec leurs chiffres, y compris ceux qui n'ont pas fonctionné.

Votre méthode

les arbitrages que vous avez tranchés, et les raisons qui les ont motivés.

Les objections réelles

dans les mots exacts avec lesquels on vous les oppose.

Ce que vous refusez de dire

et pourquoi.

Cette matière est rarement absente de l'entreprise. Elle est dispersée entre des têtes, des présentations et des comptes rendus, elle n'est consignée nulle part, et elle n'arrive jamais jusqu'à la personne qui rédige.

Base de connaissance et bibliothèque de sources : les deux intrants que vos concurrents n'ont pas

Pour qu'un modèle cesse de produire la moyenne, il faut lui donner deux choses que le marché n'a pas : ce que vous savez, et ce que vous avez choisi de lire.

Ce que vous savez : la base de connaissance. C'est l'endroit où la matière du test précédent est consignée, disponible au moment où quelqu'un écrit, en interne comme chez un prestataire. Constituer cet endroit est un chantier en soi, décrit ailleurs.

Elle ne contient pas que des faits : elle porte votre ton, l'ADN de votre marque, vos formulations validées, vos personas, les angles que vous défendez et ceux que vous écartez. C'est ce qui fait qu'un texte sonne comme vous, et non comme votre catégorie.

Ce que vous avez choisi de lire : la bibliothèque de sources. Laissé seul, un modèle va chercher ce qui se classe, c'est-à-dire ce que tout le monde cite déjà. Une bibliothèque de sources inverse ce réflexe : vous constituez le corpus documentaire qui nourrit vos contenus, en retenant les analyses de fond, les travaux institutionnels et les études sectorielles, et en écartant l'actualité de surface que vos concurrents recyclent aussi. Deux entreprises qui partent des mêmes idées mais pas des mêmes lectures n'écrivent pas le même texte.

Et ces deux intrants doivent rester privés. Tout ce qui est public figure déjà dans les modèles, à l'identique pour vous et pour vos concurrents : c'est la matière dont ils tirent la moyenne de votre marché. Ce que vous êtes seul à avoir consigné et seul à avoir sélectionné est ce dont ils ne disposent pas.

Reste à savoir ce qu'on y met. Une part de votre patrimoine publié est exactement le contenu moyen dont il est question depuis le début, et le réinjecter reviendrait à nourrir la machine avec ce qu'on lui reproche. Le test du logo retiré fournit le critère de tri ; il faut encore le passer sur plusieurs centaines de pages, et le passer face au marché plutôt que seul.

C'est le travail que WeAreFlow prend en charge. La plateforme analyse votre patrimoine de contenus et celui des concurrents de votre marché, score chaque contenu sur quatre dimensions dont la citabilité par les moteurs génératifs, et distingue ce qui porte votre position de ce qui répète la moyenne du secteur.

Ce qui survit au tri alimente votre base de connaissance, où votre identité de marque est consignée, tandis que votre bibliothèque rassemble les sources que vous avez retenues. Vos contenus s'écrivent ensuite à partir de cet ensemble, qui n'appartient qu'à vous.

À savoir : Patrimoine éditorial : savoir ce que vous détenez avant d'en produire davantage. Une analyse de votre site et de celui de vos concurrents distingue les contenus qui portent votre position de ceux qui répètent la moyenne du marché, et constitue le point de départ de votre base de connaissance. [Analyser votre patrimoine avec WEAREFLOW →]

Sur les dix derniers contenus que vous avez publiés, combien auraient pu sortir, à l'identique, du site d'un concurrent ?

Questions fréquentes

Nous rédigeons en interne, sans agence. Sommes-nous concernés ?+

L'endroit où l'on écrit compte moins que ce dont on dispose en écrivant. Une équipe interne qui ouvre un modèle sans rien lui fournir d'autre qu'un sujet obtient le même résultat qu'un prestataire dans la même situation. Le baromètre d'Infopro Digital mesure un recours à l'IA pour le texte à 65 % chez les décideurs interrogés, équipes internes comprises. Internaliser supprime un intermédiaire, cela ne résout pas l'alimentation.

Pourquoi la base de connaissance doit-elle rester privée ?+

D'abord parce que sa valeur tient à ce que les autres n'y ont pas accès : une matière publiée rejoint le corpus public, celui dont vos concurrents tirent exactement les mêmes textes que vous. Ensuite parce qu'elle ne contient pas que des faits. Elle porte votre ton, l'ADN de votre marque, vos formulations validées, vos personas et vos partis pris éditoriaux : ce que vous exposeriez là, vous le donneriez à imiter. Cela n'interdit pas de publier, cela impose de distinguer ce que vous exposez de ce qui alimente votre production, et de savoir, pour chaque élément, dans quelle catégorie il se trouve.

En quoi une bibliothèque de sources change-t-elle le contenu produit ?+

Elle décide de ce que le modèle a sous les yeux. Laissé seul, il part des pages les mieux classées sur le sujet, que vos concurrents utilisent également : les mêmes lectures produisent les mêmes textes. En sélectionnant vous-même les analyses de fond, les travaux institutionnels et les études sectorielles qui alimentent vos contenus, vous changez le point de départ. C'est aussi ce qui permet de citer des sources que personne d'autre n'a citées.

Le test du logo retiré ne disqualifie-t-il pas les contenus pédagogiques, forcément génériques ?+

Il les situe plutôt qu'il ne les disqualifie. Un contenu d'explication a une fonction d'accueil et de maillage, et il n'a pas vocation à porter votre position. Le problème commence lorsqu'il occupe la majorité du patrimoine, et que rien, au-dessus, ne fournit de raison de vous nommer.

Notre secteur est très encadré, les sujets sont contraints. La différenciation est-elle possible ?+

La contrainte porte sur l'exactitude des faits, rarement sur leur traitement : ni l'angle, ni le niveau de détail, ni la personne qui prend la parole ne sont imposés. Dans un secteur contraint, la convergence est d'ailleurs plus forte qu'ailleurs, ce qui rend l'écart moins coûteux à créer.

Sources

  1. 01Semrush et Kevin Indig, The Ghost Citations Study, 9 juin 2026. 3 981 apparitions de domaines relevées sur 115 requêtes, dans 14 pays et sur quatre moteurs (ChatGPT, Google AI Overviews, Gemini, Google AI Mode) : dans 61,7 % des cas, la plateforme utilise la page comme source sans que le nom de la marque apparaisse dans la réponse. Semrush commercialise des outils de visibilité générative : conflit d'intérêt déclaré. L'étude ne publie pas ses dates de collecte. https://www.semrush.com/blog/the-ghost-citations-study/
  2. 02Arcep et Pôle d'expertise de la régulation numérique, IA générative : des défis pour l'avenir de l'internet ouvert, 14 janvier 2026, 104 pages. Étude empirique IMPACTIA menée de février à septembre 2025 sur Mistral, Gemini et Perplexity interrogés par leurs interfaces de programmation : 800 questions posées 20 fois à chaque service, 200 000 citations recueillies et vérifiées, 9 206 noms de domaine. Nombre de sources présentées par réponse compris entre 3 et 7 ; 72 % des noms de domaine cités 1 à 10 fois. https://www.arcep.fr/uploads/tx_gspublication/rapport-IA-generative-defis-internet-ouvert-janvier2026.pdf
  3. 03Sourati, Karimi-Malekabadi, Ozcan, McDaniel, Ziabari, Trager, Tak, Chen, Morstatter et Dehghani, The Shrinking Landscape of Linguistic Diversity in the Age of Large Language Models, Nature Human Behaviour, 2026. Trois études, sept jeux de données, plus de 880 000 textes ; corpus courant jusqu'à novembre 2024, expériences de réécriture menées au plus tard en février 2025 ; modèles testés GPT-3.5, Llama 3 70B et Gemini Pro. Réduction de la variance de complexité d'écriture de 21 à 50 % selon les jeux de données et les modèles. https://arxiv.org/abs/2502.11266
  4. 04Fitterer, Gangl et Ulbrich, Testing English News Articles for Lexical Homogenization Due to Widespread Use of Large Language Models, ACL 2025 Student Research Workshop, juillet 2025. Corpus de presse en ligne anglophone comparé entre 2018 et 2024 : les effets d'homogénéisation n'apparaissent pas dans les mesures de diversité lexicale. https://aclanthology.org/2025.acl-srw.95/
  5. 05Forrester, Lisa Gately, The Content Bottleneck Has Shifted: Why Enterprise AI Isn't Enough, 24 juillet 2026. Première difficulté des décideurs du contenu : l'inefficacité de la création et de la révision, faute de système partagé. Chiffre issu de la State of B2B Content Survey, terrain 2025. https://www.forrester.com/blogs/the-content-bottleneck-has-shifted-why-enterprise-ai-isnt-enough/
  6. 06Infopro Digital Média et Institut d'Études d'Infopro Digital, Baromètre des investissements et tendances marketing B2B, édition 2026. Recours à l'IA pour la création de contenu texte mesuré à 65 %. Enquête menée du 15 septembre au 18 octobre 2025 auprès de 235 décideurs B2B français. https://www.infopro-digital-media.fr/blog-post/blog-post-barometre-marketing-b2b-2026

Vous serez aussi intéressé par

Découvrez la valeur réelle de votre patrimoine

Faites passer votre site dans WeAreFlow : inventaire, Score Patrimoine et niveau de Citabilité IA face à vos concurrents, en quelques minutes.

Lancer mon analyse gratuite →