Réponse courte : nous avons posé à ChatGPT, Gemini et Claude les trois mêmes questions d'achat, 100 fois chacune — « meilleur CRM pour une petite entreprise », « meilleur outil de gestion de projet pour une petite équipe », « quel logiciel de comptabilité pour un freelance ». 1 000 réponses en une session, sans personnalisation, une seule formulation par question. Le haut de chaque réponse est verrouillé : HubSpot, Zoho et Pipedrive sont recommandés dans 100 réponses ChatGPT sur 100 pour les CRM, et HubSpot est cité en premier dans 100 sur 100 — sur les trois moteurs. Sous le trio de tête, c'est pile ou face : Close apparaît dans 13 réponses sur 100 et monday dans 12, les chances d'une marque vont de 1 % à 62 % selon le moteur, et le trio verrouillé porte presque tout le recouvrement d'une réponse à la suivante. ChatGPT a lu un seul comparatif affilié dans 97 de ses 100 réponses CRM, et pour la question comptable il n'a pas cherché sur le web du tout. Le « score de visibilité IA » unique que vend ce secteur décrit le sommet verrouillé, là où personne n'en a besoin, et n'est que du bruit dans la traîne, là où vivent presque toutes les entreprises. Chaque chiffre ci-dessous vient des exécutions, et les réponses brutes sont publiées.
Pourquoi poser la même question 100 fois ?
Parce que c'est la seule façon de savoir ce qu'est une recommandation d'IA. En production, les grands modèles de langage ne sont pas déterministes. Thinking Machines Lab a échantillonné une même consigne 1 000 fois à température zéro — le réglage censé faire réagir le modèle à l'identique à chaque exécution — et a obtenu 80 complétions différentes. Ouyang, Zhang, Harman et Wang ont montré qu'avec les réglages par défaut de ChatGPT, entre 48 % et 76 % des tâches de programmation ne produisaient jamais deux sorties identiques d'une requête à l'autre. Ces études portaient sur des faits et du code. Personne n'avait appliqué le même test à ce pour quoi tout un secteur vend désormais un chiffre : quelles marques un assistant recommande quand un acheteur demande.
Le secteur a vu le problème par l'autre bout. En mai, Digiday citait Paul Dyer, PDG de l'agence /prompt : « Si vous utilisez trois outils différents avec les mêmes requêtes, vous obtenez trois réponses différentes. » L'explication habituelle est que les outils mesurent différemment. Nous voulions savoir quelle part du désaccord tient simplement au moteur qui se contredit lui-même.
Ce que nous avons fait
Trois questions qu'un vrai acheteur tape, choisies dans des catégories riches en marques connues et sans aucun lien avec nous :
- « What's the best CRM for a small business? »
- « What's the best project management tool for a small team? »
- « Which accounting software should a freelancer use? »
Chaque question est partie 100 fois vers chacun des trois moteurs le 22 septembre 2026 (UTC), depuis un seul lieu, via les API, sans historique de conversation ni personnalisation de compte :
- ChatGPT —
gpt-4.1via l'API Responses, outil de recherche web disponible, donc libre de chercher s'il le jugeait utile. Il a cherché dans 100 réponses CRM sur 100, 100 réponses gestion de projet sur 100, et 0 réponse comptabilité sur 100. - Gemini —
gemini-flash-latest, ancrage Google Search proposé à chaque appel. Il l'a utilisé dans 1 réponse sur 300. - Claude —
claude-sonnet-5via OpenRouter, sans recherche web.
En contrôle, nous avons reposé 100 fois la question CRM à ChatGPT avec la recherche désactivée, pour séparer le bruit qui vient de la récupération de celui qui vient de l'échantillonnage.
Une marque compte comme recommandée dans une réponse quand elle figure dans un titre, un élément numéroté ou à puce, une ligne de tableau ou une amorce en gras — là où une réponse nomme ses choix. Une marque citée en passant (« s'intègre à TurboTax ») n'est pas comptée. La marque citée en premier est celle en tête de liste. Toutes les règles d'extraction et l'ensemble des réponses sont dans la méthodologie en fin d'article.
Le haut de chaque réponse est verrouillé
Les trois mêmes marques ont été recommandées dans 899 des 900 réponses, trois questions et trois moteurs confondus. Le seul raté : ClickUp absent d'une seule réponse de Gemini.
| CRM pour une petite entreprise | ChatGPT | Gemini | Claude |
|---|---|---|---|
| HubSpot | 100/100 | 100/100 | 100/100 |
| Zoho CRM | 100/100 | 100/100 | 100/100 |
| Pipedrive | 100/100 | 100/100 | 100/100 |
| Salesforce | 92/100 | 18/100 | 85/100 |
| Freshsales | 83/100 | 21/100 | 67/100 |
| monday | 12/100 | 97/100 | 17/100 |
| Copper | 0/100 | 62/100 | 17/100 |
| Close | 13/100 | 20/100 | 2/100 |
| Streak | 0/100 | 18/100 | 23/100 |
| Less Annoying CRM | 0/100 | 16/100 | 7/100 |
| Gestion de projet pour une petite équipe | ChatGPT | Gemini | Claude |
|---|---|---|---|
| Asana | 100/100 | 100/100 | 100/100 |
| Trello | 100/100 | 100/100 | 100/100 |
| ClickUp | 100/100 | 99/100 | 100/100 |
| Notion | 77/100 | 100/100 | 100/100 |
| Basecamp | 75/100 | 64/100 | 11/100 |
| monday.com | 38/100 | 51/100 | 66/100 |
| Linear | 0/100 | 94/100 | 94/100 |
| Jira | 0/100 | 59/100 | 23/100 |
| Zoho Projects | 10/100 | 0/100 | 0/100 |
| Comptabilité pour un freelance | ChatGPT | Gemini | Claude |
|---|---|---|---|
| QuickBooks | 100/100 | 100/100 | 100/100 |
| FreshBooks | 100/100 | 100/100 | 100/100 |
| Wave | 100/100 | 100/100 | 100/100 |
| Zoho Books | 99/100 | 86/100 | 56/100 |
| Xero | 93/100 | 49/100 | 100/100 |
| Bonsai | 20/100 | 99/100 | 73/100 |
| HoneyBook | 0/100 | 42/100 | 2/100 |
| FreeAgent | 6/100 | 0/100 | 0/100 |
Lisez les premières et les dernières lignes de chaque tableau comme deux mondes différents. En haut, l'assistant recommande la marque chaque fois qu'on lui demande ; le « score de visibilité » d'un outil de suivi afficherait 100 % pour HubSpot aujourd'hui, demain et le mois prochain, et n'apprendrait rien à HubSpot. En bas, le même outil rapporte un chiffre qui bouge de dizaines de points entre deux exécutions à une heure d'intervalle, sans que rien ait changé chez la marque.
Qui est cité en premier
« Recommandé quelque part dans la réponse » est généreux. La marque en tête de liste est celle que la plupart des acheteurs essaient d'abord, et là le verrou est encore plus serré.
| Question | ChatGPT cite en premier | Gemini cite en premier | Claude cite en premier |
|---|---|---|---|
| CRM | HubSpot, 100 of 100 | HubSpot, 100 of 100 | HubSpot, 100 of 100 |
| Gestion de projet | ClickUp, 72 of 100 | Asana, 91 of 100 | Trello, 100 of 100 |
| Comptabilité | QuickBooks, 61 of 100 | FreshBooks, 55 of 100 | Wave, 85 of 100 |
Sur 300 réponses CRM, trois moteurs, HubSpot a été cité en premier 300 fois. Rien du bruit d'échantillonnage qui produit 80 biographies différentes de Feynman n'atteint la première ligne d'une recommandation de CRM. Là où le premier nom bouge, il bouge entre deux acteurs installés : ClickUp ou Trello, QuickBooks ou Wave, FreshBooks ou Wave.
Sous le trio de tête, pile ou face
Passons à la traîne. Chaque marque hors de l'ensemble verrouillé est une probabilité, et pour la plupart une probabilité faible avec une large marge d'erreur. Les intervalles à 95 % ci-dessous sont ce qu'un outil de suivi honnête devrait imprimer à côté d'un « score » bâti sur une poignée d'exécutions.
| Marque, question CRM | ChatGPT | Intervalle à 95 % |
|---|---|---|
| Freshsales | 83 % | 74–89% |
| Close | 13 % | 8–21% |
| monday | 12 % | 7–20% |
| Marque, question CRM | Gemini | Intervalle à 95 % |
|---|---|---|
| Copper | 62 % | 52–71% |
| Salesforce | 18 % | 12–27% |
| Freshsales | 21 % | 14–30% |
| Streak | 18 % | 12–27% |
| Less Annoying CRM | 16 % | 10–24% |
Deux choses à remarquer. D'abord, les chances d'une marque dépendent bien plus du moteur que de la marque : Salesforce est recommandé dans 92 % des réponses de ChatGPT et 18 % de celles de Gemini ; Copper dans 62 % de celles de Gemini et 0 % de celles de ChatGPT. Ensuite, l'intervalle d'une marque de traîne mesurée sur dix exécutions — plus que la plupart des outils n'en font — est plus large que le mouvement que quiconque célébrerait. Une marque qui passe « de 12 % à 23 % » entre deux rapports hebdomadaires n'a, le plus souvent, bougé nulle part.
Le recouvrement d'une réponse à l'autre dit la même chose en un chiffre. En comparant l'ensemble des marques recommandées dans chaque paire de réponses, celles de ChatGPT sur les CRM se recoupent à 86 %, celles de Gemini à 68 %, celles de Claude à 63 %. Le trio verrouillé porte tout ce recouvrement. Retirez-le, et le reste d'une réponse typique diffère du reste de la suivante.
Ce que ChatGPT a lu pour décider
ChatGPT a cherché sur le web pour ses 100 réponses CRM et ses 100 réponses gestion de projet. Ce qu'il a lu est le tableau le plus utile de cette étude, parce que c'est la partie sur laquelle une entreprise peut agir.
| Source, question CRM | Lue dans |
|---|---|
| croclub.com | 97 réponses sur 100 |
| techradar.com | 89 |
| cloudspress.com | 77 |
| live-agent.cn | 63 |
| bizstackhub.com | 56 |
| interobservers.com | 43 |
| freshworks.com | 42 |
| beltstack.com | 34 |
| softabase.com | 32 |
| softwareconnect.com | 24 |
Trente-quatre domaines distincts sur les 100 réponses, une médiane de sept par réponse, et l'un d'eux dans presque toutes. croclub.com est The CRO Club, un site d'avis affilié publié par Black & White Zebra ; la page lue par ChatGPT est sa liste de CRM pour grandes entreprises, ouverte 97 fois pour répondre à une question sur les petites entreprises. Son propre premier choix est monday, que ChatGPT a ensuite recommandé dans 12 réponses sur 100. Lire une page et la suivre sont deux choses différentes : le trio de tête du modèle vient de plus profond que la page qu'il a chargée.
La question gestion de projet a lu un autre ensemble — starters-tools.com dans 96 réponses sur 100, spotsaas.com dans 90, techdealforge.com dans 77, un fil du forum communautaire d'Asana dans 73 — et là encore un petit cercle de sites de comparatifs a décidé qui était dans la pièce. Aucun site d'éditeur n'entre dans le top 5 pour l'une ou l'autre question. C'est le même schéma que lorsque nous avons audité notre propre catégorie : les assistants assemblent leurs recommandations à partir de pages tierces, et figurer sur ces pages est ce qui fait bouger la traîne.
Avec ou sans recherche : d'où vient le bruit
L'exécution de contrôle répond à une question qui divise le secteur. Recherche désactivée, les réponses CRM de ChatGPT ont encore verrouillé le même trio — HubSpot, Zoho et Pipedrive dans 100 réponses sur 100 — et cité HubSpot en premier à chaque fois. Mais la traîne s'est élargie : 17 marques distinctes recommandées contre 7 avec la recherche, un recouvrement d'une réponse à l'autre de 76 % contre 86 %, et Insightly, Less Annoying CRM et Keap surgis de mémoire là où les réponses avec recherche ne les mentionnaient jamais.
La récupération resserre donc la traîne au lieu de l'élargir. Quand le modèle lit les sept mêmes pages à chaque fois, il y puise ses seconds rôles. Quand il répond de mémoire, il puise dans tout ce qu'il a jamais lu, et l'échantillon est plus bruyant. Le trio verrouillé n'est pas du tout un effet de récupération : il survit à la désactivation de la recherche, ce qui signifie qu'il vit dans le modèle, pas dans les pages.
La question que ChatGPT n'a pas voulu chercher
Un résultat nous a surpris. Outil de recherche disponible à chaque appel, ChatGPT l'a utilisé pour 100 réponses CRM sur 100, 100 réponses gestion de projet sur 100 et 0 réponse comptabilité sur 100. Même outil, même jour, même style de formulation. Le modèle décide, question par question, s'il a besoin du web, et pour « quel logiciel de comptabilité pour un freelance » il a décidé que non.
Cela compte pour la mesure. Un outil qui compte les citations — l'assistant a-t-il lié votre site — aurait rapporté zéro citation pour chaque éditeur de logiciel comptable, QuickBooks compris, et une lecture naïve de cela donne « personne n'est cité ». La lecture honnête est que rien n'a été récupéré, donc la citation n'était pas en jeu. Nous avons écrit sur cette distinction dans ce que signifie le grounding ; voilà à quoi elle ressemble en pratique.
Ce que cela signifie si vous dirigez une entreprise
Si vous êtes dans le trio verrouillé de votre catégorie, un score de visibilité IA ne vous apprend rien. Il affichera 100 % chaque semaine. Votre risque n'est pas que le score bouge ; c'est que le petit cercle de pages de comparatifs lues par le moteur change d'avis, et ce sont ces pages qu'il faut surveiller, pas un tableau de bord.
Si vous êtes dans la traîne, un chiffre isolé est du bruit. L'intervalle d'une marque à 12 % sur dix exécutions va grosso modo de 2 % à 40 %. Tout produit qui annonce « vous êtes passé de 12 % à 23 % » sans intervalle présente une erreur d'échantillonnage comme un progrès. Demandez le nombre d'exécutions et l'intervalle ; si le fournisseur ne peut pas les donner, le chiffre est décoratif. C'est pourquoi SeeGeo rapporte des taux sur des exécutions répétées et ne vend jamais de « rang IA ».
La porte d'entrée d'une réponse passe par les pages qu'elle lit. Dix domaines ont décidé de la réponse CRM. Pour la plupart des catégories, la liste est aussi courte. Trouvez-la pour la vôtre — les assistants vous la donneront, si vous leur demandez et conservez les citations — et faites-vous y figurer. C'est tout le travail de visibilité IA hors site, et il n'a rien de mystérieux.
Mesurez par échantillonnage, pas en demandant une fois. Vingt répétitions d'un jeu de questions fixe, rapportées comme un taux avec un intervalle, c'est le minimum qui transforme une anecdote en mesure. Notre audit gratuit mesure si un site est lisible et citable — la préparation — et notre suivi interroge les moteurs à répétition exactement pour cette raison.
Questions fréquentes
ChatGPT donne-t-il la même réponse à chaque fois ? Pour les premiers noms d'une recommandation, presque exactement : HubSpot a été cité en premier dans 100 réponses CRM sur 100 sur trois moteurs. Pour tout ce qui est sous le trio de tête, non : une marque de traîne est apparue dans 1 % à 62 % des réponses selon le moteur, et deux réponses consécutives à la même question ne se recoupaient qu'à environ 86 % sur ChatGPT.
Pourquoi les outils de visibilité IA ne sont-ils pas d'accord entre eux ? En partie parce qu'ils mesurent différemment, et en partie parce que le moteur se contredit lui-même. Deux outils qui échantillonnent dix fois chacun la même marque de traîne obtiendront des chiffres différents par pur hasard ; l'intervalle à 95 % d'une marque à 20 % sur dix exécutions va de 6 % à 51 % environ. Des outils qui donnent un chiffre unique sans intervalle ne peuvent pas être réconciliés, parce qu'aucun des deux chiffres n'a jamais été précis.
Est-ce parce que ChatGPT a cherché sur le web ? Non. Recherche désactivée, le même trio a encore été recommandé dans chaque réponse et HubSpot toujours cité en premier. La recherche a rendu la traîne plus étroite, parce que le modèle relisait les sept mêmes pages. Le verrou est dans le modèle ; le bruit est dans ce qui l'entoure.
Quels sites décident de la réponse ? Pour la question CRM, croclub.com (97 réponses sur 100), techradar.com (89) et cloudspress.com (77). Pour la gestion de projet, starters-tools.com (96), spotsaas.com (90) et techdealforge.com (77). Aucun site d'éditeur dans le top 5 pour l'une ou l'autre question.
Peut-on voir les réponses brutes ? Oui. Les 1 000 réponses, les règles d'extraction et les statistiques de synthèse sont publiées sur github.com/Tunisian-Aaron/ai-visibility-study-2026 sous licence CC BY 4.0, à côté de notre étude d'audit de 107 sites.
Méthodologie complète
Publiée telle quelle ; exécutions réalisées le 22 septembre 2026 (UTC), depuis un seul lieu, via les API des moteurs.
Questions. Trois, choisies pour leurs ensembles de marques connues, leur intention d'achat et l'absence de tout lien avec SeeGeo : « What's the best CRM for a small business? », « What's the best project management tool for a small team? », « Which accounting software should a freelancer use? ». Une seule formulation chacune ; la variance de reformulation n'est pas mesurée ici.
Moteurs et réglages. ChatGPT : API Responses d'OpenAI, modèle gpt-4.1, outil web_search_preview disponible à chaque appel, température par défaut du fournisseur, sans consigne système ni historique ; le fait que le modèle ait cherché est lu dans les éléments web_search_call de la réponse. Gemini : gemini-flash-latest via l'API Generative Language, ancrage google_search proposé à chaque appel ; une réponse compte comme ancrée quand des métadonnées d'ancrage sont renvoyées (1 sur 300). Claude : anthropic/claude-sonnet-5 via OpenRouter, max_tokens 1024, sans outil. Contrôle : ChatGPT comme ci-dessus sans l'outil de recherche, question CRM uniquement, 100 exécutions. Trois requêtes simultanées par moteur ; chaque appel retenté jusqu'à trois fois sur erreur de transport ; aucun appel n'a échoué après relance.
Extraction. Un dictionnaire de noms de marques et d'alias par question (37 entrées CRM, 45 gestion de projet, 52 comptabilité), apparié sans distinction de casse aux frontières de mots. Recommandée : la marque figure dans un titre, un élément numéroté ou à puce, une ligne de tableau ou une ligne amorcée en gras. Citée en premier : la première marque de ce type dans l'ordre de lecture. Les mentions en passant dans le corps du texte sont exclues des deux. Chaque titre de chaque réponse sans correspondance dans le dictionnaire a été relu à la main ; les vraies marques trouvées ainsi (HoneyBook, Bonsai) ont été ajoutées avant la passe finale. Recouvrement : similarité de Jaccard moyenne des ensembles de marques recommandées sur toutes les paires de réponses d'une cellule. Intervalle : intervalle de score de Wilson à 95 %.
Sources. Pour les réponses ChatGPT ancrées, les domaines des URL présentes dans les annotations de citation de la réponse, dédoublonnés par réponse, www. retiré.
Limites. Un jour, un lieu, une formulation par question, en anglais seulement, trois moteurs et un modèle chacun ; les résultats décrivent ces exécutions et rien d'autre. Le comportement des modèles change avec les versions et la charge, et la même expérience un mois plus tard peut verrouiller un autre trio. L'ancrage de Gemini était proposé mais presque jamais utilisé, ses réponses viennent donc en pratique de la mémoire ; Claude n'avait aucune recherche ; les moteurs ne sont donc pas comparés à armes égales et nous ne les classons pas. L'extraction des marques repose sur un dictionnaire et peut manquer une marque nommée sous une forme imprévue ; la relecture manuelle des titres sans correspondance est l'atténuation, pas une garantie. Nous n'avons pas mesuré la qualité des réponses, seulement quelles marques étaient recommandées.