forschung

Wir haben ChatGPT 100-mal dieselbe Frage gestellt. Die ersten drei änderten sich nie. Alle anderen: Münzwurf.

1.000 identische Kauffragen an ChatGPT, Gemini und Claude. Dieselben drei Marken führten jede Antwort an; darunter schwankte eine Marke von 1 % bis 62 %.

Kurze Antwort: Wir haben ChatGPT, Gemini und Claude dieselben drei Kauffragen je 100-mal gestellt — „bestes CRM für ein kleines Unternehmen", „bestes Projektmanagement-Tool für ein kleines Team", „welche Buchhaltungssoftware für Freelancer". 1.000 Antworten in einer Sitzung, ohne Personalisierung, eine Formulierung pro Frage. Die Spitze jeder Antwort ist festgeschrieben: HubSpot, Zoho und Pipedrive wurden in 100 von 100 ChatGPT-Antworten zu CRMs empfohlen, und HubSpot wurde in 100 von 100 zuerst genannt — auf allen drei Engines. Unter den ersten drei ist die Antwort ein Münzwurf: Close erschien in 13 von 100 und monday in 12, die Chance einer Marke lag je nach Engine zwischen 1 % und 62 %, und die festgeschriebenen drei trugen fast die gesamte Überschneidung von einer Antwort zur nächsten. ChatGPT las in 97 seiner 100 CRM-Antworten dieselbe Affiliate-Bestenliste, und bei der Buchhaltungsfrage suchte es gar nicht im Web. Der eine „KI-Sichtbarkeits-Score", den diese Branche verkauft, beschreibt die festgeschriebene Spitze, wo ihn niemand braucht, und ist Rauschen im Rest, wo fast jedes Unternehmen steht. Jede Zahl unten stammt aus den Läufen, und die Rohantworten sind veröffentlicht.

Warum dieselbe Frage 100-mal stellen?

Weil man nur so erfährt, was eine KI-Empfehlung ist. Große Sprachmodelle sind im Betrieb nicht deterministisch. Thinking Machines Lab hat einen Prompt 1.000-mal bei Temperatur null abgefragt — der Einstellung, die das Modell bei jedem Lauf identisch reagieren lassen soll — und 80 verschiedene Vervollständigungen erhalten. Ouyang, Zhang, Harman und Wang zeigten, dass mit den Standardeinstellungen von ChatGPT zwischen 48 % und 76 % der Programmieraufgaben über mehrere Anfragen hinweg nie zwei identische Ausgaben lieferten. Diese Studien betrafen Fakten und Code. Niemand hatte denselben Test auf das gerichtet, wofür eine ganze Branche inzwischen eine Zahl verkauft: welche Marken ein Assistent empfiehlt, wenn ein Käufer fragt.

Die Branche hat das Problem von der anderen Seite bemerkt. Im Mai zitierte Digiday Paul Dyer, CEO der Agentur /prompt: „Wenn Sie drei verschiedene Tools mit denselben Prompts füttern, bekommen Sie drei verschiedene Antworten." Die übliche Erklärung: Die Tools messen unterschiedlich. Wir wollten wissen, wie viel der Uneinigkeit schlicht daher rührt, dass die Engine sich selbst widerspricht.

Was wir getan haben

Drei Fragen, die ein echter Käufer tippt, aus Kategorien mit vielen bekannten Marken und ohne jede Beziehung zu uns:

  1. „What's the best CRM for a small business?"
  2. „What's the best project management tool for a small team?"
  3. „Which accounting software should a freelancer use?"

Jede Frage ging am 22. September 2026 (UTC) 100-mal an jede der drei Engines, von einem Standort aus, über die APIs, ohne Gesprächsverlauf und ohne Konto-Personalisierung:

  • ChatGPTgpt-4.1 über die Responses-API mit verfügbarem Websuche-Tool, das Modell konnte also suchen, wenn es wollte. Es suchte in 100 von 100 CRM-Antworten, 100 von 100 Projektmanagement-Antworten und 0 von 100 Buchhaltungs-Antworten.
  • Geminigemini-flash-latest, Google-Search-Grounding bei jedem Aufruf angeboten. Genutzt in 1 von 300 Antworten.
  • Claudeclaude-sonnet-5 über OpenRouter, ohne Websuche.

Als Kontrolle haben wir ChatGPT die CRM-Frage weitere 100-mal mit abgeschalteter Suche gestellt, um das Rauschen aus dem Abruf vom Rauschen aus dem Sampling zu trennen.

Eine Marke gilt in einer Antwort als empfohlen, wenn sie in einer Überschrift, einem nummerierten oder Aufzählungspunkt, einer Tabellenzeile oder einer fett beginnenden Zeile steht — dort, wo eine Antwort ihre Favoriten nennt. Eine nur beiläufig erwähnte Marke („integriert sich mit TurboTax") zählt nicht. Zuerst genannt ist die Marke ganz oben in der Liste. Alle Extraktionsregeln und der komplette Antwortsatz stehen in der Methodik am Ende.

Die Spitze jeder Antwort ist festgeschrieben

Dieselben drei Marken wurden in 899 von 900 Antworten empfohlen, über drei Fragen und drei Engines hinweg. Der einzige Ausreißer: ClickUp fehlte in einer einzigen Gemini-Antwort.

CRM für ein kleines Unternehmen ChatGPT Gemini Claude
HubSpot 100/100 100/100 100/100
Zoho CRM 100/100 100/100 100/100
Pipedrive 100/100 100/100 100/100
Salesforce 92/100 18/100 85/100
Freshsales 83/100 21/100 67/100
monday 12/100 97/100 17/100
Copper 0/100 62/100 17/100
Close 13/100 20/100 2/100
Streak 0/100 18/100 23/100
Less Annoying CRM 0/100 16/100 7/100
Projektmanagement für ein kleines Team ChatGPT Gemini Claude
Asana 100/100 100/100 100/100
Trello 100/100 100/100 100/100
ClickUp 100/100 99/100 100/100
Notion 77/100 100/100 100/100
Basecamp 75/100 64/100 11/100
monday.com 38/100 51/100 66/100
Linear 0/100 94/100 94/100
Jira 0/100 59/100 23/100
Zoho Projects 10/100 0/100 0/100
Buchhaltung für Freelancer ChatGPT Gemini Claude
QuickBooks 100/100 100/100 100/100
FreshBooks 100/100 100/100 100/100
Wave 100/100 100/100 100/100
Zoho Books 99/100 86/100 56/100
Xero 93/100 49/100 100/100
Bonsai 20/100 99/100 73/100
HoneyBook 0/100 42/100 2/100
FreeAgent 6/100 0/100 0/100

Lesen Sie die oberen und die unteren Zeilen jeder Tabelle als zwei verschiedene Welten. Oben empfiehlt der Assistent die Marke jedes Mal, wenn man fragt; der „Sichtbarkeits-Score" eines Tracking-Tools stünde für HubSpot heute, morgen und nächsten Monat bei 100 % und würde HubSpot nichts sagen. Unten meldet dasselbe Tool eine Zahl, die zwischen zwei Läufen im Abstand einer Stunde um Dutzende Punkte springt, ohne dass sich an der Marke etwas geändert hätte.

Wer zuerst genannt wird

„Irgendwo in der Antwort empfohlen" ist großzügig. Die Marke ganz oben in der Liste ist die, die die meisten Käufer zuerst ausprobieren, und hier ist der Riegel noch fester.

Frage ChatGPT nennt zuerst Gemini nennt zuerst Claude nennt zuerst
CRM HubSpot, 100 of 100 HubSpot, 100 of 100 HubSpot, 100 of 100
Projektmanagement ClickUp, 72 of 100 Asana, 91 of 100 Trello, 100 of 100
Buchhaltung QuickBooks, 61 of 100 FreshBooks, 55 of 100 Wave, 85 of 100

In 300 CRM-Antworten auf drei Engines wurde HubSpot 300-mal zuerst genannt. Nichts von dem Sampling-Rauschen, das 80 verschiedene Feynman-Biografien hervorbringt, erreicht die erste Zeile einer CRM-Empfehlung. Wo sich der erste Name bewegt, bewegt er sich zwischen zwei Etablierten: ClickUp oder Trello, QuickBooks oder Wave, FreshBooks oder Wave.

Unter den ersten drei: Münzwurf

Nun der Rest. Jede Marke außerhalb der festgeschriebenen Gruppe ist eine Wahrscheinlichkeit, und für die meisten eine niedrige mit breitem Fehlerbalken. Die 95-%-Intervalle unten sind das, was ein ehrliches Tracking-Tool neben einen „Score" aus einer Handvoll Läufen drucken müsste.

Marke, CRM-Frage ChatGPT 95-%-Intervall
Freshsales 83 % 74–89%
Close 13 % 8–21%
monday 12 % 7–20%
Marke, CRM-Frage Gemini 95-%-Intervall
Copper 62 % 52–71%
Salesforce 18 % 12–27%
Freshsales 21 % 14–30%
Streak 18 % 12–27%
Less Annoying CRM 16 % 10–24%

Zwei Dinge fallen auf. Erstens hängt die Chance einer Marke weit mehr von der Engine ab als von der Marke: Salesforce wird in 92 % der ChatGPT-Antworten empfohlen und in 18 % der Gemini-Antworten; Copper in 62 % bei Gemini und 0 % bei ChatGPT. Zweitens ist das Intervall einer Marke aus dem Rest, gemessen über zehn Läufe — mehr, als die meisten Tools verwenden —, breiter als jede Bewegung, die jemand feiern würde. Eine Marke, die zwischen zwei Wochenberichten „von 12 % auf 23 %" steigt, hat sich meistens gar nicht bewegt.

Die Überschneidung von Antwort zu Antwort erzählt dasselbe in einer Zahl. Vergleicht man die empfohlenen Marken jedes Antwortpaars, überschneiden sich ChatGPTs CRM-Antworten zu 86 %, Geminis zu 68 %, Claudes zu 63 %. Die festgeschriebenen drei tragen diese gesamte Überschneidung. Nimmt man sie heraus, unterscheidet sich der Rest einer typischen Antwort vom Rest der nächsten.

Was ChatGPT gelesen hat, um zu entscheiden

ChatGPT hat für alle 100 CRM-Antworten und alle 100 Projektmanagement-Antworten im Web gesucht. Was es gelesen hat, ist die nützlichste Tabelle dieser Studie, denn das ist der Teil, an dem ein Unternehmen ansetzen kann.

Quelle, CRM-Frage Gelesen in
croclub.com 97 von 100 Antworten
techradar.com 89
cloudspress.com 77
live-agent.cn 63
bizstackhub.com 56
interobservers.com 43
freshworks.com 42
beltstack.com 34
softabase.com 32
softwareconnect.com 24

Vierunddreißig verschiedene Domains über die 100 Antworten, im Median sieben pro Antwort, und eine davon in fast jeder. croclub.com ist The CRO Club, eine Affiliate-Bewertungsseite von Black & White Zebra; die Seite, die ChatGPT las, ist deren Liste von Enterprise-CRMs, 97-mal geöffnet, um eine Frage zu kleinen Unternehmen zu beantworten. Ihr eigener erster Tipp ist monday, das ChatGPT dann in 12 von 100 Antworten empfahl. Eine Seite lesen und ihr folgen sind zwei verschiedene Dinge: Die ersten drei des Modells kamen von tiefer als von der Seite, die es abrief.

Die Projektmanagement-Frage las eine andere Gruppe — starters-tools.com in 96 von 100 Antworten, spotsaas.com in 90, techdealforge.com in 77, ein Thread im Asana-Community-Forum in 73 —, und wieder entschied ein kleiner Kreis von Bestenlisten-Seiten, wer im Raum war. Keine Anbieter-Website schaffte es bei einer der beiden Fragen in die Top 5. Es ist dasselbe Muster wie damals, als wir unsere eigene Kategorie auditiert haben: Assistenten setzen Empfehlungen aus Drittseiten zusammen, und auf diesen Seiten zu stehen ist das, was den Rest bewegt.

Mit oder ohne Suche: woher das Rauschen kommt

Der Kontrolllauf beantwortet eine Frage, über die die Branche streitet. Mit abgeschalteter Websuche schrieb ChatGPT bei den CRM-Antworten immer noch dieselben drei fest — HubSpot, Zoho und Pipedrive in 100 von 100 — und nannte HubSpot jedes Mal zuerst. Aber der Rest wurde breiter: 17 verschiedene empfohlene Marken gegenüber 7 mit Suche, eine Überschneidung von Antwort zu Antwort von 76 % gegenüber 86 %, und Insightly, Less Annoying CRM und Keap tauchten aus dem Gedächtnis auf, wo die gesuchten Antworten sie nie erwähnten.

Der Abruf verengt den Rest also, statt ihn zu erweitern. Wenn das Modell jedes Mal dieselben sieben Seiten liest, holt es seine Nebenrollen aus diesen Seiten. Antwortet es aus dem Gedächtnis, schöpft es aus allem, was es je gelesen hat, und die Stichprobe rauscht stärker. Die festgeschriebenen drei sind überhaupt kein Abruf-Effekt: Sie überleben das Abschalten der Suche, also leben sie im Modell, nicht in den Seiten.

Die Frage, die ChatGPT nicht suchen wollte

Ein Ergebnis hat uns überrascht. Mit dem Suchtool bei jedem Aufruf nutzte ChatGPT es für 100 von 100 CRM-Antworten, 100 von 100 Projektmanagement-Antworten und 0 von 100 Buchhaltungs-Antworten. Dasselbe Tool, derselbe Tag, derselbe Formulierungsstil. Das Modell entscheidet pro Frage, ob es das Web braucht, und für „welche Buchhaltungssoftware für Freelancer" entschied es: nicht.

Das ist für die Messung wichtig. Ein Tool, das Zitate zählt — hat der Assistent Ihre Website verlinkt —, hätte für jeden Buchhaltungsanbieter null Zitate gemeldet, QuickBooks eingeschlossen, und die naive Lesart davon lautet „niemand wird zitiert". Die ehrliche Lesart: Es wurde nichts abgerufen, also stand ein Zitat nie zur Debatte. Wir haben über diesen Unterschied in was Grounding bedeutet geschrieben; so sieht er in der Praxis aus.

Was das bedeutet, wenn Sie ein Unternehmen führen

Wenn Sie zu den festgeschriebenen drei Ihrer Kategorie gehören, sagt Ihnen ein KI-Sichtbarkeits-Score nichts. Er wird jede Woche 100 % anzeigen. Ihr Risiko ist nicht, dass der Score sich bewegt; es ist, dass der kleine Kreis von Bestenlisten-Seiten, den die Engine liest, seine Meinung ändert — und diese Seiten sollten Sie beobachten, kein Dashboard.

Wenn Sie im Rest stehen, ist eine einzelne Zahl Rauschen. Das Intervall einer 12-%-Marke aus zehn Läufen reicht grob von 2 % bis 40 %. Jedes Produkt, das „Sie sind von 12 % auf 23 % gestiegen" ohne Intervall meldet, verkauft Stichprobenfehler als Fortschritt. Fragen Sie nach der Zahl der Läufe und dem Intervall; kann der Anbieter sie nicht nennen, ist die Zahl Dekoration. Deshalb berichtet SeeGeo Raten über wiederholte Läufe und verkauft nie einen „KI-Rang".

Der Weg in eine Antwort führt über die Seiten, die sie liest. Zehn Domains entschieden die CRM-Antwort. Für die meisten Kategorien ist die Liste so kurz. Finden Sie sie für Ihre Kategorie — die Assistenten nennen sie Ihnen, wenn Sie fragen und die Zitate behalten — und kommen Sie darauf. Das ist die ganze Off-Site-Arbeit an KI-Sichtbarkeit, und sie ist nicht geheimnisvoll.

Messen Sie durch Stichproben, nicht durch einmaliges Fragen. Zwanzig Wiederholungen eines festen Fragensets, berichtet als Rate mit Intervall, sind das Minimum, das aus einer Anekdote eine Messung macht. Unser eigener kostenloser Audit misst, ob eine Website lesbar und zitierfähig ist — die Bereitschaft —, und unser Tracking fragt die Engines genau aus diesem Grund wiederholt.

Häufige Fragen

Gibt ChatGPT jedes Mal dieselbe Antwort? Für die ersten Namen einer Empfehlung fast genau: HubSpot wurde in 100 von 100 CRM-Antworten auf drei Engines zuerst genannt. Für alles unter den ersten drei nein: Eine Marke aus dem Rest erschien je nach Engine in 1 % bis 62 % der Antworten, und aufeinanderfolgende Antworten auf dieselbe Frage überschnitten sich auf ChatGPT nur zu etwa 86 %.

Warum widersprechen sich KI-Sichtbarkeits-Tools? Teils, weil sie unterschiedlich messen, und teils, weil die Engine sich selbst widerspricht. Zwei Tools, die dieselbe Marke aus dem Rest je zehnmal abfragen, bekommen allein durch Zufall verschiedene Zahlen; das 95-%-Intervall einer 20-%-Marke aus zehn Läufen reicht grob von 6 % bis 51 %. Tools, die eine einzelne Zahl ohne Intervall melden, lassen sich nicht in Einklang bringen, weil keine der Zahlen je präzise war.

Liegt es daran, dass ChatGPT im Web gesucht hat? Nein. Mit abgeschalteter Suche wurden dieselben drei weiterhin in jeder Antwort empfohlen und HubSpot weiterhin jedes Mal zuerst genannt. Die Suche machte den Rest enger, weil das Modell immer wieder dieselben sieben Seiten las. Der Riegel sitzt im Modell; das Rauschen in dem, was ihn umgibt.

Welche Seiten entscheiden die Antwort? Bei der CRM-Frage croclub.com (97 von 100 Antworten), techradar.com (89) und cloudspress.com (77). Beim Projektmanagement starters-tools.com (96), spotsaas.com (90) und techdealforge.com (77). Keine Anbieter-Website in den Top 5 bei einer der beiden Fragen.

Kann ich die Rohantworten sehen? Ja. Alle 1.000 Antworten, die Extraktionsregeln und die Zusammenfassung sind unter github.com/Tunisian-Aaron/ai-visibility-study-2026 unter CC BY 4.0 veröffentlicht, neben unserer 107-Websites-Auditstudie.

Vollständige Methodik

Unverändert veröffentlicht; Läufe am 22. September 2026 (UTC), von einem Standort, über die APIs der Engines.

Fragen. Drei, gewählt wegen bekannter Markensets, Kaufabsicht und ohne Beziehung zu SeeGeo: „What's the best CRM for a small business?", „What's the best project management tool for a small team?", „Which accounting software should a freelancer use?". Eine Formulierung je Frage; Varianz durch Umformulierung wird hier nicht gemessen.

Engines und Einstellungen. ChatGPT: OpenAI Responses-API, Modell gpt-4.1, Tool web_search_preview bei jedem Aufruf verfügbar, Standard-Temperatur des Anbieters, kein System-Prompt, kein Verlauf; ob das Modell gesucht hat, wird aus den web_search_call-Elementen der Antwort gelesen. Gemini: gemini-flash-latest über die Generative-Language-API, google_search-Grounding bei jedem Aufruf angeboten; eine Antwort gilt als gegroundet, wenn Grounding-Metadaten zurückkommen (1 von 300). Claude: anthropic/claude-sonnet-5 über OpenRouter, max_tokens 1024, keine Tools. Kontrolle: ChatGPT wie oben ohne das Suchtool, nur CRM-Frage, 100 Läufe. Drei gleichzeitige Anfragen pro Engine; jeder Aufruf bei Transportfehler bis zu dreimal wiederholt; kein Aufruf scheiterte nach Wiederholung.

Extraktion. Ein Wörterbuch aus Markennamen und Aliassen je Frage (37 CRM-, 45 Projektmanagement-, 52 Buchhaltungs-Einträge), ohne Groß-/Kleinschreibung an Wortgrenzen abgeglichen. Empfohlen: Die Marke steht in einer Überschrift, einem nummerierten oder Aufzählungspunkt, einer Tabellenzeile oder einer fett beginnenden Zeile. Zuerst genannt: die erste solche Marke in Lesereihenfolge. Beiläufige Erwähnungen im Fließtext sind von beidem ausgeschlossen. Jede Überschrift jeder Antwort ohne Wörterbuchtreffer wurde von Hand geprüft; so gefundene echte Marken (HoneyBook, Bonsai) wurden vor dem finalen Durchlauf ergänzt. Überschneidung: mittlere Jaccard-Ähnlichkeit der empfohlenen Markensets über alle Antwortpaare einer Zelle. Intervall: Wilson-Score-Intervall, 95 %.

Quellen. Für gegroundete ChatGPT-Antworten die Domains der URLs in den Zitat-Annotationen der Antwort, je Antwort dedupliziert, www. entfernt.

Grenzen. Ein Tag, ein Standort, eine Formulierung je Frage, nur Englisch, drei Engines mit je einem Modell; die Ergebnisse beschreiben diese Läufe und sonst nichts. Modellverhalten ändert sich mit Versionen und Last, und dasselbe Experiment einen Monat später kann drei andere festschreiben. Geminis Grounding war angeboten, wurde aber fast nie genutzt, seine Antworten stammen also faktisch aus dem Gedächtnis; Claude hatte gar keine Suche; die Engines werden daher nicht unter gleichen Bedingungen verglichen, und wir erstellen keine Rangliste. Die Markenextraktion ist wörterbuchbasiert und kann eine in unerwarteter Form genannte Marke übersehen; die manuelle Prüfung nicht zugeordneter Überschriften ist die Abmilderung, keine Garantie. Wir haben keine Antwortqualität gemessen, nur welche Marken empfohlen wurden.

Wissen, wo Sie stehen? SeeGeo prüft Ihre Website auf Such- und KI-Sichtbarkeit und sagt Ihnen dann, was zu tun ist — in klarer Sprache.

Kostenlosen Audit starten