---
title: "Wir haben ChatGPT 100-mal dieselbe Frage gestellt. Die ersten drei änderten sich nie. Alle anderen: Münzwurf."
description: "1.000 identische Kauffragen an ChatGPT, Gemini und Claude. Dieselben drei Marken führten jede Antwort an; darunter schwankte eine Marke von 1 % bis 62 %."
canonical: https://see-geo.com/de/blog/same-question-100-times
language: de
published: 2026-09-22
author: "SeeGeo Team"
publisher: SeeGeo
alternates:
  en: https://see-geo.com/blog/same-question-100-times
  fr: https://see-geo.com/fr/blog/same-question-100-times
---

# Wir haben ChatGPT 100-mal dieselbe Frage gestellt. Die ersten drei änderten sich nie. Alle anderen: Münzwurf.

> 1.000 identische Kauffragen an ChatGPT, Gemini und Claude. Dieselben drei Marken führten jede Antwort an; darunter schwankte eine Marke von 1 % bis 62 %.

**Kurze Antwort: Wir haben ChatGPT, Gemini und Claude dieselben drei Kauffragen je 100-mal gestellt — „bestes CRM für ein kleines Unternehmen", „bestes Projektmanagement-Tool für ein kleines Team", „welche Buchhaltungssoftware für Freelancer". 1.000 Antworten in einer Sitzung, ohne Personalisierung, eine Formulierung pro Frage. Die Spitze jeder Antwort ist festgeschrieben: HubSpot, Zoho und Pipedrive wurden in 100 von 100 ChatGPT-Antworten zu CRMs empfohlen, und HubSpot wurde in 100 von 100 zuerst genannt — auf allen drei Engines. Unter den ersten drei ist die Antwort ein Münzwurf: Close erschien in 13 von 100 und monday in 12, die Chance einer Marke lag je nach Engine zwischen 1 % und 62 %, und die festgeschriebenen drei trugen fast die gesamte Überschneidung von einer Antwort zur nächsten. ChatGPT las in 97 seiner 100 CRM-Antworten dieselbe Affiliate-Bestenliste, und bei der Buchhaltungsfrage suchte es gar nicht im Web. Der eine „KI-Sichtbarkeits-Score", den diese Branche verkauft, beschreibt die festgeschriebene Spitze, wo ihn niemand braucht, und ist Rauschen im Rest, wo fast jedes Unternehmen steht.** Jede Zahl unten stammt aus den Läufen, und die Rohantworten sind veröffentlicht.

## Warum dieselbe Frage 100-mal stellen?

Weil man nur so erfährt, was eine KI-Empfehlung *ist*. Große Sprachmodelle sind im Betrieb nicht deterministisch. Thinking Machines Lab hat einen Prompt 1.000-mal bei Temperatur null abgefragt — der Einstellung, die das Modell bei jedem Lauf identisch reagieren lassen soll — und [80 verschiedene Vervollständigungen](https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/) erhalten. Ouyang, Zhang, Harman und Wang zeigten, dass mit den Standardeinstellungen von ChatGPT [zwischen 48 % und 76 % der Programmieraufgaben](https://arxiv.org/abs/2308.02828) über mehrere Anfragen hinweg nie zwei identische Ausgaben lieferten. Diese Studien betrafen Fakten und Code. Niemand hatte denselben Test auf das gerichtet, wofür eine ganze Branche inzwischen eine Zahl verkauft: welche Marken ein Assistent empfiehlt, wenn ein Käufer fragt.

Die Branche hat das Problem von der anderen Seite bemerkt. Im Mai zitierte Digiday Paul Dyer, CEO der Agentur /prompt: [„Wenn Sie drei verschiedene Tools mit denselben Prompts füttern, bekommen Sie drei verschiedene Antworten."](https://digiday.com/marketing/marketers-question-expensive-ai-visibility-tools-as-inconsistent-results-fuel-skepticism/) Die übliche Erklärung: Die Tools messen unterschiedlich. Wir wollten wissen, wie viel der Uneinigkeit schlicht daher rührt, dass die Engine sich selbst widerspricht.

## Was wir getan haben

Drei Fragen, die ein echter Käufer tippt, aus Kategorien mit vielen bekannten Marken und ohne jede Beziehung zu uns:

1. „What's the best CRM for a small business?"
2. „What's the best project management tool for a small team?"
3. „Which accounting software should a freelancer use?"

Jede Frage ging am 22. September 2026 (UTC) 100-mal an jede der drei Engines, von einem Standort aus, über die APIs, ohne Gesprächsverlauf und ohne Konto-Personalisierung:

- **ChatGPT** — `gpt-4.1` über die Responses-API mit verfügbarem Websuche-Tool, das Modell konnte also suchen, wenn es wollte. Es suchte in 100 von 100 CRM-Antworten, 100 von 100 Projektmanagement-Antworten und **0 von 100** Buchhaltungs-Antworten.
- **Gemini** — `gemini-flash-latest`, Google-Search-Grounding bei jedem Aufruf angeboten. Genutzt in 1 von 300 Antworten.
- **Claude** — `claude-sonnet-5` über OpenRouter, ohne Websuche.

Als Kontrolle haben wir ChatGPT die CRM-Frage weitere 100-mal mit abgeschalteter Suche gestellt, um das Rauschen aus dem Abruf vom Rauschen aus dem Sampling zu trennen.

Eine Marke gilt in einer Antwort als **empfohlen**, wenn sie in einer Überschrift, einem nummerierten oder Aufzählungspunkt, einer Tabellenzeile oder einer fett beginnenden Zeile steht — dort, wo eine Antwort ihre Favoriten nennt. Eine nur beiläufig erwähnte Marke („integriert sich mit TurboTax") zählt nicht. Zuerst genannt ist die Marke ganz oben in der Liste. Alle Extraktionsregeln und der komplette Antwortsatz stehen in der Methodik am Ende.

## Die Spitze jeder Antwort ist festgeschrieben

Dieselben drei Marken wurden in 899 von 900 Antworten empfohlen, über drei Fragen und drei Engines hinweg. Der einzige Ausreißer: ClickUp fehlte in einer einzigen Gemini-Antwort.

| CRM für ein kleines Unternehmen | ChatGPT | Gemini | Claude |
|---|---|---|---|
| HubSpot | 100/100 | 100/100 | 100/100 |
| Zoho CRM | 100/100 | 100/100 | 100/100 |
| Pipedrive | 100/100 | 100/100 | 100/100 |
| Salesforce | 92/100 | 18/100 | 85/100 |
| Freshsales | 83/100 | 21/100 | 67/100 |
| monday | 12/100 | 97/100 | 17/100 |
| Copper | 0/100 | 62/100 | 17/100 |
| Close | 13/100 | 20/100 | 2/100 |
| Streak | 0/100 | 18/100 | 23/100 |
| Less Annoying CRM | 0/100 | 16/100 | 7/100 |

| Projektmanagement für ein kleines Team | ChatGPT | Gemini | Claude |
|---|---|---|---|
| Asana | 100/100 | 100/100 | 100/100 |
| Trello | 100/100 | 100/100 | 100/100 |
| ClickUp | 100/100 | 99/100 | 100/100 |
| Notion | 77/100 | 100/100 | 100/100 |
| Basecamp | 75/100 | 64/100 | 11/100 |
| monday.com | 38/100 | 51/100 | 66/100 |
| Linear | 0/100 | 94/100 | 94/100 |
| Jira | 0/100 | 59/100 | 23/100 |
| Zoho Projects | 10/100 | 0/100 | 0/100 |

| Buchhaltung für Freelancer | ChatGPT | Gemini | Claude |
|---|---|---|---|
| QuickBooks | 100/100 | 100/100 | 100/100 |
| FreshBooks | 100/100 | 100/100 | 100/100 |
| Wave | 100/100 | 100/100 | 100/100 |
| Zoho Books | 99/100 | 86/100 | 56/100 |
| Xero | 93/100 | 49/100 | 100/100 |
| Bonsai | 20/100 | 99/100 | 73/100 |
| HoneyBook | 0/100 | 42/100 | 2/100 |
| FreeAgent | 6/100 | 0/100 | 0/100 |

Lesen Sie die oberen und die unteren Zeilen jeder Tabelle als zwei verschiedene Welten. Oben empfiehlt der Assistent die Marke jedes Mal, wenn man fragt; der „Sichtbarkeits-Score" eines Tracking-Tools stünde für HubSpot heute, morgen und nächsten Monat bei 100 % und würde HubSpot nichts sagen. Unten meldet dasselbe Tool eine Zahl, die zwischen zwei Läufen im Abstand einer Stunde um Dutzende Punkte springt, ohne dass sich an der Marke etwas geändert hätte.

## Wer zuerst genannt wird

„Irgendwo in der Antwort empfohlen" ist großzügig. Die Marke ganz oben in der Liste ist die, die die meisten Käufer zuerst ausprobieren, und hier ist der Riegel noch fester.

| Frage | ChatGPT nennt zuerst | Gemini nennt zuerst | Claude nennt zuerst |
|---|---|---|---|
| CRM | HubSpot, 100 of 100 | HubSpot, 100 of 100 | HubSpot, 100 of 100 |
| Projektmanagement | ClickUp, 72 of 100 | Asana, 91 of 100 | Trello, 100 of 100 |
| Buchhaltung | QuickBooks, 61 of 100 | FreshBooks, 55 of 100 | Wave, 85 of 100 |

In 300 CRM-Antworten auf drei Engines wurde HubSpot 300-mal zuerst genannt. Nichts von dem Sampling-Rauschen, das 80 verschiedene Feynman-Biografien hervorbringt, erreicht die erste Zeile einer CRM-Empfehlung. Wo sich der erste Name bewegt, bewegt er sich zwischen zwei Etablierten: ClickUp oder Trello, QuickBooks oder Wave, FreshBooks oder Wave.

## Unter den ersten drei: Münzwurf

Nun der Rest. Jede Marke außerhalb der festgeschriebenen Gruppe ist eine Wahrscheinlichkeit, und für die meisten eine niedrige mit breitem Fehlerbalken. Die 95-%-Intervalle unten sind das, was ein ehrliches Tracking-Tool neben einen „Score" aus einer Handvoll Läufen drucken müsste.

| Marke, CRM-Frage | ChatGPT | 95-%-Intervall |
|---|---|---|
| Freshsales | 83 % | 74–89% |
| Close | 13 % | 8–21% |
| monday | 12 % | 7–20% |

| Marke, CRM-Frage | Gemini | 95-%-Intervall |
|---|---|---|
| Copper | 62 % | 52–71% |
| Salesforce | 18 % | 12–27% |
| Freshsales | 21 % | 14–30% |
| Streak | 18 % | 12–27% |
| Less Annoying CRM | 16 % | 10–24% |

Zwei Dinge fallen auf. Erstens hängt die Chance einer Marke weit mehr von der Engine ab als von der Marke: Salesforce wird in 92 % der ChatGPT-Antworten empfohlen und in 18 % der Gemini-Antworten; Copper in 62 % bei Gemini und 0 % bei ChatGPT. Zweitens ist das Intervall einer Marke aus dem Rest, gemessen über zehn Läufe — mehr, als die meisten Tools verwenden —, breiter als jede Bewegung, die jemand feiern würde. Eine Marke, die zwischen zwei Wochenberichten „von 12 % auf 23 %" steigt, hat sich meistens gar nicht bewegt.

Die Überschneidung von Antwort zu Antwort erzählt dasselbe in einer Zahl. Vergleicht man die empfohlenen Marken jedes Antwortpaars, überschneiden sich ChatGPTs CRM-Antworten zu 86 %, Geminis zu 68 %, Claudes zu 63 %. Die festgeschriebenen drei tragen diese gesamte Überschneidung. Nimmt man sie heraus, unterscheidet sich der Rest einer typischen Antwort vom Rest der nächsten.

## Was ChatGPT gelesen hat, um zu entscheiden

ChatGPT hat für alle 100 CRM-Antworten und alle 100 Projektmanagement-Antworten im Web gesucht. Was es gelesen hat, ist die nützlichste Tabelle dieser Studie, denn das ist der Teil, an dem ein Unternehmen ansetzen kann.

| Quelle, CRM-Frage | Gelesen in |
|---|---|
| croclub.com | 97 von 100 Antworten |
| techradar.com | 89 |
| cloudspress.com | 77 |
| live-agent.cn | 63 |
| bizstackhub.com | 56 |
| interobservers.com | 43 |
| freshworks.com | 42 |
| beltstack.com | 34 |
| softabase.com | 32 |
| softwareconnect.com | 24 |

Vierunddreißig verschiedene Domains über die 100 Antworten, im Median sieben pro Antwort, und eine davon in fast jeder. croclub.com ist The CRO Club, eine Affiliate-Bewertungsseite von Black & White Zebra; die Seite, die ChatGPT las, ist deren Liste von *Enterprise*-CRMs, 97-mal geöffnet, um eine Frage zu *kleinen* Unternehmen zu beantworten. Ihr eigener erster Tipp ist monday, das ChatGPT dann in 12 von 100 Antworten empfahl. Eine Seite lesen und ihr folgen sind zwei verschiedene Dinge: Die ersten drei des Modells kamen von tiefer als von der Seite, die es abrief.

Die Projektmanagement-Frage las eine andere Gruppe — starters-tools.com in 96 von 100 Antworten, spotsaas.com in 90, techdealforge.com in 77, ein Thread im Asana-Community-Forum in 73 —, und wieder entschied ein kleiner Kreis von Bestenlisten-Seiten, wer im Raum war. Keine Anbieter-Website schaffte es bei einer der beiden Fragen in die Top 5. Es ist dasselbe Muster wie damals, als [wir unsere eigene Kategorie auditiert haben](https://see-geo.com/de/blog/we-audited-ourselves): Assistenten setzen Empfehlungen aus Drittseiten zusammen, und auf diesen Seiten zu stehen ist das, was den Rest bewegt.

## Mit oder ohne Suche: woher das Rauschen kommt

Der Kontrolllauf beantwortet eine Frage, über die die Branche streitet. Mit abgeschalteter Websuche schrieb ChatGPT bei den CRM-Antworten immer noch dieselben drei fest — HubSpot, Zoho und Pipedrive in 100 von 100 — und nannte HubSpot jedes Mal zuerst. Aber der Rest wurde breiter: 17 verschiedene empfohlene Marken gegenüber 7 mit Suche, eine Überschneidung von Antwort zu Antwort von 76 % gegenüber 86 %, und Insightly, Less Annoying CRM und Keap tauchten aus dem Gedächtnis auf, wo die gesuchten Antworten sie nie erwähnten.

Der Abruf verengt den Rest also, statt ihn zu erweitern. Wenn das Modell jedes Mal dieselben sieben Seiten liest, holt es seine Nebenrollen aus diesen Seiten. Antwortet es aus dem Gedächtnis, schöpft es aus allem, was es je gelesen hat, und die Stichprobe rauscht stärker. Die festgeschriebenen drei sind überhaupt kein Abruf-Effekt: Sie überleben das Abschalten der Suche, also leben sie im Modell, nicht in den Seiten.

## Die Frage, die ChatGPT nicht suchen wollte

Ein Ergebnis hat uns überrascht. Mit dem Suchtool bei jedem Aufruf nutzte ChatGPT es für 100 von 100 CRM-Antworten, 100 von 100 Projektmanagement-Antworten und 0 von 100 Buchhaltungs-Antworten. Dasselbe Tool, derselbe Tag, derselbe Formulierungsstil. Das Modell entscheidet pro Frage, ob es das Web braucht, und für „welche Buchhaltungssoftware für Freelancer" entschied es: nicht.

Das ist für die Messung wichtig. Ein Tool, das *Zitate* zählt — hat der Assistent Ihre Website verlinkt —, hätte für jeden Buchhaltungsanbieter null Zitate gemeldet, QuickBooks eingeschlossen, und die naive Lesart davon lautet „niemand wird zitiert". Die ehrliche Lesart: Es wurde nichts abgerufen, also stand ein Zitat nie zur Debatte. Wir haben über diesen Unterschied in [was Grounding bedeutet](https://see-geo.com/de/glossary/grounding) geschrieben; so sieht er in der Praxis aus.

## Was das bedeutet, wenn Sie ein Unternehmen führen

**Wenn Sie zu den festgeschriebenen drei Ihrer Kategorie gehören, sagt Ihnen ein KI-Sichtbarkeits-Score nichts.** Er wird jede Woche 100 % anzeigen. Ihr Risiko ist nicht, dass der Score sich bewegt; es ist, dass der kleine Kreis von Bestenlisten-Seiten, den die Engine liest, seine Meinung ändert — und diese Seiten sollten Sie beobachten, kein Dashboard.

**Wenn Sie im Rest stehen, ist eine einzelne Zahl Rauschen.** Das Intervall einer 12-%-Marke aus zehn Läufen reicht grob von 2 % bis 40 %. Jedes Produkt, das „Sie sind von 12 % auf 23 % gestiegen" ohne Intervall meldet, verkauft Stichprobenfehler als Fortschritt. Fragen Sie nach der Zahl der Läufe und dem Intervall; kann der Anbieter sie nicht nennen, ist die Zahl Dekoration. Deshalb [berichtet SeeGeo Raten über wiederholte Läufe und verkauft nie einen „KI-Rang"](https://see-geo.com/methodology).

**Der Weg in eine Antwort führt über die Seiten, die sie liest.** Zehn Domains entschieden die CRM-Antwort. Für die meisten Kategorien ist die Liste so kurz. Finden Sie sie für Ihre Kategorie — die Assistenten nennen sie Ihnen, wenn Sie fragen und die Zitate behalten — und kommen Sie darauf. Das ist die ganze Off-Site-Arbeit an KI-Sichtbarkeit, und sie ist nicht geheimnisvoll.

**Messen Sie durch Stichproben, nicht durch einmaliges Fragen.** Zwanzig Wiederholungen eines festen Fragensets, berichtet als Rate mit Intervall, sind das Minimum, das aus einer Anekdote eine Messung macht. Unser eigener [kostenloser Audit](https://see-geo.com/de) misst, ob eine Website lesbar und zitierfähig ist — die Bereitschaft —, und unser Tracking fragt die Engines genau aus diesem Grund wiederholt.

## Häufige Fragen

**Gibt ChatGPT jedes Mal dieselbe Antwort?**
Für die ersten Namen einer Empfehlung fast genau: HubSpot wurde in 100 von 100 CRM-Antworten auf drei Engines zuerst genannt. Für alles unter den ersten drei nein: Eine Marke aus dem Rest erschien je nach Engine in 1 % bis 62 % der Antworten, und aufeinanderfolgende Antworten auf dieselbe Frage überschnitten sich auf ChatGPT nur zu etwa 86 %.

**Warum widersprechen sich KI-Sichtbarkeits-Tools?**
Teils, weil sie unterschiedlich messen, und teils, weil die Engine sich selbst widerspricht. Zwei Tools, die dieselbe Marke aus dem Rest je zehnmal abfragen, bekommen allein durch Zufall verschiedene Zahlen; das 95-%-Intervall einer 20-%-Marke aus zehn Läufen reicht grob von 6 % bis 51 %. Tools, die eine einzelne Zahl ohne Intervall melden, lassen sich nicht in Einklang bringen, weil keine der Zahlen je präzise war.

**Liegt es daran, dass ChatGPT im Web gesucht hat?**
Nein. Mit abgeschalteter Suche wurden dieselben drei weiterhin in jeder Antwort empfohlen und HubSpot weiterhin jedes Mal zuerst genannt. Die Suche machte den Rest *enger*, weil das Modell immer wieder dieselben sieben Seiten las. Der Riegel sitzt im Modell; das Rauschen in dem, was ihn umgibt.

**Welche Seiten entscheiden die Antwort?**
Bei der CRM-Frage croclub.com (97 von 100 Antworten), techradar.com (89) und cloudspress.com (77). Beim Projektmanagement starters-tools.com (96), spotsaas.com (90) und techdealforge.com (77). Keine Anbieter-Website in den Top 5 bei einer der beiden Fragen.

**Kann ich die Rohantworten sehen?**
Ja. Alle 1.000 Antworten, die Extraktionsregeln und die Zusammenfassung sind unter [github.com/Tunisian-Aaron/ai-visibility-study-2026](https://github.com/Tunisian-Aaron/ai-visibility-study-2026) unter CC BY 4.0 veröffentlicht, neben unserer 107-Websites-Auditstudie.

## Vollständige Methodik

*Unverändert veröffentlicht; Läufe am 22. September 2026 (UTC), von einem Standort, über die APIs der Engines.*

**Fragen.** Drei, gewählt wegen bekannter Markensets, Kaufabsicht und ohne Beziehung zu SeeGeo: „What's the best CRM for a small business?", „What's the best project management tool for a small team?", „Which accounting software should a freelancer use?". Eine Formulierung je Frage; Varianz durch Umformulierung wird hier nicht gemessen.

**Engines und Einstellungen.** ChatGPT: OpenAI Responses-API, Modell `gpt-4.1`, Tool `web_search_preview` bei jedem Aufruf verfügbar, Standard-Temperatur des Anbieters, kein System-Prompt, kein Verlauf; ob das Modell gesucht hat, wird aus den `web_search_call`-Elementen der Antwort gelesen. Gemini: `gemini-flash-latest` über die Generative-Language-API, `google_search`-Grounding bei jedem Aufruf angeboten; eine Antwort gilt als gegroundet, wenn Grounding-Metadaten zurückkommen (1 von 300). Claude: `anthropic/claude-sonnet-5` über OpenRouter, `max_tokens` 1024, keine Tools. Kontrolle: ChatGPT wie oben ohne das Suchtool, nur CRM-Frage, 100 Läufe. Drei gleichzeitige Anfragen pro Engine; jeder Aufruf bei Transportfehler bis zu dreimal wiederholt; kein Aufruf scheiterte nach Wiederholung.

**Extraktion.** Ein Wörterbuch aus Markennamen und Aliassen je Frage (37 CRM-, 45 Projektmanagement-, 52 Buchhaltungs-Einträge), ohne Groß-/Kleinschreibung an Wortgrenzen abgeglichen. *Empfohlen*: Die Marke steht in einer Überschrift, einem nummerierten oder Aufzählungspunkt, einer Tabellenzeile oder einer fett beginnenden Zeile. *Zuerst genannt*: die erste solche Marke in Lesereihenfolge. Beiläufige Erwähnungen im Fließtext sind von beidem ausgeschlossen. Jede Überschrift jeder Antwort ohne Wörterbuchtreffer wurde von Hand geprüft; so gefundene echte Marken (HoneyBook, Bonsai) wurden vor dem finalen Durchlauf ergänzt. *Überschneidung*: mittlere Jaccard-Ähnlichkeit der empfohlenen Markensets über alle Antwortpaare einer Zelle. *Intervall*: Wilson-Score-Intervall, 95 %.

**Quellen.** Für gegroundete ChatGPT-Antworten die Domains der URLs in den Zitat-Annotationen der Antwort, je Antwort dedupliziert, `www.` entfernt.

**Grenzen.** Ein Tag, ein Standort, eine Formulierung je Frage, nur Englisch, drei Engines mit je einem Modell; die Ergebnisse beschreiben diese Läufe und sonst nichts. Modellverhalten ändert sich mit Versionen und Last, und dasselbe Experiment einen Monat später kann drei andere festschreiben. Geminis Grounding war angeboten, wurde aber fast nie genutzt, seine Antworten stammen also faktisch aus dem Gedächtnis; Claude hatte gar keine Suche; die Engines werden daher nicht unter gleichen Bedingungen verglichen, und wir erstellen keine Rangliste. Die Markenextraktion ist wörterbuchbasiert und kann eine in unerwarteter Form genannte Marke übersehen; die manuelle Prüfung nicht zugeordneter Überschriften ist die Abmilderung, keine Garantie. Wir haben keine Antwortqualität gemessen, nur welche Marken empfohlen wurden.
