Zum Inhalt springen50% Rabatt aufs erste Jahr50% Rabatt sichern
AutoSEO
  • GEO
  • Forschung

Welche GEO-Techniken wirken? Was die Forschung zeigt

Von AutoSEO Team

Veröffentlicht

13 Min. Lesezeit

Kurz gesagt

Die Forschung stützt GEO nur in einer engen Form. Im ursprünglichen GEO-Paper (Aggarwal et al., KDD 2024) steigerte das Ergänzen von Zitaten, Statistiken oder Quellenangaben den Anteil einer Quelle an einer KI-generierten Antwort um 30–40 % auf der Hauptmetrik, Keyword-Stuffing half dagegen nicht. Spätere Benchmarks sind skeptischer: C-SEO Bench (2025) fand die meisten dieser Umformulierungen für den Zitationsrang wirkungslos oder sogar schädlich, die Position eines Dokuments im abgerufenen Kontext wog deutlich schwerer. Dieser Beitrag fasst die Studien zusammen (AutoSEO hat keine eigenen Tests durchgeführt) und zeigt, wie Sie eine Technik mit Ihren eigenen Prompts prüfen.

Was hat das ursprüngliche GEO-Paper getestet?

GEO: Generative Engine Optimization von Aggarwal et al. erschien im November 2023 auf arXiv und 2024 auf der KDD. Es führte GEO-bench ein: 10.000 Suchanfragen aus neun Quellen wie MS MARCO, ELI5 und Perplexity.ai Discover, 25 Themenbereichen zugeordnet und zu rund 80 % informational.

Die „Generative Engine“ war eine eigene Pipeline der Autoren: Zu jeder Anfrage erhielt gpt-3.5-turbo die fünf besten Google-Treffer und schrieb daraus eine Antwort mit Quellenangaben (fünf Durchläufe bei Temperatur 0,7). Anschließend schrieb ein Sprachmodell eine der fünf Quellen mit einer von neun Methoden um, und die Autoren maßen, wie viel der neuen Antwort auf diese Quelle entfiel.

  • Inhaltliche Ergänzungen: Cite Sources (Quellen zitieren), Quotation Addition (Zitate), Statistics Addition (Statistiken).
  • Stil: Fluency Optimization (flüssiger Text), Easy-to-Understand (einfachere Sprache), Authoritative (überzeugenderer, autoritativer Ton).
  • Wortwahl: Keyword Stuffing (mehr Suchbegriffe wie im klassischen SEO), Unique Words, Technical Terms.

Sichtbarkeit wurde zweifach gemessen. Position-Adjusted Word Count ist der Anteil der Antwortwörter in Sätzen, die die Quelle zitieren, wobei frühe Sätze stärker zählen. Subjective Impression ist eine Bewertung durch GPT-3.5 nach sieben Kriterien wie Relevanz, Einfluss und Klickwahrscheinlichkeit.

Welche Techniken steigerten die Sichtbarkeit, welche nicht?

Auf GEO-bench lag die unoptimierte Ausgangsbasis bei 19,3 auf beiden Metriken. Nach der Umformulierung erreichte Quotation Addition 27,2 beim Position-Adjusted Word Count, Statistics Addition 25,2, Fluency Optimization 24,7 und Cite Sources 24,6. Die Autoren fassen Cite Sources, Quotation Addition und Statistics Addition als relative Verbesserung von 30–40 % beim Position-Adjusted Word Count und 15–30 % bei der Subjective Impression zusammen; die besten Methoden lagen 41 % bzw. 28 % über der Basis.

Auch reine Stiländerungen halfen: Fluency Optimization und Easy-to-Understand brachten laut Paper 15–30 % mehr Sichtbarkeit. Keyword Stuffing kam auf 17,7, also unter die Basis; die Autoren sprechen von „little to no improvement“. Unique Words (20,5) bewegte kaum etwas.

Zwei Ergebnisse werden oft zitiert. Erstens profitierten schlechter platzierte Quellen am stärksten: Cite Sources steigerte die Sichtbarkeit der in Google auf Rang 5 stehenden Quelle um 115,1 %, während die Quelle auf Rang 1 im Schnitt 30,3 % verlor. Zweitens übertraf die Kombination aus Fluency Optimization und Statistics Addition jede Einzelmethode um mehr als 5,5 %, gemessen an 200 Anfragen.

Die Wirkung hing vom Thema ab: Authoritative wirkte am besten bei Debatten- und Geschichtsfragen, Quotation Addition bei „People & Society“, Statistics Addition bei Recht und Verwaltung.

Was geschah bei Perplexity.ai?

Das Paper testete auch Perplexity.ai, allerdings nicht über die Live-Websuche. Da Perplexity keine Quell-URLs annahm, luden die Autoren die Quelltexte als Dateien hoch und prüften 200 Testanfragen. Quotation Addition verbesserte den Position-Adjusted Word Count um 22 %, Cite Sources und Statistics Addition zeigten laut Paper Verbesserungen von bis zu 9 % und 37 % auf den beiden Metriken, Keyword Stuffing schnitt 10 % schlechter ab als die Basis.

Was fanden spätere Studien?

C-SEO Bench (2025): Die meisten Umformulierungen verbesserten den Zitationsrang nicht

C-SEO Bench von Puerto et al. (NeurIPS 2025, Datasets and Benchmarks Track) prüfte acht GEO-Methoden und zwei neuere Verfahren an mehr als 1.900 Anfragen und 16.000 Dokumenten, für Fragebeantwortung und Produktempfehlungen. Als Antwortmaschinen dienten gpt-4o-mini, claude-3-5-haiku, o3 und o4-mini; gemessen wurde der Zitationsrang, nicht der Wortanteil.

Die meisten Methoden erzielten im Mittel nahezu keinen Effekt, viele sogar einen signifikant negativen: Statistics senkte den Rang in 19 von 24 untersuchten Konstellationen, bei Produktempfehlungen mit Haiku 3.5 waren 26 von 30 Fällen signifikant negativ. Stand das Dokument dagegen an erster Stelle im Kontext des Modells, fielen die Gewinne weit größer aus, etwa 2,77 ± 2,31 Rangplätze für den Bereich Retail mit gpt-4o-mini. Je mehr Wettbewerber dieselbe Methode nutzten, desto stärker schrumpften die Gewinne gegen null.

Die Autoren erklären den Unterschied mit der Metrik: Ein höherer Wortanteil bedeutet nicht, dass das Modell eine Quelle bevorzugt. Die Ergebnisse beider Papers zu Modellpräferenzen widersprechen sich ihrer Ansicht nach nicht.

Ranking-Manipulation funktioniert im Labor, bleibt aber Manipulation

Pfrommer et al. (EMNLP 2024) bauten mit RAGDOLL einen Datensatz aus 1.147 Produktseiten aus fünf Produktgruppen und zeigten, dass Sprachmodelle Produktname, Dokumentinhalt und Position im Kontext sehr unterschiedlich gewichten. Per Tree-of-Attacks-Jailbreak erzeugter Text schob schlecht platzierte Produkte nach oben und wirkte auch bei Perplexity. Kumar und Lakkaraju (2024) hoben fiktive Kaffeemaschinen mit einer „strategic text sequence“ in den Empfehlungen von Llama-2 nach oben. Nestaas et al. (2024) demonstrierten solche Angriffe bei Bing und Perplexity und beschreiben ein Gefangenendilemma: Alle greifen an, und die Antworten werden für alle schlechter.

Chen et al. (2025): KI-Suche bevorzugt Earned Media

Chen, Wang, Chen und Koudas (University of Toronto) verglichen Google mit den API-Varianten von GPT-4o Search, Claude, Gemini und Perplexity, mit Daten aus dem August 2025. Sie berichten von einer systematischen, deutlichen Bevorzugung von Earned Media (unabhängige Drittquellen) gegenüber markeneigenen und sozialen Inhalten: Bei US-Anfragen zu Unterhaltungselektronik stammten 92,1 % der Quellen der KI-Suche aus Earned Media. Die Studie ist beobachtend, und die Autoren bezeichnen ihre Quellenklassifikation selbst als teilweise subjektiv.

AutoGEO (2025): gelernte, maschinenspezifische Regeln

AutoGEO (Wu et al., 2025) ließ Sprachmodelle erklären, warum ein Dokument sichtbarer war als ein anderes, und leitete daraus Regeln für Umformulierungen ab. Auf simulierten Antwortmaschinen mit gemini-2.5-flash-lite, gpt-4o-mini und claude-3-haiku stiegen die GEO-Metriken im Schnitt um 35,99 %, ohne dass die Antwortqualität litt. Die Regelsätze der drei Modelle überschnitten sich zu 78,95–84,21 %, mit umfassender Themenabdeckung als gemeinsamer Regel; bei E-Commerce-Anfragen zählten dagegen konkrete Handlungsempfehlungen mehr als tiefe Erklärungen.

2026: Messrauschen und eine nüchterne Übersichtsarbeit

Sielinski (Preprint 2026) fragte Perplexity, OpenAI SearchGPT und Gemini neun Tage lang täglich sowie im Zehn-Minuten-Takt ab. Wiederholte Durchläufe derselben Anfrage zitierten unterschiedliche Domains: Die mediane Jaccard-Überschneidung auf Domainebene (1,0 = identisch) lag bei 0,29–0,31 für Gemini, 0,33–0,40 für SearchGPT und 0,50 für Perplexity. Unterschiede im Zitationsanteil unter 5–7 Prozentpunkten lagen meist im Rauschen.

Eine Übersichtsarbeit zu 45 Studien von Martinez (Juli 2026) kommt zu dem Schluss, dass bereits abgerufene Inhalte ihre Zitation nachweislich verändern können, aber keine untersuchte Technik einen stabilen, langfristigen, plattformübergreifenden kausalen Effekt auf die organische Auffindbarkeit oder das Nutzerverhalten zeigt. Eine Analyse von 602 Prompts aus 2026 fand, dass Seiten mit mehr Einfluss auf Antworten tendenziell länger, besser strukturiert und reicher an Definitionen, Zahlen und Schritten sind; das ist eine Korrelation, kein getesteter Eingriff.

Wie schneiden die Techniken im direkten Vergleich ab?

Effektgrößen so, wie die Papers sie angeben; Benchmarks, Modelle und Metriken unterscheiden sich zwischen den Zeilen.
TechnikBefundQuelle (Jahr)
Zitate ergänzenGEO-bench: 19,3 → 27,2 (Position-Adjusted Word Count); +22 % bei Perplexity (hochgeladene Dateien). C-SEO Bench: nahe null.Aggarwal et al. (2024); Puerto et al. (2025)
Statistiken ergänzenGEO-bench: 19,3 → 25,2; +37 % Subjective Impression bei Perplexity. C-SEO Bench: schlechterer Rang in 19 von 24 Konstellationen.Aggarwal et al. (2024); Puerto et al. (2025)
Quellen zitierenGEO-bench: 19,3 → 24,6; +115,1 % für die Quelle auf Rang 5, −30,3 % für Rang 1. C-SEO Bench: nahe null.Aggarwal et al. (2024); Puerto et al. (2025)
Flüssigerer Stil, einfachere SpracheGEO-bench: 15–30 % mehr Sichtbarkeit. C-SEO Bench: in den meisten Konstellationen nahe null.Aggarwal et al. (2024); Puerto et al. (2025)
Keyword-StuffingGEO-bench: 17,7 statt 19,3; bei Perplexity 10 % schlechter als die Basis.Aggarwal et al. (2024)
Besseres Ranking beim Abruf (klassisches SEO)Erste Position im Kontext: 2,77 ± 2,31 Rangplätze Gewinn (Retail, gpt-4o-mini), weit mehr als jede Umformulierung.Puerto et al. (2025); Pfrommer et al. (2024)
Gelernte, maschinenspezifische UmformulierungIm Schnitt +35,99 % auf GEO-Metriken bei stabiler Antwortqualität, auf simulierten Antwortmaschinen.Wu et al. (2025)
Berichterstattung durch Dritte92,1 % Earned-Media-Quellen in der KI-Suche bei US-Unterhaltungselektronik (beobachtend, August 2025).Chen et al. (2025)
Versteckte Anweisungen, Prompt InjectionHebt Produkte im Labor sowie bei Perplexity und Bing; manipulativ.Pfrommer et al. (2024); Nestaas et al. (2024)

Warum widersprechen sich die Studien?

  • Unterschiedliche Zielgrößen. GEO misst den Wortanteil, C-SEO Bench den Zitationsrang, Chen et al. die Quellenmischung. Keine Studie misst Traffic oder Umsatz.
  • Fester Kontext. Laborstudien geben dem Modell wenige Dokumente vor. Produktive KI-Suchen entscheiden erst, ob und was sie abrufen (siehe Query Fan-out).
  • Modelle und Zeitpunkt. GEO nutzte 2023 gpt-3.5-turbo, C-SEO Bench Modelle aus 2024 und 2025. Produktive Systeme ändern sich ohne Ankündigung.
  • Ein Akteur oder viele. Gewinne schrumpfen, wenn Wettbewerber ebenfalls optimieren, und nur wenige Experimente liefen gegen ein Live-Produkt.

Googles eigene Dokumentation weist in dieselbe Richtung wie C-SEO Bench: Für AI Overviews und AI Mode gebe es keine zusätzlichen Anforderungen und keine speziellen Optimierungen, die Best Practices für SEO blieben relevant (Google Search Central, zuletzt aktualisiert im Dezember 2025).

Was bedeutet das für Ihre Inhalte?

  • Zuerst abgerufen werden. Die Position beim Abruf war in C-SEO Bench der stärkste Hebel. Crawlbarkeit, Indexierung und klassische Rankings kommen vor jeder Umformulierung; siehe wie KI-Crawler Ihre Seiten lesen.
  • Nur belegbare Fakten ergänzen. Statistiken, Zitate und Quellen halfen im GEO-Paper, doch die Ergänzungen dort erzeugte ein Sprachmodell. Verwenden Sie nur Zahlen und Zitate mit Quelle, und verlinken Sie diese.
  • Teilfragen abdecken. Umfassende Abdeckung war eine gemeinsame AutoGEO-Regel; bei Kaufanfragen zählten konkrete Handlungsempfehlungen mehr als Erklärungen.
  • Berichterstattung durch Dritte gewinnen. Wenn KI-Suche Earned Media bevorzugt, können unabhängige Tests ebenso zählen wie Ihre eigene Seite.
  • Auf Keyword-Stuffing und versteckte Anweisungen verzichten. Ersteres half nicht, Letzteres ist Manipulation.
  • Jede Technik als Hypothese behandeln. Testen Sie sie an Ihren eigenen Prompts, bevor Sie sie auf die ganze Website ausrollen.

Wie testen Sie eine GEO-Technik selbst?

Ein Laboreffekt zeigt, was einen Versuch wert ist, nicht, was auf Ihren Seiten passiert. Ein einfacher kontrollierter Test:

  1. Testgruppe wählen. Nehmen Sie getrackte Prompts, für die die zu ändernde Seite eine plausible Antwort ist, und versehen Sie sie mit einem Tag für die Testgruppe.
  2. Kontrollgruppe wählen. Taggen Sie vergleichbare Prompts, deren Seiten Sie nicht anfassen; sie fangen Updates der KI-Suchen und saisonale Effekte ab.
  3. Ausgangswert erfassen. Tracken Sie beide Gruppen täglich über die relevanten KI-Antwortmaschinen, mindestens zwei bis vier Wochen vor jeder Änderung.
  4. Eine Seite, eine Technik ändern. Ergänzen Sie etwa belegte Statistiken. Notieren Sie das Veröffentlichungsdatum und ändern Sie sonst nichts an der Seite.
  5. Weiter tracken. Lassen Sie Antwortmaschinen, Märkte und Prompt-Formulierungen nach der Änderung mehrere Wochen unverändert.
  6. Differenzen vergleichen. Vergleichen Sie Erwähnungs- und Zitationsrate von Test- und Kontrollgruppe vor und nach der Änderung. Steigen beide Gruppen, liegt es vermutlich nicht an Ihrer Änderung.
  7. Rauschen ernst nehmen. Antworten schwanken von Durchlauf zu Durchlauf. Mehr Prompts und mehr Tage verringern die Unsicherheit; Unterschiede von wenigen Punkten sind oft Rauschen.

Beispiel: Ein fiktiver Anbieter von Rechnungssoftware testet Statistics Addition an seinem Preisratgeber. Alle Zahlen sind illustrativ.

  1. Das Team taggt 30 Prompts zu Rechnungskosten als test-stats und 30 Prompts zu anderen Funktionen als control.
  2. In vier Wochen Ausgangsmessung über ChatGPT, Perplexity und Google AI Overviews zeigt die Testgruppe eine illustrative Zitationsrate von 12 %, die Kontrollgruppe 10 %.
  3. Das Team ergänzt fünf Statistiken im Preisratgeber, jeweils mit Link zur Originalumfrage, und ändert sonst nichts.
  4. Vier Wochen später liegt die Testgruppe bei illustrativen 17 %, die Kontrollgruppe bei 11 %. Die Differenz der Differenzen beträgt 4 Punkte (5 minus 1).
  5. Angesichts der in der Forschung berichteten Schwankungen sind 4 Punkte bei 30 Prompts nicht belastbar; das Team verlängert den Test und nimmt weitere Prompts auf, bevor es entscheidet.

Wie messen Sie das mit AutoSEO?

AutoSEO misst Prompts, es sagt Ihnen nicht, welche Technik wirkt. Laut Open-Source-Code bietet es:

  • Prompt-Tracking über mehrere KI-Suchen. Prompts laufen täglich, wöchentlich oder monatlich auf den aktivierten Antwortmaschinen, etwa ChatGPT, Perplexity, Google AI Overviews, Google AI Mode, Gemini, Claude und Microsoft Copilot (AI Visibility Tracking). Pro Prompt, Antwortmaschine und Tag wird eine Antwort gespeichert; Wiederholungen sammeln sich also über die Tage.
  • Klar definierte Kennzahlen. Sichtbarkeit (Antworten, die Sie nennen oder zitieren), Erwähnungsrate, Zitationsrate (Antworten, die eine Ihrer Seiten zitieren), durchschnittliche Position und Share of Voice, jeweils im Vergleich zum gleich langen Vorzeitraum.
  • Tags für Test- und Kontrollgruppen. Prompts lassen sich taggen, und Tracker, Trends sowie die Tools des MCP-Servers filtern Kennzahlen nach Tag und Antwortmaschine.
  • Quellen. Die meistzitierten URLs und Domains, aufgeteilt in eigene, Wettbewerber- und Drittquellen, dazu eine Lückenanalyse gegenüber Wettbewerbern (AI Citation Tracking).
  • Content-Bewertung. Ein AEO-Score aus sechs gewichteten Säulen (Extractability, Fact density, Structure, Schema markup, Depth, Metadata), auch für eine bestehende URL vor der Überarbeitung (AI Content Optimization). Er ist eine heuristische Checkliste, kein validierter Prädiktor für Zitationen.
  • Prompt Research, um das Prompt-Set nach Thema, Persona und Funnel-Phase aufzubauen.

Jede gespeicherte Antwort hält fest, welches Backend sie erzeugt hat; ist keine direkte Quelle konfiguriert, kann ein Modell mit Websuche eine Antwortmaschine nachahmen, gekennzeichnet als simuliert. Halten Sie das Backend während eines Tests konstant.

Häufige Fragen

Ist GEO etwas anderes als SEO?

Teilweise. Das GEO-Paper optimiert, wie viel einer KI-Antwort auf eine bereits abgerufene Seite entfällt. C-SEO Bench und Googles Dokumentation deuten darauf hin, dass das Abgerufenwerden, also klassisches SEO, der größere Hebel bleibt.

Werden Seiten mit Statistiken häufiger zitiert?

Im GEO-Paper hob Statistics Addition den Position-Adjusted Word Count auf GEO-bench von 19,3 auf 25,2. C-SEO Bench fand, dass dieselbe Methode den Zitationsrang in 19 von 24 Konstellationen senkte. Ergänzen Sie Statistiken, weil sie Lesern helfen und belegt sind, und messen Sie die Wirkung an Ihren eigenen Prompts.

Wie lange sollte ein GEO-Test laufen?

Lange genug, um Ihre Änderung von der natürlichen Schwankung der Antworten zu trennen: einige Wochen täglicher Ausgangsmessung und einige Wochen danach, mit einer Kontrollgruppe von Prompts.

Sollte ich Seiten automatisch für GEO umschreiben lassen?

AutoGEO verbesserte GEO-Metriken auf simulierten Antwortmaschinen, und C-SEO Bench fand, dass die Vorteile früher Anwender schrumpfen, sobald Wettbewerber nachziehen. Prüfen Sie jede automatische Überarbeitung auf Richtigkeit, besonders ergänzte Zahlen und Zitate, und testen Sie sie vorab.

Warum zitieren verschiedene KI-Suchen unterschiedliche Quellen?

Sie rufen Inhalte unterschiedlich ab, nutzen verschiedene Modelle und ändern sich laufend. Chen et al. berichten Unterschiede bei Domainvielfalt, Aktualität und Empfindlichkeit gegenüber Formulierungen, und Sielinski maß geringe Überschneidungen selbst zwischen wiederholten Durchläufen derselben KI-Suche. Tracken Sie jede Antwortmaschine separat.

Quellen

Für diesen Artikel verwendete Primärquellen, Stand zum Veröffentlichungsdatum.

  1. arXiv / KDD 2024: Aggarwal et al., GEO: Generative Engine Optimization (2024)arxiv.org
  2. arXiv / NeurIPS 2025: Puerto et al., C-SEO Bench: Does Conversational SEO Work? (2025)arxiv.org
  3. arXiv / EMNLP 2024: Pfrommer et al., Ranking Manipulation for Conversational Search Engines (2024)arxiv.org
  4. arXiv: Kumar und Lakkaraju, Manipulating Large Language Models to Increase Product Visibility (2024)arxiv.org
  5. arXiv: Nestaas et al., Adversarial Search Engine Optimization for Large Language Models (2024)arxiv.org
  6. arXiv: Chen et al., Generative Engine Optimization: How to Dominate AI Search (2025)arxiv.org
  7. arXiv: Wu et al., What Generative Search Engines Like and How to Optimize Web Content Cooperatively (2025)arxiv.org
  8. arXiv: Sielinski, Quantifying Uncertainty in AI Visibility (2026)arxiv.org
  9. arXiv: Martinez, A Critical Survey of Generative Engine Optimization 2023–2026 (2026)arxiv.org
  10. arXiv: From Citation Selection to Citation Absorption (2026)arxiv.org
  11. Google Search Central: KI-Funktionen und Ihre Website (2025)developers.google.com

Weiterlesen

Alle Artikel

Messen Sie Ihre eigene KI-Sichtbarkeit

AutoSEO ist Open Source. Betreiben Sie es kostenlos auf Ihrem eigenen Server oder lassen Sie es von uns in der AutoSEO Cloud betreiben.

50% Rabatt sichern