Synthetische Daten: Kann KI den Menschen als Datenquelle ersetzen?

Warum synthetische Befragte faszinierend sind – und warum die entscheidende Frage nicht lautet, ob KI Menschen simulieren kann.

Es klingt nach einem Paradigmenwechsel in der Marktforschung. Keine Rekrutierung von Teilnehmern. Keine Fragebögen. Keine Wartezeit auf Feldarbeit. Stattdessen lässt man eine KI Tausende von „Menschen" simulieren und fragt sie, was sie von einem neuen Produkt, einer Marke oder einer Werbekampagne halten. Die Antworten sind sofort da. Und oft klingen sie erstaunlich menschlich. Genau darin liegt die Faszination – aber auch das Problem. Denn eine plausible Antwort ist noch lange keine valide Antwort. 

Der Reiz synthetischer Daten ist unbestreitbar

Die Vorteile liegen auf der Hand: Synthetische Befragungen sind schnell, skalierbar und vergleichsweise günstig. Varianten lassen sich in großer Zahl durchspielen. Man kann Zielgruppen differenzieren, Szenarien verändern und Fragen stellen, die mit klassischen Stichproben teuer oder praktisch unmöglich wären. Für Unternehmen ist das attraktiv. Statt eine Studie wochenlang vorzubereiten, könnte eine erste Einschätzung innerhalb von Stunden vorliegen. Das verändert die Ökonomie von Forschung. Aber es verändert nicht automatisch die Qualität der Entscheidung. Denn hinter einer menschlichen Befragung steht ein reales Individuum mit Erfahrungen, Gewohnheiten, Widersprüchen, sozialen Einflüssen und situativen Reaktionen. Ein synthetischer Befragter dagegen ist ein Modell. Die entscheidende Frage lautet deshalb:

„Wie gut muss ein Modell die Realität abbilden, damit eine darauf basierende Entscheidung sinnvoll ist?“

Die aktuelle Forschung liefert hierzu ein differenziertes Bild. Eine 2026 veröffentlichte Untersuchung von Forschern um Olivier Toubia verglich sogenannte Digital Twins – also KI-Modelle, die auf Informationen über konkrete Personen basieren – mit den Antworten realer Menschen. Das Ergebnis ist ernüchternd: Die Digital Twins korrelierten nur schwach mit den tatsächlichen Antworten der Menschen. Die Studie identifizierte außerdem systematische Verzerrungen, unter anderem durch Stereotypisierung, mangelnde Individualisierung und eine Tendenz zu rationaleren Antworten als bei echten Menschen.

Das ist ein wichtiger Punkt. Denn genau diese Verzerrungen sind schwer zu erkennen, wenn man nur die Antworten der KI betrachtet. Die KI liefert keine Warnmeldung:

„Achtung, diese Antwort ist möglicherweise zu rational."

Sie liefert eine plausible Antwort. Und genau deshalb kann synthetische Forschung so überzeugend wirken. Aber die Geschichte ist nicht so einfach. Gleichzeitig wäre es falsch, daraus abzuleiten, dass synthetische Daten grundsätzlich nicht funktionieren. Eine im September 2026 veröffentlichte Feldstudie von Forschern der Columbia Business School und Partnern untersuchte sogenannte Customer Digital Twins in einem realen Finanzdienstleistungsumfeld. Dafür wurden Daten von rund 330.000 Kunden verwendet. Die entscheidende Besonderheit: Nicht die Ähnlichkeit zu einer menschlichen Befragung war das Erfolgskriterium, sondern ein tatsächliches Geschäftsergebnis – die Conversion.

In den untersuchten Cross-Selling-Szenarien wurden deutliche Verbesserungen gegenüber der bisherigen Vorgehensweise berichtet. Das ist wesentlich interessanter als eine KI, die in einer Befragung „menschlich klingt". Denn hier wurde letztlich eine einfache Frage gestellt: Funktioniert es in der Realität? Damit zeichnet sich eine wichtige Unterscheidung ab.

Synthetische Daten können dort besonders interessant sein, wo sie auf umfangreichen realen Verhaltens- und Transaktionsdaten aufbauen und anschließend gegen tatsächliche Ergebnisse getestet werden. Das ist etwas anderes als die Behauptung: Vielleicht stellen wir die falsche Frage. Die Diskussion wird häufig als Entweder-oder geführt: Mensch oder KI? Das halte ich für die falsche Fragestellung. Interessanter ist:

„Welche Aufgabe soll die Simulation eigentlich erfüllen?“

Wenn ich wissen möchte, wie eine konkrete Person auf eine völlig neue Situation reagieren wird, ist die Unsicherheit groß. Wenn ich dagegen vorhandene Kundendaten nutze, um unterschiedliche Angebote zu priorisieren und anschließend die tatsächliche Conversion messe, kann ein KI-Modell einen ganz anderen Nutzen haben. Der Unterschied ist entscheidend. Im ersten Fall geht es um die Simulation menschlichen Verhaltens. Im zweiten Fall geht es um die Verbesserung einer konkreten Geschäftsentscheidung. Das sind zwei völlig unterschiedliche Ansprüche.

Der Durchschnitt kann täuschen

Ein weiteres Problem entsteht, wenn synthetische Daten auf aggregierter Ebene gut aussehen. Nehmen wir an, eine synthetische Stichprobe sagt voraus, dass 42 Prozent der Kunden ein neues Produkt interessant finden. Eine echte Befragung kommt ebenfalls auf 42 Prozent. Das klingt hervorragend. Aber vielleicht sind es nicht dieselben Menschen. Vielleicht versteht das Modell die Verteilung falsch. Vielleicht überschätzt es bestimmte Kundentypen und unterschätzt andere. Vielleicht produziert es einen richtigen Durchschnitt aus den falschen Gründen.

Für eine grobe Marktabschätzung kann das möglicherweise ausreichen. Für eine hochgradig personalisierte Entscheidung kann es fatal sein. Deshalb muss man zwischen aggregierter Genauigkeit und individueller Vorhersagekraft unterscheiden.

Was bedeutet das für die Marktforschung?

Für mich bedeutet es vor allem, dass die Diskussion nüchterner werden muss. Synthetische Daten sind kein Ersatz für reale Menschen. Aber sie müssen das vielleicht auch gar nicht sein. Ihre Stärke könnte vielmehr darin liegen, dort eingesetzt zu werden, wo Geschwindigkeit, Skalierung und Exploration wichtiger sind als die vollständige Abbildung individueller menschlicher Komplexität. Zum Beispiel:

  • bei der Entwicklung erster Hypothesen,
  • beim Durchspielen vieler Varianten,
  • bei der Vorbereitung einer qualitativen oder quantitativen Studie,
  • bei der Identifikation möglicher Zielgruppenunterschiede,
  • bei der Priorisierung von Ideen,
  • bei der Optimierung von Angeboten auf Basis realer Verhaltensdaten.

Und anschließend kommt der entscheidende Schritt: Validierung in der Realität.

  • Das kann ein A/B-Test sein.
  • Eine tatsächliche Conversion.
  • Eine echte Kaufentscheidung.
  • Oder – wenn es um Einstellungen und Motive geht – eine Untersuchung mit realen Menschen.

Vielleicht entsteht gerade ein neues Forschungsmodell. Damit könnte sich auch die Rolle klassischer Marktforschung verändern. Nicht: KI ersetzt die Befragten. Sondern: KI erweitert den Raum dessen, was vor einer realen Entscheidung getestet werden kann. Man könnte beispielsweise zunächst mit synthetischen Daten tausende Produktvarianten oder Botschaften explorieren. Danach werden nur die interessantesten Varianten mit echten Menschen getestet. Und anschließend entscheidet das tatsächliche Marktverhalten. Das wäre kein Sieg der KI über den Menschen. Es wäre eine andere Arbeitsteilung. KI für Geschwindigkeit und Skalierung. Menschen für Validierung dort, wo menschliches Verhalten tatsächlich der Unsicherheitsfaktor ist.

Und reale Marktdaten als letztendlicher Reality Check. Die wichtigste Frage lautet deshalb anders. Die interessante Frage für Unternehmen ist nicht: „Kann KI Menschen simulieren?" Das kann sie bereits erstaunlich gut. Die wichtigere Frage lautet: „Für welche Entscheidung ist die Simulation gut genug?" Und genau dort wird es spannend. Denn zwischen einer netten KI-Demo und einem belastbaren Business Case liegt ein großer Unterschied. Wer diesen Unterschied nicht berücksichtigt, kann mit synthetischen Daten sehr schnell sehr viele Antworten produzieren.

Wer ihn berücksichtigt, kann möglicherweise etwas viel Wertvolleres gewinnen: mehr Entscheidungen, die schneller getestet werden können – bevor echtes Geld eingesetzt wird.

Quellen

Die aktuelle Diskussion stützt sich insbesondere auf die Arbeiten von Olivier Toubia und Kollegen zu Synthetic Data und Digital Twins sowie auf die 2026 veröffentlichte Feldstudie zu Customer Digital Twins und tatsächlichen Conversion-Ergebnissen.

Information icon

Wir benötigen Ihre Zustimmung zum Laden der Übersetzungen

Wir nutzen einen Drittanbieter-Service, um den Inhalt der Website zu übersetzen, der möglicherweise Daten über Ihre Aktivitäten sammelt. Bitte überprüfen Sie die Details in der Datenschutzerklärung und akzeptieren Sie den Dienst, um die Übersetzungen zu sehen.