1,2 Milliarden Menschen pro Woche – so viele erreicht ChatGPT laut OpenAI. Das schreibt das Unternehmen in seinem Post „Building advertising for the way people use AI“, den es am Montag veröffentlicht hat, und es nennt sich dort „world’s largest AI-native consumer platform“. Das ist ein Claim von OpenAI, keine unabhängig geprüfte Zahl. Die Kernaussage für Ihren Shop in drei Sätzen: OpenAI testet laut eigener Angabe später im Oktober ein Anzeigenformat mit Bildern, und zwar während der Bildgenerierung in ChatGPT, zunächst in den USA mit einer ersten Gruppe von Werbetreibenden. Die drei veröffentlichten Erfolgszahlen stammen aus Partner-Cases zu ChatGPT Ads allgemein, nicht aus dem neuen Bildformat. Und sie wurden mit drei verschiedenen Methoden gemessen.
Wir bei digital-magazin.de haben den Originalpost von OpenAI heute, am Dienstag, 6. Oktober, noch einmal Absatz für Absatz gelesen. Die Frage, die uns dabei begleitet hat, ist die, die Sie sich als Händlerin oder Händler stellen sollten: Ist das schon ein neuer Kanal neben Google Shopping – oder ein Benchmark, den Sie noch gar nicht nachrechnen können? Meine Einschätzung vorab: eher das Zweite. Warum, das erkläre ich Ihnen nüchtern – ohne erfundene Zahlen. Die braucht es hier nicht.
Bildformat in ChatGPT Ads: Was OpenAI tatsächlich angekündigt hat
Neu ist nicht, dass ChatGPT Werbung zeigt. Das wissen Sie, und den bisherigen Start haben wir bereits in unserem Artikel zum Ads-Start und zur Budgetfrage gegenüber Meta und Google eingeordnet. Ich erzähle ihn hier nicht noch einmal nach. Neu ist: OpenAI will künftig Bildanzeigen verkaufen – und liefert die Messlatte gleich mit.
Zum Format selbst. Laut OpenAI zeigen die Anzeigen Bilder, die Produkt-Inspiration, Produktnutzung oder die damit möglichen Erlebnisse darstellen. Getestet wird das Format zunächst „during image generation“, also während der Bildgenerierung in ChatGPT. Die Anzeigen sind laut OpenAI klar gekennzeichnet und bleiben getrennt von dem Bild, das gerade erzeugt wird. Außerdem schreibt OpenAI, Werbung beeinflusse die Antworten von ChatGPT nicht. Das ist eine Aussage des Unternehmens; prüfen können wir sie von außen nicht.
Mehr steht nicht drin. Keine Platzierungsdetails, keine Preise, kein Abrechnungsmodell, kein Mindestbudget. Ich werde Ihnen also auch kein Mock-up beschreiben – es gibt schlicht keines, das ich belegen könnte.
Der Start: Der Test beginnt laut OpenAI „later this month“, also später im Oktober, in den USA, mit einer ersten Gruppe von Werbetreibenden. Kein konkretes Datum, kein weiteres Land. Klartext: Für den Shop in Köln oder Graz ist das heute kein Schalter, den Sie umlegen können, sondern ein Blick über den Atlantik.
Dass ChatGPT Ads nicht bei einem einzigen Format bleiben, sehen wir auch an den Sponsored Agents als Checkout-Dialog statt Banner. Das Bildformat ist also eine weitere Variante in einem wachsenden Werbebaukasten, kein Ersatz für Bestehendes.
Was das für Creatives und Produktbilder bedeuten könnte
Jetzt wird es spekulativ, und ich sage das ausdrücklich: Das Folgende ist meine eigene Einschätzung, keine Aussage von OpenAI. Bilder, die laut OpenAI Produkt-Inspiration, Produktnutzung oder mögliche Erlebnisse zeigen, sind eine andere Sprache als eine Textzeile oder ein Listing mit Preis und Versandkosten. Das ist die Sprache von Lookbooks, Anwendungsszenen und Stimmungsbildern.
Ich finde, daraus ergibt sich eine unbequeme, aber nützliche Übung. Schauen Sie sich Ihre vorhandenen Produktbilder an. Welche zeigen das Produkt nur freigestellt auf weißem Grund, weil der Marktplatz oder der Feed es verlangt? Welche zeigen es im Gebrauch? Wer heute nur Packshots hat, hat für ein inspirationsgetriebenes Bildformat vermutlich weniger Material als jemand mit einer gepflegten Bildwelt. Ob das am Ende wirklich zählt, wissen wir nicht – dazu fehlen schlicht Ergebnisse aus dem Test.
Ebenso offen ist, wer die Bilder liefert: Sie, eine Agentur, ein Werkzeug der Plattform? Der Post sagt dazu nichts. Und auch zu Rechten, Freigaben und Markenrichtlinien steht dort nichts. Das sind Fragen, die ich als Händler früh stellen würde, bevor das Format irgendwo in Ihrer Region auftaucht. Ein Bild, das Ihre Marke zeigt, ist schließlich kein Nebenprodukt, sondern Teil Ihres Auftritts.
Mein Rat bleibt trotzdem bodenständig: Kein Shop sollte jetzt Bildwelten neu aufsetzen, nur weil ein Test in den USA angekündigt wurde. Aber wer ohnehin Fotos plant, kann Anwendungsszenen und Kontextbilder gleich mitdenken. Das nützt Ihnen auch auf der Produktseite, im Newsletter und in jedem anderen Kanal.
Der Mess-Baukasten: Drei Ebenen, die man nicht vermischen sollte
Das eigentliche Händlerthema des Posts ist nicht das Bild, sondern die Messung. OpenAI listet hier viele Namen auf, und die werden schnell durcheinandergeworfen. Deshalb trenne ich drei Ebenen sauber – und übersetze jede in die Frage, was sie für einen Shop praktisch heißt.
Ebene 1: Konversionsdaten-Integrationen
Hightouch, Tealium und LiveRamp erleichtern es Werbetreibenden laut OpenAI, Konversionsdaten aus bestehenden Systemen an ChatGPT Ads zu senden. Das sind Integrationen für Konversionsdaten, keine Attributionsanbieter. Sie transportieren Daten – bewerten tun sie nichts.
Was heißt das im Shop-Alltag? Ihre Bestellungen entstehen im Shopsystem, Zahlungen laufen über Ihren Zahlungsanbieter, Retouren landen oft in der Warenwirtschaft, und Kundendaten liegen vielleicht noch in einem CRM. Eine Integration kann Teile davon an ChatGPT Ads übermitteln. Ob das, was ankommt, vollständig, dedupliziert und mit der richtigen Bestellung verknüpft ist, hängt an Ihrer Datenbasis.
Das Problem dabei: Wer schlechte Conversion-Daten hat, transportiert sie jetzt eben bequemer. Eine Integration repariert keine kaputte Erfassung. Wenn Ihre Bestellungen doppelt gezählt werden, wenn stornierte Aufträge als Verkäufe gelten oder wenn die Marge pro Bestellung nirgends auftaucht, dann sieht die Plattform ein Bild, das mit Ihrer Realität wenig zu tun hat. Und am Ende optimieren Sie auf das falsche Signal.
Ebene 2: Attribution
Für Attribution – Conversions API, Reporting, Klick-Attribution, für Web und App – nennt OpenAI Firmen wie AppsFlyer, Triple Whale, Adjust, DV Rockerbox, Northbeam, Branch, Singular, Kochava, Airbridge und Tenjin. Dazu kommen Partnerschaften mit „full-funnel and advanced measurement partners“: Fospha, Measured und INCRMNTAL.
Attribution beantwortet die Frage: Wem schreiben wir einen Verkauf zu? Das ist nützlich, aber es ist eine Zuordnungsregel und kein Beweis. Ein Verkauf, der ohnehin passiert wäre, bleibt ein zugeordneter Verkauf. Für Ihren Shop bedeutet das: Der Bericht eines Attributionsanbieters sagt Ihnen, welche Bestellungen nach Regeln dem Kanal zugerechnet werden – nicht, ob Sie ohne den Kanal weniger verkauft hätten.
Praktisch heißt das auch: Zwei Anbieter können mit denselben Rohdaten zu unterschiedlichen Zuordnungen kommen, weil Regeln, Zeitfenster und Datenquellen verschieden sind. Das ist kein Skandal, sondern der Normalfall. Es ist aber der Grund, warum Sie Zahlen verschiedener Anbieter nie ungeprüft nebeneinanderlegen sollten – dazu gleich mehr bei den Cases.
Ebene 3: Inkrementalität
Und hier wird OpenAI erfrischend ehrlich. Der Satz lautet wörtlich: „While our work on incrementality is still in its early stages“. Sinngemäß: Die Arbeit an der Inkrementalitätsmessung steht laut OpenAI noch am Anfang. Dazu arbeitet OpenAI mit Haus, Measured und WorkMagic an geo-basierten Experimenten, um den kausalen Effekt von ChatGPT Ads zu verstehen.
Mal ehrlich: Das ist der Knackpunkt. Inkrementalität fragt, was ohne die Anzeige passiert wäre. Genau diese Frage entscheidet über Ihre Marge. Und ausgerechnet dort sagt der Anbieter selbst, er stehe am Anfang. Ich finde, das ist zumindest aufrichtig – und es sollte Ihre Erwartungen an jede Zahl dämpfen, die aus diesem Umfeld kommt.
Für den Shop heißt das: Sie bekommen vom Kanal künftig wahrscheinlich Zahlen zu Zuordnung und womöglich auch zu Zusatzeffekten. Aber die Frage „Hat mir dieses Budget tatsächlich mehr Umsatz oder Gewinn gebracht, als ich ohne es gehabt hätte?“ beantwortet nur ein Experiment, das Sie selbst oder gemeinsam mit einem Dienstleister sauber aufsetzen. Alles andere ist Näherung.
Im Ads-Blog von OpenAI gibt es dazu eine zweite Quelle, „More ways to measure ChatGPT Ads“. Dort stehen Tests mit Kantar und Cint zur Messung von Markenwirkung (Brand Resonance) im „early-stage testing“. WorkMagics Geo-Lift-Studie schätzt für Dose 2,3-mal mehr inkrementelle Bestellungen, als die Last-Click-Attribution erfasst hatte. Und in einer frühen Analyse globaler Kampagnen fielen laut OpenAI 52,7 % der berechtigten One-Day-View-Through-Conversions in die erste Stunde nach der Ad-Impression. Alles OpenAI- beziehungsweise Partner-Angaben, ohne offengelegte Stichprobe. Ich nehme diese Werte deshalb ausdrücklich nicht in die Case-Liste unten auf und verrechne sie nicht mit den anderen.
Drei frühe Partner-Cases: Wer hat was womit gemessen?
OpenAI leitet die Cases mit dem Satz ein: „Early partner findings illustrate strong performance across different measurement approaches“. Beachten Sie die letzten Worte: unterschiedliche Messansätze. Das ist keine Kleinigkeit, sondern der Schlüssel zum Lesen der folgenden Liste. Alle drei Fälle betreffen ChatGPT Ads allgemein, nicht das neue Bildformat.
- WeightWatchers: Gemessen hat DV Rockerbox, das OpenAI als Attributionspartner führt. Laut dieser Attribution lag der CPA (Cost per Acquisition) auf ChatGPT Ads 15,3 % unter dem „blended paid-search benchmark“ von WeightWatchers, also dem eigenen, gemischten Paid-Search-Vergleichswert des Kunden.
- Dose (Wellness-Marke): Gemessen hat WorkMagic, das laut OpenAI zu den Partnern für geo-basierte Experimente gehört. Die Inkrementalitätsmessung zeigt einen statistisch signifikanten Lift; 67 % der inkrementellen Käufe kamen von „net-new customers“, also Neukunden.
- Portland Leather: Gemessen hat Triple Whale, das OpenAI als Attributionspartner führt. Laut der Auswertung der Besucherherkunft waren 93 % der Besucherinnen und Besucher, die über ChatGPT Ads kamen, neu.
Diese drei Werte sind nicht miteinander vergleichbar: andere Kunden, andere Messdienstleister, andere Methoden, andere Bezugsgrößen. Und keiner dieser Werte stammt aus dem neuen Bildformat.
Lassen Sie mich die Bezugsgrößen auseinanderklamüsern. Beim ersten Fall geht es um Kosten je Akquise, verglichen mit einem hausinternen Referenzwert – absolute CPA-Werte nennt die Quelle nicht. Beim zweiten geht es um die Herkunft inkrementeller Käufe, also um eine Verteilung innerhalb eines gemessenen Zusatzeffekts. Beim dritten geht es um Besucher. Drei Zahlen, drei Fragen. Wer sie zu einer Erfolgsgeschichte zusammenrührt, hat nichts verstanden – oder etwas zu verkaufen.
Was die Quellen ebenfalls nicht sagen: Kampagnengrößen, Laufzeiten, absolute Werte, Vergleichswerte zu anderen Plattformen. Meiner Einschätzung nach sind das Schaufensterzahlen, keine Benchmark. Das ist ausdrücklich meine eigene Lesart, kein Urteil über die genannten Unternehmen. Ein Schaufenster zeigt, was der Betreiber zeigen möchte – und das ist sein gutes Recht.
Neue Besucher, Neukunden, inkrementelle Käufe: drei verschiedene Dinge
Die Begriffe in den Cases klingen verwandt, bezeichnen aber Verschiedenes. Wer sie vermischt, zieht falsche Schlüsse. Deshalb hier die Unterschiede, so einfach wie möglich.
Neue Besucher sind Menschen, die Ihre Seite zum ersten Mal aufrufen – genauer: die ein Messsystem als neu einstuft. Das hängt davon ab, wie das System Menschen wiedererkennt. Wer Cookies löscht, das Gerät wechselt oder anders unterwegs ist, kann als „neu“ zählen, obwohl die Person Ihren Shop längst kennt. Und wer neu zu Besuch ist, hat damit noch nichts gekauft. Schauen, gehen, nie wiederkommen – auch das zählt als Besuch.
Neukunden sind Menschen, die zum ersten Mal bei Ihnen bestellen. Das ist eine Aussage über Käufe, nicht über Besuche. Damit sie belastbar ist, brauchen Sie eine saubere Kundenzuordnung – etwa über Kundenkonto oder E-Mail-Adresse. Ob jemand „net-new“ ist, entscheidet im Kern Ihr Datenbestand, nicht die Anzeige.
Inkrementelle Käufe sind Käufe, die ohne die Anzeige nicht stattgefunden hätten. Das ist die strengste dieser drei Größen, denn sie setzt einen Vergleich voraus: Gruppe mit Anzeige gegen Gruppe ohne. Und es ist eine Aussage über Verursachung, nicht über Zuordnung.
Jetzt zurück zu den Cases. Bei Dose lautet die Angabe: 67 % der inkrementellen Käufe kamen von Neukunden. Das kombiniert zwei Begriffe – zuerst wird der Zusatzeffekt gemessen, dann wird gefragt, wer hinter diesen zusätzlichen Käufen stand. Bei Portland Leather lautet die Angabe: 93 % der Besucher waren neu. Hier fehlt der Schritt zur Bestellung. Meine Lesart: Beides ist für sich genommen interessant, aber es wäre falsch, aus der zweiten Angabe auf Neukunden oder gar auf Zusatzumsatz zu schließen. Das hat die Quelle nicht gesagt.
Brand Suitability und Negative Phrases: Kontrolle im Gespräch
Ein dritter Block des Posts betrifft das Umfeld der Anzeigen. Bei einer Suchseite oder einem Video ist der Kontext sichtbar. In einer Konversation ist er das nicht ohne Weiteres. Laut OpenAI prüfen Placement-Guardrails, ob eine Konversation für Werbung geeignet ist, und halten Anzeigen aus emotional verletzlichen, sensiblen oder sonst unpassenden Kontexten heraus. Genannt werden automatisierte Prüfung, menschliche Aufsicht und laufendes Monitoring.
Dazu kommen „Negative Phrases“, gedacht für enge, markenspezifische Platzierungsvorgaben. Sie sind laut OpenAI jetzt für qualifizierte Werbetreibende verfügbar. Was „qualifiziert“ heißt, steht nicht im Post.
Spannend ist der unabhängige Teil: OpenAI entwickelt Brand-Suitability-Evaluationspiloten mit DoubleVerify (DV) und Integral Ad Science (IAS). Unabhängige Partner sollen in einer kontrollierten Testumgebung prüfen, wie OpenAIs Brand-Safety-Standards angewendet werden – ohne Zugriff auf private Nutzerkonversationen. Wichtig: Diese Piloten sind in Entwicklung. Sie laufen nicht.
Zwei Aussagen von Führungskräften, jeweils sinngemäß aus dem Englischen übersetzt:
Marketer bräuchten das Vertrauen, dass Brand-Safety-Schutz in KI-nativen Umgebungen dauerhaft, konsistent und skalierbar funktioniere; die unabhängige Evaluation von IAS werde prüfen, wie OpenAIs Schutzmechanismen über ein breites, sich veränderndes Spektrum von Szenarien funktionieren – unter Wahrung der Privatsphäre echter Nutzerkonversationen.
Lidiane Jones, CEO von Integral Ad Science (sinngemäße Übersetzung)
ChatGPT schaffe ein von Grund auf anderes Werbeumfeld, in dem der Kontext durch die Konversation selbst definiert werde statt durch eine Seite oder ein Video; man wolle unabhängige Messung in dieses Umfeld bringen und dabei die Privatsphäre der Nutzenden respektieren.
Mark Zagorski, CEO von DoubleVerify (sinngemäße Übersetzung)
Für Sie als Händlerin oder Händler heißt das: Die Frage „Wo erscheint meine Anzeige?“ ist hier komplizierter als bei einer Produktliste. Ob die Guardrails halten, was sie versprechen, soll künftig von außen geprüft werden – aber eben erst künftig. Bis dahin gilt eine OpenAI-Selbstauskunft, ergänzt um die Absicht, sie prüfen zu lassen. Das ist ein Anfang, keine Bescheinigung.
Was bedeutet das für die Praxis? Wenn Sie ein sensibles Sortiment führen – etwa Produkte, die mit Gesundheit, Körperbild oder Lebenskrisen zu tun haben können –, ist die Frage nach dem Gesprächskontext für Sie keine Theorie. Mit den „Negative Phrases“ lassen sich laut OpenAI enge, markenspezifische Vorgaben machen. Wie fein diese Steuerung ist und wie Sie sie prüfen können, steht nicht im Post. Genau das sollten Sie erfragen, bevor Sie Budget zusagen.
Neuer Kanal neben Google Shopping – oder Benchmark zum Nicht-Nachrechnen?
Dieses Bild wurde komplett mit KI generiertProviderhiggsfieldModellgpt_image_2PromptPhotorealistic close photo of hands arranging printed product photos without any text next to a smartphone with a dark blank screen on a white desk, soft light, no logos, no readable text, no watermarks, 16:9Jetzt zur Frage, wegen der Sie vermutlich lesen. Ich gehe sie in zwei Teilen durch.
Erstens: Ist das ein Kanal, den Sie heute buchen? Für das Bildformat lautet die Antwort nach der Quellenlage: nein. Der Test startet später im Oktober, in den USA, mit einer ersten Gruppe. Zu ChatGPT Ads insgesamt in Europa hat unser Artikel vom 30. August den damaligen Stand festgehalten: OpenAI will ChatGPT Ads nach Europa bringen. Den aktuellen Europa-Status nennt die Quelle vom 5. Oktober nicht. Ich behaupte also weder, es gebe die Anzeigen hier nicht, noch, sie seien verfügbar. Prüfen Sie den Stand selbst bei OpenAI; Unternehmen können sich laut OpenAI über ads.openai.com für Anzeigen anmelden.
Zweitens: Ist die Zahlenlage ein Benchmark? Hand aufs Herz: nein. Die drei Cases haben jeweils eigene Kunden, eigene Messdienstleister und eigene Methoden. Der eine Wert vergleicht mit einem hausinternen Paid-Search-Mix, der zweite misst Zusatzeffekte, der dritte zählt Besucher. Keiner kommt aus dem Bildformat. Wer daraus einen Maßstab für den eigenen Shop ableitet, vergleicht Äpfel mit Birnen und Kartoffeln.
Und Ihr Google-Shopping-ROAS? Der hängt an Ihrem Sortiment, Ihren Margen, Ihrem Feed und Ihrer Attribution. Halten Sie die OpenAI-Cases nicht dagegen. Die Bezugsgrößen passen nicht, und die Quellen liefern ohnehin keinen Vergleichswert zu Google Shopping oder anderen Plattformen. Ich finde, genau das ist die Schwäche der aktuellen Debatte: Alle wollen ein „besser als“ oder „schlechter als“, und die Daten geben beides nicht her.
Offen bleibt vieles. Wie wird abgerechnet? Gibt es Mindestbudgets? Wann kommt das Bildformat in andere Länder? Die Quellen schweigen, und ich fülle diese Lücken nicht mit Vermutungen.
Fragen an OpenAI und an Ihre Agentur
Wer die Lücken nicht selbst füllt, kann sie erfragen. Wenn Sie mit OpenAI, einem Messpartner oder Ihrer Agentur sprechen, wären das meine Fragen, in dieser Reihenfolge:
- Für welche Länder und Händlertypen gilt das Bildformat, und wann ist es für mich verfügbar?
- Wie wird abgerechnet, und welche Kennzahl ist die Grundlage meiner Berichte?
- Welche Konversionsdaten kann ich übermitteln, und wie werden Doppelzählungen, Stornos und Retouren behandelt?
- Welches Attributionsmodell und welches Zeitfenster liegen den Berichten zugrunde, und kann ich beides einsehen?
- Kann ich einen Holdout oder Geo-Test aufsetzen, und wer unterstützt mich dabei?
- Wie sind die genannten Erfolgsangaben entstanden: Welche Stichprobe, welcher Zeitraum, welche Vergleichsgruppe?
- Wie kann ich Ausschlüsse über „Negative Phrases“ steuern, und wie kann ich prüfen, in welchen Kontexten meine Anzeige erschienen ist?
- Wem gehören die Bilder, wer gibt sie frei, und wie gehe ich mit Markenrichtlinien um?
- Wie verlasse ich den Test wieder, ohne Daten oder Budget zu verlieren?
Nicht jede dieser Fragen wird sofort eine Antwort bekommen. Aber schon die Reaktion verrät etwas. Wer präzise antwortet, ist vorbereitet. Wer ausweicht, ist es vermutlich noch nicht.
Eigene Messung zuerst: So bauen Sie sich Ihren Maßstab
Wenn Sie in ChatGPT Ads irgendwann testen wollen, dann nicht mit fremden Zahlen im Kopf, sondern mit einer eigenen Messung. Mein Rat, redaktionell und ohne Zahlenbeispiele, in der Reihenfolge, die ich wählen würde:
- Saubere Conversion-Daten. Prüfen Sie, ob Bestellungen, Retouren und Marge sauber in Ihren Systemen ankommen. Die Konversionsdaten-Integrationen aus dem Post transportieren nur, was Sie ihnen geben.
- Holdout oder Geo-Test. Ein Teil Ihrer Zielgruppe oder bestimmte Regionen sehen die Anzeige nicht. Der Vergleich zeigt, was zusätzlich passiert. OpenAI selbst lotet mit Partnern geo-basierte Experimente aus, um den kausalen Effekt von ChatGPT Ads zu verstehen.
- Exit-Kriterium vorab. Legen Sie fest, bei welchem Ergebnis Sie aufhören – bevor das erste Budget fließt. Nachträglich findet jeder einen Grund weiterzumachen.
- Eine Methode, ein Bezugswert. Mischen Sie nicht Attribution, Besucherzahlen und Lift in einem Bericht. Entscheiden Sie, welche Frage Sie beantworten wollen.
Wie ein sauberes Testdesign aussieht, haben wir am Beispiel von A/B-Tests für Budgets und ROI-Ziele bei Google AI Max beschrieben. Die Logik lässt sich übertragen: eine Änderung, eine Vergleichsgruppe, ein vorab festgelegter Maßstab.
Was Holdout und Geo-Test im Shop-Alltag bedeuten
Die Begriffe klingen nach Statistikseminar. Im Alltag sind sie handfest. Beim Holdout halten Sie bewusst einen Teil Ihrer Zielgruppe von der Anzeige fern und vergleichen später, wie sich beide Gruppen verhalten. Das setzt voraus, dass Sie Gruppen sauber trennen können und dass sich beide Gruppen sonst ähnlich verhalten.
Beim Geo-Test trennen Sie nach Regionen. In einigen Gebieten laufen die Anzeigen, in vergleichbaren anderen nicht. Das hat einen Vorteil: Sie müssen einzelne Menschen nicht verfolgen, es genügt, Bestellungen nach Region auszuwerten. Und es hat Nachteile: Regionen unterscheiden sich in Kaufkraft, Wetter, Saison und Wettbewerb. Wählen Sie Gebiete, die sich in der Vergangenheit ähnlich entwickelt haben, und halten Sie währenddessen andere Kanäle möglichst stabil. Wer mitten im Test eine Rabattaktion fährt, verwässert den Vergleich.
Ehrlich gesagt ist das für kleinere Shops nicht trivial. Wenig Bestellungen pro Region heißt oft: rauschige Ergebnisse. Dann kann es klüger sein, den Test länger laufen zu lassen, als ihn zu früh zu deuten – oder auf einen Anbieter zu setzen, der solche Experimente begleitet. Genau dafür nennt OpenAI Partner wie Haus, Measured und WorkMagic. Ob und wie diese Angebote für Händler Ihrer Größe zugänglich sind, steht im Post nicht.
Zwei weitere Punkte gehören in jeden Testplan. Erstens: Legen Sie vorab fest, wie lange der Test läuft und was „Erfolg“ heißt – in Ihrer eigenen Kennzahl, etwa Deckungsbeitrag statt reiner Bestellanzahl. Zweitens: Dokumentieren Sie, was sich sonst im Zeitraum ändert, von Preisaktionen bis zu Lieferengpässen. Das klingt pedantisch, spart aber hinterher Diskussionen.
Das klingt nach Arbeit, und das ist es auch. Aber schlicht und einfach: Ohne diese Vorarbeit können Sie nach dem Test nicht sagen, ob ein Kanal Ihre Marge verbessert hat oder nur Verkäufe umgetauft. Und der Checkout interessiert sich nicht für schöne Dashboards.
Die Messung zuerst zu bauen, kostet Sie im besten Fall nichts außer Zeit – und sie nützt Ihnen bei jedem anderen Kanal. Wer dagegen erst bucht und danach nachdenkt, wie er das Ergebnis lesen soll, ist im Zweifel auf die Zahlen der Plattform angewiesen. Das ist bequem, aber selten die ganze Wahrheit.
Was die Cases Ihnen sagen – und was nicht
Ich will fair bleiben. Die drei Cases sind keine Nebelkerzen. Sie zeigen, dass Partner unterschiedliche Messmethoden an ChatGPT Ads anlegen, und dass eine davon – die Inkrementalitätsmessung bei Dose – einen statistisch signifikanten Lift ausweist. Das ist mehr als Anekdote. Aber es ist weniger als Beleg für Ihren Shop.
Was die Cases Ihnen sagen: Der Kanal ist messbar, zumindest mit den genannten Werkzeugen. Was sie nicht sagen: wie viel er bei Ihnen bringt, was er kostet, ob das Bildformat überhaupt ähnlich wirkt, ob Ihre Zielgruppe in ChatGPT Bilder generiert. Kurz: nichts, was Ihre Budgetentscheidung tragen könnte.
Besonders vorsichtig wäre ich bei der Verdichtung. Wer Neukunden unter inkrementellen Käufen und neue Besucher in einem Satz zu „ChatGPT bringt Neukunden“ zusammenzieht, überdehnt beide Aussagen. Das Wort „Neukundengewinnung“ gehört in Ihre eigene Auswertung, nicht in die Pressemitteilung eines Dritten.
Und die Reichweite? 1,2 Milliarden Menschen pro Woche ist eine große Zahl – als Claim von OpenAI. Wie viele davon Bilder generieren, in Ihrem Land sind oder zu Ihrer Zielgruppe gehören, sagt sie nicht. Reichweite ist kein Umsatz. Das wissen Sie aus dem Alltag besser als ich.
Noch ein Gedanke zum Vergleich mit dem eigenen Kanalmix. Wenn Sie heute Ihre Suchkampagnen oder Produktanzeigen auswerten, kennen Sie die Eigenheiten Ihrer Zahlen: Wie Sie Marken- und Nicht-Marken-Suche trennen, welche Retouren abgezogen werden, welches Zeitfenster gilt. Genau diese Details fehlen bei den OpenAI-Cases. Ohne sie ist jeder Vergleich ein Ratespiel mit Dezimalstellen.
Was bleibt? Eine Messlatte, die erst noch geeicht werden muss
OpenAI hat am Montag drei Dinge gleichzeitig angekündigt: ein Bildformat im Test, einen breiten Kreis an Mess- und Integrationspartnern und Vorhaben zur Brand Suitability. Das ist eine erkennbare Strategie. Anzeigen allein genügen nicht – Werbetreibende wollen sehen, was sie bewirken, und wissen, wo ihre Marke auftaucht. Dass OpenAI dabei selbst sagt, die Inkrementalitätsarbeit stehe noch am Anfang, nehme ich als Zeichen von Realismus.
Meine Lesart in einem Satz: Das Bildformat ist für Sie heute ein Beobachtungsthema, der Mess-Baukasten ist ein Arbeitsauftrag, und die drei Cases sind Schaufenster. Wer jetzt seine Conversion-Daten aufräumt und ein Testdesign mit Holdout oder Geo-Test samt Exit-Kriterium vorbereitet, verliert nichts – egal, ob ChatGPT Ads bei Ihnen morgen oder erst in einem Jahr relevant werden.
Was uns beschäftigt, sind die offenen Fragen. Wann kommt das Bildformat über die USA hinaus? Wie sieht das Abrechnungsmodell aus? Welche Ergebnisse liefert der Test – und werden sie mit offengelegter Methode und Stichprobe veröffentlicht? Und: Wann laufen die Brand-Suitability-Evaluationen von DoubleVerify und Integral Ad Science tatsächlich, und was kommt dabei heraus? Wir bei digital-magazin.de bleiben dran und melden uns, sobald es belastbare Angaben gibt – mit Quelle, Methode und, falls nötig, dem Hinweis, was fehlt.
Bis dahin eine Frage an Sie: Könnten Sie heute, ohne Plattformbericht, sagen, was ein zusätzlicher Kanal Ihrem Shop tatsächlich bringt? Wenn nicht, ist das Ihre erste Aufgabe – nicht die von OpenAI.




