Sonntagabend, kurz vor neun. Das Bewerbungsanschreiben muss morgen früh raus.
Sie öffnen ChatGPT, tippen drei Stichpunkte ein und bekommen vier saubere Absätze zurück. Ein bisschen Feinschliff, Name drunter, abgeschickt.
Diese Szene habe ich mir ausgedacht, eine OpenAI-Statistik steckt nicht dahinter. Sie steht aber für etwas, das viele kennen. Und sie wirft eine Frage auf, die seit dem 5. Oktober im Raum steht: Was ändert sich, wenn in solchen Texten ein Stempel steckt, den Sie nicht sehen und nicht prüfen können?
Kurze Antwort vorweg: weniger, als die Schlagzeilen vermuten lassen. Mehr, als Sie vielleicht denken.
Ich gehe das Schritt für Schritt durch. Erst die Ankündigung, dann die Technik, dann die Zahlen. Danach drei Alltagsszenen: die Bewerbung, die Mail an die Vermieterin, die Hausaufgabe. Alle drei sind mein Framing und ausdrücklich keine Daten von OpenAI.
Was hat OpenAI da eigentlich angekündigt?
Am Montag, dem 5. Oktober, hat OpenAI seinen Ansatz für Text-Herkunft in der EU vorgestellt. Heute, am Mittwoch, 7. Oktober, ist das noch ziemlich frisch. Die Hauptquelle von OpenAI lohnt einen eigenen Blick.
Der Kern: „Over the coming weeks“, also in den kommenden Wochen, bekommen „eligible“ Texte aus ChatGPT und Codex in der EU ein unsichtbares Text-Wasserzeichen. Es heißt textGrain.
Ein konkretes Startdatum nennt OpenAI nicht. Das gilt über alle Tarife hinweg, aber nur in der EU. Einen globalen Standard gibt es dafür nicht.
Moment mal: „eligible“. Das Wort ist unscharf. Meine Lesart: Es heißt nicht, dass jeder einzelne ChatGPT-Satz markiert wird. Welche Texte genau darunterfallen, steht für mich nicht fest.
Was könnte „eligible“ praktisch heißen? Ich spekuliere hier ausdrücklich, das ist keine Aussage von OpenAI.
Denkbar ist, dass Länge, Textart oder Einsatzort eine Rolle spielen. Der Code of Practice nimmt Texte unter 200 Token und Code-Snippets aus, das ist belegt. Ob OpenAI „eligible“ genau so zieht, steht in der Ankündigung nicht.
Für Sie heißt das: Gehen Sie nicht davon aus, dass jeder Absatz einen Stempel trägt. Gehen Sie aber auch nicht vom Gegenteil aus.
Für die API gilt etwas anderes. Dort ist das Wasserzeichen seit dem 5. Oktober weltweit als Opt-in verfügbar. Standardmäßig bleibt es aus. Wer es nutzen will, muss es also aktiv einschalten.
Damit nichts durcheinandergerät: Das sind zwei verschiedene Wege. Beim Rollout für ChatGPT und Codex geht es um die EU und um „eligible“ Texte, über alle Tarife. Bei der API geht es um einen weltweiten Opt-in, dessen Default „aus“ lautet.
Meine Folgerung aus diesem Default: Ein Text aus einer Anwendung, die über die API an ein OpenAI-Modell angebunden ist, trägt das Muster vermutlich nur, wenn jemand den Opt-in eingeschaltet hat. Wie viele das tun, weiß heute niemand.
OpenAI verweist bei alldem auf die Transparenzpflichten des EU AI Acts. Zum genauen Datum einer Pflicht widersprechen sich die Quellen. Ich lege mich deshalb nicht fest und rate auch von schnellen Datumsbehauptungen ab.
Wer verstehen will, wie die Kennzeichnungsdebatte in Europa insgesamt läuft, findet dazu unseren Beitrag zur Kennzeichnungspflicht:
Wie soll ein Wasserzeichen unsichtbar sein, das aus Wörtern besteht?
Gute Frage. Die Antwort ist unspektakulär.
textGrain arbeitet statistisch. Das Modell wählt Wörter beziehungsweise Token so aus, dass sich in einem längeren Text ein Muster bildet. Ein passender Detektor kann dieses Muster später nachweisen.
Was es laut OpenAI nicht gibt: versteckte Zeichen, zusätzliche Token oder unsichtbare Leerzeichen. Copy & Paste fügt nichts hinzu und nimmt nichts weg. Das Muster steckt in der Wortwahl selbst.
Stellen Sie sich (mein Bild, nicht das von OpenAI) eine Handschrift vor. Niemand klebt einen Aufkleber auf den Brief. Aber wer viele Seiten vergleicht, erkennt Vorlieben bei Schleifen und Abständen. Bei textGrain sind es Vorlieben bei der Wortwahl, die nur über viele Wörter hinweg sichtbar werden.
Daraus folgt etwas Praktisches. Es gibt nichts, was Sie aus dem Text „herauslöschen“ könnten. Kein Zeichen, das ein Editor anzeigt. Kein Filter, der es entfernt, indem er Sonderzeichen säubert.
OpenAI plant, das Verfahren als Open Source zu veröffentlichen. Ein Termin steht in den Angaben nicht. Ich finde, genau dort entscheidet sich später, wie viel Vertrauen das Verfahren bekommt, denn offener Code lässt sich von Dritten prüfen.
Und die Textqualität? OpenAI verweist auf Astra-Benchmarks. Der AA Intelligence Index liegt ohne Wasserzeichen bei 49,57 und mit Wasserzeichen bei 49,76 Punkten, GPQA Diamond ohne bei 94,44 % und mit bei 93,94 %. Laut OpenAI sind das keine bedeutsamen Unterschiede. Mehr als diese Randnotiz braucht es dazu nicht.
Wie zuverlässig ist die Erkennung?
Hier lohnt genaues Lesen. Alle Zahlen stammen aus der OpenAI-eigenen Evaluation unter Idealbedingungen, bei einer Falsch-positiv-Rate (FPR) von 1 %.
Das heißt: Von 100 menschlich geschriebenen Texten soll im Schnitt einer fälschlich als markiert gelten.
Bei einem Text von 200 Token liegt die Erkennung laut OpenAI bei etwa 80 %. Bei 400 Token sind es etwa 95 %. Das Beispiel stammt aus der Psychologie. Bei Mathematik-Texten ist die Erkennung laut OpenAI „substantially lower“, also deutlich niedriger.
Länge hilft also. Das Fachgebiet auch, in beide Richtungen.
Dazu gehört ein Satz von OpenAI selbst, den ich übersetze: „Starke Leistung unter Idealbedingungen garantiert keine verlässliche Erkennung im Alltag.“ Das schreibt OpenAI, nicht ich.
Ich finde es bemerkenswert, dass der Anbieter das so deutlich sagt. Es nimmt Druck aus der Debatte, weil niemand die Zahlen als Freibrief lesen soll. Es lässt aber offen, wie groß die Lücke zwischen Labor und Alltag am Ende wirklich ist.
Warum zählen Idealbedingungen so viel? Weil sie festlegen, wofür eine Zahl überhaupt gilt.
Im Labor geht es um einen Text in bekannter Länge, in einem Fach, das gut passt, und so, wie das Modell ihn ausgegeben hat. Im Alltag wird gekürzt, ergänzt, umgestellt, aus mehreren Quellen zusammenkopiert. Jede dieser Veränderungen kann das Ergebnis verschieben. Wie stark, sagen die Werte nicht.
Meine Lesart: Die 95 % bei 400 Token sind das Bild eines guten Falls. Ein Durchschnitt für alles, was ChatGPT je geschrieben hat, sind sie nicht.
Wir bei digital-magazin.de haben uns schon früher angesehen, wie wackelig KI-Detektoren sein können. Wer das vertiefen will, findet es in unserem Beitrag zu KI-Content-Detektoren. Ein Textwasserzeichen ist etwas anderes als eine Stilanalyse, doch die Vorsicht bei Einzelfällen bleibt.
Und wenn ich den Text danach überarbeite?
Dann wird es relevant. Denn kaum jemand schickt den Rohtext raus.
OpenAI hat auch das getestet, in einer eigenen Auswertung mit Texten von 400 Token. Unbearbeitet lag die Erkennung dort laut OpenAI bei etwa 92 %. Das ist eine andere Messreihe als der Längenvergleich oben, deshalb weicht der Wert von den 95 % ab. Ersetzt man 10 % der Wörter durch Synonyme, sinkt sie laut OpenAI auf 66 %. Bei 25 % Synonym-Ersatz liegt sie bei 17 %.
Text-Wasserzeichen-Erkennung nach Synonym-Ersatz laut OpenAI-Evaluation (400 Token)
Das Muster in der Wortwahl wird durch Umformulieren schwächer. Das ist logisch. Wer Wörter tauscht, verändert genau das, worin der Stempel steckt.
Zurück zu Ihrem Sonntagabend. Sie streichen zwei Formulierungen, tauschen ein paar Adjektive, kürzen den Schluss und machen aus „sehr motiviert“ ein „hoch motiviert“. Ob das schon reicht, sagt die Zahl nicht. Sie gilt für eine bestimmte Basis, nicht für Ihre Bewerbung.
Deshalb wäre es falsch, aus „66 %“ oder „17 %“ eine Faustregel zu machen. Es sind Laborwerte für einen definierten Fall mit Synonym-Ersatz. Wie ein echter Mensch tatsächlich überarbeitet, ist meist unordentlicher: Sätze werden umgestellt, Absätze gestrichen, eigene Beispiele eingefügt.
Mein Eindruck: Je mehr eigene Arbeit im Text steckt, desto weniger sagt ein einzelnes Ergebnis aus. Das ist keine Anleitung zum Umgehen, sondern eine Beobachtung zur Grenze des Verfahrens. Und es passt zu dem, was OpenAI über den fehlenden Beweiswert sagt (dazu gleich mehr).
Und die kurze Mail an die Vermieterin?
Das ist die zweite Szene, wieder mein Alltagsbeispiel und keine OpenAI-Zahl. Sie bitten ChatGPT um eine höfliche Mail: Der Wasserhahn tropft, ob jemand vorbeikommen kann.
Das sind ein paar Sätze. Vermutlich weniger als 200 Token.
Und genau da setzt der Code of Practice an. Danach gibt es keinen Wasserzeichen-Zwang unter 200 Token, das sind etwa 150 Wörter Englisch. Auch für Code-Snippets gilt der Zwang nicht. Hintergrund liefert die Seite der EU-Kommission zum Code of Practice.
Kurze Texte sind statistisch schwer zu markieren. Zu wenig Material für ein Muster. Das passt zur Logik von OpenAIs Längenwerten: Schon bei 200 Token liegt die Erkennung laut OpenAI (Inhalte wie Psychologie, 1 % FPR) bei etwa 80 %, bei 400 Token bei etwa 95 %.
Meine Lesart: Der Alltag besteht zu einem großen Teil aus kurzen Texten. Mails an die Hausverwaltung, Nachrichten an Kolleginnen und Kollegen, ein knapper Kommentar. Für diese Fälle bringt das Wasserzeichen vermutlich wenig. Bei längeren Texten wie dem Anschreiben oder einem Aufsatz sieht es anders aus.
Ein Tropfhahn-Mail-Stempel? Das wäre ziemlich viel Aufwand für wenig Aussage.
Praktisch heißt das: Wenn Sie ChatGPT für Alltagskorrespondenz nutzen, ändert sich für Sie nach meiner Einschätzung kaum etwas. Die Texte sind kurz, der Empfänger prüft nichts, und für den Detektor wäre die Menge Text ohnehin dünn.
Weiter zur dritten Szene. Wir bei digital-magazin.de haben dazu zuletzt auch über den Alltag mit KI-Werkzeugen geschrieben, zum Beispiel über Videos:
Hausaufgabe und Elternbrief: wo wird es heikel?
Dieses Bild wurde komplett mit KI generiertProviderhiggsfieldModellgpt_image_2PromptPhotorealistic close photo of a magnifying glass lying on a few blank white paper sheets on a wooden desk, soft side light, shallow depth of field, no logos, no readable text, no writing on the paper, no watermarks, 16:9Dritte Szene, wieder meine eigene. Ein Kind sitzt an einem Aufsatz über den letzten Ausflug. Drei Absätze sollen es sein.
Es tippt ein paar Stichworte ein und lässt ChatGPT ausformulieren. Dann ändert es ein paar Wörter, damit es „nach mir klingt“.
Drei Absätze sind schnell über 200 Token. Ob das Wasserzeichen dann trägt, hängt von Länge, Sprache und Überarbeitung ab. Mehr kann ich ehrlich nicht sagen.
Jetzt die Gegenseite. Eine Lehrkraft liest den Aufsatz und hat ein Störgefühl. Der Text klingt glatter als sonst. Aber: Der Detektor ist nicht öffentlich, die Lehrkraft kann nichts prüfen. Und selbst wenn sie es könnte, wäre ein fehlendes Wasserzeichen kein Beweis für menschliche Autorschaft.
Dann der Elternbrief. Eine Elternvertreterin bittet ChatGPT, einen Brief zum Sommerfest zu entwerfen. Einladung, Zeitplan, Bitte um Kuchenspenden. Der Brief geht an dreißig Familien.
Ob jemand ihn jemals prüfen würde? Kaum. Und wozu auch: Es geht um Kuchen, nicht um Täuschung.
Ich finde, an diesen beiden Szenen sieht man den Unterschied gut. Beim Elternbrief ist die KI-Hilfe völlig normal. Bei der Hausaufgabe hängt vieles daran, was die Schule erwartet. Ein Wasserzeichen entscheidet diese Frage nicht. Es kann höchstens ein Indiz liefern, und das nur für Stellen mit Zugang zum Detektor.
Für alle Szenen gilt: Sie sind meine Beispiele, keine Auswertung von Nutzungsdaten. OpenAI sagt dazu nichts. Ich nutze sie, damit die Technik greifbar wird.
Wer kann den Stempel überhaupt prüfen?
Nicht Sie. Nicht die Vermieterin. Nicht die Personalabteilung.
Der Detektor ist nicht öffentlich. Zugang bekommen genehmigte Forschende und Expertenorganisationen auf Antrag. Er liefert nur ein Ja oder Nein, ohne Angaben zu Nutzenden oder Prompt.
Das hat eine klare Folge: Wer prüft, erfährt weder, wer den Text erzeugt hat, noch, was in den Prompt getippt wurde. Es bleibt bei der Frage „Wasserzeichen gefunden: ja oder nein?“.
Ein Stempel, den fast niemand lesen darf, ist erst mal ein Stempel für Fachleute. Im Alltag ändert sich dadurch zunächst wenig, weil Lesende den Text nicht selbst prüfen können. Das beschäftigt mich.
Ob das richtig oder falsch ist, will ich nicht entscheiden. Es gibt gute Gründe für Zurückhaltung: Ein öffentlicher Detektor lädt dazu ein, Menschen zu verdächtigen, besonders bei kurzen Texten und bei Fachgebieten, in denen die Erkennung laut OpenAI schwächer ist. Ein geschlossener Detektor macht dagegen unabhängige Überprüfung schwer, und niemand kann nachvollziehen, wie oft er danebenliegt. Beides hat seinen Preis.
Interessant ist der Kontrast zu Bild und Audio. Dort sind Content Credentials und SynthID öffentlich prüfbar, über openai.com/verify. Bei Text ist das anders. Dazu später mehr.
Was das Wasserzeichen nicht sagt
OpenAI zieht selbst Grenzen. Ich gehe sie einzeln durch, weil sie im Alltag am häufigsten missverstanden werden dürften.
- Kein Maß für den menschlichen Anteil. Das Wasserzeichen sagt nicht, ob ein Text zu 10 oder zu 90 Prozent von einem Menschen stammt. Es gibt nur an, ob das Muster erkannt wurde.
- Kein Eigentumsnachweis. Wer ein Muster nachweist, beweist nicht, wem ein Text gehört. Urheberschaft und Rechte sind eine andere Frage.
- Keine Identifikation von Nutzenden. Der Detektor nennt weder Konto noch Person. Das ist laut OpenAI auch so gedacht.
- Keine Prüfung der Richtigkeit. Ein Text kann markiert und trotzdem falsch sein. Er kann auch unmarkiert und trotzdem falsch sein.
Und ein fehlendes Wasserzeichen ist kein Beweis menschlicher Autorschaft. OpenAI sagt das ausdrücklich.
Das ist für mich der wichtigste Absatz in diesem Artikel. Ein positives Ergebnis sagt: Das Muster wurde gefunden. Ein negatives sagt fast nichts, denn der Text kann aus einer anderen Quelle stammen, zu kurz gewesen sein oder so stark überarbeitet worden sein, dass das Muster verblasst ist.
Wer daraus ein Urteil über eine Bewerbung oder eine Hausaufgabe ableitet, überdehnt die Technik. Das ist meine Einschätzung, kein Zitat.
Dazu ein typischer Denkfehler. „Der Detektor sagt Nein, also hat der Mensch alles selbst geschrieben.“ Stimmt nicht. Das Nein heißt nur: Das Muster wurde nicht gefunden.
Umgekehrt: „Der Detektor sagt Ja, also hat die Bewerberin geschummelt.“ Auch das trägt nicht. Ein Ja sagt nichts über Absicht, Anteil oder Regeln. Vielleicht war KI-Hilfe erlaubt. Vielleicht erwartet das Unternehmen sie sogar.
In der Schule ist es ähnlich. Ein Ja ersetzt kein Gespräch mit dem Kind. Ein Nein entlastet nicht automatisch. Meine Lesart: Der Detektor ist höchstens ein Anlass zum Nachfragen, nie das Urteil.
Falls Sie in einem Unternehmen arbeiten: Wir bei digital-magazin.de haben aufgeschrieben, was KI-Wasserzeichen für Unternehmen bedeuten. Dort geht es um Prozesse, Verantwortung und die Frage, was Teams jetzt klären sollten. Genau da landen die Missverständnisse aus dem Kasten oben sonst schnell in der Personalakte.
Und wer wissen will, wie Kontrolle von außen bei OpenAI sonst aussieht, kann hier weiterlesen:
Text ist die neue Schicht: textGrain neben SynthID
Für Bild und Audio gibt es bereits Herkunftssignale. Content Credentials und SynthID bleiben öffentlich, geprüft werden kann über openai.com/verify. Text kommt jetzt als weitere Schicht dazu.
Die Unterschiede sind groß. Bei Bildern und Audio lassen sich Signale öffentlich abfragen. Bei Text steckt alles in der Wortwahl, und der Detektor bleibt bei genehmigten Forschenden und Expertenorganisationen.
Das ist eine Asymmetrie, die mir auffällt. Ein Foto können Sie prüfen lassen, einen Brief nicht. Warum? OpenAI nennt dafür die Bedingungen des Zugangs, aber ich lese darin auch die Sorge, dass Textprüfung schnell zur Verdachtsmaschine wird.
Noch ein Kontrast, den ich wichtig finde. Bei Bild und Audio kann die Öffentlichkeit selbst nachsehen. Bei textGrain bleibt es bei Ja oder Nein für wenige Stellen, und das Ergebnis hängt von Länge, Sprache und Bearbeitung ab.
Beides soll Herkunft sichtbar machen, nur eben mit sehr unterschiedlicher Reichweite. Ein öffentlicher Prüfweg erzeugt Vertrauen durch Nachprüfbarkeit. Ein statistisches Muster in der Wortwahl lebt dagegen davon, dass Fachleute es sauber messen und offenlegen. Deshalb halte ich den geplanten Open-Source-Schritt für den Punkt, an dem sich der Unterschied am ehesten verkleinern ließe.
Mehr zu den Hintergründen der Signale bietet die Help-FAQ von OpenAI. Dort stehen auch die Sprachwerte, die ich gleich anspreche.
Spanisch ja, Rumänisch … schwierig?
Jetzt zu den Sprachen. Laut Help-FAQ hat OpenAI 500 Prompts in 24 EU-Sprachen getestet, wieder bei 1 % FPR.
Spanisch kommt auf 69,0 %. Rumänisch auf 42,2 %.
Das ist eine große Spanne. Für Deutsch nenne ich bewusst keinen Wert, denn ich will keine Zahl behaupten, die ich nicht belegen kann.
Was folgt daraus? Das Wasserzeichen wirkt nicht in jeder Sprache gleich gut. Das passt zu OpenAIs eigener Warnung vor dem Sprung vom Labor in den Alltag.
Ich finde, das sollte man im Kopf behalten, wenn jemand sagt: „Das lässt sich doch sicher nachweisen.“ Vielleicht. Je nach Sprache, Länge und Bearbeitung.
Dass die Debatte um Kennzeichnung auch außerhalb der Technik läuft, zeigt ein Nebenschauplatz: Der Bitkom hat am 6. Oktober einen Wunsch nach Kennzeichnung bei Büchern geäußert. Mehr dazu in unserem Beitrag über E-Books und den Bitkom.
Was bleibt für Ihren Alltag?
Ehrlich gesagt: weniger, als die Schlagzeile verspricht.
Für die kurze Mail an die Vermieterin ändert sich vermutlich nichts. Für das Anschreiben ändert sich im Moment auch nichts Sichtbares, weil kein Mensch den Stempel sehen kann. Für die Hausaufgabe ist die Lage offen, denn Länge, Sprache und Überarbeitung spielen alle mit. Der Elternbrief bleibt, was er war: ein Brief über Kuchen.
Was sich ändert, ist die Grundlage. Es existiert jetzt ein Verfahren, mit dem geprüfte Stellen in bestimmten Fällen herausfinden können, ob ein Text aus einem OpenAI-Modell stammt. Mit klaren Grenzen, die OpenAI selbst benennt.
Was ich für wichtig halte:
- Behandeln Sie das Wasserzeichen nicht als Beweis, weder für noch gegen jemanden.
- Prüfen Sie Ihre Texte inhaltlich, so wie bisher. Das Wasserzeichen sagt nichts über Richtigkeit.
- Beobachten Sie, wann OpenAI den Rollout konkretisiert und den Quellcode veröffentlicht.
Meine Einschätzung: Der Stempel ist weniger Kontrollinstrument für den Alltag als ein Baustein im Regelwerk. Ob er trägt, zeigt sich erst, wenn Forschende ihn außerhalb der Idealbedingungen testen.
Bis dahin bleibt eine ziemlich persönliche Frage, die keine Statistik beantwortet.
Und Sie so? Schreiben Sie den Text noch selbst — oder nur noch den Prompt?




