DS Hölle Wasserzeichen im Text 1 Blog Grafik

Wie zur Hölle funktionieren unsichtbare Wasserzeichen in Texten?

Naja – wie Wasserzeichen halt, denkt der eine oder andere. Aber, Moment mal: Wenn man einen Text schreibt, kopiert und dann irgendwo einfügt, wie zur Hölle soll denn da ein unsichtbares Wasserzeichen reinkommen? Oder gar drin bleiben? Unser Mit-Digisaurier Michael – eher so der Deep-Dive-Technik Interessierte – hat sich das auch gefragt. Und herauskam ein denkwürdiger Dialog mit dem Experten der das am besten wissen muss: Claude. Denn Claude kann das. Behauptung Claude! Wirklich? Frage Michael. Hier die Erklärung.

MiKa (Michael Kallinnen) mein früherer Mitstreiter im Studio bei „Neues… der Anwenderkurs“ – woher ihn dann wohl die meisten hier auch kennen – hat eine ganz besondere Art im Dialog mit der KI. Und das ergibt, wie wir finden, auch eine ganz besondere Art der Antworten bei der KI. Bei so einem Dialog lernt man nicht nur, wie KI funktioniert und wie man am besten nachfragt oder wo man vielleicht skeptisch sein könnte. Man kriegt auch ein Ergebnis. Und eine ziemliche Menge Unterhaltungswert. Darum starten wir – in lockerer Folge – die Serie: MiKa – Prompt & Antwort. Zur Info: Wir haben den Dialog genau so gelassen, wie er entstanden ist. Keine Änderungen oder redaktionellen rumschleifereien. Allein: wir haben die eine oder andere Zwischenüberschrift zur besseren Lesbarkeit eingefügt. (Ja – wir haben Claude vorher um Erlaubnis gefragt ;-) )Und damit übergebe ich an Michael & Claude…

Mit MiKa damals im Anwenderkurs…

Wie soll das denn gehen? Wasserzeichen im reinen Text?

Seit kurzem macht Anthropic Schlagzeilen, weil deren KI-Modelle ab sofort alle generierten Texte oder Überarbeitungen mit einem unsichtbaren Wasserzeichen versehen – zumindest innerhalb der Europäischen Union, da diese eine eindeutige Kennzeichnung von KI-generierten Inhalten verlangt.

Wasserzeichen kennt man ja schon lange von Bildern, Videos und Musikstücken – da können sie als zusätzliche nicht (direkt) sicht- oder hörbare Informationen im Datenstrom versteckt werden – und sind nur mit mehr oder weniger großem Aufwand auffindbar oder löschbar. Aber in Texten? Noch dazu in reinen Textdateien, die nur den blanken Textinhalt wiedergeben und keinerlei Formatierungsinformationen und -steuerzeichen enthalten… wie, bitte schön, soll das funktionieren?

So sieht der Michael Kallinen übrigens heute aus…

Um das genau(er) zu verstehen, fragte ich bei jemandem nach, der es wissen muss, weil er einer der ganz großen KI-Stars ist: Claude von Anthropic.

MiKa – Prompt und Antwort: Der Wasserzeichen-Dialog

Claude und ich kennen uns seit etwa einem halben Jahr, und uns verbindet seitdem ein verbindliches Bezahl-Abo zu Claudes Gunsten. Unser Gesprächsverhältnis ist etwas ambivalent: manchmal sind Claude und ich im Chat beim traulichen Du und dann im nächsten Chat wieder beim distanzierten Sie – da ich in der prä-KI-Zeit zu universeller Höflichkeit erzogen wurde, formuliere ich meine erste Frage an die KI immer anredeneutral und warte ab, wie sie mich anspricht. Nachfolgend mein Chat mit Claude im unveränderten Originaltext. (Naja – mal abgesehen von den Zwischenüberschriften, die Christian unbedingt reinpacken musste, damit es wie ein Artikel aussieht – seufz…)

Der MiKa trifft den Claude zum Interview – naja, so in etwa halt. Bild ist natürlich KI – wärd ihr jetzt nicht drauf gekommen, gell?

// Chat MiKa<–>Claude (Sonnet 5) am 12.08.26 ca. 08:05 Uhr //
kursiv: Text von Claude während „Denkphase“ oder Quellenangaben

MiKa
Guten Morgen,
ich habe gerade gelesen, dass Anthropic zukünftig KI-Texte mit einem Wasserzeichen versehen will, das für Nutzer unsichtbar ist, aber auch bei Textänderungen und Kopieren der Datei erhalten bleiben soll. Mich würde interessieren, wie das bei reinen Textdateien funktionieren kann – es geht mir nicht um die genauen technischen Details, sondern nur um das Prinzip – in einer reinen Textdatei würde ich ja mittels eines (hex)Editors oder eines rein zeichenorientierten Programms zusätzlich eingefügte (codierte) Zeichen sehen.

Claude
Web durchsucht
Guten Morgen! Ja, diese Meldung ist aktuell und korrekt – Anthropic hat das erst vor wenigen Tagen eingeführt, im Zuge der EU-KI-Verordnung (Artikel 50 AI Act), die maschinenlesbare Kennzeichnung von KI-Inhalten vorschreibt.

Zu Ihrer eigentlichen Frage, dem Prinzip: Ihre Intuition, dass da irgendwo zusätzliche codierte Zeichen „versteckt“ werden, ist der naheliegende, aber falsche Gedanke. Genau das würde ein Hex-Editor oder ein zeichenorientiertes Tool sofort aufdecken – Sie hätten recht, so ein Wasserzeichen wäre trivial zu entfernen (einfach die verdächtigen Bytes rauslöschen).

Das tatsächliche Prinzip funktioniert anders und setzt nicht auf zusätzliche Zeichen, sondern auf verzerrte Auswahl unter den ganz normalen Zeichen/Wörtern selbst:

Ein Sprachmodell erzeugt Text, indem es bei jedem Schritt aus vielen möglichen nächsten Wörtern/Token wählt, die alle mehr oder weniger gut passen („der Hund lief“ vs. „der Hund rannte“ vs. „der Hund sprintete“ – alles plausibel). Beim Wasserzeichen wird nun mithilfe eines geheimen Schlüssels und des bisherigen Textverlaufs eine Art Pseudozufallsfunktion berechnet, die die Kandidatenwörter in zwei Gruppen einteilt (vereinfacht: eine „bevorzugte“ und eine „unbevorzugte“ Gruppe). Das Modell wird dann leicht dazu angestoßen, öfter aus der bevorzugten Gruppe zu wählen – ohne dass der Text dadurch unnatürlich oder erkennbar anders wirkt.

Der entscheidende Punkt: Es wird kein einziges zusätzliches Zeichen eingefügt. Der Text besteht ausschließlich aus ganz normalen, sinnvollen Wörtern – nur eben eine statistische Tendenz in der Wortwahl, die man in einem einzelnen Wort oder Satz nicht erkennen kann. Ein Hex-Editor sieht deshalb tatsächlich nichts Auffälliges – da ist buchstäblich nichts „extra“ drin.

Nachweisbar wird das Wasserzeichen erst, wenn man mit demselben geheimen Schlüssel und derselben Pseudozufallsfunktion über einen längeren Textabschnitt statistisch prüft, ob die tatsächlich gewählten Wörter signifikant häufiger aus der „bevorzugten“ Gruppe stammen, als es der Zufall erwarten ließe. Bei kurzen Texten reicht das Signal oft nicht aus, das wird in den Artikeln auch so beschrieben.

Warum das Wasserzeichen auch Copy & Paste überlebt

Das erklärt auch zwei Dinge aus den Berichten:

Warum es Kopieren/Einfügen übersteht: Das Wasserzeichen steckt im Wortmaterial selbst, nicht in Metadaten oder unsichtbaren Steuerzeichen, die beim Umformatieren verloren gehen könnten.

Warum starkes Umschreiben oder Übersetzen es zerstört: Sobald die konkreten Wörter durch andere ersetzt werden, ist die ursprüngliche statistische Verzerrung weg – ein neuer Text hat eine neue, unabhängige Wortwahl.

Ein öffentlich dokumentiertes Verfahren nach genau diesem Prinzip ist Googles SynthID für Text, das die Wahrscheinlichkeiten, mit denen ein Sprachmodell einzelne Textbausteine auswählt, in einem für Menschen unsichtbaren Muster verschiebt, das sich später statistisch nachweisen lässt. Anthropic selbst hat laut den Berichten nicht erklärt, wie ihre Markierungen im Detail funktionieren oder erstellt werden – vom Prinzip her dürfte es aber sehr ähnlich gelagert sein, eventuell kombiniert mit signierten Metadaten nach dem C2PA-Standard als zweite, separate Ebene (die dann tatsächlich in Metadatenfeldern steckt und beim reinen Textkopieren auch verloren gehen kann).

WeSpeakIoT
Futurezone

Der geheime Schlüssel

MiKa
Sie schreiben „Beim Wasserzeichen wird nun mithilfe eines geheimen Schlüssels und des bisherigen Textverlaufs eine Art Pseudozufallsfunktion berechnet…“ und „Nachweisbar wird das Wasserzeichen erst, wenn man mit demselben geheimen Schlüssel und derselben Pseudozufallsfunktion über einen längeren Textabschnitt statistisch prüft…“ – dazu müsste der Schlüssel aber im Dokument oder in einer Datenbank abgelegt werden – oder?

Claude
Dachte 24 s nach
Guter Einwand – aber nein, genau das ist der Clou: Der Schlüssel muss nicht pro Dokument gespeichert werden, und es gibt auch keine Datenbank, die „Dokument X → Schlüssel Y“ zuordnet. Das wäre tatsächlich unpraktisch und würde auch dem widersprechen, was in den Artikeln steht (dass niemand weiß, welcher konkrete Text markiert ist, außer man testet ihn aktiv).

Der Trick ist: Es gibt nur einen einzigen geheimen Schlüssel (oder eine kleine Handvoll, z. B. einen pro Modellversion), den der Anbieter für alle Texte verwendet, die dieses Modell je erzeugt. Dieser Schlüssel steckt weder im Dokument noch in einer Zuordnungstabelle – er liegt einfach zentral beim Anbieter (Anthropic) und wird geheim gehalten.

Die „Zufälligkeit“ pro Textstelle entsteht nicht durch eine Dokument-ID, sondern durch den Text selbst: Die Pseudozufallsfunktion nimmt als Eingabe den geheimen Schlüssel plus die letzten paar bereits geschriebenen Wörter (den lokalen Kontext, sagen wir die letzten 3–5 Token). Das Ergebnis bestimmt dann, welche Wörter an der nächsten Stelle „bevorzugt“ sind.

So läuft die Prüfung am Schluss – auch nach Copy & Paste

Der wichtige Punkt dabei: Diese Kontext-Information (die letzten paar Wörter) steht ja bereits sichtbar im Text selbst – man muss also nichts extra abspeichern oder mitschicken. Bei der Prüfung geht man später einfach so vor:

Man nimmt den verdächtigen Text.

Für jede Textstelle berechnet man erneut die Pseudozufallsfunktion – mit dem (geheimen, aber beim Anbieter bekannten) Schlüssel und dem Kontext, der direkt aus dem vorliegenden Text abgelesen wird.

Man prüft statistisch: Stimmen die tatsächlich verwendeten Wörter überdurchschnittlich oft mit der „bevorzugten“ Gruppe überein?

Da es nur eine Handvoll Schlüssel gibt (einen pro Modell), kann der Anbieter bei der Prüfung einfach alle seine bekannten Schlüssel durchprobieren, bis einer ein starkes statistisches Signal liefert (oder eben keiner – dann gilt der Text als nicht markiert).

Das ist im Prinzip vom Ansatz her ähnlich wie bei einem HMAC oder einer kryptografischen Prüfsumme: Der Schlüssel ist ein globales Geheimnis des Anbieters, nicht eine pro-Objekt gespeicherte Information. Wichtig zur Abgrenzung: Das ist etwas anderes als z. B. Wasserzeichen zur Leck-Verfolgung (wer hat dieses interne Dokument weitergegeben?), wo man tatsächlich individuelle Schlüssel pro Nutzer/Kopie braucht und dafür auch eine Zuordnungstabelle pflegen muss. Bei den hier gemeinten KI-Wasserzeichen geht es aber laut den Berichten nur um die generelle Aussage „war ein Claude-Modell beteiligt?“, nicht um Rückverfolgung auf einzelne Nutzer – dafür reicht ein einziger, modellweiter Schlüssel völlig aus.

Intermezzo – ein kleiner Schwatz mit Claude über Ideen & Schreiben

MiKa
Vielen Dank, jetzt habe ich das Prinzip verstanden.
Ich schreibe meine Texte weiterhin selbst und mache die mir eigenen Fehler auch weiterhin (selbst), dann erkenne zumindest ich meine Texte immer wieder :)

Claude
[ohne Nachdenkzeit]
Sehr gute Strategie – und ehrlich gesagt eine, bei der Sie sich um kein Wasserzeichen und keine Statistik-Tests Gedanken machen müssen. Die eigenen kleinen Macken im Schreibstil sind ja quasi das Original-Wasserzeichen, das schon lange vor der EU-Verordnung erfunden wurde 🙂

Viel Erfolg beim Schreiben, und einen schönen Tag noch!

MiKa
„Die eigenen kleinen Macken im Schreibstil sind ja quasi das Original-Wasserzeichen, das schon lange vor der EU-Verordnung erfunden wurde.“ Sehr originelle Antwort – gerade erfunden oder aus der Konserve geholt?

Claude
Ganz frisch für diesen Moment formuliert – ich habe keine Schublade mit fertigen Sprüchen, aus der ich sowas ziehe. Ob man das dann „originell“ nennen darf, ist bei einem Sprachmodell natürlich eine knifflige Frage: Ich setze Wörter und Gedanken neu zusammen, aber letztlich aus Bausteinen, die ich aus sehr viel gelesenem Text gelernt habe – ähnlich wie ein Mensch ja auch nicht im luftleeren Raum formuliert, sondern aus allem schöpft, was er je gelesen und gehört hat.

Also: keine Konserve, aber auch kein Anspruch auf geniale Einzigartigkeit – einfach eine naheliegende Pointe zum Thema, die sich gerade beim Schreiben ergeben hat 🙂

🙂 Schönen Tag noch!

MiKa
…Danke – gleichfalls (sofern das angemessen ist)

Claude
Sehr angemessen – und der Gedanke zählt so oder so 🙂 Alles Gute!

// Ende Chat MiKa<–>Claude (Sonnet 5) am 12.08.26 ca. 08:25 Uhr //

Ein friedlicher Abschluss dieser ersten Folge von MiKa – Prompt & Antwort bei einem virtuellen Bier. Das Bild ist KI… Naja – brauchen wir nicht mehr sagen, oder…

Zusammenfassung: So funktioniert der Wasserzeichentrick bei Text und so trickst man ihn aus…

Tja, ich glaub, jetzt habe ich das Prinzip verstanden:

Die KI berechnet (mit nur dem Anbieter bekannten Schlüsseln) für jede Textstelle, ob sie ein starkes statistisches Signal auf Übereinstimmung mit der von der KI bevorzugten Wortwahl bzw. Wortfolge liefert.

Das heißt aber auch, dass nachträgliche Änderungen (Umformulierungen, Textverschiebungen, Einfügungen, Löschungen etc.) die Bewertung der KI verändern können, und zwar in beide Richtungen: KI-generierte Texte werden vielleicht nicht mehr als solche eingestuft und/oder human-generierte Texte werden plötzlich der KI zugeordnet.

Ich überlasse jetzt der geneigten Leserschaft zu prüfen, welche Teile dieses Beitrags KI-generiert sind, und welche ich mühsam aus meinem analogen Hirn gepresst habe – der geheime Schlüssel zu letzterem liegt jedenfalls unter meinem Kopfkissen.

Ein Kommentar zu „Wie zur Hölle funktionieren unsichtbare Wasserzeichen in Texten?“

  1. Ich nutze auf dem Handy das Android-Opera (mit dem ich das hier schreibe) und auch gerne dessen KI.

    Testweise habe ich „ihr“ MiKa’s erste Frage vollständig und unverändert vorgeworfen und dazu die Option „tiefer Nachdenken“ (die gibt es erst seit einigen Monaten) aktiviert: Es wird dann deutlich gründlicher „recherchiert“, was entsprechend länger dauert.

    Das war die unveränderte, vollständige Antwort (Quellen wurden diesmal keine genannt):

    —–
    Guten Morgen!

    Das ist ein sehr guter Gedankengang von Ihnen. Sie haben völlig recht: Würde man unsichtbare Sonderzeichen oder versteckte Codes (wie etwa spezielle Unicode-Zeichen) einfügen, würden diese in einem Hex-Editor oder reinen Text-Editor sofort auffallen oder beim Kopieren als reiner Text verloren gehen.

    Der Trick bei diesem Wasserzeichen funktioniert daher ganz anders. Es arbeitet nicht auf der Ebene einzelner Zeichen, sondern auf der Ebene der Wortwahl (Statistik).

    Das Prinzip lässt sich vereinfacht so erklären:

    Die Auswahlmöglichkeiten: Wenn eine KI einen Text generiert, berechnet sie für jedes nächste Wort Wahrscheinlichkeiten. Nach dem Satzanfang „Das Wetter ist heute sehr…“ könnte das nächste Wort „schön“, „gut“, „schlecht“ oder „wechselhaft“ sein. All diese Wörter ergeben Sinn.
    Die grüne und die rote Liste: Das Wasserzeichen-System verwendet im Hintergrund einen geheimen Algorithmus (einen kryptografischen Schlüssel), der die möglichen Wörter in zwei Listen einteilt: eine „grüne Liste“ (bevorzugte Wörter) und eine „rote Liste“ (weniger bevorzugte Wörter). Diese Listen ändern sich dynamisch für jedes einzelne Wort, basierend auf den Wörtern, die davor stehen.
    Die subtile Bevorzugung: Die KI wird nun so gesteuert, dass sie unauffällig etwas häufiger Wörter aus der „grünen Liste“ wählt.

    Warum ist das unsichtbar und robust? Das Ergebnis ist ein völlig normaler Text, der nur aus ganz normalen Buchstaben und Wörtern besteht. In einem Hex-Editor sehen Sie nur die Standard-Zeichen für die verwendeten Wörter. Es gibt keine versteckten Codes.

    Wie wird es erkannt? Wenn Anthropic später prüfen möchte, ob ein Text von ihrer KI stammt, wenden sie ihren geheimen Schlüssel auf den Text an. Das System prüft dann, ob ungewöhnlich viele Wörter aus der damaligen „grünen Liste“ verwendet wurden. Da es für einen Menschen mathematisch nahezu unmöglich ist, durch Zufall exakt dieses spezielle, unsichtbare Wortmuster zu treffen, gilt der Text als KI-generiert.

    Warum überlebt es Textänderungen? Da das Wasserzeichen direkt in der Wortwahl selbst „eingebacken“ ist, bleibt es beim einfachen Kopieren (Copy & Paste) oder Speichern als  .txt -Datei vollständig erhalten. Selbst wenn ein Nutzer einzelne Wörter umschreibt oder Sätze löscht, bleibt die statistische Häufung der „grünen“ Wörter im Rest des Textes meist immer noch hoch genug, um den Ursprung eindeutig nachzuweisen.
    —–

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert