Wasserzeichen in KI-Texten: Warum sie sich immer entfernen lassen
Ab August 2026 verlangt der EU AI Act, dass KI-generierte Texte als solche erkennbar sein müssen. Wasserzeichen sollen helfen. Doch wie Sean Goedecke zeigt, sind Text-Wasserzeichen grundsätzlich angreifbar. Dieser Beitrag analysiert die technischen Hürden, die Funktionsweise von SynthID und Unicode-Homoglyphen – und warum eine perfekte Lösung nicht in Sicht ist.
Überblick
Der EU AI Act schreibt vor, dass alle KI-Ausgaben als künstlich erzeugt erkennbar sein müssen. Für Text ist das besonders schwierig. Text ist ein hochkomprimiertes Medium – anders als bei Bildern lassen sich nicht einfach unsichtbare Pixel ändern. Goedecke beschreibt Text-Wasserzeichen als ein Problem der Steganografie. Der Klartext darf dabei nicht beliebig manipuliert werden, ohne die Qualität zu beeinträchtigen. Er diskutiert zwei Ansätze: Googles SynthID, das auf probabilistischem Sampling basiert, und Unicode-Homoglyphen, die OpenAI und Anthropic einsetzen. Beide lassen sich leicht entfernen – durch Normalisierung der Zeichen oder durch Paraphrasierung mit einem anderen Sprachmodell. Das Fazit: Text-Wasserzeichen bleiben trivial zu entfernen. Der EU AI Act stellt damit eine Anforderung, die technisch nicht erfüllbar ist.
Prompt-Analyse
Der Prompt
Der Artikel enthält keine konkreten Prompts. Wir konstruieren zwei typische: einen zum Entfernen von Wasserzeichen durch Paraphrasierung, einen zur Erkennung von Unicode-Homoglyphen.
# Prompt 1: Wasserzeichenentfernung durch Paraphrasierung
Rolle: Du bist ein professioneller Redakteur mit umfassender Erfahrung im Umschreiben von Texten.
Kontext: Ich habe einen KI-generierten Text erhalten, der mit einem statistischen Wasserzeichen wie SynthID markiert ist. Ich möchte den Inhalt behalten, aber die wasserzeichentypischen Token-Wahlmuster vermeiden.
Aufgabe: Paraphrasiere den folgenden Text vollständig. Verwende Synonyme, ändere die Satzstruktur und passe den Stil leicht an, ohne die Bedeutung zu verändern. Ziel ist es, dass eine Wasserzeichen-Erkennung den Text nicht mehr als KI-generiert einstuft.
Output-Format: Gib nur den umgeschriebenen Text aus, ohne weitere Kommentare oder Erklärungen.
Constraints: Achte darauf, dass der umgeschriebene Text natürlich und in einem konsistenten Stil bleibt. Vermeide Erkennungsmerkmale wie zu viele Em-Dashes oder ungewöhnliche Formulierungen.
Bestandteile
Der erste Prompt folgt dem Muster von Rollen-Prompts: Die Zuweisung eines Redakteur-Profils gibt dem Modell einen kohärenten Handlungsrahmen. Der Kontext erklärt die Situation – das unsichtbare Wasserzeichen – und warum Paraphrasierung nötig ist. Die Aufgabe ist klar definiert: Paraphrase mit bestimmten Techniken. Das Output-Format beschränkt die Antwort auf den reinen Text, die Constraints verhindern typische Artefakte. Diese Struktur ist effektiv: Sie lässt dem Modell Freiheit, gibt aber Qualitätskriterien vor.
# Prompt 2: Homoglyphen-Erkennung
Rolle: Du bist ein Textforensiker, der sich auf Unicode-Analyse spezialisiert hat.
Kontext: Ich habe einen Text, der möglicherweise mit unsichtbaren Unicode-Homoglyphen versehen wurde, um eine KI-Erkennung zu markieren. Es könnten ungewöhnliche Leerzeichen oder Sonderzeichen verwendet worden sein.
Aufgabe: Untersuche den folgenden Text auf Homoglyphen. Identifiziere alle Zeichen, die nicht dem üblichen ASCII- oder UTF-8-Standard entsprechen, insbesondere alternative Leerzeichen (z.B. U+2004, U+3000). Liste jedes Vorkommen mit Unicode-Codepoint und Position auf.
Output-Format: Erstelle eine Tabelle mit Spalten für Position, Originalzeichen, Unicode-Codepoint und Empfehlung zur Ersetzung.
Constraints: Sei präzise und vollständig. Gehe nur auf Homoglyphen ein, nicht auf andere Texteigenschaften.
Bestandteile
Der zweite Prompt nutzt eine Experten-Persona, um die Analyse zu strukturieren. Der Kontext beschreibt das Problem – mögliche Homoglyphen – und gibt Beispiele für verdächtige Unicode-Zeichen. Die Aufgabe ist präzise: Untersuchung und Dokumentation. Das Output-Format in Tabellenform erleichtert die maschinelle Auswertung. Die Constraints verhindern Abschweifungen. Solche Prompts eignen sich, um KI-Modelle gezielt für forensische Aufgaben einzusetzen – genau das, was in der Wasserzeichen-Debatte vorkommt.
Häufig gestellte Fragen
Was ist der EU AI Act und was hat er mit Wasserzeichen zu tun?
Der EU AI Act ist eine Verordnung der Europäischen Union, die die Nutzung von KI regulieren soll. Ab August 2026 müssen alle KI-Ausgaben als künstlich erzeugt erkennbar sein (Artikel 50). Anbieter von Sprachmodellen, die in der EU tätig sein wollen, müssen dann Wasserzeichen in ihre Textausgaben einbauen. Referenz: Artikel 50 des EU AI Act und der zugehörige Verhaltenskodex.
Warum ist Text-Wasserzeichen schwieriger als Bild-Wasserzeichen?
Bilder enthalten viel Rauschen, das für das menschliche Auge unsichtbar ist und zum Verstecken von Daten genutzt werden kann. Text ist dagegen ein hochgradig komprimiertes Medium – jede Änderung an einem Zeichen oder einer Wortwahl würde sofort auffallen. Deshalb müssen Wasserzeichen in Text in die sprachliche Struktur selbst eingebettet werden, was die Qualität des Ausgabetextes beeinträchtigen kann.
Wie funktioniert Googles SynthID?
SynthID basiert auf dem probabilistischen Samplingprozess großer Sprachmodelle. Bei jedem Token-Schritt erhält jedes mögliche Token einen Wahrscheinlichkeitswert. SynthID weist jedem Token einen „Score“ zu, der auf vorherigen Token basiert – zum Beispiel durch eine mathematische Funktion. Das Modell wählt dann aus den wahrscheinlichsten Token eines aus, das den höchsten SynthID-Score hat. So entsteht ein statistisches Muster im Text, das mit einer Detektionsfunktion überprüft werden kann. Die Detektion ist günstig, weil sie nur die Scores berechnen muss.
Was sind Unicode-Homoglyphen und wie können sie als Wasserzeichen dienen?
Homoglyphen sind Zeichen, die unterschiedliche Unicode-Codepunkte haben, aber gleich aussehen – wie normale Leerzeichen (U+0020) und dreifach breite Leerzeichen (U+2004) oder CJK-Leerzeichen (U+3000). Man kann ein verstecktes Muster erzeugen, indem man bestimmte Leerzeichen durch solche Alternativen ersetzt. Da diese Zeichen für das Auge unsichtbar sind, dienen sie als unsichtbares Wasserzeichen. Allerdings kann man sie leicht entfernen, indem man alle Unicode-Zeichen auf ihre Standard-Entsprechung normalisiert.
Warum sind Text-Wasserzeichen immer trivial zu entfernen?
Es gibt zwei Hauptmethoden: Homoglyphen lassen sich entfernen, indem man alle Sonderzeichen einfach ersetzt. Statistische Wasserzeichen wie SynthID verlieren ihre Wirkung, wenn der Text umgeschrieben wird – auch von einem einfachen Sprachmodell. Da beide Methoden in der Textstruktur selbst verankert sind, reicht eine leichte Veränderung der Satzstruktur oder Wortwahl, um das Wasserzeichen zu zerstören. Das ist eine grundsätzliche Eigenschaft von Text. Eine perfekte Lösung gibt es nicht.
Quelle
Basiert auf diesem Artikel.