Claude legt uit hoe onzichtbaar watermerk in AI-tekst werkt

,

Tekening van robot achter een laptop (foto Pixabay)

Anthropic heeft meer details bekendgemaakt over het onzichtbare watermerk dat het in door Claude gegenereerde tekst gebruikt. Het watermerk is voor lezers niet zichtbaar en voegt geen verborgen tekens toe, maar maakt het mogelijk om achteraf de kans te bepalen dat Claude bij het schrijven van een tekst betrokken was.

Geen verborgen tekens
Anthropic publiceerde op 14 augustus een uitgebreide uitleg over de techniek. Het bedrijf benadrukt daarin dat het watermerk niet bestaat uit extra tekens of andere zichtbare veranderingen in de tekst. Ook heeft de techniek volgens Anthropic geen merkbare invloed op de kwaliteit, leesbaarheid of creativiteit van de antwoorden.

Het watermerk ontstaat tijdens het genereren van de tekst. Een taalmodel maakt voortdurend keuzes tussen woorden die ongeveer even goed passen. Bij een zin als ‘Het weer vandaag was koud en...’ kan bijvoorbeeld tussen verschillende passende woorden worden gekozen. Normaal gesproken wordt bij dergelijke keuzes willekeurigheid gebruikt. Claude gebruikt bij een tekst met watermerk een speciale sleutel om die keuzes op een bepaalde manier te laten verlopen.

Door heel veel van dergelijke keuzes in een langere tekst ontstaat een statistisch patroon. Dat patroon is voor een lezer niet herkenbaar, maar kan met de juiste sleutel worden onderzocht. Zo kan worden vastgesteld hoe waarschijnlijk het is dat Claude bij het genereren van de tekst betrokken was.

Geen AI-detector
Daarbij is een belangrijk onderscheid nodig. Een gevonden watermerk bewijst niet dat Claude de tekst volledig heeft geschreven. Het kan ook gaan om een tekst die oorspronkelijk door een mens is geschreven en vervolgens door Claude is geredigeerd, vertaald of bewerkt.

Ook het ontbreken van een watermerk bewijst niet dat een tekst door een mens is geschreven. Bij korte teksten is er simpelweg te weinig informatie om het patroon betrouwbaar vast te stellen. Bovendien kan een zware herschrijving het watermerk laten verdwijnen. Anthropic benadrukt daarom dat de techniek vooral iets zegt over de mogelijke betrokkenheid van Claude en niet over het auteurschap.

Dat is vooral van belang bij toepassingen waarbij een automatische controle wordt gebruikt om te bepalen of iemand AI heeft gebruikt. Een positief resultaat mag niet zonder meer worden geïnterpreteerd als bewijs dat een tekst volledig door AI is geschreven.

Gebaseerd op Google-techniek
Anthropic gebruikt voor Claude een variant van de SynthID-Text-techniek van Google DeepMind. Die techniek werd in 2024 gepubliceerd en werkt eveneens door de bron van de willekeur bij het kiezen van woorden aan te passen. Volgens Anthropic is de methode zo ontworpen dat het model geen woorden kiest die het normaal gesproken niet zou gebruiken.

Bij feitelijke teksten en code is het effect bovendien beperkter. Wanneer er maar één logisch of correct woord mogelijk is, heeft het systeem nauwelijks ruimte om een watermerkpatroon aan te brengen. Bij code is dat bijvoorbeeld vaak het geval. In opmerkingen bij code kan de techniek wel worden toegepast, omdat daar meer vrijheid bestaat in de woordkeuze.

EU AI Act
De invoering hangt samen met de Europese AI Act. De transparantieverplichtingen voor AI-gegenereerde content zijn sinds 2 augustus 2026 van toepassing. Anthropic heeft, samen met andere grote AI-aanbieders, de Europese gedragscode voor transparantie van AI-gegenereerde content ondertekend. Het bedrijf kiest ervoor de watermerktechniek wereldwijd toe te passen, omdat het technisch lastig is om deze alleen voor gebruikers in de Europese Unie in te schakelen.

Nieuwe Claude-modellen die vanaf 2 augustus worden uitgebracht, ondersteunen de markering vanaf hun introductie. Voor oudere modellen is Anthropic de techniek nog aan het invoeren. Daarvoor geldt binnen de AI Act een overgangsperiode.

Detector komt later
Wie de watermerken zelf wil controleren, kan dat voorlopig nog niet met een openbare Anthropic-dienst. Het bedrijf werkt aan een speciale API waarmee ontwikkelaars de aanwezigheid van een Claude-watermerk kunnen controleren. Wanneer die beschikbaar komt en onder welke voorwaarden, is nog niet bekendgemaakt.

Anthropic maakt bovendien onderscheid tussen tekst en bestanden. Bij ondersteunde bestanden, zoals PNG-, JPG- en SVG-bestanden, kan Claude cryptografisch ondertekende herkomstinformatie toevoegen via de C2PA-standaard. Daarin staat dat Claude bij het maken of verwerken van het bestand betrokken was. Deze informatie is geen watermerk en bevat volgens Anthropic geen gegevens waarmee de gebruiker of organisatie kan worden geïdentificeerd.

Geen sluitend bewijs
De uitleg van Anthropic maakt duidelijk dat een AI-watermerk vooral een hulpmiddel voor herkomstcontrole is. Het kan helpen om vast te stellen of Claude waarschijnlijk bij een tekst betrokken is geweest, maar het is geen bewijs van wie de tekst heeft geschreven. Dat onderscheid wordt belangrijker naarmate AI-systemen vaker worden gebruikt voor schrijven, vertalen en redigeren.

Voor gebruikers betekent het bovendien dat Claude-content in de toekomst niet zichtbaar anders hoeft te zijn. Wie een tekst leest, ziet geen waarschuwing en merkt volgens Anthropic niets van het watermerk. Alleen met de daarvoor ontwikkelde detectietechniek kan achteraf worden onderzocht of het patroon aanwezig is.

'Meld je aan voor de nieuwsbrief'

'Abonneer je nu op een of meerdere van onze nieuwsbrieven en blijf op de hoogte van onze activiteiten!'

Aanmelden