Anthropic watermerkt sinds 2 augustus de tekst die Claude genereert, met een techniek gebaseerd op SynthID-Text van Google DeepMind. In plaats van zichtbare markeringen of verborgen tekens toe te voegen, grijpt de methode in op de willekeur waarmee het model woorden kiest tijdens het genereren.
Wanneer Claude tussen meerdere even goede woordkeuzes moet kiezen, gebruikt het systeem een geheime sleutel in combinatie met de voorafgaande context om die keuze te sturen. Daardoor ontstaat een statistisch patroon over de hele tekst heen. Zoals Anthropic het zelf omschrijft: de woorden die Claude kiest blijven willekeurig, maar je kunt achteraf controleren of die reeks consistent is met de keuzes die Claude zou maken als het de sleutel gebruikte.
De directe aanleiding is de EU AI Act, die AI-bedrijven verplicht gegenereerde content herkenbaar te maken. Anthropic conformeert zich aan de bijbehorende gedragscode van de EU en past de watermerken wereldwijd toe — het bedrijf geeft zelf aan nog geen duurzame manier te hebben om dit per regio te beperken.
De techniek kent grenzen. Feitelijke uitspraken met één correct antwoord ontsnappen aan het watermerk, code draagt minder watermerksignaal vanwege de noodzaak tot exactheid, korte tekstfragmenten zijn onbetrouwbaarder te detecteren, en een volledige herschrijving elimineert het watermerk volledig. Voor gebruikers verandert er niets merkbaars: geen zichtbare markeringen, geen extra tokens, en verwaarloosbare invloed op snelheid, creativiteit of leesbaarheid.
Nieuwere Claude-modellen genereren sinds 2 augustus gewatermerkte tekst; oudere modellen volgen de komende maanden. Anthropic werkt aan een API voor detectie, al kan die nooit met zekerheid auteurschap vaststellen — alleen een inschatting geven van Claude’s betrokkenheid.
Bron: BleepingComputer
Blijf op de hoogte
Meld je aan voor de nieuwsbrief: spoedalerts bij kritieke dreigingen en een wekelijks overzicht. Geen mail achterlaten? Volg ons dan via RSS.