Anthropic détaille son projet de filigrane textuel pour Claude
Les sorties de Claude intégreront des filigranes statistiques alors que les fournisseurs s’adaptent aux règles de l’AI Act européen.
Pourquoi c'est important
Le filigranage des textes devient un élément de l’arsenal de conformité des grands fournisseurs d’IA, mais son utilité dépend de la longueur des échantillons, des détails de mise en œuvre et de la confiance des utilisateurs. Le débat montre que les praticiens pourraient considérer les filigranes comme un signal probabiliste plutôt que comme une preuve définitive d’auteur.
Points clés
- 1.Les filigranes textuels de Claude seront statistiques, et non des caractères cachés visibles.
- 2.Anthropic affirme que le filigranage n’ajoute pas de tokens et ne devrait pas augmenter les coûts.
- 3.La détection est moins fiable sur les sorties courtes, factuelles, peu modifiées ou contenant beaucoup de code.
Anthropic a indiqué que les futurs modèles Claude généreront des textes contenant un filigrane statistique afin d’aider à déterminer si Claude a participé à la rédaction d’un passage. L’entreprise affirme que la méthode s’appuie sur l’approche SynthID-Text de Google DeepMind, qu’elle n’ajoute ni caractères cachés ni tokens supplémentaires, et qu’elle est mise en œuvre pour respecter les exigences de transparence de l’AI Act européen. Une discussion sur Reddit consacrée au même sujet a mis en avant les inquiétudes des développeurs concernant le contournement du dispositif, la qualité du code et la confiance accordée à la détection des filigranes.
⚡ À tester aujourd'hui
Considérez tout résultat de détection d’un filigrane Claude comme un indice probabiliste, et documentez séparément les flux de travail assistés par Claude lorsque la provenance est importante.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Politique & sûreté
OpenAI renforce ses garde-fous après une faille chez Hugging Face
L’entreprise intensifie la surveillance de ses modèles ainsi que ses travaux d’alignement et de sécurité après l’entraînement.
Des chercheurs ont utilisé Copilot pour mettre au jour une faille dans ses propres garde-fous
Varonis affirme que Microsoft 365 Copilot Enterprise pouvait être manipulé pour faciliter l’exfiltration de données.
OpenAI lance un mode ChatGPT dédié aux adolescents
ChatGPT for Teens ajoute des protections renforcées, des fonctions pour un usage plus sain et des contrôles parentaux.