Anthropic впровадить приховані «водяні знаки» у майбутні моделі Claude

- Claude буде непомітно маркувати згенерований текст.
- Мітки дозволяють оцінити ймовірність ІІ‑створення без візуальних змін.
- Технологія відповідає вимогам EU AI Act і не підвищує вартість запитів.
Цього тижня розробник штучного інтелекту Anthropic повідомив про плани інтегрувати в майбутні версії свого чат‑бота Claude невидимі мітки, які часто називають «водяними знаками». Ці мітки будуть зберігатися при копіюванні, вставці та в ряді випадків навіть після редагування тексту.
Навіщо потрібні приховані мітки
Головна мета – дати можливість стороннім системам оцінювати ймовірність участі Claude у написанні конкретного фрагмента. Такий механізм став частиною зусиль щодо дотримання вимог Європейського закону про штучний інтелект, який вимагає прозорості при використанні генеративних моделей.
Технічно «водяні знаки» реалізуються зміною малозначних рішень при виборі слів. Коли модель стикається з кількома майже однаковими варіантами, вона використовує інше джерело випадковості, формуючи статистично перевіряємий шаблон. При цьому в текст не додаються спеціальні символи, приховані теги або інші додаткові дані, тому візуально він повністю збігається з звичайним виводом.
Для виявлення такої мітки потрібен спеціалізований аналізатор, оснащений відповідним ключем. Інструмент порівнює розподіл обраних токенів з характерним патерном Claude і видає оцінку ймовірності, що текст був згенерований цією моделлю.
Ефективність методу залежить від обсягу тексту. На довгих уривках статистичний сигнал стає помітнішим, тоді як у коротких фразах або в фактичних витягах можливості аналізу обмежені. Якщо Claude лише доопрацьовує вже написаний людиною матеріал, мітка може практично зникнути. У програмному коді система працює менш надійно, оскільки вибір слів обмежений строгими синтаксичними вимогами.
Важливо зазначити, що «водяні знаки» не містять персональних даних: вони не дозволяють встановити, хто саме користувався Claude, в якому чаті або від імені якої організації був створений текст. Мітка прив'язана тільки до моделі і слугує для зовнішніх перевірок, а не для стеження.
Для звичайних користувачів зміни майже непомітні. Claude продовжить генерувати відповіді і редагувати тексти так само, як і раніше, а вартість запитів залишиться незмінною, оскільки впровадження міток не вимагає додаткових токенів.
Anthropic не є єдиною компанією, яка працює над подібними рішеннями. Великі гравці галузі також розробляють методи маркування, щоб відповідати вимогам нового регулювання і знизити ризики зловживання генеративним ІІ.
Таким чином, впровадження прихованих «водяних знаків» у Claude є технічним відповіддю на зростаючий запит суспільства і законодавців щодо прозорості ІІ, дозволяючи перевіряти походження тексту без шкоди для якості і вартості сервісів.
Джерело: 3DNews



