Определить, был ли текст или код написан человеком или искусственным интеллектом, становится всё сложнее. Опасаясь, что интернет окончательно утонет в потоке низкокачественного ИИ-контента, Европейский Союз принял новый Закон об искусственном интеллекте (EU AI Act). Он требует прозрачности и обязательной маркировки сгенерированных материалов.
В ответ на это компания Anthropic обновила свою документацию: начиная с августа 2026 года для пользователей из ЕС, модели Claude начнут встраивать машиночитаемые водяные знаки во все генерируемые тексты и код.
Но будет ли эта защита работать на практике? Давайте разберем техническую сторону вопроса и поймем, почему маркировка текста — это задача со звездочкой.
Почему водяные знаки для текста — это головная боль?
Встраивать водяные знаки в медиафайлы (изображения, аудио, видео) относительно просто. Цифровая картинка весом в несколько сотен килобайт содержит массу «шума», который человеческий глаз не воспринимает. В этом шуме легко спрятать метаданные или изменить цвет каждого четвертого пикселя на 1%.
Однако даже у изображений есть проблема: алгоритмы сжатия (например, конвертация из PNG в JPEG) или минимальное изменение масштаба разрушают этот пиксельный узор, стирая водяной знак.
С текстом всё гораздо сложнее. Текст изначально является крайне сжатым форматом данных.
- В картинке из миллионов пикселей изменение одного останется незамеченным.
- В тексте изменение одного слова меняет смысл и стилистику предложения.
Внедрение невидимых меток в текст — это классическая задача стеганографии (сокрытия информации), и решать её в условиях работы LLM крайне трудно.
Как Anthropic (Claude) планирует помечать контент
Anthropic заявляет, что будет использовать два взаимодополняющих метода для выполнения требований ЕС:
- Криптографические метаданные для файлов (C2PA)
- Когда Claude создает или обрабатывает файлы (например, SVG, PNG или PDF), в них будут вшиваться подписанные метаданные стандарта C2PA. Это открытый отраслевой стандарт, который позволяет отследить происхождение контента (Provenance metadata). Эти данные можно удалить, но их нельзя подделать.
- Текстовые внедрения (Text Embeds / Watermarks)
- Для обычного текста и фрагментов кода Claude будет вплетать «незаметный водяной знак прямо в сам текст». Как именно это работает?
- Математическое распределение токенов (как в SynthID): Когда нейросеть генерирует ответ, она выбирает следующее слово (токен) из списка наиболее вероятных вариантов. Модель может использовать скрытую стратегию: например, из топ-5 слов всегда выбирать то, у которого самый высокий «скрытый балл». Детектор, проанализировав большой блок текста, заметит эту математическую аномалию и поймет, что текст сгенерирован алгоритмом.
- Хитрости с Unicode: Использование невидимых пробелов (zero-width spaces) или гомоглифов (символов, которые выглядят одинаково, но имеют разные коды) между словами.
- Для обычного текста и фрагментов кода Claude будет вплетать «незаметный водяной знак прямо в сам текст». Как именно это работает?
Фатальные недостатки: как легко обойти защиту
Главная проблема текстовых водяных знаков заключается в их хрупкости. Подобные системы способны поймать только самых ленивых пользователей (например, ботов в соцсетях, которые напрямую копируют ответы из ChatGPT или Claude).
Для всех остальных эти знаки легко устранимы:
- Перефразирование: Если вы пропустите текст от Claude через любую другую (немаркированную) ИИ-модель с просьбой «перепиши этот текст своими словами», специфический выбор словаря и вероятности токенов полностью разрушатся. Водяной знак исчезнет.
- Очистка форматирования: Если использовались скрытые символы Unicode, базовые скрипты нормализации текста или даже вставка в некоторые IDE без поддержки нестандартных пробелов автоматически очистят текст от меток.
- Ручная редактура: Даже банальный перевод на другой язык или внесение нескольких правок руками человека ломают математические паттерны, которые ищут детекторы.
- Короткие тексты: Для работы статистического водяного знака требуется определенный объем текста. В коротком ответе (например, в одной строке кода) просто не хватит данных для внедрения паттерна.
Итог: сработает ли закон?
Европейский AI Act требует, чтобы методы маркировки были «надежными и эффективными насколько это технически возможно». Однако техническая реальность такова, что надежных водяных знаков для текста пока не существует.
Инициатива Anthropic добавит прозрачности в экосистему, но разработчикам и авторам контента следует понимать: это защита от автоматизированного спама, а не безупречный инструмент для выявления использования ИИ в каждой строчке кода.
На основе Claude watermarks your code now
