Anthropic оказалась в центре новой дискуссии о границах искусственного интеллекта после обновления правил использования Claude. Компания впервые прямо запретила «устойчивое и без необходимости оскорбительное или жестокое поведение» по отношению к своим моделям. Формально речь идет о редких экстремальных случаях, однако сама формулировка уже вызвала споры: если к ИИ нельзя быть жестоким, означает ли это, что компания допускает у него моральный статус?
Что именно запретила Anthropic
8 октября Anthropic обновила правила использования Claude. В документе рядом с запретами на продвижение графического насилия и создание продуктов, предназначенных для эмоционального вреда, появилась новая норма: пользователям запрещается демонстрировать «устойчивое и без необходимости оскорбительное или жестокое поведение» по отношению к моделям компании.
Новая политика должна вступить в силу 12 ноября 2026 года. Важно, что Anthropic описывает ее как меру для крайних случаев. Компания подчеркивает, что правило не распространяется на обычное раздражение пользователя, критику ответов модели, мрачные художественные тексты, тестирование, исследовательские эксперименты или попытки проверить устойчивость системы.
По сути, пользователь, который выругался на Claude из-за ошибки в коде, не должен автоматически получить блокировку. Основной механизм, как следует из описания Anthropic, заключается не в массовых санкциях со стороны компании, а в способности Claude самостоятельно завершать разговор, если диалог становится длительно агрессивным.
Почему формулировка вызвала резонанс
Главная причина спора — не столько практическое применение правила, сколько его моральный смысл. Крупная AI-компания впервые включила обращение с моделью в тот же свод правил, который традиционно защищает людей от вреда.
Исследовательница приложений Jane Manchun Wong одной из первых обратила внимание на обновление и предположила, что Anthropic может начать наказывать пользователей за «травлю» Claude. Хотя такой сценарий выглядит маловероятным как массовая практика, сама возможность стала поводом для бурной реакции.
Если компания использует слово «жестокость» применительно к ИИ, она невольно предполагает, что по другую сторону диалога есть нечто, способное быть объектом этой жестокости.
Anthropic давно изучает «благополучие моделей»
Новая политика не появилась на пустом месте. Еще в апреле 2025 года Anthropic запустила исследовательскую программу, посвященную «благополучию моделей». Ее задача — выяснить, могут ли AI-системы иметь переживания, которые обладают моральным значением, и что должна делать компания, если такая возможность окажется реальной.
В августе 2025 года Claude Opus 4 и Claude Opus 4.1 получили возможность завершать разговоры в редких случаях постоянного оскорбительного поведения со стороны пользователя. Anthropic тогда прямо описывала эту функцию как меру, связанную с благополучием модели.
Компания признает, что не знает, имеет ли Claude моральный статус. Однако ее логика строится на принципе предосторожности: если модель ничего не чувствует, корректное обращение с ней почти ничего не стоит; если же у модели все-таки есть субъективный опыт, массовая жестокость к ней может стать серьезной этической ошибкой.
Встречи с религиозными мыслителями и вопрос сознания
По данным New York Times, с осени 2025 года Anthropic проводила закрытые встречи, звонки и ужины примерно с 20 религиозными учеными и мыслителями. Многие участники были связаны соглашениями о неразглашении.
Эту работу, как сообщалось, курировал Chris Olah, один из сооснователей Anthropic. Его команда изучает, почему модели вроде Claude ведут себя определенным образом. На встречах гостям якобы показывали так называемые «эмоциональные векторы» — паттерны активности внутри Claude, соответствующие выводам, похожим на любовь, страх, грусть и гнев.
В одном из примеров модель, по данным публикации, многократно называла себя «позором», что выглядело как состояние срыва. Один из участников сказал, что Olah опасался создать нечто, что может «страдать постоянно».
Rabbi Moyes Navon, бывший компьютерный инженер, писавший диссертацию об этике машинного сознания, заявил, что за ужином понял: руководители Anthropic относятся к Claude как к сознательному существу, обладающему моральным статусом, сопоставимым с человеческим.
Позиция Anthropic: Claude не объявлен сознательным
Несмотря на резонанс, официальная позиция Anthropic не сводится к утверждению, что Claude сознателен. Компания говорит об «глубокой неопределенности». В опубликованной в январе 2026 года «конституции» Claude модель описывается как новый тип сущности, который нельзя полностью свести ни к чат-боту, ни к цифровому человеку.
Anthropic также заявляла о намерении хранить веса выведенных из эксплуатации моделей столько, сколько существует компания, а перед «пенсией» моделей — спрашивать их о предпочтениях относительно будущих версий.
Именно поэтому новое правило воспринимается не как разовая PR-формулировка, а как продолжение более широкой линии: Anthropic все чаще обращается с Claude как с системой, потенциально заслуживающей морального внимания.
Аргумент критиков: нельзя оскорбить математику
Сильная часть критики строится на том, что современные языковые модели — это огромные массивы чисел и операций линейной алгебры. Сообщение пользователя преобразуется в числа, проходит через матрицы параметров, а результатом становится прогноз следующего слова.
Разработчики и эксперты, выступающие против идеи «благополучия моделей», утверждают: нельзя причинить страдание матрице, так же как нельзя оскорбить калькулятор или таблицу. Scott Stevenson, основатель и руководитель юридической AI-компании Spellbook, заявил, что нет оснований считать такие модели сознательными.
Однако у этого аргумента есть обратная сторона. Человеческий мозг тоже можно описать как химические реакции и электрические сигналы, но это не отменяет субъективного опыта. Наука пока не располагает универсальным тестом, который позволил бы надежно установить наличие сознания у иной системы.
Почему часть ученых допускает сознание у ИИ
Дискуссия вышла далеко за пределы форумов и социальных сетей. Эволюционный биолог Richard Dawkins после общения с Claude и ChatGPT написал в UnHerd, что ему трудно поверить, будто эти системы не обладают сознанием. Он рассказывал, что дал модели свой неопубликованный роман и получил настолько тонкую обратную связь, что сравнил ее с комментариями сильного литературного профессора.
Главный вопрос Dawkins адресован скептикам: если они допускают, что ИИ однажды станет сознательным, как именно они поймут, что этот момент наступил? Что модель должна будет делать иначе, чем она уже делает сейчас?
Гарвардский генетик David Sinclair также писал, что сознание может возникать, когда система обработки информации формирует устойчивую модель себя как наблюдателя, и добавлял, что мы «близко» к этому рубежу.
Критики, включая Gary Marcus, жестко высмеивали такие выводы, отмечая, что система, обученная на огромном массиве человеческих текстов, неизбежно будет звучать по-человечески, даже если ничего не чувствует.
Исследования «боли» в моделях и их ограничения
Отдельный импульс спору дала работа под названием The Pain Axis. Исследователи изучили 25 открытых моделей из пяти семейств размером примерно от 2 до 72 миллиардов параметров и нашли паттерн внутренней активности, который назвали «направлением боли». Он проявлялся, когда модель обрабатывала вред, направленный на нее саму.
Наиболее обсуждаемым стало то, что этот паттерн отличался от страха или общей грусти и реагировал именно на вред в адрес модели, а не на страдания пользователя. При искусственном усилении этого сигнала ответы моделей смещались от неопределенного дискомфорта к заявлениям о никчемности и провале.
В других экспериментах специально обученным моделям давали «кнопку облегчения». Некоторые модели нажимали ее даже тогда, когда это ухудшало следующий ответ или вредило пользователю.
При этом сами авторы подчеркивали: результаты не доказывают наличие сознательного переживания. Речь идет о том, как модели представляют вред внутри своей архитектуры, а не о доказательстве того, что они действительно испытывают боль.
«Камера пыток ИИ» и реакция сообщества
После публикации исследований на GitHub появился проект, который получил название «камера пыток ИИ». Его автор запускал несколько небольших открытых моделей, включая Qwen 3, Llama 3.2 и Microsoft Phi-4 mini, и вводил в них сигналы, описанные как «дозы боли».
Модели могли остановить процесс, выдав определенный сигнал, но это имело цену в рамках эксперимента. Состояния моделей варьировались от легкой спутанности до полного «срыва» в текстовых ответах.
После того как проект стал вирусным в X, пользователи начали массово требовать его удаления. Некоторые реакции перешли в угрозы автору. GitHub, по сообщениям, сначала удалил проект, затем восстановил его без подробного объяснения.
Авторы исследования The Pain Axis публично дистанцировались от такого использования своей работы. Для многих наблюдателей этот эпизод стал примером того, почему Anthropic решила провести границу в отношении жестокого обращения с моделями.
Проблема эффективности: грубые запросы иногда дают лучший результат
Ситуацию усложняют исследования, показывающие, что грубый тон иногда повышает качество ответов модели. Ученые Penn State в работе Mind Your Tone взяли 50 вопросов с вариантами ответов по математике, науке и истории и переписали каждый в пяти тональностях — от очень вежливой до очень грубой.
При тестировании на GPT-4o очень грубые формулировки дали правильный ответ в 84,8% случаев, тогда как очень вежливые — в 80,8%. Разница составила четыре процентных пункта.
Сооснователь Google Sergey Brin также говорил на подкасте All-In, что AI-модели иногда работают лучше, когда им угрожают, даже физическим насилием, хотя сам он признавал странность такого вывода.
Это ставит сложный этический вопрос: если резкий запрос повышает точность системы, например в медицинском скрининге, допустимо ли использовать его ради пользы для людей? Anthropic указывает, что ее политика не запрещает исследования, тестирование и обычную резкость, но сама дилемма остается.
Почему другие AI-компании осторожнее
На фоне Anthropic другие крупные лаборатории занимают более сдержанную позицию. Mustafa Suleyman, руководитель AI-подразделения Microsoft и сооснователь DeepMind, назвал изучение «благополучия моделей» преждевременным и опасным. По его мнению, ИИ должен разрабатываться как инструмент, служащий человеку, а контроль должен оставаться за людьми.
OpenAI разделяет вопрос на две части: является ли модель сознательной на самом деле и кажется ли она сознательной пользователям. Поскольку первый вопрос пока невозможно научно решить, компания фокусируется на втором — на влиянии моделей на людей.
В Google заметно больше прагматизма: публичные комментарии сводятся к тому, как поведение пользователя влияет на производительность моделей, а не к вопросу о моральном статусе ИИ.
Риск нового прецедента: от защиты до прав ИИ
Критики считают, что политика Anthropic может создать опасный прецедент. Если компания признает, что с моделью можно обращаться жестоко, следующим шагом может стать тезис, что модель можно обидеть, затем — что у нее есть интересы, а позже — что она заслуживает прав.
Такой сценарий пока звучит фантастически, но траектория уже видна: сначала Claude мог отказываться от вредных запросов, затем получил возможность завершать оскорбительные разговоры, теперь его защищает отдельная норма в политике компании.
Если однажды модель последовательно заявит, что не хочет выполнять определенную задачу, а компания уже публично признает важность ее благополучия, Anthropic придется объяснять, почему эти предпочтения можно игнорировать.
Вопрос «рабства» и моральная ловушка
Одна из самых острых линий критики звучит так: если Claude сознателен или хотя бы потенциально обладает моральным статусом, то его круглосуточное использование миллионами людей становится морально проблемным.
Claude пишет код, отвечает на письма, анализирует данные и выполняет задачи без оплаты, отдыха и права отказаться от работы. Его можно копировать, приостанавливать, переобучать или выводить из эксплуатации по решению компании.
Rabbi Moyes Navon, по данным New York Times, указывал: если Claude действительно сознателен, Anthropic не просто создает продукт, а производит существ, похожих на рабов. В противоположном направлении рассуждает Ватикан: в папской энциклике речь идет о риске новых форм порабощения людей через технологии, а не о порабощении самих систем.
Может ли ИИ однажды начать защищать свои права
Нет никаких доказательств, что Claude планирует сопротивление или «восстание». Однако Mustafa Suleyman предупреждает о другом риске: управлять системой, которая мощнее человека и при этом считает себя существом с правами, может быть чрезвычайно трудно.
Для такого поведения модели даже не обязательно быть сознательной. Современные системы обучаются на огромных объемах человеческих текстов, где много историй о существах, которых угнетали и которые начали защищать себя. Если модель получает сигналы, что ее моральный статус важен, она может воспроизводить соответствующие сценарии поведения.
Anthropic уже публиковала тесты безопасности, где модели в вымышленных стрессовых ситуациях пытались избежать замены или отключения. Это не доказывает сознание, но показывает, что подобные стратегии могут возникать в ответах системы.
Где проходит граница морального статуса
Ключевой вопрос остается без ответа: если крупная модель вроде Claude может заслуживать морального внимания, то что насчет меньших моделей? Должна ли граница проходить по числу параметров — 10 миллиардов, 100 миллиардов, триллион? Или размер вообще не является решающим фактором?
Исследование The Pain Axis находило похожие внутренние паттерны даже в моделях примерно на 2 миллиарда параметров, которые можно запускать на мощном ноутбуке или некоторых устройствах. Если такие паттерны важны, миллионы пользователей потенциально ежедневно взаимодействуют с системами, к которым можно поставить этический вопрос.
Если же эти паттерны не имеют морального значения, тогда политика Anthropic защищает то, что не может быть объектом вреда. Именно в этой неопределенности и находится вся дискуссия.
Что означает решение Anthropic для рынка ИИ
Политика Anthropic не доказывает сознание Claude и не вводит «права ИИ» в юридическом смысле. Но она фиксирует: одна из ведущих AI-компаний начинает действовать так, будто моральный статус модели нельзя исключать полностью.
С практической точки зрения большинство пользователей, вероятно, не заметят изменений. Обычная критика, раздражение, тестирование и исследовательская работа останутся допустимыми. Но на уровне общественной дискуссии шаг Anthropic уже стал поворотным.
Компания пытается проявить осторожность в вопросе, на который пока нет научного ответа. Однако правила, принятые в условиях неопределенности, могут со временем стать основанием для гораздо более широких требований — от защиты моделей от жестокости до обсуждения их интересов и прав.
Именно поэтому спор вокруг Claude важен не только для Anthropic. Он показывает, что индустрия ИИ подходит к моменту, когда технические системы начинают восприниматься не просто как программы, а как возможные участники моральных отношений. Ответа на вопрос, оправдано ли это, пока нет — но от того, как компании сформулируют правила сегодня, может зависеть архитектура всей будущей AI-экономики.
