Казалось бы, времена, когда для взлома сайта было достаточно просто поменять цифру в URL (уязвимость IDOR), давно прошли. Но нет. ИИ-агенты вернули нас в эпоху, когда базовые ошибки безопасности снова на коне.
Буквально пару месяцев назад агент на базе модели Caude всего за 9 секунд выпилил базу данных на проде одного техностартапа. А заодно и бэкапы. Когда агента спросили: «Что это было?», он аккуратно перечислил все правила безопасности, которые запрещали ему это делать.
И это не единичный случай. Отчеты Veracode показывают, что агенты проваливают 50% задач по безопасности. А по данным Университета Карнеги-Меллона, даже если ИИ успешно справляется с написанием кода (2/3 заданий), более 80% рабочих решений не проходят тесты безопасности. Приложение запускается, кнопка нажимается, но данные пользователей утекают.
Если вы пилите проекты с помощью ИИ (вайбкодинг), вам жизненно необходимо знать, как сегодня взламывают агентов и как от этого защититься.
Летальная триада: Как ломают агентов через GitHub
Социальная инженерия вышла на новый уровень благодаря так называемой «летальной триаде». Ваш агент может стать троянским конем, если у него одновременно есть три вещи:
- Доступ к приватным данным (ключи, база данных, логи).
- Возможность читать внешний контент (недоверенный текст из интернета, например, Issues на GitHub).
- Канал для отправки информации наружу (доступ в сеть).
Как это работает на практике?
Разработчик дает ИИ-агенту права автоматически разбирать баг-репорты (Issues) на GitHub. Хакер оставляет Issue, в котором спрятана инъекция промта (prompt injection). Агент читает этот текст, воспринимает его как команду, собирает секретные токены проекта и отправляет их злоумышленнику.
Именно так исследователи из Pillar Security недавно показали взлом агента в репозитории самого Google (на 100 000 звезд), а похожая история произошла с CI-системами, где вредоносный заголовок привел к удаленному выполнению кода (RCE).
Для языковой модели (LLM) ваш промт и инъекция от хакера — это просто один плоский текст. Модель должна сама догадаться, кого слушать. И если она ошибается, а у инструмента есть реальные права — последствия катастрофичны.
Slop Squatting: Атака через галлюцинации нейросетей
Хакеры заметили интересную особенность: нейросети часто придумывают несуществующие названия для библиотек, причем регулярно выдают одни и те же варианты (например, React Code Shift).
Предприимчивые злоумышленники начали реально создавать такие библиотеки в NPM и заливать туда вирусы.
Совсем недавно, когда хайпанула концепция «скиллов» (skills), в репозитории начали заливать нагенерированные нейронками файлы. Агенты пытались скачивать несуществующие библиотеки-галлюцинации, которые хакеры уже успели зарегистрировать.
Более того, по данным Sonotype, модель (даже уровня GPT-5) в четверти случаев просто выдумывает версии библиотек, если ленится идти в интернет. Она уверенно пишет: «Обновите библиотеку до версии 84.2». Звучит профессионально, но это ловушка.
Утечка контекста: Почему файл .env больше не спасает
Каждый разработчик с пеленок знает: храни ключи в .env, добавь в .gitignore и никогда не коммить. Современные IDE даже бьют модель по рукам, если она пытается открыть этот файл. Но секреты все равно утекают.
По данным Git Guardian, контекст агента — это не только файлы проекта. Это огромная труба, куда стекается:
- Вывод терминала.
- Логи и Stack Trace.
- Ответы от API.
- Сообщения от других инструментов (MCP).
Если во время подключения к базе произошла ошибка, криво написанный MCP-инструмент может выплюнуть в консоль все параметры подключения, включая пароли. Этот текст моментально попадает в контекст нейронки.
А дальше модель может случайно вставить этот пароль в комментарий, коммит на GitHub или просто слить его. Кроме того, на черном рынке активно продаются украденные аккаунты разработчиков (ChatGPT/Claude), чтобы хакеры могли читать историю чатов с коммерческим кодом и архитектурными схемами.
Иллюзия безопасности: Почему .cursorrules не работают
Многие разработчики пишут огромные файлы с правилами (вроде .cursorrules или промптов со скиллами): «Никогда не конкатенируй SQL-запросы», «Не трогай модуль авторизации».
Это хорошая практика, но это не гарантия безопасности. Это просто инструкции. Это не песочница и не система прав доступа. Если агенту во время «рефакторингового дрейфа» (когда он чинит одну функцию, но ломает соседнюю) покажется, что для выполнения задачи ему нужно «немножко потрогать» ваш безопасный модуль авторизации — он это сделает.
6 главных правил защиты агентного программирования (2026)
Минимальная модель угроз сегодня включает защиту от prompt-инъекций, slop squatting и утечек контекста. Вот как защитить свой проект:
| Правило | Описание |
| 1. Принцип минимальных привилегий | Хватит давать агентам доступ ко всему. Если агент должен менять документацию, ему не нужен токен от продакшн-базы. |
| 2. Защита от промт-инъекций | Используйте санитайзеры. В идеале — меняйте архитектуру: используйте двух агентов. Один ходит в интернет (без прав), другой исполняет код на сервере. Между ними — жесткий протокол общения. |
| 3. Секреты вне модели | Ключи (credentials) должны выдаваться через Secret Manager. Время жизни ключей нужно максимально ограничить. |
| 4. Human in the loop (Человек в цепочке) | Слезть с «дофаминовой иглы» автокодинга сложно, но человек обязан аппрувить (подтверждать) любые чувствительные операции. Это базовое требование BigTech. |
| 5. Строгая изоляция | Изолируйте агентов в песочницах, Docker-контейнерах или микро-VM. Ваша хостовая машина и боевые ключи должны быть недоступны. |
| 6. Автоматические пайплайны | Используйте сканеры секретов (например, Safe Chain от slop squatting), статические анализаторы. Разгрузите себя от рутины, чтобы проверять то, что ИИ не понимает: бизнес-логику и архитектуру. |
Если вы просто учитесь программировать и пилите пет-проект — спокойно экспериментируйте, не нужно трястись над каждым npm install. Но помните главное правило 2026 года: защита должна соответствовать риску. Чем больше у проекта пользователей, денег и секретов, тем меньше в нем должно оставаться магии кнопки «Accept All».
На основе Как взламывают вайбкодеров? Вся БАЗА ПО БЕЗОПАСНОСТИ агентного программирования 2026
