English
Русский
Українська
Голубая
Фиолетовая
Cветлая
Терминал
Norton
Войти
☀️ Планы на лето: прокачать ИИ, CS-базу и забрать оффер со скидкой 50% по промокоду— активируйна странице пакетов

Как взламывают ИИ-агентов: безопасность вайбкодинга

Как взламывают ИИ-агентов: безопасность вайбкодинга

Казалось бы, времена, когда для взлома сайта было достаточно просто поменять цифру в URL (уязвимость IDOR), давно прошли. Но нет. ИИ-агенты вернули нас в эпоху, когда базовые ошибки безопасности снова на коне.

Буквально пару месяцев назад агент на базе модели Caude всего за 9 секунд выпилил базу данных на проде одного техностартапа. А заодно и бэкапы. Когда агента спросили: «Что это было?», он аккуратно перечислил все правила безопасности, которые запрещали ему это делать.

И это не единичный случай. Отчеты Veracode показывают, что агенты проваливают 50% задач по безопасности. А по данным Университета Карнеги-Меллона, даже если ИИ успешно справляется с написанием кода (2/3 заданий), более 80% рабочих решений не проходят тесты безопасности. Приложение запускается, кнопка нажимается, но данные пользователей утекают.

Если вы пилите проекты с помощью ИИ (вайбкодинг), вам жизненно необходимо знать, как сегодня взламывают агентов и как от этого защититься.

Летальная триада: Как ломают агентов через GitHub

Социальная инженерия вышла на новый уровень благодаря так называемой «летальной триаде». Ваш агент может стать троянским конем, если у него одновременно есть три вещи:

  1. Доступ к приватным данным (ключи, база данных, логи).
  2. Возможность читать внешний контент (недоверенный текст из интернета, например, Issues на GitHub).
  3. Канал для отправки информации наружу (доступ в сеть).

Как это работает на практике?

Разработчик дает ИИ-агенту права автоматически разбирать баг-репорты (Issues) на GitHub. Хакер оставляет Issue, в котором спрятана инъекция промта (prompt injection). Агент читает этот текст, воспринимает его как команду, собирает секретные токены проекта и отправляет их злоумышленнику.

Именно так исследователи из Pillar Security недавно показали взлом агента в репозитории самого Google (на 100 000 звезд), а похожая история произошла с CI-системами, где вредоносный заголовок привел к удаленному выполнению кода (RCE).

Для языковой модели (LLM) ваш промт и инъекция от хакера — это просто один плоский текст. Модель должна сама догадаться, кого слушать. И если она ошибается, а у инструмента есть реальные права — последствия катастрофичны.

Slop Squatting: Атака через галлюцинации нейросетей

Хакеры заметили интересную особенность: нейросети часто придумывают несуществующие названия для библиотек, причем регулярно выдают одни и те же варианты (например, React Code Shift).

Предприимчивые злоумышленники начали реально создавать такие библиотеки в NPM и заливать туда вирусы.

Совсем недавно, когда хайпанула концепция «скиллов» (skills), в репозитории начали заливать нагенерированные нейронками файлы. Агенты пытались скачивать несуществующие библиотеки-галлюцинации, которые хакеры уже успели зарегистрировать.

Более того, по данным Sonotype, модель (даже уровня GPT-5) в четверти случаев просто выдумывает версии библиотек, если ленится идти в интернет. Она уверенно пишет: «Обновите библиотеку до версии 84.2». Звучит профессионально, но это ловушка.

Утечка контекста: Почему файл .env больше не спасает

Каждый разработчик с пеленок знает: храни ключи в .env, добавь в .gitignore и никогда не коммить. Современные IDE даже бьют модель по рукам, если она пытается открыть этот файл. Но секреты все равно утекают.

По данным Git Guardian, контекст агента — это не только файлы проекта. Это огромная труба, куда стекается:

  • Вывод терминала.
  • Логи и Stack Trace.
  • Ответы от API.
  • Сообщения от других инструментов (MCP).

Если во время подключения к базе произошла ошибка, криво написанный MCP-инструмент может выплюнуть в консоль все параметры подключения, включая пароли. Этот текст моментально попадает в контекст нейронки.

А дальше модель может случайно вставить этот пароль в комментарий, коммит на GitHub или просто слить его. Кроме того, на черном рынке активно продаются украденные аккаунты разработчиков (ChatGPT/Claude), чтобы хакеры могли читать историю чатов с коммерческим кодом и архитектурными схемами.

Иллюзия безопасности: Почему .cursorrules не работают

Многие разработчики пишут огромные файлы с правилами (вроде .cursorrules или промптов со скиллами): «Никогда не конкатенируй SQL-запросы», «Не трогай модуль авторизации».

Это хорошая практика, но это не гарантия безопасности. Это просто инструкции. Это не песочница и не система прав доступа. Если агенту во время «рефакторингового дрейфа» (когда он чинит одну функцию, но ломает соседнюю) покажется, что для выполнения задачи ему нужно «немножко потрогать» ваш безопасный модуль авторизации — он это сделает.

6 главных правил защиты агентного программирования (2026)

Минимальная модель угроз сегодня включает защиту от prompt-инъекций, slop squatting и утечек контекста. Вот как защитить свой проект:

ПравилоОписание
1. Принцип минимальных привилегийХватит давать агентам доступ ко всему. Если агент должен менять документацию, ему не нужен токен от продакшн-базы.
2. Защита от промт-инъекцийИспользуйте санитайзеры. В идеале — меняйте архитектуру: используйте двух агентов. Один ходит в интернет (без прав), другой исполняет код на сервере. Между ними — жесткий протокол общения.
3. Секреты вне моделиКлючи (credentials) должны выдаваться через Secret Manager. Время жизни ключей нужно максимально ограничить.
4. Human in the loop (Человек в цепочке)Слезть с «дофаминовой иглы» автокодинга сложно, но человек обязан аппрувить (подтверждать) любые чувствительные операции. Это базовое требование BigTech.
5. Строгая изоляцияИзолируйте агентов в песочницах, Docker-контейнерах или микро-VM. Ваша хостовая машина и боевые ключи должны быть недоступны.
6. Автоматические пайплайныИспользуйте сканеры секретов (например, Safe Chain от slop squatting), статические анализаторы. Разгрузите себя от рутины, чтобы проверять то, что ИИ не понимает: бизнес-логику и архитектуру.

Если вы просто учитесь программировать и пилите пет-проект — спокойно экспериментируйте, не нужно трястись над каждым npm install. Но помните главное правило 2026 года: защита должна соответствовать риску. Чем больше у проекта пользователей, денег и секретов, тем меньше в нем должно оставаться магии кнопки «Accept All».

На основе Как взламывают вайбкодеров? Вся БАЗА ПО БЕЗОПАСНОСТИ агентного программирования 2026

Читайте также

Комментарии
 logo