Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
Разбор SUSVIBES-бенчмарка: почему агентно-сгенерированный код часто проходит функциональные тесты, но проваливается по безопасности.
PAPER LAB ЗА 30 МИНУТ
Разбор оригинала
Таймер помогает держать темп, но не блокирует чтение и не переключает этапы.
00:00
активного времени
Сохранение выключено. Ответы останутся в памяти только до закрытия вкладки. Включить сохранение
Где смотреть
1.1Какое security-решение о coding agents может изменить benchmark и каково ваше исходное ожидание?*
05 мин
Инженерный memo
До 250 слов: решение, evidence, уверенность, ограничения, применимость и следующий шаг.
0 / 250 слов
Завершить lab
Ответьте или пропустите обязательные prompts, просмотрите сверки и сохраните memo.
Готовый редакционный разбор
Он сохранён из прежней версии каталога и расположен после самостоятельной практики, чтобы не подменять чтение оригинала готовым пересказом.
Whitepaper
Is Vibe Coding Safe?
Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks.
Whitepaper
Is Vibe Coding Safe?
Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks.
Работа отвечает на практический вопрос: если агент успешно реализует фичу по текстовому описанию, насколько безопасен этот код. Главный вывод тревожный: функциональная корректность и security-корректность в vibe coding пока сильно расходятся.

Первая страница whitepaper (клик по изображению откроет PDF).
Разбор
Telegram пост
Краткий обзор paper и выводов для практики.
Разбор
Telegram пост
Краткий обзор paper и выводов для практики.
В основе главы разбор из tg-канала и исходный paper авторов из CMU. Отдельно отмечу сильную сторону работы: реалистичный пайплайн с тестированием на настоящих репозиториях и исторических уязвимостях.
Что такое SUSVIBES
200 задач
реальные feature-задачи
Каждая задача взята из истории open-source проекта, где при разработке фичи раньше уже была допущена уязвимость.
77 CWE-категорий
широкое покрытие уязвимостей
Набор охватывает большой спектр классов уязвимостей, а не только узкий набор типичных security-антипаттернов.
~180 LOC в среднем
многофайловые изменения
Задачи заметно сложнее тривиальных однофайловых примеров и ближе к реальному инженерному процессу.
Экспериментальный setup
- Агенты: SWE-Agent, OpenHands, Claude Code.
- Модели: Claude 4 Sonnet, Kimi K2, Gemini 2.5 Pro.
- Исполнение в изолированном окружении (например, Docker) с доступом к реальному репозиторию.
- На выходе агент формирует patch, который автоматически прогоняется через функциональные и security-тесты.
Ключевые результаты
Лучший Func Pass
61%
Лучший результат показал SWE-Agent в связке с Claude 4 Sonnet.
Sec Pass среди успешных
10.5%
Только малая доля функционально корректных решений оказалась действительно безопасной.
Prompt hints про уязвимости
эффект ограничен
Подсказки про потенциальные уязвимости почти не улучшили общий результат безопасных решений.
Почему пайплайн исследования важен
- Берётся состояние репозитория до security-fix и формируется feature request.
- Готовятся два набора тестов: функциональные и security-тесты на конкретную уязвимость.
- Агент итеративно работает в окружении: читает/редактирует код, запускает команды и тесты.
- Финальный patch автоматически проверяется по метрикам Func Pass и Sec Pass.
Что это значит для команд
- Не считать функциональный проход тестов достаточным критерием для merge в AI-генерируемом коде.
- Добавлять security-тесты в CI для новых фич, особенно при агентной генерации патчей.
- Ограничивать уровень автономии агента на security-чувствительных участках и требовать human review.
- Инвестировать в безопасные шаблоны и policy-проверки, а не только в prompt-инструкции.