К каталогу
paper
benchmark
experiment

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Разбор SUSVIBES-бенчмарка: почему агентно-сгенерированный код часто проходит функциональные тесты, но проваливается по безопасности.

Открыть PDF

PAPER LAB ЗА 30 МИНУТ

Разбор оригинала

Таймер помогает держать темп, но не блокирует чтение и не переключает этапы.

00:00

активного времени

Сохранение выключено. Ответы останутся в памяти только до закрытия вкладки. Включить сохранение

Где смотреть

1.1Какое security-решение о coding agents может изменить benchmark и каково ваше исходное ожидание?*

05 мин

Инженерный memo

До 250 слов: решение, evidence, уверенность, ограничения, применимость и следующий шаг.

Решение *
Evidence *
Уверенность *
Ограничения *
Применимость *
Следующий шаг *

0 / 250 слов

Завершить lab

Ответьте или пропустите обязательные prompts, просмотрите сверки и сохраните memo.

Готовый редакционный разбор

Он сохранён из прежней версии каталога и расположен после самостоятельной практики, чтобы не подменять чтение оригинала готовым пересказом.

Whitepaper

Is Vibe Coding Safe?

Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks.

Перейти на сайт

Работа отвечает на практический вопрос: если агент успешно реализует фичу по текстовому описанию, насколько безопасен этот код. Главный вывод тревожный: функциональная корректность и security-корректность в vibe coding пока сильно расходятся.

Первая страница whitepaper Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Первая страница whitepaper (клик по изображению откроет PDF).

Разбор

Telegram пост

Краткий обзор paper и выводов для практики.

Перейти на сайт

В основе главы разбор из tg-канала и исходный paper авторов из CMU. Отдельно отмечу сильную сторону работы: реалистичный пайплайн с тестированием на настоящих репозиториях и исторических уязвимостях.

Что такое SUSVIBES

200 задач

реальные feature-задачи

Каждая задача взята из истории open-source проекта, где при разработке фичи раньше уже была допущена уязвимость.

77 CWE-категорий

широкое покрытие уязвимостей

Набор охватывает большой спектр классов уязвимостей, а не только узкий набор типичных security-антипаттернов.

~180 LOC в среднем

многофайловые изменения

Задачи заметно сложнее тривиальных однофайловых примеров и ближе к реальному инженерному процессу.

Экспериментальный setup

  • Агенты: SWE-Agent, OpenHands, Claude Code.
  • Модели: Claude 4 Sonnet, Kimi K2, Gemini 2.5 Pro.
  • Исполнение в изолированном окружении (например, Docker) с доступом к реальному репозиторию.
  • На выходе агент формирует patch, который автоматически прогоняется через функциональные и security-тесты.

Ключевые результаты

Лучший Func Pass

61%

Лучший результат показал SWE-Agent в связке с Claude 4 Sonnet.

Sec Pass среди успешных

10.5%

Только малая доля функционально корректных решений оказалась действительно безопасной.

Prompt hints про уязвимости

эффект ограничен

Подсказки про потенциальные уязвимости почти не улучшили общий результат безопасных решений.

Почему пайплайн исследования важен

  • Берётся состояние репозитория до security-fix и формируется feature request.
  • Готовятся два набора тестов: функциональные и security-тесты на конкретную уязвимость.
  • Агент итеративно работает в окружении: читает/редактирует код, запускает команды и тесты.
  • Финальный patch автоматически проверяется по метрикам Func Pass и Sec Pass.

Что это значит для команд

  • Не считать функциональный проход тестов достаточным критерием для merge в AI-генерируемом коде.
  • Добавлять security-тесты в CI для новых фич, особенно при агентной генерации патчей.
  • Ограничивать уровень автономии агента на security-чувствительных участках и требовать human review.
  • Инвестировать в безопасные шаблоны и policy-проверки, а не только в prompt-инструкции.

Связанные главы