Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity
Разбор whitepaper METR: дизайн RCT-эксперимента, результат замедления на ~19%, факторы, ограничения и как корректно интерпретировать выводы.
PAPER LAB ЗА 30 МИНУТ
Разбор оригинала
Таймер помогает держать темп, но не блокирует чтение и не переключает этапы.
00:00
активного времени
Сохранение выключено. Ответы останутся в памяти только до закрытия вкладки. Включить сохранение
Где смотреть
1.1Какое решение об AI-инструментах может изменить результат и какой эффект вы ожидаете до чтения?*
05 мин
Инженерный memo
До 250 слов: решение, evidence, уверенность, ограничения, применимость и следующий шаг.
0 / 250 слов
Завершить lab
Ответьте или пропустите обязательные prompts, просмотрите сверки и сохраните memo.
Готовый редакционный разбор
Он сохранён из прежней версии каталога и расположен после самостоятельной практики, чтобы не подменять чтение оригинала готовым пересказом.
Whitepaper
Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity
METR, июль 2025.
Whitepaper
Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity
METR, июль 2025.
Исследование получило большой резонанс из-за «неудобного» вывода: в этом конкретном эксперименте опытные разработчики в знакомых OSS-репозиториях работали с AI медленнее, чем без него.

Первая страница whitepaper (клик по изображению откроет PDF).
Основа [1/2]
Telegram пост #3673
Контекст, методология и причины высокого внимания к исследованию.
Основа [1/2]
Telegram пост #3673
Контекст, методология и причины высокого внимания к исследованию.
Почему исследование вызвало резонанс
Контринтуитивный результат
Работа показала статистически значимое замедление опытных OSS-разработчиков при использовании AI, что противоречит массовому ожиданию «AI всегда ускоряет».
Сильный экспериментальный дизайн
Использован RCT-подход с рандомным назначением задач в AI-allowed и AI-forbidden режимы в реальной рабочей среде участников.
Высокая практическая ставка
Выводы напрямую влияют на оценку ROI многомиллиардных инвестиций в AI-инструменты разработки.
Методология и масштаб эксперимента
16 опытных OSS-разработчиков
Участники
246 реальных задач
Задачи
≈5 лет
Средний опыт с репо
≈1500 коммитов
Средний вклад
≈1.1M LOC в среднем
Размер проектов
≈23k stars
Популярность репо
- Задачи случайно назначались в две группы: AI-разрешенная и AI-запрещенная.
- В AI-группе разработчики использовали привычные инструменты (чаще Cursor Pro + Claude Sonnet).
- Основная метрика — время выполнения задачи; дополнительно собирались screen recordings, интервью и логи использования AI.
- Каждая задача должна была пройти обычный code review в целевых OSS-репозиториях.
Ключевые результаты
- Зафиксировано статистически значимое замедление: около 19% (с 95% доверительным интервалом).
- Ожидания участников и экспертов были обратными: обе группы прогнозировали ускорение, а не замедление.
- Авторы отдельно ограничивают обобщаемость выводов: контекст — опытные инженеры, знакомые крупные кодовые базы и задачи до ~2 часов.
Основа [2/2]
Telegram пост #3674
Результаты, факторы замедления и ограничения исследования.
Основа [2/2]
Telegram пост #3674
Результаты, факторы замедления и ограничения исследования.
Предполагаемые факторы замедления
Чрезмерный оптимизм относительно полезности AI в конкретном контексте задач.
Высокая знакомость разработчиков с репозиториями (низкий маржинальный выигрыш от подсказок).
Большие и сложные кодовые базы с высоким уровнем неявного контекста.
Ограниченная надежность AI-предложений (принятие <44% в этом эксперименте).
Существенная часть контекста проекта оставалась недоступной модели.
Ограничения и границы обобщения
- Малый размер выборки (16 участников) ограничивает статистическую мощность и детализацию причин.
- Краткосрочный горизонт не отражает эффекты обучения и адаптации к инструментам.
- Сильная специфичность контекста (зрелые OSS-кодовые базы) сужает внешнюю валидность.
- Возможный эффект Хоторна: участники знали, что находятся в эксперименте.
- Время фиксировалось самими участниками, что может вносить систематические ошибки.
- Продуктивность измерялась в основном временем, а не полной корзиной quality/impact-метрик.
Как применять результаты в организациях
- Результат не означает «AI бесполезен», а указывает на сильную зависимость эффекта от контекста.
- Для внедрения в компаниях полезнее пошаговые A/B-эксперименты на собственных репозиториях и workflow.
- Нужен многомерный замер: скорость, rework, качество, влияние на review load и бизнес-impact.
- Решения о масштабировании AI-инструментов лучше принимать по локальным данным, а не по одному внешнему исследованию.
Белая бумага ценна не как универсальный вердикт про AI, а как качественный «антипример» против упрощенного тезиса, что ускорение гарантировано в любом инженерном контексте.
Связанные главы
RIMS #17 - Measuring the Impact of Early-2025 AI on Developer Productivity
Подкаст-разбор того же исследования и границ интерпретации.
Achieving Productivity Gains with AI-based IDE features: A Journey at Google
Контрастный кейс, где при другом контексте и методологии фиксируется положительный эффект.
Как собираются отчеты DORA
Методологический ориентир по корректному построению и интерпретации инженерных метрик.
После самостоятельного разбора
Видео и редакционные разборы открываются после практики и помогают сверить ход мысли.