К каталогу
paper
randomized-trial
telemetry

Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity

Разбор whitepaper METR: дизайн RCT-эксперимента, результат замедления на ~19%, факторы, ограничения и как корректно интерпретировать выводы.

Открыть PDF

PAPER LAB ЗА 30 МИНУТ

Разбор оригинала

Таймер помогает держать темп, но не блокирует чтение и не переключает этапы.

00:00

активного времени

Сохранение выключено. Ответы останутся в памяти только до закрытия вкладки. Включить сохранение

Где смотреть

1.1Какое решение об AI-инструментах может изменить результат и какой эффект вы ожидаете до чтения?*

05 мин

Инженерный memo

До 250 слов: решение, evidence, уверенность, ограничения, применимость и следующий шаг.

Решение *
Evidence *
Уверенность *
Ограничения *
Применимость *
Следующий шаг *

0 / 250 слов

Завершить lab

Ответьте или пропустите обязательные prompts, просмотрите сверки и сохраните memo.

Готовый редакционный разбор

Он сохранён из прежней версии каталога и расположен после самостоятельной практики, чтобы не подменять чтение оригинала готовым пересказом.

Whitepaper

Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity

METR, июль 2025.

Перейти на сайт

Исследование получило большой резонанс из-за «неудобного» вывода: в этом конкретном эксперименте опытные разработчики в знакомых OSS-репозиториях работали с AI медленнее, чем без него.

Первая страница whitepaper Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity

Первая страница whitepaper (клик по изображению откроет PDF).

Основа [1/2]

Telegram пост #3673

Контекст, методология и причины высокого внимания к исследованию.

Перейти на сайт

Почему исследование вызвало резонанс

Контринтуитивный результат

Работа показала статистически значимое замедление опытных OSS-разработчиков при использовании AI, что противоречит массовому ожиданию «AI всегда ускоряет».

Сильный экспериментальный дизайн

Использован RCT-подход с рандомным назначением задач в AI-allowed и AI-forbidden режимы в реальной рабочей среде участников.

Высокая практическая ставка

Выводы напрямую влияют на оценку ROI многомиллиардных инвестиций в AI-инструменты разработки.

Методология и масштаб эксперимента

16 опытных OSS-разработчиков

Участники

246 реальных задач

Задачи

≈5 лет

Средний опыт с репо

≈1500 коммитов

Средний вклад

≈1.1M LOC в среднем

Размер проектов

≈23k stars

Популярность репо

  • Задачи случайно назначались в две группы: AI-разрешенная и AI-запрещенная.
  • В AI-группе разработчики использовали привычные инструменты (чаще Cursor Pro + Claude Sonnet).
  • Основная метрика — время выполнения задачи; дополнительно собирались screen recordings, интервью и логи использования AI.
  • Каждая задача должна была пройти обычный code review в целевых OSS-репозиториях.

Ключевые результаты

  • Зафиксировано статистически значимое замедление: около 19% (с 95% доверительным интервалом).
  • Ожидания участников и экспертов были обратными: обе группы прогнозировали ускорение, а не замедление.
  • Авторы отдельно ограничивают обобщаемость выводов: контекст — опытные инженеры, знакомые крупные кодовые базы и задачи до ~2 часов.

Основа [2/2]

Telegram пост #3674

Результаты, факторы замедления и ограничения исследования.

Перейти на сайт

Предполагаемые факторы замедления

Чрезмерный оптимизм относительно полезности AI в конкретном контексте задач.

Высокая знакомость разработчиков с репозиториями (низкий маржинальный выигрыш от подсказок).

Большие и сложные кодовые базы с высоким уровнем неявного контекста.

Ограниченная надежность AI-предложений (принятие <44% в этом эксперименте).

Существенная часть контекста проекта оставалась недоступной модели.

Ограничения и границы обобщения

  • Малый размер выборки (16 участников) ограничивает статистическую мощность и детализацию причин.
  • Краткосрочный горизонт не отражает эффекты обучения и адаптации к инструментам.
  • Сильная специфичность контекста (зрелые OSS-кодовые базы) сужает внешнюю валидность.
  • Возможный эффект Хоторна: участники знали, что находятся в эксперименте.
  • Время фиксировалось самими участниками, что может вносить систематические ошибки.
  • Продуктивность измерялась в основном временем, а не полной корзиной quality/impact-метрик.

Как применять результаты в организациях

  • Результат не означает «AI бесполезен», а указывает на сильную зависимость эффекта от контекста.
  • Для внедрения в компаниях полезнее пошаговые A/B-эксперименты на собственных репозиториях и workflow.
  • Нужен многомерный замер: скорость, rework, качество, влияние на review load и бизнес-impact.
  • Решения о масштабировании AI-инструментов лучше принимать по локальным данным, а не по одному внешнему исследованию.

Белая бумага ценна не как универсальный вердикт про AI, а как качественный «антипример» против упрощенного тезиса, что ускорение гарантировано в любом инженерном контексте.

Связанные главы

После самостоятельного разбора

Видео и редакционные разборы открываются после практики и помогают сверить ход мысли.