Quantifying large language model usage in scientific papers
Разбор Nature-исследования о росте LLM-модификаций в научных текстах: масштаб корпуса, результаты по дисциплинам и последствия для публикационной экосистемы.
Практика чтения для этого источника ещё не опубликована
Ниже доступен готовый редакционный brief из прежнего каталога. Он даёт контекст, но не засчитывается как lab.
Открыть оригиналГотовый редакционный разбор
Он сохранён из прежней версии каталога и расположен после самостоятельной практики, чтобы не подменять чтение оригинала готовым пересказом.
Whitepaper
Quantifying large language model usage in scientific papers
Nature Human Behaviour, 2025.
Whitepaper
Quantifying large language model usage in scientific papers
Nature Human Behaviour, 2025.
Работа оценивает, насколько быстро LLM стали частью научного письма. В центре — количественный анализ большого корпуса публикаций и сравнение дисциплин по доле AI-модифицированного текста.
Основа главы
Telegram пост #3727
Контекст и интерпретация результатов исследования.
Основа главы
Telegram пост #3727
Контекст и интерпретация результатов исследования.
Масштаб исследования
~1.1M
Корпус
препринтов и опубликованных статей
01.2020-09.2024
Период
динамика до широкого и после широкого внедрения LLM
arXiv, bioRxiv, Nature
Источники
разные режимы публикации и рецензирования
LLM-modified text
Фокус
оценка доли AI-модифицированного текста в научных работах
Что показали данные
Устойчивый рост LLM-следа в научных текстах
Исследование фиксирует стабильный рост вероятного использования LLM в период 2020-2024.
Компьютерные науки лидируют по доле AI-модификаций
В области computer science доля работ с признаками AI-модифицированного текста доходит до ~22%.
В математике доля заметно ниже
Для математических публикаций оценка примерно вдвое ниже, чем в computer science.
Обнаружены общие паттерны публикаций
Такие статьи чаще короче, относятся к популярным доменам и сильнее связаны с preprint-контуром.
Методологические сигналы (высокоуровнево)
- Сравнение больших корпусов по времени: от до-LLM периода к периоду активного внедрения генеративных моделей.
- Сопоставление доменов (например, computer science и mathematics), чтобы отделить общий тренд от отраслевой специфики.
- Анализ текстовых признаков на уровне публикаций для оценки вероятного AI-модифицированного фрагмента.
- Проверка на разных источниках публикаций (препринты и журнальные площадки) для устойчивости выводов.
Science News
One-fifth of computer science papers may include AI content
Контекстная новость, которая привела к разбору оригинальной статьи.
Science News
One-fifth of computer science papers may include AI content
Контекстная новость, которая привела к разбору оригинальной статьи.
Возможные последствия для научной экосистемы
- Скорость выпуска научных текстов может расти, но риск падения сигнал/шум в перегретых доменах становится выше.
- Для доверия к публикациям важны прозрачные правила: где AI помогал, в каком режиме и какие части текста были модифицированы.
- Публикационная инфраструктура будет испытывать давление: ручного ревью меньше хватает, растёт запрос на автоматизированный pre-screening и AI-assisted review.
Что может снизить риски
Ввести стандартизированное раскрытие использования LLM в статье (disclosure section).
Разделить допустимую языковую редактуру и содержательные вкладки/выводы, требующие явного авторского контроля.
Дополнить peer review автоматическими проверками, но сохранять scientists-in-the-loop для финального решения.
Переосмыслить метрики качества публикаций: не только количество, но и воспроизводимость, новизна и устойчивость результатов.
Связанные главы
Canaries in the Coal Mine?
Как AI уже меняет рынок труда и почему важно учитывать человеческий контур адаптации.
Future of Work with AI Agents
Подход к оценке автоматизации через баланс «желания людей vs технические возможности».
RIMS #18 - AI in SDLC
Практики внедрения AI и измерения эффектов в инженерных организациях.