К каталогу
paper
statistics

Quantifying large language model usage in scientific papers

Разбор Nature-исследования о росте LLM-модификаций в научных текстах: масштаб корпуса, результаты по дисциплинам и последствия для публикационной экосистемы.

Практика чтения для этого источника ещё не опубликована

Ниже доступен готовый редакционный brief из прежнего каталога. Он даёт контекст, но не засчитывается как lab.

Открыть оригинал

Готовый редакционный разбор

Он сохранён из прежней версии каталога и расположен после самостоятельной практики, чтобы не подменять чтение оригинала готовым пересказом.

Whitepaper

Quantifying large language model usage in scientific papers

Nature Human Behaviour, 2025.

Перейти на сайт

Работа оценивает, насколько быстро LLM стали частью научного письма. В центре — количественный анализ большого корпуса публикаций и сравнение дисциплин по доле AI-модифицированного текста.

Основа главы

Telegram пост #3727

Контекст и интерпретация результатов исследования.

Перейти на сайт

Масштаб исследования

~1.1M

Корпус

препринтов и опубликованных статей

01.2020-09.2024

Период

динамика до широкого и после широкого внедрения LLM

arXiv, bioRxiv, Nature

Источники

разные режимы публикации и рецензирования

LLM-modified text

Фокус

оценка доли AI-модифицированного текста в научных работах

Что показали данные

Устойчивый рост LLM-следа в научных текстах

Исследование фиксирует стабильный рост вероятного использования LLM в период 2020-2024.

Компьютерные науки лидируют по доле AI-модификаций

В области computer science доля работ с признаками AI-модифицированного текста доходит до ~22%.

В математике доля заметно ниже

Для математических публикаций оценка примерно вдвое ниже, чем в computer science.

Обнаружены общие паттерны публикаций

Такие статьи чаще короче, относятся к популярным доменам и сильнее связаны с preprint-контуром.

Методологические сигналы (высокоуровнево)

  • Сравнение больших корпусов по времени: от до-LLM периода к периоду активного внедрения генеративных моделей.
  • Сопоставление доменов (например, computer science и mathematics), чтобы отделить общий тренд от отраслевой специфики.
  • Анализ текстовых признаков на уровне публикаций для оценки вероятного AI-модифицированного фрагмента.
  • Проверка на разных источниках публикаций (препринты и журнальные площадки) для устойчивости выводов.

Science News

One-fifth of computer science papers may include AI content

Контекстная новость, которая привела к разбору оригинальной статьи.

Перейти на сайт

Возможные последствия для научной экосистемы

  • Скорость выпуска научных текстов может расти, но риск падения сигнал/шум в перегретых доменах становится выше.
  • Для доверия к публикациям важны прозрачные правила: где AI помогал, в каком режиме и какие части текста были модифицированы.
  • Публикационная инфраструктура будет испытывать давление: ручного ревью меньше хватает, растёт запрос на автоматизированный pre-screening и AI-assisted review.

Что может снизить риски

Ввести стандартизированное раскрытие использования LLM в статье (disclosure section).

Разделить допустимую языковую редактуру и содержательные вкладки/выводы, требующие явного авторского контроля.

Дополнить peer review автоматическими проверками, но сохранять scientists-in-the-loop для финального решения.

Переосмыслить метрики качества публикаций: не только количество, но и воспроизводимость, новизна и устойчивость результатов.

Связанные главы