К каталогу
archive

2025 LLM Year in Review

Архивный brief поста Andrej Karpathy о сдвигах в обучении моделей, агентных приложениях, local-first execution, vibe coding и LLM GUI.

Сдвиги парадигмы

Karpathy выделяет RL с проверяемыми наградами, jagged intelligence, новый application layer в духе Cursor, близость агента к локальному окружению, vibe coding и переход от chat UI к визуальным рабочим поверхностям. Это авторский обзор индустрии, а не систематическое исследование.

Что проверить на практике

Оценивайте модели на production-сценариях, задавайте уровни автономии draft → checked → approved, приближайте coding agents к живому окружению только вместе со строгими permissions и observability. Разделяйте capability модели и качество orchestration/UX.

Полный разбор из прежнего каталога

Текст перенесён целиком: короткие секции выше — это его конспект, а ниже идёт исходный разбор с ссылками и материалами.

Оригинал

2025 LLM Year in Review

Короткий пост Andrej Karpathy о ключевых сдвигах в экосистеме LLM.

Перейти на сайт

Этот обзор интересен не перечнем моделей, а сменой парадигм: как поменялись методы обучения, дизайн приложений, роль локального окружения и пользовательские интерфейсы. Ниже - шесть тезисов из поста и практический разбор, что с ними делать инженерам и лидерам.

Разбор

Telegram пост

Краткое саммари ключевых тезисов на русском.

Перейти на сайт

Если нужен первоисточник, рекомендую начать с оригинального текста Karpathy: он короткий и ёмкий. Для быстрого русскоязычного контекста можно использовать обзор в Telegram.

6 парадигмальных сдвигов LLM-ландшафта

Reinforcement Learning from Verifiable Rewards (RLVR)

К стеку `pretrain -> SFT -> RLHF` добавился крупный этап RL по проверяемым наградам (математика, код, паззлы). Более длинные RL-прогоны улучшают capability/$ и усиливают test-time compute.

Практический сигнал

Проектировать контуры с учётом режима `let the model think longer`: для сложных задач важны бюджеты на размышление и оценка качества по классам задач.

Ghosts vs Animals / Jagged Intelligence

LLM ведут себя как "призраки": на одних задачах выглядят гениально, на других ломаются и поддаются jailbreak. Бенчмарки всё чаще отражают степень overfitting, а не реальную надёжность.

Практический сигнал

Сместить фокус с демо-бенчмарков на production-evaluation: adversarial тесты, red teaming и проверки на устойчивость к контекстным атакам.

Cursor и новый слой LLM-приложений

Cursor стал шаблоном нового app-layer: context engineering, DAG-оркестрация вызовов, human-in-the-loop интерфейс и "autonomy slider". Отсюда паттерн "Cursor for X".

Практический сигнал

Если строите AI-продукт, думайте не только про модель, но и про orchestration + UX: именно слой продукта определяет итоговую ценность.

AI, который живёт на вашем компьютере

Карпаты выделяет важность локальной близости агента к реальной среде: конфиги, секреты, локальные данные, инструменты, минимальная латентность и быстрый цикл обратной связи.

Практический сигнал

Для инженерных агентов выигрывает подход `agent close to environment`: local-first execution, строгие permissions и наблюдаемость действий.

Vibe coding и удешевление кода

По версии автора термина, порог уже пройден: рабочие штуки можно собирать на английском как на универсальном языке программирования. Код становится пластичным и иногда одноразовым.

Практический сигнал

Перестраивать процессы под быстрое прототипирование: больше автоматических проверок, sandbox-сред, коротких итераций и дешёвого рефакторинга.

Nano Banana и сдвиг от chat UI к LLM GUI

Чат сравнивается с консолью 80-х: следующий интерфейсный слой - визуальные артефакты (слайды, схемы, whiteboard, web-apps), где модель работает вместе с человеком в визуальном контексте.

Практический сигнал

В новых AI-фичах стоит сразу закладывать визуальные рабочие поверхности и интерактивные артефакты, а не только текстовый чат.

Что делать с этим в 2026

Инженерам

  • Оценивать LLM-системы по реальным сценариям и инцидентам, а не только по benchmark-лидерам.
  • Строить пайплайны с уровнем автономии: `draft -> checked -> approved` вместо бинарного on/off.
  • Поддерживать local-first режим для coding-агентов там, где важны латентность и доступ к живому контексту проекта.
  • Инвестировать в guardrails для vibe coding: тесты, линтеры, policy checks и review-гейты по риску.

Руководителям

  • Разделить стратегию на два слоя: model capability и app orchestration (UX, workflow, governance).
  • Формализовать risk tiers для агентных задач и привязать к ним права, эскалации и обязательные проверки.
  • Создавать платформенные "Cursor for X" паттерны внутри компании вместо точечных разрозненных интеграций.
  • Планировать roadmap интерфейсов с упором на visual-first LLM GUI, а не только чатовые ассистенты.

Связанные главы

Первоисточники и companions

2