2025 LLM Year in Review
Архивный brief поста Andrej Karpathy о сдвигах в обучении моделей, агентных приложениях, local-first execution, vibe coding и LLM GUI.
Сдвиги парадигмы
Karpathy выделяет RL с проверяемыми наградами, jagged intelligence, новый application layer в духе Cursor, близость агента к локальному окружению, vibe coding и переход от chat UI к визуальным рабочим поверхностям. Это авторский обзор индустрии, а не систематическое исследование.
Что проверить на практике
Оценивайте модели на production-сценариях, задавайте уровни автономии draft → checked → approved, приближайте coding agents к живому окружению только вместе со строгими permissions и observability. Разделяйте capability модели и качество orchestration/UX.
Полный разбор из прежнего каталога
Текст перенесён целиком: короткие секции выше — это его конспект, а ниже идёт исходный разбор с ссылками и материалами.
Оригинал
2025 LLM Year in Review
Короткий пост Andrej Karpathy о ключевых сдвигах в экосистеме LLM.
Оригинал
2025 LLM Year in Review
Короткий пост Andrej Karpathy о ключевых сдвигах в экосистеме LLM.
Этот обзор интересен не перечнем моделей, а сменой парадигм: как поменялись методы обучения, дизайн приложений, роль локального окружения и пользовательские интерфейсы. Ниже - шесть тезисов из поста и практический разбор, что с ними делать инженерам и лидерам.
Разбор
Telegram пост
Краткое саммари ключевых тезисов на русском.
Разбор
Telegram пост
Краткое саммари ключевых тезисов на русском.
Если нужен первоисточник, рекомендую начать с оригинального текста Karpathy: он короткий и ёмкий. Для быстрого русскоязычного контекста можно использовать обзор в Telegram.
6 парадигмальных сдвигов LLM-ландшафта
Reinforcement Learning from Verifiable Rewards (RLVR)
К стеку `pretrain -> SFT -> RLHF` добавился крупный этап RL по проверяемым наградам (математика, код, паззлы). Более длинные RL-прогоны улучшают capability/$ и усиливают test-time compute.
Практический сигнал
Проектировать контуры с учётом режима `let the model think longer`: для сложных задач важны бюджеты на размышление и оценка качества по классам задач.
Ghosts vs Animals / Jagged Intelligence
LLM ведут себя как "призраки": на одних задачах выглядят гениально, на других ломаются и поддаются jailbreak. Бенчмарки всё чаще отражают степень overfitting, а не реальную надёжность.
Практический сигнал
Сместить фокус с демо-бенчмарков на production-evaluation: adversarial тесты, red teaming и проверки на устойчивость к контекстным атакам.
Cursor и новый слой LLM-приложений
Cursor стал шаблоном нового app-layer: context engineering, DAG-оркестрация вызовов, human-in-the-loop интерфейс и "autonomy slider". Отсюда паттерн "Cursor for X".
Практический сигнал
Если строите AI-продукт, думайте не только про модель, но и про orchestration + UX: именно слой продукта определяет итоговую ценность.
AI, который живёт на вашем компьютере
Карпаты выделяет важность локальной близости агента к реальной среде: конфиги, секреты, локальные данные, инструменты, минимальная латентность и быстрый цикл обратной связи.
Практический сигнал
Для инженерных агентов выигрывает подход `agent close to environment`: local-first execution, строгие permissions и наблюдаемость действий.
Vibe coding и удешевление кода
По версии автора термина, порог уже пройден: рабочие штуки можно собирать на английском как на универсальном языке программирования. Код становится пластичным и иногда одноразовым.
Практический сигнал
Перестраивать процессы под быстрое прототипирование: больше автоматических проверок, sandbox-сред, коротких итераций и дешёвого рефакторинга.
Nano Banana и сдвиг от chat UI к LLM GUI
Чат сравнивается с консолью 80-х: следующий интерфейсный слой - визуальные артефакты (слайды, схемы, whiteboard, web-apps), где модель работает вместе с человеком в визуальном контексте.
Практический сигнал
В новых AI-фичах стоит сразу закладывать визуальные рабочие поверхности и интерактивные артефакты, а не только текстовый чат.
Что делать с этим в 2026
Инженерам
- Оценивать LLM-системы по реальным сценариям и инцидентам, а не только по benchmark-лидерам.
- Строить пайплайны с уровнем автономии: `draft -> checked -> approved` вместо бинарного on/off.
- Поддерживать local-first режим для coding-агентов там, где важны латентность и доступ к живому контексту проекта.
- Инвестировать в guardrails для vibe coding: тесты, линтеры, policy checks и review-гейты по риску.
Руководителям
- Разделить стратегию на два слоя: model capability и app orchestration (UX, workflow, governance).
- Формализовать risk tiers для агентных задач и привязать к ним права, эскалации и обязательные проверки.
- Создавать платформенные "Cursor for X" паттерны внутри компании вместо точечных разрозненных интеграций.
- Планировать roadmap интерфейсов с упором на visual-first LLM GUI, а не только чатовые ассистенты.
Связанные главы
2026 Agentic Coding Trends
Как парадигмальные сдвиги LLM превращаются в изменения процессов разработки.
Google AI IDE Productivity
Практический кейс, как AI-фичи IDE дают измеримый рост output.
How AI is transforming work at Anthropic
Организационный взгляд на внедрение AI в ежедневную инженерную работу.