Files
BlackboxBook/book/00_introduction.md
2026-05-20 20:55:03 +03:00

22 KiB
Raw Blame History

ОТ ЧЁРНОГО ЯЩИКА К ИНЖЕНЕРИИ

Как понимать, проектировать и контролировать LLM-системы


ВВЕДЕНИЕ

Почему разработчик должен понимать, как думает LLM

Большие языковые модели перестали быть экспериментальными прототипами. К 2026 году они стали инфраструктурным слоем — таким же привычным, как базы данных или очереди сообщений. Генерация кода, аналитика, агентные контуры, обработка документов и мультимодальные интерфейсы уже работают в production. Актуальные семейства моделей меняются быстро: к апрелю 2026 в практической работе одновременно встречаются GPT-5.x, Claude Opus 4.6 / Sonnet 4.6, Gemini 3.x и Gemini 2.5, Llama 4, DeepSeek-V3/R1, Qwen3.x. Эта книга опирается на принципы, которые стареют медленнее, чем названия моделей, цены и размеры context window.

Однако подход «запрос → ответ → магия» давно исчерпал себя. Представьте автомеханика, который не знает, как устроен двигатель: он может крутить ручки и менять масло, но когда машина глохнет на трассе — он бессилен. То же самое с LLM. Когда модель ошибается, повторяется, теряет контекст, галлюцинирует или впадает в цикл — разработчик, воспринимающий LLM как чёрный ящик, обречён на метод проб и ошибок. Он перебирает формулировки промптов, добавляет слова «пожалуйста» и «будь внимательнее», увеличивает температуру, затем уменьшает — и всё это без понимания, почему одно работает, а другое нет.

Понимание внутренней механики — токенизации, внимания, каузального чтения, хранения ассоциаций в MLP-слоях — превращает промпт-инжиниринг из гадания в предсказуемую инженерную дисциплину. Вы перестаёте «уговаривать» модель и начинаете проектировать контуры, в которых она работает предсказуемо.

Где заканчивается магия

Магия заканчивается там, где начинается математика. LLM не «понимает» и не «рассуждает» в человеческом смысле — даже если ответ выглядит пугающе осмысленным. По сути, это авторегрессионные статистические машины: они предсказывают следующий токен (кусочек текста), опираясь на всё, что было написано до него. Их целевая функция — минимизация cross-entropy loss: модель на каждом шаге сравнивает свой прогноз следующего токена с тем, что реально встретилось в обучающих данных, и штрафуется за сильное расхождение.

Проще говоря: модель прочитала предложение до текущей позиции и «делает ставку» — какое слово (токен) скорее всего идёт дальше. Она не хранит «знания» в виде базы данных — она хранит статистические ассоциации, распределённые по миллиардам параметров. Думайте об этом как о невероятно мощном автодополнении, которое учитывает не только последнее слово, а весь контекст разговора.

«Интеллект» LLM — побочный продукт масштабирования (scaling laws: Kaplan et al., 2020; Hoffmann et al., 2022), выравнивания предпочтений (RLHF: Ouyang et al., 2022; DPO: Rafailov et al., 2023), архитектурных инноваций (Flash Attention: Dao et al., 2022; RoPE: Su et al., 2021; Mixture of Experts: Fedus et al., 2021) и — что стало ключевым к 2026 году — вычислений на этапе инференса (test-time compute), когда модель «думает дольше» над сложной задачей, прежде чем дать ответ.

Как только вы принимаете эту аксиому, происходит сдвиг парадигмы:

  • Вы перестаёте ждать от модели чуда и начинаете проектировать контуры, которые компенсируют её ограничения.
  • Вы перестаёте оптимизировать формулировки и начинаете оптимизировать архитектуру: структуру промпта, pipeline обработки, верификационные петли.
  • Вы перестаёте удивляться ошибкам и начинаете предсказывать их, проектируя fallback-механизмы.

Что изменилось к 2026 году

Если вы следили за развитием LLM последние два года, вы заметили: ландшафт изменился радикально. Вот ключевые сдвиги, которые определяют контекст этой книги.

От чистого Transformer к гибридным архитектурам. Оригинальный Transformer (Vaswani et al., 2017) остаётся фундаментом, но фронтир сместился к гибридам. Появились published-системы, сочетающие attention с SSM/Mamba-слоями и/или MoE (Mixture of Experts). Для вас как разработчика это значит: модели стали эффективнее по cost/latency, но внутренняя архитектура и поведение маршрутизации стали сложнее.

От «больше параметров» к «умнее вычисления». Гонка за триллионами параметров уступила место более тонкой стратегии: как потратить вычислительный бюджет оптимально — и на обучение, и на инференс. Reasoning-модели и режимы extended thinking/test-time compute тратят дополнительные вычисления на «размышление», прежде чем выдать финальный ответ. Это как разница между тем, чтобы ответить сходу, и тем, чтобы взять паузу и продумать задачу. На сложных задачах это часто даёт больший выигрыш, чем слепой переход на более крупную модель.

Open-weight модели — полноценные фронтирные конкуренты. Llama 4, DeepSeek-V3/R1, Kimi K2.5, Qwen 3.5-397B-A17B, MiniMax M2.5, GLM-5.1 — к 2026 году open-weight модели не просто приблизились к закрытым, а конкурируют с ними на равных, регулярно занимая верхние строчки бенчмарков. Это не косметическое улучшение, а структурный сдвиг в индустрии: выбор между hosted API и self-hosted моделью теперь определяется задачей и инфраструктурой, а не разрывом в качестве.

От чат-ботов к агентам. Пожалуй, самый важный сдвиг для практикующих инженеров. LLM перестали быть «говорящими головами» — они стали ядром агентных систем, которые планируют, вызывают инструменты, читают файлы, пишут код и действуют в реальном мире. Agentic AI перешёл из стадии прототипов в production: IDE-ассистенты пишут и деплоят код, финансовые агенты обрабатывают транзакции, исследовательские агенты проводят литературный обзор за минуты. Эта книга уделяет агентной архитектуре особое внимание — потому что именно здесь сейчас создаётся наибольшая ценность и возникают наибольшие риски.

Все эти изменения объединяет одна мысль: понимание механики модели стало не просто полезным — оно стало необходимым. Чем мощнее инструмент, тем важнее понимать, где проходят его границы.

Для кого эта книга

Эта книга написана для людей, которые строят системы на основе LLM и хотят делать это предсказуемо:

Software-инженеры, которые интегрируют LLM в backend-сервисы, API и пользовательские интерфейсы. Вы узнаете, почему ваши промпты нестабильны (спойлер: дело не в формулировках, а в структуре), как проектировать structured outputs и почему длинный контекст — не серебряная пуля.

ML-инженеры, которые fine-tune'ят модели, строят RAG-пайплайны и оптимизируют inference. Вы получите детальное понимание механизмов attention, MLP-памяти и позиционных кодировок, которое поможет диагностировать проблемы на уровне архитектуры.

Технические лиды и архитекторы, которые принимают решения о внедрении LLM в продуктовые системы. Вы научитесь отличать маркетинговые обещания от инженерной реальности, оценивать риски галлюцинаций и проектировать агентные контуры с верификацией.

Продакт-менеджеры технических продуктов, которые хотят понимать ограничения технологии, чтобы формировать реалистичные ожидания и roadmap.

Начинающие разработчики, которые только входят в мир LLM. Вам не нужна степень по машинному обучению, чтобы читать эту книгу — каждая концепция объясняется с нуля, с аналогиями и примерами. Но после прочтения вы будете понимать, как работают эти системы, лучше, чем многие «сеньоры», которые используют их вслепую.

Общий знаменатель: вы уже работаете с LLM (или начинаете) и хотите перейти от интуитивного «промптинга» к системной инженерии.

Как читать эту книгу

Книга построена как инженерный путеводитель — от фундаментальных механизмов к прикладным практикам.

Главы 15 — фундамент. Здесь описана внутренняя механика: как модель читает текст, где хранятся знания, почему возникают галлюцинации, как работает каузальное чтение и чем опасен длинный контекст. Эти главы дают ментальные модели, без которых остальные практики превращаются в карго-культ. Если вы новичок — начните именно здесь; если опытный инженер — проверьте свои интуиции, они могут оказаться неточными.

Главы 69 — протоколирование. Промпт как контракт, XML-разметка, многогипотезная генерация, декомпозиция задач. Это инструментарий для повседневной работы с LLM.

Главы 1013 — архитектура. Агенты vs чат, инструменты, RAG-пайплайны, антигаллюцинационные контуры, логирование. Здесь — про системы, а не про отдельные запросы.

Главы 1415 — качество и безопасность. Eval-дисциплина: golden datasets, LLM-as-Judge, regression gates, failure taxonomy. Безопасность: prompt injection, jailbreaks, red-teaming, guardrails, tenant isolation.

Глава 16 — архитектура кода. AI-friendly код, модули, контракты, AGENTS.md. Принцип LDD (Log-Driven Development) вводится в Главе 13 и развивается в Главе 17.

Главы 1720 — продвинутые темы. Наблюдаемость и эксплуатация (OpenTelemetry, SLO, incident response). Мультимодальные системы (vision, audio, ColPali). Post-training (SFT, DPO, LoRA). Паттерны проектирования (Router, Fallback Chain, Human-in-the-Loop, каталог из 20 паттернов).

Главы 2122 — serving и runtime. Inference pipeline (prefill/decode), KV-кэш, PagedAttention, batching, quantization, speculative decoding. Durable orchestration, saga-паттерны, жизненный цикл агента.

Глава 23 — как начать. Минимальный контур, постепенная интеграция, метрики.

Глава 24 — ландшафт 2026. Гибридные архитектуры (Mamba + Transformer + MoE), reasoning-модели, Diffusion LLM, экономика inference, open source vs closed source.

Глава 25 — резюме. Общие принципы LLM-инженерии и полный список источников.

Каждая глава завершается практическим выводом — конкретными действиями, которые можно применить сразу. Каждая глава содержит ссылки на первоисточники: научные статьи, репозитории, бенчмарки.

Вы можете читать последовательно — это оптимальный путь. Или использовать книгу как справочник: каждая глава самодостаточна и ссылается на необходимые предыдущие разделы.

Краткая карта территории

Блок Главы Содержание
Механика 15 Токены, векторы, attention, MLP, каузальное чтение, длинный контекст
Ограничения 3, 5 Галлюцинации, потеря контекста, траекторийная инерция, U-образное запоминание
Протоколирование 69 Промпт как контракт, XML-разметка, многогипотезность, декомпозиция
Архитектура 1013 Агенты vs чат, инструменты, RAG, верификация, логирование
Качество и безопасность 1415 Evals, тестовые наборы, regression gates, security, guardrails
Код и наблюдаемость 1617 AI-friendly код, observability, tracing, SLO, incident response
Продвинутые темы 1820 Мультимодальность, post-training, паттерны проектирования
Serving и runtime 2122 Inference pipeline, KV-кэш, durable orchestration, жизненный цикл агента
Внедрение 23 Минимальный контур, постепенная интеграция, метрики
Ландшафт 2026 24 Гибридные архитектуры, reasoning-модели, MoE, экономика inference
Резюме 25 Принципы LLM-инженерии, полный список источников

Язык этой книги

Технический, точный, без маркетинговой риторики — но и без академической сухости. Мы пишем так, как объясняли бы коллеге у доски: с аналогиями, где они помогают, и с формулами, где без них не обойтись. Термины используются в соответствии с современными публикациями (20232026). Все математические формулы приведены в стандартной нотации и сопровождаются пояснениями на уровне интуиции. Примеры кода и промптов — на русском и английском, где это уместно для демонстрации токенизации. Все рекомендации проверены на воспроизводимость в open-source и коммерческих моделях актуального поколения, включая гибридные архитектуры и reasoning-модели.

Что вы получите

После прочтения этой книги у вас будет:

  1. Ментальные модели внутренней работы LLM, которые позволяют предсказывать поведение модели до запуска промпта.
  2. Готовые протоколы для промптов, агентных петель, верификации и логирования.
  3. Каталог анти-паттернов — конкретных ошибок, которые ломают production-системы, с объяснением, почему они возникают и как их избежать.
  4. Практические чек-листы для внедрения, отладки и масштабирования LLM-систем.
  5. Источники для углубления: статьи, репозитории, бенчмарки — проверенные ссылки на лучшие материалы в каждой области.

Магия закончилась. Началась инженерия. И это хорошая новость — потому что инженерию можно освоить.


Практический вывод

Если вы строите систему на LLM, не начинайте с «магического промпта». Начинайте с механики, протокола и контура проверки. Читайте книгу как инженерную карту: сначала поймите, как модель видит токены, почему ошибается и где заканчивается её внутренняя компетенция, а затем переходите к архитектуре агентов, tool use, RAG и production-практикам. Тогда каждая следующая глава будет не набором техник, а частью одной системы решений.


Источники

  • Vaswani, A., et al. (2017). "Attention Is All You Need." NeurIPS.
  • Kaplan, J., et al. (2020). "Scaling Laws for Neural Language Models." arXiv:2001.08361.
  • Hoffmann, J., et al. (2022). "Training Compute-Optimal Large Language Models." NeurIPS. (Chinchilla)
  • Ouyang, L., et al. (2022). "Training Language Models to Follow Instructions with Human Feedback." NeurIPS. (InstructGPT)
  • Dao, T., et al. (2022). "FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness." NeurIPS.
  • Su, J., et al. (2021). "RoFormer: Enhanced Transformer with Rotary Position Embedding." arXiv:2104.09864.
  • Fedus, W., et al. (2021). "Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity." arXiv:2101.03961.
  • Rafailov, R., et al. (2023). "Direct Preference Optimization: Your Language Model is Secretly a Reward Model." NeurIPS.

Навигация: