Фаза 3 · Production Agents

Здесь ваш CI/CD-бэкграунд даёт огромное преимущество. Evals как тесты, observability как метрики, cost как обычная статья бюджета.

≈ 3–4 недели · основной блок

Курсы
CourseDeepLearning.AI · 5–7ч · Free
Четыре паттерна: Reflection, Tool Use, Planning, Multi-agent collaboration.
CourseAnthropic Academy · Free · сертификат
Официальный бесплатный курс с сертификатом: от базового tool use до агентных систем, MCP и Agent SDK. Каталог всех курсов Academy — anthropic.com/learn.
Evals — это тесты для LLM
DocsAnthropic
Официальный гайд по построению eval-метрик.
ToolOpen Source
Практичный инструмент для прогона evals и red-teaming в CI. YAML-конфиг, легко встраивается в pipeline. С марта 2026 команда в OpenAI; проект остаётся open source под прежней лицензией.
DocsOpenAI · current
Разобрать связку dataset + testing criteria + graders. Это полезнее, чем просто прогонять ручные golden prompts.
ArticleAnthropic Engineering · 01.2026
Свежий пост: типы evals, подходы к грейдингу и дорожная карта «с нуля до продакшена» именно для агентов, а не просто промптов. Апгрейд всего eval-блока фазы на агентный уровень.
Практика — построить агента без фреймворка
Practice3–4 дня
Построить агента на голом Anthropic SDK или OpenAI SDK
Tool use loop, structured outputs через Pydantic, retries, fallbacks, логирование. Без LangGraph и CrewAI. Это даст понимание, что фреймворки потом просто абстрагируют.
LibraryOpen Source
Pydantic-обёртка над LLM API. Превращает structured outputs из боли в удовольствие.
Practice2 дня
Написать первый eval suite для своего агента
10–30 кейсов. Прогон через CI на каждый PR. Метрики: success rate, latency, cost.
Practice1 день
Подключить traces и разобрать один плохой run
Сохранить вход, tool calls, intermediate outputs, latency, cost и причину ошибки. Итог — короткий incident note.
Practice1 день
Сделать первый eval report как артефакт
Baseline model, candidate model/prompt, pass rate, false positives, false negatives, cost delta и решение: ship / hold / rollback.
Practice3–4 часа
Добавить cost/token logger к своему агенту
Обернуть каждый вызов API в декоратор, логирующий model, input_tokens, output_tokens, latency_ms и стоимость. Вывести сводку за сессию в таблицу.
Practice4–6 часов
Написать LLM-as-judge grader и сравнить с rule-based
Создать два грейдера для одного набора eval-кейсов: один на регулярках/exact match, второй — LLM-модель как судья. Сравнить agreement rate и стоимость.
Claude Agent SDK и память агента
ArticleAnthropic Engineering
Почему Anthropic превратила цикл Claude Code в общий Agent SDK. Принцип «дать агенту компьютер»: файлы, терминал, инструменты. Естественный следующий шаг после агента на голом SDK из p3-8.
DocsAnthropic
Production-harness, лежащий под Claude Code: сессии, permissions, hooks, MCP — программируется из Python/TS.
DocsAnthropic
Файловая память между сессиями: агент записывает то, что узнал, и читает по требованию, а не грузит всё в контекст заранее. Вместе с context editing в бенчмарках Anthropic — до ~84% экономии токенов на длинных задачах.
DocsAnthropic
Автоматическая чистка устаревших tool results и сжатие контекста по мере роста. Вторая половина связки с memory tool из p3-19.
DocsAnthropic · beta
Серверные агенты Anthropic: долгие сессии, sandbox, память и мультиагентная оркестрация на их стороне — цикл Claude Code как managed-сервис. Читать как карту того, что берут на себя за вас, чтобы понимать, что вы строите сами в p3-8.
ArticleAnthropic Engineering
Как проектировать и оценивать контракты инструментов — вплоть до того, что агенты улучшают собственные tools. Пара к практике tool-цикла из p3-8.
0 /19 материалов завершено

Здесь ваш CI/CD-бэкграунд даёт огромное преимущество: evals работают как автотесты, observability — как метрики, а cost становится обычной статьёй бюджета. Цель фазы — собрать агента без фреймворка и обвесить его evals, трейсами и учётом стоимости.

Мои заметки

Не сохранено
Самопроверка
Вопрос 1 из 5
Зачем нужны evals для LLM-приложений?
AЧтобы измерить точность модели в академических бенчмарках
BЭто аналог автотестов — ловить регрессии при изменении промптов, моделей или кода
CТолько для научных публикаций и сравнения с конкурентами
DЧтобы сравнивать стоимость разных моделей
Правильно: B. Evals в production — это unit/integration тесты для LLM-приложений. Изменили промпт? Прогоните evals. Поменялась модель? Прогоните evals. Без них вы не заметите, как новая версия Claude или промпта стала хуже отрабатывать ваш конкретный кейс.
Вопрос 2 из 5
Что НЕ является типичной частью observability для LLM-приложения?
ATraces всех вызовов модели с входом и выходом
BCost per request и общий бюджет
CLatency на каждом шаге агентного цикла
DВеса нейронной сети и градиенты во время инференса
Правильно: D. Веса и градиенты — это про обучение моделей, а не про наблюдаемость их использования. В production observability вы смотрите на traces (Langfuse, LangSmith), стоимость, латентность, success rate. То, что важно для бизнес-метрик и SLA.
Вопрос 3 из 5
Какая библиотека помогает получать structured outputs через Pydantic-схемы?
APandas
BInstructor
CFastAPI
DSQLAlchemy
Правильно: B. Instructor — небольшая обёртка над OpenAI/Anthropic SDK. Описываете Pydantic-модель — получаете типизированный ответ от LLM с автоматическими retries при невалидном выводе. Для вас как для Python-разработчика — must-have инструмент.
Вопрос 4 из 5
Какой принцип лежит в основе Claude Agent SDK?
AМаксимум абстракций над LLM API
B«Дать агенту компьютер»: файловая система, терминал и инструменты — тот же harness, что у Claude Code
CЗамена MCP-протокола
DТолько для кодинг-задач
Правильно: B. Anthropic превратила внутренний цикл Claude Code в общий SDK: агент работает как человек за компьютером — файлы, bash, скрипты. Это противоположность тяжёлым фреймворкам-абстракциям.
Вопрос 5 из 5
Зачем агенту memory tool и context editing на длинных задачах?
AДля соблюдения GDPR
BЧтобы модель дообучалась на ваших данных
CПамять выносит знания в файлы вне контекста, а context editing чистит устаревшие tool results — меньше токенов, стабильнее качество
DЭто нужно только для мультимодальных моделей
Правильно: C. Контекстное окно — исчерпаемый ресурс. В бенчмарках Anthropic связка memory + context editing дала ~84% экономии токенов на 100-ходовой задаче. Память — это файлы, которыми управляет ваш код, а не «магия» модели.
0 / 5