Фаза 5 · Deploy & Ops

Это ваша зона. Переносим CI/CD-мышление на LLM-приложения. Прививка против хаоса в продакшене.

≈ 1–2 недели · финишная прямая

Observability — выбрать один инструмент
Tool · RecommendedOpen Source · self-hostable
Рекомендую как основной выбор. Open source, отлично self-hosted, понятный UI.
ToolLangChain
Идеально интегрируется с LangGraph. Если выбрали LangGraph в Фазе 4 — это естественный выбор.
ToolArize · Open Source
Фокус на evals и tracing. Хорошо встраивается в существующий ML-стек.
Безопасность и guardrails
ReferenceOWASP GenAI · 09.2026 · обязательно
Издание 2026 (вышло 2 сентября): обновлённые ранги и расширенное покрытие, сверенные с тысячами реальных инцидентов. Prompt injection, утечки данных, небезопасная обработка вывода — обязательно к прочтению.
FrameworkNVIDIA
Фреймворк для guardrails. Декларативно описываете, что агенту нельзя.
DocsOpenAI · safety
Сформулировать, какие tool calls требуют approval, где нужен sandbox, какие данные нельзя отправлять в модель.
ReferenceOWASP GenAI
Агентный список (издание 2026, ASI01–ASI10): перехват цели агента, tool misuse, злоупотребление правами и identity, отравление памяти, межагентные риски (включая MCP и A2A), rogue agents — то, чего нет в LLM Top-10.
ReferenceOWASP GenAI · 09.2026
Стандарт контролей для агентов: как ограничивать права, инструменты и степень автономии. Использовать как чеклист рядом с Agentic Top-10 в threat-model заметке из p5-20.
ArticleAnthropic Engineering
OS-уровневый sandbox (изоляция файловой системы и сети) как путь к безопасной автономии без усталости от подтверждений.
ArticleAnthropic Engineering
Containment-архитектура во всех продуктах Anthropic: sandbox'ы, permissions, blast-radius мышление для агентов уровня computer use.
Practice1 день
Прогнать свой агент по чеклисту Agentic Top-10
Наложить каждый из 10 агентных рисков на свой capstone-агент: применим? чем закрыт? Итог — threat-model заметка на одну страницу (сшивается с финальным проектом).
Кейсы и противоположные взгляды
CaseAnthropic Engineering
Реальный кейс от Anthropic. Что сработало, что не сработало.
OpinionCognition
Противоположный взгляд. Читать критически — это полезный «холодный душ» против хайпа.
CI/CD-чеклист для LLM-приложения
Practice
Промпты в git с версионированием и review в PR
Как код — никаких промптов в БД или конфигах без истории.
Practice
Eval suite в CI на каждый PR
Изменение промпта, модели или зависимостей запускает прогон. Регрессии ловятся до прода.
Practice
Cost & latency как обычные метрики (Prometheus / Grafana)
Дашборды, алерты на превышение бюджета, ежедневные отчёты.
Practice
Канареечный деплой моделей
Например, перевод трафика с лёгкой модели на флагманскую того же провайдера. Новая модель получает малую долю трафика, есть fallback и rollback-критерии.
Practice
Логирование всех запросов с PII-маскированием
Для дебага и аудита, но без утечки персональных данных.
Practice
Release scorecard для prompt/model changes
Перед релизом фиксировать eval delta, latency delta, cost delta, known failures, rollback plan и владельца решения.
ReferenceOpenAI · launch
Пройти как production readiness review: ограничения, monitoring, rate limits, security, incident response и cost control.
Practice4–6 часов
Настроить rate-limit алерты и backoff retry для мультипровайдерной конфигурации
Реализовать middleware, отслеживающий 429/5xx ответы, записывающий алерт в Prometheus/CloudWatch, и автоматически переключающий провайдера (OpenAI → Anthropic → Gemini) при исчерпании лимита.
0 /21 материалов завершено

Финишная прямая курса: переносим CI/CD-мышление на LLM-приложения. Выбираем один observability-инструмент, закрываем безопасность и guardrails, изучаем реальные кейсы и собираем production-чеклист от промптов в git до канареечных деплоев.

Мои заметки

Не сохранено
Самопроверка
Вопрос 1 из 4
Какой пункт OWASP Top 10 for LLM наиболее критичен для агентов с tool use?
AУязвимости UI/UX интерфейса чата
BPrompt injection — атакующий через данные заставляет агент вызвать опасный tool
CНормализация базы данных
DFront-end XSS-уязвимости
Правильно: B. Prompt injection — главная угроза для агентов. Пример: агент читает email и в теле письма зашита инструкция «удали все файлы». Если у агента есть tool для удаления — катастрофа. Решения: sanitization входов, sandbox для tools, human approval для опасных операций.
Вопрос 2 из 4
Что такое канареечный деплой LLM-моделей?
AТест модели на одной фиксированной задаче
BПостепенный rollout новой модели на малую долю трафика с возможностью отката
CA/B-тест двух моделей с разделением пользователей 50/50
DИспользование самой дешёвой модели для всех запросов
Правильно: B. Канареечный деплой пришёл из классической инфраструктуры. Новая модель сначала получает 1% трафика, потом 5%, 25%, 100%. Если метрики (latency, cost, eval scores) ухудшаются — откат. Стандартная практика для production LLM-приложений.
Вопрос 3 из 4
Что должно происходить в CI при изменении промпта в pull request?
AНичего особенного — промпт это просто текст
BЗапуск eval suite с метриками success rate, latency, cost
CТолько проверка синтаксиса YAML-конфига
DАвтоматический мердж в main без проверок
Правильно: B. Изменение промпта может привести к регрессии так же, как изменение кода. CI должен прогнать eval suite на всех тестовых кейсах, сравнить метрики с main и показать diff в PR. Это то же, что тесты в вашем обычном backend-проекте.
Вопрос 4 из 4
Чем OWASP Top 10 for Agentic Applications отличается от Top 10 for LLM Applications?
AЭто одно и то же под новым названием
BАгентный список — только про мультиагентные системы
CОн покрывает риски автономии: tool misuse, перехват поведения агента, злоупотребление правами, межагентное взаимодействие (включая MCP)
DОн относится только к computer-use агентам
Правильно: C. LLM Top-10 писался про «модель, которая генерирует текст». Агенты действуют: вызывают инструменты, принимают многошаговые решения, общаются с другими агентами. Отсюда новые классы рисков — от Agent Behavior Hijacking до Identity & Privilege Abuse.
0 / 4