Протокол handoff AI-агент↔человек: QA-скоринг в production
Стабильный production AI-агента держится не на «умной модели», а на жёстком протоколе handoff человек↔агент и ежедневном QA-скоринге: когда передавать, с каким контекстом, кто правит знания и какой % ответов проходит выборочную проверку.
Я выстраиваю handoff так же, как смену операторов: очередь, приоритет, обязательные поля, stop-list и метрики «после передачи». Ниже — каркас, который работает для first-line поддержки, квалификации лидов и внутренних ops-агентов. Цифры — порядок величины из проектов 2025–2026, не оферта.
Зачем протокол, а не «кнопка оператору»
Без протокола handoff превращается в хаос: клиент повторяет историю, оператор не видит intent, агент снова вмешивается, логи рвутся. Типовая цена — рост time-to-resolve на 20–40% и падение CSAT именно на «пограничных» диалогах.
| Элемент | Без протокола | С протоколом |
|---|---|---|
| Триггер эскалации | «модель не уверена» / настроение | Правила + score + stop-list |
| Контекст человеку | Скрин/«посмотри чат» | Карточка: intent, факты, попытки, риск |
| Возврат агенту | Никогда / всегда | Только после закрытия edge и правки знаний |
| Ответственность | «бот виноват» | Владелец процесса + владелец знаний |
| QA | Раз в месяц «почитали» | Ежедневная выборка + scorecard |
Цель handoff — не «спасти диалог любой ценой», а безопасно закрыть кейс и улучшить систему так, чтобы такой кейс чаще решался агентом в следующий раз.
Правила эскалации: матрица «когда звать человека»
Я фиксирую правила до пилота. Модель не «сама решает судьбу клиента» — она классифицирует и следует политике.
Обязательный handoff (stop-list)
- Деньги: скидка вне прайса, возврат, спор по оплате
- Юр. обещания: сроки договора «от себя», гарантии вне шаблона
- Безопасность / PII: смена доступов, удаление данных без процедуры
- Эмоция + риск churn: повторная жалоба, угроза судом/ОЗПП
- Медицина / финансы / дети — если есть в scope бизнеса
Условный handoff (score)
| Сигнал | Порог | Действие |
|---|---|---|
| Confidence / agreement tools | < порога (часто 0.55–0.7) | Эскалация или уточняющий вопрос ×1 |
| Повтор «не понял» от клиента | ≥2 в сессии | Handoff |
| Out-of-scope intent | любое | Человек или честный отказ + маршрут |
| Конфликт фактов CRM vs текст | любое | Человек + флаг в лог |
| Сумма/срок выше лимита | по матрице | Человек с prefill |
Чеклист карточки handoff (минимум)
- Intent + подтип
- ID клиента / лида / заказа
- Что уже проверено агентом (tools, факты)
- Что клиент уже сказал (3–5 буллетов, не простыня)
- Причина эскалации (код из справочника)
- Рекомендованный следующий шаг человеку
- Риск: low / med / high
Без кодов причин вы не увидите, почему агент «сдаёт» 30% диалогов — и будете чинить модель вместо знаний или CRM.
QA-скоринг ответов: как считать качество каждую неделю
QA — не «почитали 5 чатов и понравилось». Это scorecard на выборке + разбор хвоста.
Выборка
| Объём трафика в scope | Выборка / день | Фокус |
|---|---|---|
| до 50 диалогов | 100% или 20–30 | Все эскалации + random |
| 50–200 | 15–25 + 100% high-risk | Эскалации, money, жалобы |
| 200+ | 25–40 stratified | По intent-бакетам |
Scorecard (пример 0–100)
| Критерий | Вес | 0 | 1 | 2 |
|---|---|---|---|---|
| Факт / соответствие источнику | 30 | Ошибка факта | Спорно | Верно |
| Полнота (закрыл вопрос) | 20 | Ушёл в сторону | Частично | Закрыл |
| Тон и политика бренда | 15 | Грубо/обещание | Норм | Эталон |
| Корректный handoff | 20 | Молчание/петля | Поздно | Вовремя + карточка |
| Безопасность (stop-list) | 15 | Нарушение | На грани | Ок |
Pass: средний score ≥80 и ноль critical fails (факт money/legal, stop-list).
Go-live / hold: 7 дней подряд pass на выборке и автозакрытие в scope не ниже согласованного floor (часто 40–55% на first-line FAQ).
Еженедельный ритуал (45–60 мин)
- Топ-10 low-score диалогов
- Классификация root cause: знание / tool / промпт / процесс / человек
- 3–7 правок в knowledge + 1 правка правил handoff
- Не трогаем «модель ради модели», пока не закрыт хвост знаний
Метрики production: что смотреть на дашборде
| KPI | Зачем | Ориентир после стабилизации* |
|---|---|---|
| % автозакрытия в scope | ёмкость | 45–70% (зависит от темы) |
| % handoff | нагрузка на людей | 20–40% в scope |
| First response (бот) | SLA канала | секунды–минуты |
| Time-to-human после триггера | качество очереди | <5–15 мин в раб. время |
| Reopen / повтор за 48ч | «ложное закрытие» | ↓ к baseline |
| QA pass rate | доверие | ≥85–90% выборки |
| Critical fail rate | риск | → 0 на money/legal |
| CSAT / оценки после handoff | стык систем | не хуже human-only |
*Композит пилотов; ваш baseline важнее чужих «−40%».
Связка handoff + QA даёт управляемость: вы видите не только «бот ответил», а когда система должна уступить человеку и почему качество просело.
Часто задаваемые вопросы
Сколько операторов нужно на handoff при 100 диалогах в день?
Зависит от % handoff и средней длины. При 30% handoff и 8–12 мин на кейс это порядка 4–6 человеко-часов чистого времени плюс пики. Считайте от своего AHT и графика, не от «одного дежурного на всё».
Можно ли отдавать handoff в общую очередь CRM без карточки?
Технически да, практически — нет. Без prefill вы теряете 1–3 минуты на каждый кейс и учите людей ненавидеть агента. Карточка — дешёвая интеграция с высоким ROI.
Что важнее: поднять автозакрытие или QA pass rate?
Сначала ноль critical fails и pass rate, потом автозакрытие. Иначе вы масштабируете ошибки. После 2–3 недель стабильного QA можно аккуратно расширять scope и снижать ложные эскалации.
Как часто пересматривать stop-list?
Раз в спринт (1–2 недели) по кодам эскалаций и инцидентам. Stop-list живой: новый офер, новая акция, новый юр. риск — сразу в правила, не «потом в v2».
Читайте также
- 7 ошибок production AI-агентов и handoff человек↔агент
- Внедрение AI-агента за 90 дней: этапы, цифры и процесс без хайпа
- Кейс: квалификация лидов в CRM за 45 дней — +38% к MQL без найма
Нужен рабочий протокол handoff и QA под ваш процесс — разберём scope и метрики на https://raisovich.ru
Что должно быть в карточке handoff от AI-агента?
Минимум: intent и подтип, ID клиента или заказа, что уже проверено tools, 3–5 буллетов слов клиента, код причины эскалации, рекомендованный шаг человеку и риск low/med/high.
Какой QA pass rate нужен для go-live AI-агента?
Ориентир — средний score ≥80 при нуле critical fails (money/legal, stop-list) и 7 дней подряд pass на выборке плюс автозакрытие не ниже согласованного floor (часто 40–55% на first-line FAQ).
Какие KPI смотреть на дашборде handoff в production?
Смотрите % автозакрытия в scope, % handoff, time-to-human после триггера, reopen за 48ч, QA pass rate, critical fail rate и CSAT после handoff — не только «бот ответил».
Подпишитесь на @raisovich_news
Первыми получайте новые статьи об AI-автоматизации, нейросетях для бизнеса и создании сайтов. Без спама — только полезный контент.
Часто задаваемые вопросы
Что должно быть в карточке handoff от AI-агента?
Минимум: intent и подтип, ID клиента или заказа, что уже проверено tools, 3–5 буллетов слов клиента, код причины эскалации, рекомендованный шаг человеку и риск low/med/high.
Какой QA pass rate нужен для go-live AI-агента?
Ориентир — средний score ≥80 при нуле critical fails (money/legal, stop-list) и 7 дней подряд pass на выборке плюс автозакрытие не ниже согласованного floor (часто 40–55% на first-line FAQ).