Пилот AI-агента за 14 дней: success, SLA, цена и когда стоп
14-дневный пилот AI-агента имеет смысл только с заранее записанными критериями success, SLA сторон, вилкой «пилот vs production» и стоп-условиями — иначе это демо, которое все хвалят и никто не внедряет.
Я не продаю «давайте попробуем нейросеть». Я продаю контролируемый эксперимент на одном узком контуре: вход → агент → CRM/ответ → разбор. Если за 14 дней нельзя измерить success — пилот спроектирован плохо, а не «AI не зашёл».
Зачем именно 14 дней, а не «месяц почувствовать»
14 дней достаточно, чтобы:
- набрать 30–100+ реальных касаний (зависит от трафика);
- дважды пройти цикл правок промпта/tools;
- увидеть не только «вау», но и отказы, эскалации, дыры в данных.
Месяц без рамок обычно размывает ответственность: «ещё подкрутим». 7 дней — мало на стабилизацию логов и вторую итерацию.
| Горизонт | Плюс | Минус |
|---|---|---|
| 7 дней | дёшево | мало статистики, одна правка |
| 14 дней | 2 итерации + scorecard | нужен дисциплинированный owner |
| 30+ дней | «как в бою» | часто маскирует отсутствие success-метрик |
Критерии success до старта (не после)
Success пишу до доступа к API и чатам. Иначе success станет «нам в целом понравилось».
Минимальный набор (выбираю 3–5, не 15):
- Coverage — % обращений контура, которые агент обработал end-to-end без ручного старта.
- Task success — % диалогов с достигнутой целью (статус в CRM, ответ по FAQ, слот, эскалация по правилам).
- Critical error rate — % с policy-break / выдуманной ценой / утечкой внутреннего (цель: 0 critical).
- Handoff quality — % эскалаций с полным контекстом (не «посмотрите чат»).
- Time-to-first-response — медиана первого ответа vs baseline человека.
Пример порогов для первой линии FAQ+CRM (цифры фиксируем в договоре пилота):
| Метрика | Baseline | Success пилота | Fail / стоп |
|---|---|---|---|
| Task success | 0 (не было) | ≥70% | <50% к дню 14 |
| Critical errors | — | 0 | ≥1 повторный после фикса |
| Handoff с контекстом | ~30% | ≥80% | <60% |
| Медиана 1-го ответа | 12–40 мин | ≤2 мин в канал | хуже baseline без причины |
Анти-метрики, которые я не принимаю как success:
- «количество токенов»;
- «сколько раз открыли чат»;
- «команде интересно»;
- абстрактный ROI без единиц (лид, час, FTE) — это уже другой разговор после стабильного пилота.
SLA и ответственность: кто за что отвечает
Пилот ломается, когда «все немного отвечают». Я делю зоны явно.
Заказчик
- owner процесса (1 человек), доступ в CRM/каналы за 48 часов;
- список red lines и актуальное FAQ/прайс (что можно говорить);
- ежедневный 15-мин разбор в рабочие дни 1–2 недели;
- трафик: не отключать канал «на всякий случай».
Исполнитель
- контур агента, логи,
prompt_hash, eval smoke; - SLA реакции на critical: например 4 рабочих часа на hotfix или rollback;
- еженедельный scorecard (2 раза за пилот минимум);
- обучение handoff для менеджеров (1 сессия).
Совместно
- стоп-условия и go/no-go на production;
- список out-of-scope (что агент не делает в эти 14 дней).
Шаблон SLA пилота (коротко в приложении к счёту):
- окно поддержки: будни 10:00–19:00 (МСК) или как договорились;
- critical = ошибочная цена/договорённость, PII leak, массовый отказ канала;
- major = tool down >1 ч, деградация task success;
- эскалация human: всегда доступна, агент не «держит» клиента бесконечно.
Цена пилота vs production
Пилот и production — разные продукты. Смешивать в одной смете «под ключ навсегда» я не рекомендую: либо пилот раздувается, либо production недооценивается.
| Статья | Пилот 14 дней | Production (после go) |
|---|---|---|
| Scope | 1 контур, 1 канал, урезанные tools | каналы, роли, мониторинг, регламенты |
| Цель | измерить success / стоп | стабильный SLA и развитие |
| Данные | тестовые + ограниченный prod | политика логов, доступы, резерв |
| Сопровождение | плотное 14 дней | retainer / пакет часов / инциденты |
| Ценовой ориентир* | фиксированный короткий спринт | отдельная смета (внедрение + run) |
*Ориентиры по рынку MSP/B2B-автоматизации сильно зависят от интеграций; я всегда выношу цифры пакетов в коммерческое предложение после inventory. На сайте и в КП — лестница от простых контуров к сложным, без «бесплатно попробуйте без рамок».
Что входит в «честный» пилот по деньгам:
- дизайн success + red lines;
- сборка агента и запись в CRM;
- логи + 2 итерации;
- scorecard и go/no-go.
Что не входит, пока не купили production:
- бесконечные новые каналы «раз уж пошло»;
- обучение всей компании;
- гарантия win-rate продаж;
- замена отдела за две недели.
Когда стоп: правила до эмоций
Стоп — нормальный исход пилота. Я прописываю его заранее.
Стоп немедленно (rollback / выключение авто)
- critical policy-break повторился после фикса;
- утечка ПДн / внутренних данных;
- заказчик не дал доступы >N дней и нет трафика (пилот нельзя «рисовать»).
Стоп на go/no-go (день 14)
- task success ниже fail-порога;
- owner со стороны заказчика фактически отсутствует;
- out-of-scope разросся так, что это уже другой продукт;
- нет пути в production (бюджет/системы) — фиксируем learnings и не делаем вид, что «ещё чуть-чуть».
Go в production
- success-пороги выполнены;
- handoff и red lines живут в регламенте;
- понятен run-cost (модель, инфраструктура, часы сопровождения);
- назначен owner на следующие 30–90 дней.
Чеклист перед днём 0:
- Success и fail записаны числами
- SLA critical / major согласованы
- Цена пилота отделена от production
- Стоп-условия подписаны (хотя бы в переписке/КП)
- Один канал, один контур, один owner
Часто задаваемые вопросы
Можно ли пилот бесплатно?
Иногда — узкий technical spike на часах. Полноценные 14 дней с CRM, логами и разборами без бюджета почти всегда заканчиваются «некогда смотреть scorecard». Я лучше сокращу scope, чем уберу ответственность.
Чем пилот отличается от MVP на 90 дней?
Пилот доказывает гипотезу на контуре. MVP/внедрение на 30–90 дней строит эксплуатацию. Разные метрики, разные сметы, разные стоп-условия.
Нужен ли отдельный договор на пилот?
Достаточно оферты/КП с приложением: scope, success, SLA, стоп, что не входит. Главное — не устные «ну вы поняли».
Что если success есть, а команда боится production?
Это change management, не провал AI. Go можно сделать поэтапным: 30% трафика → 70% → 100% при тех же порогах critical errors.
Читайте также
- Внедрение AI-агента за 90 дней: этапы и цифры
- TCO AI-агента: KPI и стоимость владения 30–90 дней
- Как продавать AI-автоматизацию: пилот, ROI, scope, возражения
Запустить 14-дневный пилот с success, SLA и стоп-условиями: https://raisovich.ru
Какие метрики success фиксировать до старта пилота?
3–5 чисел: coverage, task success, critical error rate (цель 0), handoff quality и медиана первого ответа — не «команде понравилось» и не абстрактный ROI.
Почему цену пилота отделяют от production?
Пилот — фиксированный спринт на 1 контур и измерение гипотезы; production — каналы, мониторинг, run-cost и retainer; смешение раздувает пилот или недооценивает внедрение.
Когда стоп пилота — нормальный исход, а не провал?
Немедленный стоп при повторном critical или утечке ПДн; на go/no-go дня 14 — если task success ниже fail-порога, нет owner или нет пути в budget/системы.
Подпишитесь на @raisovich_news
Первыми получайте новые статьи об AI-автоматизации, нейросетях для бизнеса и создании сайтов. Без спама — только полезный контент.
Часто задаваемые вопросы
Какие метрики success фиксировать до старта пилота?
3–5 чисел: coverage, task success, critical error rate (цель 0), handoff quality и медиана первого ответа — не «команде понравилось» и не абстрактный ROI.
Почему цену пилота отделяют от production?
Пилот — фиксированный спринт на 1 контур и измерение гипотезы; production — каналы, мониторинг, run-cost и retainer; смешение раздувает пилот или недооценивает внедрение.