Реклама. ИП Ахунов Александр Раисович, ИНН 665911236854
Пилот AI-агента за 14 дней: success, SLA, цена и когда стоп

Пилот AI-агента за 14 дней: success, SLA, цена и когда стоп

14-дневный пилот AI-агента имеет смысл только с заранее записанными критериями success, SLA сторон, вилкой «пилот vs production» и стоп-условиями — иначе это демо, которое все хвалят и никто не внедряет.

Я не продаю «давайте попробуем нейросеть». Я продаю контролируемый эксперимент на одном узком контуре: вход → агент → CRM/ответ → разбор. Если за 14 дней нельзя измерить success — пилот спроектирован плохо, а не «AI не зашёл».

Зачем именно 14 дней, а не «месяц почувствовать»

14 дней достаточно, чтобы:

  • набрать 30–100+ реальных касаний (зависит от трафика);
  • дважды пройти цикл правок промпта/tools;
  • увидеть не только «вау», но и отказы, эскалации, дыры в данных.

Месяц без рамок обычно размывает ответственность: «ещё подкрутим». 7 дней — мало на стабилизацию логов и вторую итерацию.

ГоризонтПлюсМинус
7 днейдёшевомало статистики, одна правка
14 дней2 итерации + scorecardнужен дисциплинированный owner
30+ дней«как в бою»часто маскирует отсутствие success-метрик

Критерии success до старта (не после)

Success пишу до доступа к API и чатам. Иначе success станет «нам в целом понравилось».

Минимальный набор (выбираю 3–5, не 15):

  1. Coverage — % обращений контура, которые агент обработал end-to-end без ручного старта.
  2. Task success — % диалогов с достигнутой целью (статус в CRM, ответ по FAQ, слот, эскалация по правилам).
  3. Critical error rate — % с policy-break / выдуманной ценой / утечкой внутреннего (цель: 0 critical).
  4. Handoff quality — % эскалаций с полным контекстом (не «посмотрите чат»).
  5. Time-to-first-response — медиана первого ответа vs baseline человека.

Пример порогов для первой линии FAQ+CRM (цифры фиксируем в договоре пилота):

МетрикаBaselineSuccess пилотаFail / стоп
Task success0 (не было)≥70%<50% к дню 14
Critical errors0≥1 повторный после фикса
Handoff с контекстом~30%≥80%<60%
Медиана 1-го ответа12–40 мин≤2 мин в каналхуже baseline без причины

Анти-метрики, которые я не принимаю как success:

  • «количество токенов»;
  • «сколько раз открыли чат»;
  • «команде интересно»;
  • абстрактный ROI без единиц (лид, час, FTE) — это уже другой разговор после стабильного пилота.

SLA и ответственность: кто за что отвечает

Пилот ломается, когда «все немного отвечают». Я делю зоны явно.

Заказчик

  • owner процесса (1 человек), доступ в CRM/каналы за 48 часов;
  • список red lines и актуальное FAQ/прайс (что можно говорить);
  • ежедневный 15-мин разбор в рабочие дни 1–2 недели;
  • трафик: не отключать канал «на всякий случай».

Исполнитель

  • контур агента, логи, prompt_hash, eval smoke;
  • SLA реакции на critical: например 4 рабочих часа на hotfix или rollback;
  • еженедельный scorecard (2 раза за пилот минимум);
  • обучение handoff для менеджеров (1 сессия).

Совместно

  • стоп-условия и go/no-go на production;
  • список out-of-scope (что агент не делает в эти 14 дней).

Шаблон SLA пилота (коротко в приложении к счёту):

  • окно поддержки: будни 10:00–19:00 (МСК) или как договорились;
  • critical = ошибочная цена/договорённость, PII leak, массовый отказ канала;
  • major = tool down >1 ч, деградация task success;
  • эскалация human: всегда доступна, агент не «держит» клиента бесконечно.

Цена пилота vs production

Пилот и production — разные продукты. Смешивать в одной смете «под ключ навсегда» я не рекомендую: либо пилот раздувается, либо production недооценивается.

СтатьяПилот 14 днейProduction (после go)
Scope1 контур, 1 канал, урезанные toolsканалы, роли, мониторинг, регламенты
Цельизмерить success / стопстабильный SLA и развитие
Данныетестовые + ограниченный prodполитика логов, доступы, резерв
Сопровождениеплотное 14 днейretainer / пакет часов / инциденты
Ценовой ориентир*фиксированный короткий спринтотдельная смета (внедрение + run)

*Ориентиры по рынку MSP/B2B-автоматизации сильно зависят от интеграций; я всегда выношу цифры пакетов в коммерческое предложение после inventory. На сайте и в КП — лестница от простых контуров к сложным, без «бесплатно попробуйте без рамок».

Что входит в «честный» пилот по деньгам:

  • дизайн success + red lines;
  • сборка агента и запись в CRM;
  • логи + 2 итерации;
  • scorecard и go/no-go.

Что не входит, пока не купили production:

  • бесконечные новые каналы «раз уж пошло»;
  • обучение всей компании;
  • гарантия win-rate продаж;
  • замена отдела за две недели.

Когда стоп: правила до эмоций

Стоп — нормальный исход пилота. Я прописываю его заранее.

Стоп немедленно (rollback / выключение авто)

  • critical policy-break повторился после фикса;
  • утечка ПДн / внутренних данных;
  • заказчик не дал доступы >N дней и нет трафика (пилот нельзя «рисовать»).

Стоп на go/no-go (день 14)

  • task success ниже fail-порога;
  • owner со стороны заказчика фактически отсутствует;
  • out-of-scope разросся так, что это уже другой продукт;
  • нет пути в production (бюджет/системы) — фиксируем learnings и не делаем вид, что «ещё чуть-чуть».

Go в production

  • success-пороги выполнены;
  • handoff и red lines живут в регламенте;
  • понятен run-cost (модель, инфраструктура, часы сопровождения);
  • назначен owner на следующие 30–90 дней.

Чеклист перед днём 0:

  • Success и fail записаны числами
  • SLA critical / major согласованы
  • Цена пилота отделена от production
  • Стоп-условия подписаны (хотя бы в переписке/КП)
  • Один канал, один контур, один owner

Часто задаваемые вопросы

Можно ли пилот бесплатно?

Иногда — узкий technical spike на часах. Полноценные 14 дней с CRM, логами и разборами без бюджета почти всегда заканчиваются «некогда смотреть scorecard». Я лучше сокращу scope, чем уберу ответственность.

Чем пилот отличается от MVP на 90 дней?

Пилот доказывает гипотезу на контуре. MVP/внедрение на 30–90 дней строит эксплуатацию. Разные метрики, разные сметы, разные стоп-условия.

Нужен ли отдельный договор на пилот?

Достаточно оферты/КП с приложением: scope, success, SLA, стоп, что не входит. Главное — не устные «ну вы поняли».

Что если success есть, а команда боится production?

Это change management, не провал AI. Go можно сделать поэтапным: 30% трафика → 70% → 100% при тех же порогах critical errors.

Читайте также

Запустить 14-дневный пилот с success, SLA и стоп-условиями: https://raisovich.ru

Какие метрики success фиксировать до старта пилота?

3–5 чисел: coverage, task success, critical error rate (цель 0), handoff quality и медиана первого ответа — не «команде понравилось» и не абстрактный ROI.

Почему цену пилота отделяют от production?

Пилот — фиксированный спринт на 1 контур и измерение гипотезы; production — каналы, мониторинг, run-cost и retainer; смешение раздувает пилот или недооценивает внедрение.

Когда стоп пилота — нормальный исход, а не провал?

Немедленный стоп при повторном critical или утечке ПДн; на go/no-go дня 14 — если task success ниже fail-порога, нет owner или нет пути в budget/системы.

Р
Команда экспертов по AI-автоматизации бизнеса, созданию сайтов и продвижению нейросетями. Помогаем бизнесу расти с помощью современных технологий.

Часто задаваемые вопросы

Какие метрики success фиксировать до старта пилота?

3–5 чисел: coverage, task success, critical error rate (цель 0), handoff quality и медиана первого ответа — не «команде понравилось» и не абстрактный ROI.

Почему цену пилота отделяют от production?

Пилот — фиксированный спринт на 1 контур и измерение гипотезы; production — каналы, мониторинг, run-cost и retainer; смешение раздувает пилот или недооценивает внедрение.