Запросить демо
Лояльность и персонализация

Churn prediction в CDP с ML моделями: pipeline и фичи

Как построить churn prediction в CDP-контуре: фичи из 6 категорий, выбор модели, реактивационные сценарии, метрики и ROI.

Категория
Лояльность и персонализация
Время чтения
6 минут
Опубликовано
Автор
stackfort

Ключевые выводы

  • Churn prediction в CDP с ML моделями — это система раннего обнаружения клиентов с высоким риском оттока, которая запускает превентивные сценарии за 30-60 дней до фактического ухода
  • Базовые модели (логистическая регрессия, XGBoost) дают 65-75% accuracy при правильной фичей-инженерии — этого достаточно для большинства бизнес-задач
  • Главное — не модель, а data pipeline: правильные фичи из CDP-событий важнее, чем выбор алгоритма
  • Внедрение полного цикла занимает 3-5 месяцев и стоит 4-7 млн ₽; ROI обычно достигается на 6-9 месяце эксплуатации
  • Без системы реактивации, в которую встроена модель churn prediction — это просто красивый дашборд без бизнес-эффекта

Churn prediction в CDP с ML моделями — стандартный сценарий для retail и подписочных бизнесов с базой 1+ млн клиентов. Идея простая: на основе истории взаимодействия предсказать вероятность ухода клиента и запустить реактивацию до того, как отток произойдёт. На практике в этой простой идее есть десятки технических деталей, на которых проекты регулярно спотыкаются.

Эта статья — практический разбор архитектуры churn prediction в CDP-контуре. Как собирать фичи, как выбирать модель, как встраивать предсказания в сценарии и как считать ROI.

Что такое churn и как его измерять

Прежде чем строить модель, нужно определить, что такое отток в вашем бизнесе:

  • Subscription-бизнесы — отказ от продления подписки
  • Retail — нет покупок в течение N месяцев (обычно 6-12)
  • Banking — закрытие основных продуктов или резкое снижение остатков
  • SaaS B2B — закрытие договора или прекращение использования
  • Telecom — переход к другому оператору (number portability)

Точное определение влияет на target-переменную модели. Если в retail отток определяется как «нет покупок 6 месяцев», то предсказание делается на горизонт 4-5 месяцев — чтобы успеть запустить реактивацию.

Фичи для churn prediction

Хорошая модель строится на 30-80 фичах из 6 категорий:

Транзакционные

  • Дни с последней покупки
  • Среднее время между покупками
  • Изменение частоты покупок (тренд за 6 месяцев)
  • Средний чек и его изменение
  • Категории товаров и их разнообразие

Engagement

  • Open rate email за 90 дней
  • Click rate за 90 дней
  • Дни с последнего открытия email
  • Активность в мобильном приложении
  • Push-уведомления: subscribe/unsubscribe ratio

Behavioral

  • Жалобы и обращения в саппорт
  • Возвраты и жалобы на качество
  • NPS-оценки (если есть)
  • Использование промокодов и скидок

Профильные

  • Возраст и стаж клиента
  • Сегмент и роль
  • География (если важно)
  • Канал привлечения

Lifecycle

  • RFM-кластер
  • LTV (фактический и прогнозный)
  • Стадия customer journey

Внешние

  • Сезонность
  • Локальные события и праздники
  • Экономические индикаторы (для крупных проектов)

Выбор модели

Для churn prediction в CDP оптимальный starting point — простые модели:

МодельAccuracyСложностьКогда использовать
Логистическая регрессия60-70%НизкаяBaseline, объяснимая модель для бизнеса
Random Forest70-78%СредняяСтандартный выбор для большинства задач
XGBoost / LightGBM72-80%СредняяЛучшая модель в большинстве enterprise-проектов
Neural networks74-82%ВысокаяОчень большие данные, специфические задачи
Survival analysis72-80%ВысокаяКогда важно «когда» уйдёт, а не только «уйдёт ли»

На практике XGBoost даёт 90% возможной точности с минимальными усилиями. Переход к neural networks оправдан только при очень больших данных (50+ млн клиентов) и специфических задачах.

Pipeline в CDP

  1. Feature engineering pipeline — раз в день рассчитываются все 30-80 фичей для всей базы клиентов из событий CDP
  2. Model training — раз в неделю модель переобучается на актуальных данных
  3. Inference — раз в день рассчитываются churn-вероятности для каждого клиента
  4. Сегментация — клиенты с вероятностью >0.6 попадают в сегмент «high churn risk»
  5. Триггерные сценарии — для high churn risk запускаются реактивационные кампании
  6. Мониторинг — отслеживание точности модели в реальном времени, retraining при дрейфе

Реактивационные сценарии

Без сценариев реактивации даже идеальная модель churn prediction даёт нулевой ROI. Типовой набор реактивационных активностей:

  • Прогрессивная скидка — 10% при первой коммуникации, 20% при второй, 30% при третьей
  • Эксклюзивный контент — вебинары, гайды, ранний доступ к новинкам
  • Персональный звонок — для VIP-сегментов и крупных B2B-клиентов
  • Опрос причин снижения активности — иногда проблема легко решаема
  • Win-back офферы — специальные предложения для возврата
  • Отзыв на качество услуги — иногда дешевле признать проблему и компенсировать

Эффективность реактивационной кампании измеряется через split-тестирование: контрольная группа без коммуникаций сравнивается с тестовой группой с коммуникациями. Разница в churn rate — net effect модели.

Метрики качества

  • Precision на топ-N — какая доля из топ-1% по риску действительно ушла
  • Recall — какую долю реально ушедших модель идентифицировала
  • F1-score — гармоническое среднее precision и recall
  • AUC-ROC — общая дискриминирующая способность модели
  • Lift на топ-decile — во сколько раз больше реальных уходов в топ-10% по риску
  • Бизнес-метрика — снижение фактического churn rate в test-группе vs control-группе

Стоимость и сроки

ЭтапСрокБюджет
Сбор и подготовка данных1-2 мес1.5-2 млн ₽
Feature engineering и моделирование1-1.5 мес1-1.5 млн ₽
Интеграция в CDP1-1.5 мес1-1.5 млн ₽
Сценарии реактивации1 мес0.5-1 млн ₽
Мониторинг и retraining0.5-1 млн ₽/год
Итого внедрение3-5 мес4-7 млн ₽

FAQ о churn prediction в CDP

Сколько данных нужно для модели?

Минимум — 12 месяцев истории взаимодействия с базой клиентов от 50 тысяч активных профилей. Меньше — модель будет нестабильной из-за сезонности и малой выборки. Лучше — 24+ месяцев данных, чтобы модель видела полный годовой цикл и реакцию на крупные события.

Как часто нужно переобучать модель?

Раз в 1-3 месяца в зависимости от стабильности бизнес-процессов. После крупных изменений (новый продукт, рекламная кампания, смена ассортимента) — внеочередное retraining. Признак необходимости — снижение precision и lift в production-метриках.

Можно ли использовать готовые ML-сервисы?

Yandex DataSphere, VK Cloud ML и другие российские сервисы дают подходящую инфраструктуру. Но фичи и сценарии всё равно нужно строить под специфику бизнеса. Готовые «коробочные» churn-модели в SaaS CDP обычно дают 10-15% accuracy ниже кастомных — это много.

Что важнее — модель или данные?

Данные. 90% качества churn prediction — это качество фичей и pipeline их расчёта. Хорошая модель на плохих фичах работает хуже, чем средняя модель на отличных фичах. Поэтому 60% бюджета проекта обычно тратится на data engineering и feature engineering, а не на сам ML.

Какой ROI ожидать от churn prediction?

В retail — снижение фактического churn на 1-3 п.п. через 6-9 месяцев эксплуатации. Для базы 3 млн клиентов с месячным churn 2.5% это 30-90 тыс сохранённых клиентов в месяц. При среднем LTV 8 тыс ₽ это сохранённая выручка 240-720 млн ₽/год — окупает CAPEX 4-7 млн ₽ за 1-3 месяца.

Что в итоге

Churn prediction в CDP с ML моделями — стандартный enterprise-сценарий с понятным алгоритмом внедрения и предсказуемым ROI. Главный фокус — не выбор модели, а качество фичей и интеграция в реактивационные сценарии.

Готовы помочь с проектированием pipeline и подбором архитектуры churn prediction под ваш контекст — обсудим в формате аналитической сессии.