Ключевые выводы
- Churn prediction в CDP с ML моделями — это система раннего обнаружения клиентов с высоким риском оттока, которая запускает превентивные сценарии за 30-60 дней до фактического ухода
- Базовые модели (логистическая регрессия, XGBoost) дают 65-75% accuracy при правильной фичей-инженерии — этого достаточно для большинства бизнес-задач
- Главное — не модель, а data pipeline: правильные фичи из CDP-событий важнее, чем выбор алгоритма
- Внедрение полного цикла занимает 3-5 месяцев и стоит 4-7 млн ₽; ROI обычно достигается на 6-9 месяце эксплуатации
- Без системы реактивации, в которую встроена модель churn prediction — это просто красивый дашборд без бизнес-эффекта
Churn prediction в CDP с ML моделями — стандартный сценарий для retail и подписочных бизнесов с базой 1+ млн клиентов. Идея простая: на основе истории взаимодействия предсказать вероятность ухода клиента и запустить реактивацию до того, как отток произойдёт. На практике в этой простой идее есть десятки технических деталей, на которых проекты регулярно спотыкаются.
Эта статья — практический разбор архитектуры churn prediction в CDP-контуре. Как собирать фичи, как выбирать модель, как встраивать предсказания в сценарии и как считать ROI.
Что такое churn и как его измерять
Прежде чем строить модель, нужно определить, что такое отток в вашем бизнесе:
- Subscription-бизнесы — отказ от продления подписки
- Retail — нет покупок в течение N месяцев (обычно 6-12)
- Banking — закрытие основных продуктов или резкое снижение остатков
- SaaS B2B — закрытие договора или прекращение использования
- Telecom — переход к другому оператору (number portability)
Точное определение влияет на target-переменную модели. Если в retail отток определяется как «нет покупок 6 месяцев», то предсказание делается на горизонт 4-5 месяцев — чтобы успеть запустить реактивацию.
Фичи для churn prediction
Хорошая модель строится на 30-80 фичах из 6 категорий:
Транзакционные
- Дни с последней покупки
- Среднее время между покупками
- Изменение частоты покупок (тренд за 6 месяцев)
- Средний чек и его изменение
- Категории товаров и их разнообразие
Engagement
- Open rate email за 90 дней
- Click rate за 90 дней
- Дни с последнего открытия email
- Активность в мобильном приложении
- Push-уведомления: subscribe/unsubscribe ratio
Behavioral
- Жалобы и обращения в саппорт
- Возвраты и жалобы на качество
- NPS-оценки (если есть)
- Использование промокодов и скидок
Профильные
- Возраст и стаж клиента
- Сегмент и роль
- География (если важно)
- Канал привлечения
Lifecycle
- RFM-кластер
- LTV (фактический и прогнозный)
- Стадия customer journey
Внешние
- Сезонность
- Локальные события и праздники
- Экономические индикаторы (для крупных проектов)
Выбор модели
Для churn prediction в CDP оптимальный starting point — простые модели:
| Модель | Accuracy | Сложность | Когда использовать |
|---|---|---|---|
| Логистическая регрессия | 60-70% | Низкая | Baseline, объяснимая модель для бизнеса |
| Random Forest | 70-78% | Средняя | Стандартный выбор для большинства задач |
| XGBoost / LightGBM | 72-80% | Средняя | Лучшая модель в большинстве enterprise-проектов |
| Neural networks | 74-82% | Высокая | Очень большие данные, специфические задачи |
| Survival analysis | 72-80% | Высокая | Когда важно «когда» уйдёт, а не только «уйдёт ли» |
На практике XGBoost даёт 90% возможной точности с минимальными усилиями. Переход к neural networks оправдан только при очень больших данных (50+ млн клиентов) и специфических задачах.
Pipeline в CDP
- Feature engineering pipeline — раз в день рассчитываются все 30-80 фичей для всей базы клиентов из событий CDP
- Model training — раз в неделю модель переобучается на актуальных данных
- Inference — раз в день рассчитываются churn-вероятности для каждого клиента
- Сегментация — клиенты с вероятностью >0.6 попадают в сегмент «high churn risk»
- Триггерные сценарии — для high churn risk запускаются реактивационные кампании
- Мониторинг — отслеживание точности модели в реальном времени, retraining при дрейфе
Реактивационные сценарии
Без сценариев реактивации даже идеальная модель churn prediction даёт нулевой ROI. Типовой набор реактивационных активностей:
- Прогрессивная скидка — 10% при первой коммуникации, 20% при второй, 30% при третьей
- Эксклюзивный контент — вебинары, гайды, ранний доступ к новинкам
- Персональный звонок — для VIP-сегментов и крупных B2B-клиентов
- Опрос причин снижения активности — иногда проблема легко решаема
- Win-back офферы — специальные предложения для возврата
- Отзыв на качество услуги — иногда дешевле признать проблему и компенсировать
Эффективность реактивационной кампании измеряется через split-тестирование: контрольная группа без коммуникаций сравнивается с тестовой группой с коммуникациями. Разница в churn rate — net effect модели.
Метрики качества
- Precision на топ-N — какая доля из топ-1% по риску действительно ушла
- Recall — какую долю реально ушедших модель идентифицировала
- F1-score — гармоническое среднее precision и recall
- AUC-ROC — общая дискриминирующая способность модели
- Lift на топ-decile — во сколько раз больше реальных уходов в топ-10% по риску
- Бизнес-метрика — снижение фактического churn rate в test-группе vs control-группе
Стоимость и сроки
| Этап | Срок | Бюджет |
|---|---|---|
| Сбор и подготовка данных | 1-2 мес | 1.5-2 млн ₽ |
| Feature engineering и моделирование | 1-1.5 мес | 1-1.5 млн ₽ |
| Интеграция в CDP | 1-1.5 мес | 1-1.5 млн ₽ |
| Сценарии реактивации | 1 мес | 0.5-1 млн ₽ |
| Мониторинг и retraining | — | 0.5-1 млн ₽/год |
| Итого внедрение | 3-5 мес | 4-7 млн ₽ |
FAQ о churn prediction в CDP
Сколько данных нужно для модели?
Минимум — 12 месяцев истории взаимодействия с базой клиентов от 50 тысяч активных профилей. Меньше — модель будет нестабильной из-за сезонности и малой выборки. Лучше — 24+ месяцев данных, чтобы модель видела полный годовой цикл и реакцию на крупные события.
Как часто нужно переобучать модель?
Раз в 1-3 месяца в зависимости от стабильности бизнес-процессов. После крупных изменений (новый продукт, рекламная кампания, смена ассортимента) — внеочередное retraining. Признак необходимости — снижение precision и lift в production-метриках.
Можно ли использовать готовые ML-сервисы?
Yandex DataSphere, VK Cloud ML и другие российские сервисы дают подходящую инфраструктуру. Но фичи и сценарии всё равно нужно строить под специфику бизнеса. Готовые «коробочные» churn-модели в SaaS CDP обычно дают 10-15% accuracy ниже кастомных — это много.
Что важнее — модель или данные?
Данные. 90% качества churn prediction — это качество фичей и pipeline их расчёта. Хорошая модель на плохих фичах работает хуже, чем средняя модель на отличных фичах. Поэтому 60% бюджета проекта обычно тратится на data engineering и feature engineering, а не на сам ML.
Какой ROI ожидать от churn prediction?
В retail — снижение фактического churn на 1-3 п.п. через 6-9 месяцев эксплуатации. Для базы 3 млн клиентов с месячным churn 2.5% это 30-90 тыс сохранённых клиентов в месяц. При среднем LTV 8 тыс ₽ это сохранённая выручка 240-720 млн ₽/год — окупает CAPEX 4-7 млн ₽ за 1-3 месяца.
Что в итоге
Churn prediction в CDP с ML моделями — стандартный enterprise-сценарий с понятным алгоритмом внедрения и предсказуемым ROI. Главный фокус — не выбор модели, а качество фичей и интеграция в реактивационные сценарии.
Готовы помочь с проектированием pipeline и подбором архитектуры churn prediction под ваш контекст — обсудим в формате аналитической сессии.