A/B-тесты в холодной рассылке
Тест решает спор, который иначе идёт неделями: «мне кажется, так лучше» против «а мне кажется, наоборот». Проблема в том, что плохо поставленный тест тоже даёт ответ, только неправильный, и звучит он так же уверенно.
Разберём, как получить из теста знание, а не иллюзию.
Сколько отправок нужно
Главная цифра: около ста отправок на каждый вариант.
Причина арифметическая. При отклике 15 % на двадцати отправках вы получите три ответа. Разница между тремя и пятью ответами — это разница между 15 % и 25 %, и она целиком укладывается в случайность. Решение, принятое по таким данным, будет монеткой с красивым обоснованием.
Из этого следует практическое ограничение: вариантов должно быть немного. Два варианта по сто отправок — это двести контактов, четыре варианта — четыреста. В платформе максимум четыре варианта на шаг именно поэтому.
Если ваша база меньше двухсот контактов, тестировать нечего. Пишите один вариант, который кажется лучшим, и собирайте данные для следующей кампании.
Что тестировать
По одному элементу за раз, иначе вы не узнаете, что сработало.
Порядок по силе влияния, от большего к меньшему:
| Что меняем | Влияние |
|---|---|
| Сегмент, кому пишем | очень высокое |
| Повод обращения | высокое |
| Структура сообщения: вопрос или оффер | высокое |
| Тема письма | среднее, влияет на открытия |
| Длина | среднее |
| Формулировка призыва | низкое |
| Приветствие, подпись | почти нулевое |
Начинать с последних двух строк — распространённая ошибка. Люди неделями спорят про «Здравствуйте» и «Добрый день», хотя эта разница не видна ни на каком объёме.
Отдельно стоит сказать про сегмент: он влияет сильнее всего, но A/B-тестом не проверяется. Разные сегменты — это разные кампании, а не варианты одного шага.
Как должно быть устроено распределение
Три требования к механике теста.
Вариант закрепляется за контактом навсегда. Иначе при повторной отправке человек попадёт в другую ветку, и данные смешаются.
Распределение не зависит от порядка. Если варианты чередуются по очереди, а база отсортирована по алфавиту или по региону, вы получите не тест, а сравнение двух разных выборок.
Условия одинаковые. Один и тот же список, одни и те же дни, одни и те же отправляющие аккаунты. Вариант, который отправлялся с прогретого ящика против варианта с непрогретого, сравнивает инфраструктуру, а не текст.
Что считать результатом
Здесь кроется самая дорогая ошибка.
Обычно победителя определяют по доле ответов. Это удобно, потому что ответы приходят быстро, и неверно, потому что ответы — не цель.
У нас есть замер ровно на эту тему. Мы сравнили долю ответов с реальным продвижением лидов по воронке, и разброс перехода «ответил — продвинулся дальше» между кампаниями составил от 3 % до 44 %. Этот разброс оказался больше, чем разброс самого отклика.
Практически это значит: вариант, который собрал 22 % ответов, может дать меньше сделок, чем вариант с 9 %. Особенно если первый — вопрос без предложения, который собирает много вежливых «а что вы предлагаете?».
Что с этим делать:
- Смотрите отклик, чтобы понять, доходит ли сообщение и цепляет ли оно.
- Смотрите долю заинтересованных от охваченных, чтобы понять, приносит ли вариант смысл.
- Через две-три недели смотрите, сколько лидов из каждой ветки продвинулось по воронке.
Третий шаг требует терпения, зато отвечает на настоящий вопрос.
Когда тест ничего не значит
Мало отправок. Меньше ста на вариант — данных нет.
Варианты отправлялись в разное время. Понедельник и пятница дают разный отклик сами по себе.
Разная инфраструктура. Один прогретый ящик и один свежий — это тест ящиков.
Изменено больше одного элемента. Другая тема и другая длина одновременно: победил один из двух, но какой — неизвестно.
Разные сегменты. Один и тот же текст на разных аудиториях у нас расходился втрое, и это разница аудиторий, а не текста.
Тест остановлен, когда «пошло хорошо». Самая коварная ошибка: если подглядывать в результаты и останавливать тест на удачном отклонении, вы гарантированно получите ложного победителя.
Практический сценарий
Как выглядит нормальный цикл на базе в тысячу контактов.
- Первая кампания без теста. Один вариант, четыреста контактов. Задача — убедиться, что письма доходят, и понять базовый уровень отклика.
- Второй запуск с тестом. Два варианта первого шага, по двести-триста контактов на каждый. Меняется один элемент: например, вопрос против короткого оффера.
- Ждём. Ответы идут первые три-четыре дня, содержательные разговоры разворачиваются в течение двух недель.
- Считаем оба показателя. Отклик и продвижение по воронке.
- Применяем победителя и делаем его новой отправной точкой.
- Следующий тест — про другой элемент.
Три-четыре таких цикла дают больше понимания своей аудитории, чем любое обсуждение внутри команды.
Что дают тесты, а что нет
Тест отвечает на вопрос «какой из двух вариантов лучше на этой аудитории». Он не отвечает на вопросы «что написать» и «кому писать».
Поэтому тесты имеет смысл запускать, когда базовые вещи уже сделаны: сегмент выбран, доставляемость нормальная, ответы кто-то разбирает. Оптимизация формулировок при доставляемости в 40 % — способ потратить время на то, что не решает.
Дальше по теме: как написать первое сообщение, метрики аутрича, A/B-тесты в платформе.
Попробовать — две недели бесплатно.