← Home

Как A/B-тестировать холодные письма и не обмануться

2026-07-20

Почти каждое руководство по холодным письмам советует A/B-тестировать темы. Почти нигде не сказано, что при объёмах, которые есть у большинства малых отправителей, тест темы в принципе не может дать надёжный ответ. Цифру вы всё равно получите. Победитель всё равно определится. Просто это будет шум в костюме.

Это честная версия: что стоит тестировать в первую очередь, сколько писем нужно, чтобы результат что-то значил, как распознать ложную победу и что делать вместо теста, когда арифметика говорит, что настоящий тест вам не по силам. Все расчёты приведены полностью — подставьте свои числа и пересчитайте.

Почему холодные письма — плохое место для экспериментов

A/B-тест хорошо работает там, где измеряемое событие происходит часто. Тесты корзины в интернет-магазине работают, потому что каждый день конвертируются проценты от тысяч посетителей. С холодными письмами наоборот: нужное вам событие — ответ — случается примерно у 2–8% адресатов, а малый отправитель касается нескольких сотен человек в месяц, а не нескольких сотен тысяч. Редкое событие плюс маленький объём равно широкая неопределённость. Всё остальное в этой статье вытекает из одной этой фразы.

По какой метрике тестировать

По ответам, а если можете считать — по назначенным встречам. Не по открытиям.

Трекинг открытий сломан. Прокси приватности подгружают картинки до того, как письмо увидит человек, антивирусные сканеры прокликивают ссылки для проверки, а часть клиентов блокирует пиксели полностью. Результат раздут в одну сторону машинными предзагрузками и занижен в другую заблокированными пикселями, и разделить одно от другого вы не можете. «Победа» темы, измеренная по открытиям, — часто просто вариант, попавший в большее число ящиков с агрессивными прокси картинок.

Ответы считать сложнее, но они реальны: человек прочитал письмо и что-то написал в ответ. Встречи ещё лучше, но они реже, а это только усугубляет проблему выборки — поэтому оптимизируйте по ответам и сверяйтесь по встречам.

Арифметика: сколько писем нужно

Сначала правило, потом — откуда оно.

Отправок на вариант ≈ 16 × p × (1 − p) ÷ d²

где p — средняя доля ответов по обоим вариантам, а d — абсолютный прирост, который вы хотите уметь различать. Шестнадцать берётся из стандартных требований 95% доверия и 80% мощности: (1,96 + 0,84)² ≈ 7,85, удвоенное примерно до 16, потому что вы сравниваете две группы, а не одну группу с фиксированным числом. Формуле верить не обязательно — достаточно прогнать её на своих цифрах.

Пример 1: реалистичный прирост

Сейчас у вас 4% ответов, и вы хотите понять, даёт ли новый вариант 6% — прирост на 50% относительно, действительно ценное изменение.

  • Среднее двух долей: p = 5%, значит p × (1 − p) = 0,05 × 0,95 = 0,0475
  • Различаемая разница: d = 0,02, значит d² = 0,0004
  • 16 × 0,0475 ÷ 0,0004 = 0,76 ÷ 0,0004 = 1 900 отправок на вариант

Это 3 800 писем ради ответа на один вопрос об одной переменной. Если вы шлёте 300 холодных писем в месяц из небольшого офиса в Москве, такой тест займёт год — за который и ваша база, и оффер, и почтовые провайдеры успеют смениться под вами.

Пример 2: скромный прирост

Теперь предположим, что новая версия поднимает вас с 4% лишь до 5%.

  • p = 4,5%, значит p × (1 − p) = 0,045 × 0,955 = 0,042975
  • d = 0,01, значит d² = 0,0001
  • 16 × 0,042975 ÷ 0,0001 ≈ 6 900 отправок на вариант

Почти 14 000 писем. Обратите внимание, что произошло: разница уменьшилась вдвое — требование выросло вчетверо, потому что размер выборки растёт как квадрат разницы. Это главный факт статьи: именно он говорит, какие тесты малому отправителю доступны, а какие нет.

Пример 3: крупный замах

Теперь вы не правите формулировки, а меняете весь оффер — другое обещание, другая причина ответить — и это поднимает вас с 4% до 8%.

  • p = 6%, значит p × (1 − p) = 0,06 × 0,94 = 0,0564
  • d = 0,04, значит d² = 0,0016
  • 16 × 0,0564 ÷ 0,0016 ≈ 560 отправок на вариант

Порядка 1 100 писем всего — достижимо за месяц-два. А если изменение достаточно радикальное, чтобы поднять вас с 4% до 12%, требование падает примерно до 185 на вариант, около 370 писем.

Вывод неизбежен: малый отправитель способен различать только крупные изменения. При скромных объёмах тест «Быстрый вопрос» против «Быстрый вопрос, {{Имя}}» сжигает единственную экспериментальную ёмкость, которая у вас есть. Потратьте её на то, что может удвоить долю ответов.

Почему 50 против 50 не доказывает ничего

Самый частый «тест» в реальной жизни: 50 писем версии A, 50 — версии B. У A три ответа, у B один. Версия A выигрывает втрое, основатель переписывает всю цепочку, и историю потом рассказывают на конференции.

Посмотрите на неопределённость. Три ответа из 50 — это наблюдаемые 6%. Стандартная ошибка равна корню из (0,06 × 0,94 ÷ 50), это около 3,4 процентных пункта, а 95-процентный интервал — примерно наблюдаемая доля плюс-минус две стандартные ошибки: от нуля примерно до 12,6%. У версии B один ответ из 50 — это 2%, стандартная ошибка около 2,0 пункта, интервал примерно от 0% до 5,9%.

Эти диапазоны перекрываются почти на всю ширину. Данные одинаково согласуются и с тем, что A вдвое лучше, и с тем, что B чуть лучше, и с тем, что они идентичны. Три ответа против одного — ровно то, что случайность выдаёт, когда истинные доли одинаковы; так же как четыре орла из пяти бросков не доказывают, что монета кривая.

Неопределённость при объёмах, которые кажутся большими

Двести отправок на вариант ощущаются как серьёзный тест. При доле ответов 4% это восемь ответов. Стандартная ошибка — корень из (0,04 × 0,96 ÷ 200), около 1,4 пункта, то есть истинная доля за этими восемью ответами лежит где-то между 1,3% и 6,7%. Внутри такого разброса посредственный вариант от хорошего не отличить.

Полезное упрощение: неопределённость задаётся числом ответов, а не числом отправок. Ниже примерно 25–30 ответов на вариант вы гадаете на кофейной гуще; ниже десяти — просто смотрите в чашку. При доле ответов 4% тридцать ответов означают 750 отправок на вариант.

Что тестировать в первую очередь

Раз вы можете позволить себе различать только крупные эффекты — тестируйте крупное.

1. База

Ничто в холодных письмах не двигает долю ответов так, как то, кому вы пишете. Одно и то же письмо, отправленное точно подобранному сегменту и приблизительно подобранному, может отличаться втрое и больше — такой эффект малый отправитель действительно способен измерить. Делите по отрасли, размеру компании, городу или по наличию явного повода (новая точка, наём, недавние инвестиции). Если узкое место — чистая, точно нацеленная база, то это проблема сбора данных, а не копирайтинга, и сократить сбор под конкретную нишу как раз и призваны инструменты вроде JustLeadIt.

2. Оффер

Не формулировка, а сам оффер. Бесплатный аудит, отраслевой бенчмарк, 15-минутный разбор и платный пилот — это разные предложения, и доли ответов у них расходятся широко. Второй по силе рычаг и второй по измеримости.

3. Угол и повод

Почему вы пишете именно этому бизнесу? Письмо, зацепленное за что-то наблюдаемое («страница записи не открывается с телефона»), играет в другой лиге, чем общий рассказ о своих возможностях. Смена угла — изменение достаточно крупное, чтобы его заметить.

4. Призыв к действию

Проверка интереса («интересно взглянуть?»), ссылка на календарь и предложение конкретного времени дают заметно разное поведение. Тестировать стоит, но эффект будет меньше, чем у базы и оффера, — часто как раз в диапазоне, на который вам не хватит объёма.

5. Темы и микро-копирайтинг

В последнюю очередь и, честно говоря, опционально при малых объёмах. Эффект темы на ответы — обычно пункт-два, а это по арифметике выше требует тысяч отправок на вариант. Напишите простую тему, не похожую на маркетинг, и идите дальше.

Как провести тест, который не мусор

По одной переменной за раз

Если вы разом поменяли тему, первую фразу и призыв, а ответов стало больше, вы узнали, что этот набор лучше того набора — но не какое из изменений сработало, и ничего не унесёте в следующую кампанию. При малых объёмах это иногда приемлемый размен: тест «чемпион против претендента» из двух целиком разных писем — законная конструкция. Просто честно понимайте, что он говорит, а что нет.

Рандомизируйте внутри одной базы и одного окна

Классически испорченный тест: версия A во вторник утром, версия B в четверг после обеда. Теперь вы тестируете день недели, время суток и текст одновременно и разделить их не можете. То же самое, если A ушла лучшему сегменту, а B — остаткам. Назначайте каждому контакту A или B случайно внутри одной базы и одного окна отправки — чередуйте по списку, если нет инструмента. Это самое дешёвое улучшение качества теста, и его пропускают чаще всего.

Следите за дрейфом доставляемости

Доставляемость не константа. Прогревающийся домен на третьей неделе попадает во «Входящие» лучше, чем на первой, а провайдер может начать вас душить посреди кампании. Если A уходила при здоровом домене, а B — после всплеска жалоб на спам, текст тут ни при чём. Хуже того: если в одном варианте есть слово или паттерн ссылки, задевающий фильтр, вариант целиком уедет в спам для целого класса адресатов и будет выглядеть как слабый текст, хотя его просто не прочитали. Проверяйте попадание в папки по каждому варианту, прежде чем верить цифрам.

Не подглядывайте и не останавливайте тест

Смотреть результат каждый день и объявлять победителя, как только один вариант вырвался вперёд, — надёжный способ производить ложные победы. В начале теста соотношение швыряет: при 20 отправках на сторону один лишний ответ выглядит как прирост в 100%. Остановиться на максимальном разрыве — значит выбрать шум. Зафиксируйте размер выборки до старта и посмотрите один раз в конце.

Считайте сравнения

Тестируя пять вариантов сразу или снимая пять метрик с одного теста, вы даёте себе пять попыток найти «значимый» результат. При обычном пороге 95% примерно одно сравнение из двадцати даёт ложноположительный результат чисто случайно. При пяти сравнениях фальшивый победитель — рядовой исход, а не невезение.

Что малому отправителю делать вместо этого

Отказаться от A/B-теста — не значит лететь вслепую. Это значит перейти к методам, которые работают на малых объёмах, и честно маркировать их выводы.

Последовательные партии

Отправьте одно письмо партии из 100–150 контактов и запишите долю ответов. Поменяйте одну крупную вещь — оффер, угол, сегмент — и отправьте следующую партию. Ведите простой журнал: партия, изменение, ответы.

Статистической значимости вы отсюда не получите и заявлять её не должны. Что вы получите — картину за десять-пятнадцать партий: одни подходы стабильно дают 1–2 ответа на сотню, другие стабильно дают 6–8. Повторяющийся направленный сигнал по многим партиям — реальная информация, даже без p-value. Просто никогда не действуйте по одной партии.

Читайте ответы, а не только считайте их

На 200 отправках у вас будет восемь ответов — статистически бесполезно, качественно золото. Люди не понимают, что вы продаёте? Пишут «не тот человек»? «У нас уже есть подрядчик»? Каждое указывает на своё лекарство: ясность, таргетинг, тайминг. Отрицательные ответы полезнее всех: «не актуально, мы этим не занимаемся» означает, что фильтр базы неверный, — а это ваш самый мощный рычаг. Это занятие с наивысшей отдачей информации на письмо, и оно вообще не требует размера выборки.

Тестируйте базы и офферы, а не предложения

Раз при малых объёмах решает размер эффекта, тратьте экспериментальный бюджет на две переменные с самым большим потенциалом. Другая вертикаль или другой оффер вполне могут поднять вас с 3% до 9%. Переписанное второе предложение — нет.

Честно маркируйте свои выводы

Привыкните говорить: «направленно оффер с аудитом выглядит лучше на четырёх партиях — стоит продолжить, но не доказано». Эта фраза полезнее вашему будущему «я», чем фальшивая уверенность. Команды, ведущие честный журнал, на шестой месяц принимают решения лучше тех, кто прогнал дюжину недомощных тестов и поверил каждому.

Практическое правило решения

Перед настройкой любого теста: оцените текущую долю ответов p по последним нескольким сотням отправок; решите, какой минимальный прирост d реально изменит ваше поведение; посчитайте 16 × p × (1 − p) ÷ d². Если результат больше того, что вы можете отправить за шесть недель, — не запускайте тест, ведите последовательные партии и так и говорите. Шесть недель не случайны: дальше сезонность, устаревание базы и дрейф доставляемости загрязняют сравнение настолько, что даже правильно рассчитанный тест перестаёт быть чистым.

Коротко

A/B-тесты холодных писем реальны, но это инструмент больших объёмов, а у большинства применяющих его объёмов нет. При базовых 4% различить переход к 6% стоит около 1 900 отправок на вариант; к 5% — около 6 900; к 8% — около 560. Поэтому малым отправителям надо тестировать офферы, базы и углы, а оптимизацию тем оставить тем, кто шлёт десятки тысяч писем в месяц.

Меряйте ответы, а не открытия. Рандомизируйте внутри одной базы и одного окна. Фиксируйте размер выборки до старта и смотрите один раз. А когда арифметика говорит, что валидный тест невозможен — а так будет чаще всего — ведите последовательные партии, внимательно читайте каждый ответ и называйте свои данные тем, что они есть: направленным сигналом. Честная неопределённость складывается в хорошее суждение. Фальшивая уверенность складывается в год оптимизации не того предложения.

Найдите новых B2B-лидов

Поиск компаний по нише и региону — контакты в один клик.

Начать бесплатный поиск