Обложка статьи PPC Rebels об экспериментах в Google Ads и Experiment Center в 2026 году

Эксперименты в Google Ads 2026: как проверять гипотезы в Experiment Center, а не на глаз

«Поменяли стратегию ставок — стало лучше». Через две недели выясняется, что в тот же понедельник конкурент срезал бюджет, а маркетинг запустил рассылку. Что именно сработало — никто не знает, а решение уже принято и раскатано на весь аккаунт. Эксперименты в Google Ads существуют ровно затем, чтобы этого не происходило: они делят один и тот же трафик на две части, показывают им разные версии кампании и считают разницу в одинаковых внешних условиях.

В январе 2026 года Google свёл разрозненные инструменты тестирования в единый Experiment Center. Разбираем, что там появилось, как правильно резать трафик, сколько ждать, какие гипотезы вообще проверяемы сплитом, а какие — нет, и как читать результат, чтобы не принять шум за победу.

Как устроены эксперименты в Google Ads: черновик, сплит, значимость

Механика простая и от этого надёжная. Вы создаёте черновик — точную копию кампании, в которой можно править что угодно, не трогая оригинал. Из черновика запускается эксперимент: Google начинает случайным образом делить входящий трафик исходной кампании между двумя версиями. Контроль — оригинал, вариант — ваш черновик.

Ключевое отличие от «до и после»: обе версии живут одновременно. Сезонность, погода, поведение конкурентов, ваша рассылка, курс валюты — всё это бьёт по обеим группам одинаково и вычитается при сравнении. Именно поэтому эксперимент отвечает на вопрос «что дало изменение», а последовательное сравнение периодов — не отвечает никогда.

Деление трафика происходит на уровне пользователя, а не запроса: один и тот же человек стабильно попадает в свою группу. Это важно для длинных циклов — иначе пользователь видел бы то одну версию, то другую, и результат размывался бы.

Что такое Experiment Center и что изменилось в 2026 году

Раньше тестирование было раскидано по кабинету: черновики и эксперименты в одном месте, тесты вариантов объявлений — в другом, lift-исследования — через менеджера. В январе 2026 года Google собрал это в Experiment Center — единый раздел, где живут два принципиально разных класса измерений:

  • Эксперименты — классические A/B-тесты со сплитом трафика внутри кампании. Отвечают на вопрос «какая настройка лучше».
  • Lift-исследования — измерение прироста: части аудитории реклама не показывается вовсе, и сравнивается поведение экспонированной и неэкспонированной групп. Отвечают на вопрос «а реклама вообще что-то добавила».

Внутри центра эксперименты сгруппированы по четырём типам:

Тип эксперимента Что тестирует Типичный вопрос
Настройки и функции кампании Стратегии ставок, бюджет, таргетинг, расписание показов tROAS 400% лучше, чем tCPA $40?
Ассеты Заголовки, описания, изображения, видео Новая линейка креативов даёт больше конверсий?
Типы кампаний Вклад нового типа кампании в общий результат Добавление Demand Gen увеличило продажи или каннибализировало поиск?
Кастомные эксперименты Несколько переменных сразу, в том числе между кампаниями Новая структура целиком работает лучше старой?

Поддержка типов кампаний широкая: поиск, торговые, видео, приложения, Demand Gen и Performance Max. Часть продвинутых сценариев (особенно lift-исследования с большими требованиями к объёму) по-прежнему требует участия представителя Google — их нельзя просто включить кнопкой в маленьком аккаунте.

Как запустить эксперимент: пошагово

  1. Сформулируйте гипотезу письменно, до создания черновика. Формат: «Если мы [изменение], то [метрика] изменится на [величину], потому что [механизм]». Гипотеза без ожидаемой величины — это не гипотеза, а любопытство: вы согласитесь с любым результатом задним числом.
  2. Создайте черновик нужной кампании и внесите ровно одно изменение. Два изменения — два разных объяснения любого результата.
  3. Запустите эксперимент из черновика, задав даты и долю сплита.
  4. Выберите долю трафика. По умолчанию 50/50 — и в большинстве случаев это правильный выбор.
  5. Определите длительность заранее. Две–четыре недели в зависимости от конверсионного объёма — и не меньше двух полных недельных циклов.
  6. Не трогайте ничего до финиша. Правка внутри эксперимента обнуляет его смысл: вы уже не знаете, какая версия что дала.
  7. Дождитесь значимости, потом решайте. В интерфейсе Google помечает результат как статистически значимый при уровне доверия 95% — то есть вероятность, что разница случайна, меньше 5%.
  8. Примените или откатите. Победивший вариант применяется к исходной кампании одним действием, либо разворачивается в отдельную кампанию.

Почему 50/50, а не 10/90

Соблазн «попробовать осторожно, на 10% трафика» понятен и почти всегда вреден. Чувствительность теста зависит от объёма конверсий в меньшей группе. На 10% трафика вы наберёте статистику в десять раз дольше — и за это время изменится всё то, от чего эксперимент должен был вас защитить. Малую долю имеет смысл ставить только в одном случае: изменение рискованное и потенциально дорогое, и вы готовы платить сроком за безопасность.

Сколько нужно данных: грубая прикидка

Полноценный расчёт размера выборки требует ожидаемого эффекта и базовой конверсии, но для планирования достаточно ориентира. Чем меньше эффект вы хотите поймать, тем больше конверсий нужно — зависимость квадратичная: чтобы поймать вдвое меньший эффект, нужно вчетверо больше данных.

Ожидаемый эффект Ориентир по конверсиям на группу Практический вывод
+30% и больше ~100–150 Ловится за 2 недели даже в среднем аккаунте
+15% ~400–600 Нужен заметный объём или месяц теста
+5% ~3 000–5 000 В большинстве аккаунтов недостижимо — не тестируйте

Цифры в таблице — порядок величины, а не точный расчёт. Но вывод из них жёсткий и практический: если у кампании 20 конверсий в неделю, тестировать пятипроцентные улучшения бессмысленно. Такому аккаунту нужно тестировать крупные, структурные гипотезы — смену стратегии ставок, принципиально другую посадочную, другую структуру, — а мелкие правки просто внедрять по здравому смыслу и не мучить статистику.

Что тестировать, а что не тестировать

Хорошие кандидаты в эксперимент:

  • смена стратегии ставок или заметный сдвиг цели (tCPA → tROAS, изменение цели на 20–30%) — детали по стратегиям разобраны в материале про стратегии ставок Google Ads;
  • расширение типов соответствия ключевых слов — тема, где интуиция подводит чаще всего, см. разбор про типы соответствия ключевых слов;
  • новая посадочная страница против старой;
  • другая структура групп объявлений (укрупнение против дробления);
  • расширение или сужение гео и корректировок;
  • подключение или отключение отдельного типа кампании в миксе.

Плохие кандидаты:

  • Мелкие правки текста в RSA. Google сам ротирует комбинации, и на уровне кампании эффект утонет. Для объявлений есть отдельная логика тестирования — она разобрана в статье про A/B-тесты объявлений RSA.
  • Гипотезы про инкрементальность. «Приносит ли брендовая кампания дополнительные продажи» сплитом внутри кампании не проверяется — там нужен гео-эксперимент или lift-исследование, см. инкрементальность и гео-эксперименты.
  • Всё, что чинит явную поломку. Если счётчик конверсий не работает или в кампании крутятся нецелевые запросы — это не гипотеза, это баг. Чините сразу.
  • Изменения на очень малом объёме. См. таблицу выше.

Как читать результат и не обмануть себя

Основные ловушки интерпретации:

  1. Подглядывание. Проверять эксперимент каждый день и остановить его в момент, когда вариант впервые вырвался вперёд, — самый быстрый способ систематически внедрять шум. Дата окончания назначается заранее и не двигается «потому что уже видно».
  2. Победа не по той метрике. Рост числа конверсий при падении их ценности — это не победа. Смотрите на ту метрику, которая связана с деньгами, а не на самую приятную.
  3. Период обучения внутри теста. При смене стратегии ставок первые 7–14 дней вариант работает хуже просто потому, что учится. Либо закладывайте обучение в срок теста и отбрасывайте первую неделю при анализе, либо удлиняйте эксперимент.
  4. Лаг конверсии. Если сделка закрывается за 10 дней, последние 10 дней эксперимента недосчитаны в обеих группах. Анализируйте с задержкой, равной вашему типичному лагу.
  5. Значимость без величины. Значимый прирост в 1,5% на большом объёме статистически реален и практически бесполезен. Спрашивайте не только «значимо?», но и «стоит ли это внедрения».

Эксперимент отвечает не на вопрос «стало ли лучше», а на вопрос «стало ли лучше из-за нашего изменения». Это единственный вопрос, ответ на который можно переносить на другие кампании.

Эксперименты как процесс, а не как разовая акция

Аккаунты, где тестирование даёт эффект, отличаются не инструментом, а дисциплиной. Рабочая схема выглядит так:

  • Бэклог гипотез. Простая таблица: гипотеза, ожидаемый эффект, стоимость внедрения, источник (отчёт по запросам, аудит, рекомендация Google). Гипотезы приоритизируются по «эффект ÷ усилие».
  • Один-два активных эксперимента на кампанию. Больше — и вы перестанете понимать, какое изменение на что повлияло.
  • Журнал результатов. Записывайте и провалы тоже: повторно запущенная через полгода та же гипотеза — самая частая потеря времени в командах.
  • Регулярный источник гипотез. Отчёт по поисковым запросам, квартальный аудит и рекомендации кабинета. Готовый список мест, где обычно прячутся гипотезы, — в чек-листе аудита аккаунта Google Ads.

Отдельный и очень удобный сценарий: эксперимент как фильтр для рекомендаций Google. Кабинет предлагает расширить соответствие, поднять бюджет, включить новую функцию — вместо того чтобы принимать или отклонять на веру, вы прогоняете предложение через сплит-тест и получаете ответ на своих данных. Какие рекомендации вообще стоит рассматривать, а какие отклонять сразу, разобрано в материале про оценку оптимизации и рекомендации Google Ads.

И обратная связка: результат эксперимента — это входные данные для бюджетного планирования. Проверенное сплитом изменение можно закладывать в прогноз, непроверенное — нет. Как из прогноза достать предельную цену конверсии, разобрано в статье про Performance Planner и планирование бюджета.

Три разбора: как это выглядит на цифрах

Сценарий 1. Смена стратегии ставок, которая «победила» и не победила

Кампания даёт 60 конверсий в неделю на tCPA $35. Гипотеза: переход на «Максимум ценности конверсий» с tROAS 350% поднимет выручку при том же расходе. Запускаем сплит 50/50 на 4 недели.

Показатель Контроль (tCPA) Вариант (tROAS) Разница
Расход $4 200 $4 180 −0,5%
Конверсии 121 104 −14%
Ценность конверсий $18 900 $21 300 +12,7%
ROAS 450% 510% +13%

Если смотреть на конверсии — вариант проиграл на 14%, и по привычке его бы откатили. Если смотреть на деньги — он выиграл: тот же расход принёс на $2 400 больше выручки. Это классический случай, когда «победа не по той метрике» работает в обратную сторону: тест был про ценность, и судить его надо по ценности. Решение принимается по метрике, зафиксированной в гипотезе до старта, — именно поэтому её пишут заранее.

Отдельно: первые 10 дней вариант шёл хуже по обеим метрикам — это было обучение стратегии. Если бы тест остановили на второй неделе, вывод был бы противоположным.

Сценарий 2. Значимо, но не стоит внедрения

Крупный аккаунт, 1 400 конверсий в неделю. Тест новой формулировки в ассетах даёт +2,1% конверсий, значимость 96%. Формально победа. Считаем деньги: +2,1% при CPA $22 и недельном расходе $30 800 — это примерно +29 конверсий в неделю, около $640 дополнительной прибыли при марже. Внедрение и поддержка новой линейки ассетов на 40 кампаний — два дня работы специалиста плюс дизайн. Окупится, но за месяц, и только если эффект удержится. Вывод: внедрять, но не в приоритете, а в общей очереди. Значимость — это допуск к обсуждению, а не решение.

Сценарий 3. Ложный вывод из недостатка данных

Кампания с 18 конверсиями в неделю. Тест новой посадочной, 3 недели, 27 конверсий у контроля против 21 у варианта. Разница в 22% выглядит убедительно и не является значимой: при таких числах доверительный интервал перекрывает и −40%, и +25%. Правильный вывод: тест не дал ответа. Неправильный и самый частый: «новый лендинг хуже, откатываем». Именно так команды выбрасывают рабочие гипотезы и годами возвращаются к тому, что уже проверяли — потому что решение принималось по цифрам, которые ничего не значили.

Что делать, если сплит-тест невозможен

Не каждую гипотезу можно проверить внутри кампании. Аккаунт слишком мал, изменение затрагивает весь сайт, тестируется работа колл-центра или новый оффер целиком. Рабочие альтернативы по убыванию надёжности:

  1. Гео-сплит. Разделите регионы на две сопоставимые группы, изменение включите только в одной. Работает даже там, где встроенный эксперимент недоступен, и хорошо ловит эффекты, выходящие за пределы кабинета. Требует, чтобы группы были сопоставимы по объёму и структуре спроса.
  2. Ступенчатое внедрение (staged rollout). Изменение раскатывается на 20% кампаний, затем на 50%, затем на все — с проверкой метрик на каждом шаге. Не даёт чистой причинности, но ограничивает ущерб от плохого решения.
  3. Сравнение с контрольной группой кампаний. Изменение внедряется в одной половине похожих кампаний, вторая остаётся как есть. Слабее сплита (кампании никогда не идентичны), но лучше, чем «до и после».
  4. Переключение туда-обратно (switchback). Неделя с изменением, неделя без, четыре-шесть циклов. Гасит сезонность за счёт чередования. Подходит для быстро действующих изменений, не подходит там, где есть период обучения.
  5. Обычное «до и после». Последний вариант. Если приходится им пользоваться, хотя бы возьмите период той же длины, тот же день недели на старте и явно перечислите всё, что изменилось за это время помимо вашей правки.

Типичный годовой план тестов для среднего аккаунта

Квартал Фокус тестирования Почему в этот период
Q1 Стратегии ставок и цели Низкий сезон — ошибка дешевле
Q2 Структура и типы соответствия Есть время на длинный тест
Q3 Посадочные и ассеты Готовим базу к пиковому сезону
Q4 Ничего структурного В пик тестируют только то, что нельзя отложить

Правило «в пиковый сезон не экспериментируем» звучит скучно, но экономит больше денег, чем любой удачный тест: цена ошибки в ноябре в разы выше, а качество данных из-за аномального спроса ниже.

Инфраструктурное условие, о котором забывают

Эксперимент требует стабильного аккаунта, который проживёт весь срок теста. Если кабинет уходит в блокировку на второй неделе или лимиты не дают набрать объём в обеих группах, тестирование превращается в лотерею — и вы принимаете решения по половине выборки. Для команд, которым нужна предсказуемая площадка с историей и достаточными лимитами, это закрывается инфраструктурно: агентские аккаунты Google Ads и остальные сервисы PPC Rebels дают ту стабильность, без которой любые методики тестирования остаются теорией.

FAQ: частые вопросы про эксперименты в Google Ads

Чем эксперимент отличается от простого сравнения «до и после»?

Эксперимент сравнивает две версии в одно и то же время на одинаковом трафике, поэтому внешние факторы — сезон, конкуренты, ваши другие каналы — влияют на обе группы одинаково и вычитаются. Сравнение периодов приписывает вашему изменению всё, что произошло в мире за это время.

Какую долю трафика выделить эксперименту?

По умолчанию 50/50 — это даёт максимальную чувствительность при заданном объёме. Меньшую долю варианту имеет смысл давать только при рискованном изменении, понимая, что тест продлится значительно дольше.

Сколько должен идти эксперимент?

Минимум две полные недели, обычно две–четыре в зависимости от конверсионного объёма. Срок назначается заранее и не сдвигается по ходу теста. Если внутри теста меняется стратегия ставок, добавьте 7–14 дней на обучение.

Что означает «статистическая значимость 95%»?

Что вероятность получить наблюдаемую разницу случайно, при отсутствии реального эффекта, меньше 5%. Это не гарантия, а порог приемлемого риска ошибки. И значимость ничего не говорит о величине эффекта — значимый прирост может быть слишком мал, чтобы окупить внедрение.

Можно ли остановить эксперимент раньше, если вариант уже впереди?

Технически можно, методологически — нет. Ранняя остановка по первому благоприятному результату систематически завышает эффект: вы ловите случайные колебания. Если срок надо сократить, планируйте это до старта, а не по ходу.

Что тестировать, если конверсий совсем мало?

Крупные гипотезы с большим ожидаемым эффектом: другая посадочная, другая стратегия ставок, принципиально иная структура. Мелкие правки на малом объёме статистически неразличимы — их проще внедрить по здравому смыслу и оценивать по совокупности за квартал.

Что такое lift-исследование и чем оно отличается от обычного эксперимента?

В lift-исследовании части аудитории реклама не показывается вообще, и сравнивается поведение экспонированной и контрольной групп. Это измерение прироста от самого факта рекламы, а не сравнение двух её вариантов. Требования к объёму там выше, и часто нужна поддержка представителя Google.

Можно ли запускать несколько экспериментов одновременно?

В разных кампаниях — да. В одной кампании параллельные тесты пересекаются по трафику, и результаты становятся невоспроизводимыми. Держите один активный эксперимент на кампанию.

Что делать, если эксперимент не показал значимой разницы?

Это тоже результат: изменение не даёт эффекта, который вы способны измерить на своём объёме. Значит, не внедряйте его как «улучшение» и не тратьте на него время повторно — запишите в журнал и переходите к следующей гипотезе с большим ожидаемым эффектом.

Работают ли эксперименты в Performance Max?

Да, PMax поддерживается в Experiment Center — в частности, для проверки вклада самой кампании в общий результат и для тестов ассетов. Из-за закрытой внутренней логики интерпретировать такие тесты сложнее, чем поисковые: вы видите итог, но не видите, за счёт какой площадки он получен.

Как понять, что эксперимент нужно применять на весь аккаунт?

Три условия одновременно: результат значим, величина эффекта окупает внедрение, и механизм улучшения понятен. Если победа необъяснима, повторите тест на другой кампании — прежде чем переносить решение на весь аккаунт.

Похожие записи