Несколько MMM-моделей вместо одной: как снизить риск ошибок в медиабюджете
Одна маркетинг-модель даёт лишь первое мнение, а не вердикт: сравнение нескольких моделей на одних данных показывает, где выводы зависят от допущений, а где подтверждаются.
- Один маркетинг-микс даёт убедительный график, но не показывает, сколько в нём данных, а сколько — заложенных допущений.
- Запуск нескольких моделей на одних и тех же входных данных обнажает разброс рекомендаций до решения о бюджете.
- Совпадающие выводы можно защищать перед руководством, расхождения указывают, где нужен дополнительный тест.
Как отмечает Search Engine Land, после настройки любая маркетинг-микс модель (MMM) выдаёт убедительную декомпозицию каналов, кривые отклика и аккуратный R². Но график не отвечает на главный вопрос: насколько результат определили данные, а насколько — заложенные в модель допущения. Окна adstock и затухания решают, как долго держится эффект канала. Кривые насыщения определяют скорость убывающей отдачи и, значит, любую рекомендацию по перераспределению бюджета. Априорные распределения и регуляризация (байесовская или ridge) кодируют представления о правдоподобных размерах эффекта, а сезонность и контрольные переменные влияют на то, сколько роста модель отнесёт к календарю, а сколько — к каналу.
Поменяйте эти факторы — и одна и та же история покажет другую картину. Поэтому одиночная модель — это первое мнение, а не приговор. Прогон нескольких моделей на одних входных данных показывает, как разные допущения меняют рекомендацию, пока решение о семизначном бюджете ещё не принято.
Валидация модели и валидация экспериментом
Перед сравнением моделей стоит разделить проверку модели и проверку экспериментом. Тесты на инкрементальность дают более сильную причинную проверку: геолифт, holdout или тест on/off напрямую измеряют, принёс ли канал дополнительные результаты. Но такой тест покрывает один канал за раз, стоит дороже и требует запланированной вариации. MMM работает шире: выводит вклад всех каналов сразу, включая те, что сложно протестировать, и пересчитывается дёшево — за дни или недели. Плата за это — полная зависимость от собственных допущений. В идеале подходы дополняют друг друга: модели порождают и ранжируют гипотезы, эксперименты подтверждают, какие из них важны, а подтверждённые результаты возвращаются в модели как априорные данные.
Поскольку протестировать каждый канал в каждом квартале невозможно, вторая и третья модели становятся следующей линией защиты от слепых зон первой. Пропустите этот шаг — и перераспределение из одиночной модели унаследует её слепые зоны. Ошибка в распределении бюджета может дойти до шести-семи знаков, прежде чем её заметят.
Три инструмента с разными подходами
Автор материала предлагает прогонять MMM через три отдельных инструмента с разной логикой и допущениями. Robyn (Meta, открытый код) использует ridge-регрессию с эволюционным поиском по гиперпараметрам: быстрый запуск и доступность для команд без байесовской подготовки, что делает его крепкой базовой линией. Meridian (Google, открытый код) — байесовская и географически иерархическая модель, учитывающая охват, частоту и эффекты верхней воронки. Вариация расходов по регионам добавляет статистические сигналы, которых нет у модели только по стране, поэтому Meridian хорошо подходит для географических данных и брендовых каналов. PyMC-Marketing (открытый код на Python, построен на PyMC) — полностью байесовская модель с задаваемыми пользователем априорными распределениями, структурой и путями косвенных эффектов между каналами. Она даёт полный контроль над допущениями, но требует специалиста, готового эти допущения защищать.
Robyn работает на R, а Meridian и PyMC-Marketing — на Python. Если команда сильнее в R, разумно оставить Robyn быстрой внутренней базой, а для двух других либо собрать лёгкие обёртки на Python, либо заложить время на работу в обеих экосистемах. Подготовка данных общая для всех трёх.
Как выстроить сравнение
Рабочий процесс начинается с входных данных: одинаковые переменные расходов, результатов и контроля для всех трёх инструментов. Первая модель стоит дорого, но каждая следующая переиспользует те же подготовленные входы, поэтому предельная стоимость второй и третьей модели невелика. Сначала все три запускаются на настройках по умолчанию, и только потом идёт тонкая настройка. Не стоит вручную подгонять первую модель до того, как запущена вторая: важно увидеть, где значения по умолчанию расходятся, прежде чем объяснять расхождение.
На этапе сравнения сопоставляют декомпозицию каналов и кривые отклика. Метрики качества подгонки здесь скорее отвлекают: высокий R² означает, что модель хорошо описывает историю, а не то, что её причинная версия верна. Все MMM подгоняются приемлемо, но всё равно расходятся между собой. Рекомендации по бюджету зависят сильнее от того, где каждая модель видит убывающую отдачу на кривой насыщения и насколько устойчиво каналы ранжируются между моделями, чем от небольших различий в доле выручки.
Дальше сравнение становится решением. Там, где модели сходятся, результат выдержал проверку тремя разными подходами и их допущениями: перераспределение можно защищать, спор закрывать, а вывод использовать как априорные данные для следующего обновления. Там, где модели расходятся, победитель не объявляется. Причина почти всегда — смешивающий фактор, коллинеарность или пробел в данных. Уверенность в выводе понижается, а следующий эксперимент фокусируется на самом большом расхождении. Среди повторяющихся причин расхождений — коллинеарность каналов: два канала растут вместе, и каждая модель делит кредит между ними по-своему; из наблюдений это разделение не установить.
Одна MMM-модель — это не основание для перераспределения бюджета, а гипотеза. Если решение принимается по единственному графику, его слепые зоны переходят в бюджет: расхождение моделей показывает, сколько в рекомендации от допущений, а не от данных.
Владельцам сайтов и рекламных бюджетов, маркетологам и аналитикам стоит закладывать в процесс минимум две-три модели с разными подходами на одних подготовленных данных. Совпавшие выводы можно защищать и фиксировать как априорные для следующего пересчёта, а расхождения — не сглаживать, а превращать в план экспериментов. Отдельно нужно решить кадровый вопрос: для байесовских моделей нужен специалист, готовый объяснить и защитить заложенные допущения.
Оригинал публикации: searchengineland.com. Разбор и выводы — редакции «SEO-зоны».