Facebook 广告 A/B 拆分测试:它到底在测什么,结果什么时候只是噪声

拆分测试真正解决的问题,复制一个广告组解决不了
想知道素材 A 是不是比 B 好,最顺手的做法是复制一个广告组、改一处。这个测试在开跑之前就已经被污染了。
两个瞄准同一批人的广告组会进同一场竞价。Meta 通常是从符合条件的广告组里挑一个去竞价,而不是让它们同时出价——于是你看到的差异里,混进了投放系统"选谁上场"的判断,而不只是受众对素材的偏好。更麻烦的是同一个人整周下来两个版本都能看到,所谓"赢的那版"可能只是拿到第二次曝光的那版。这和 Facebook 广告受众重叠 说的是同一个结构性问题,只不过那篇从成本角度看,这篇从测量角度看。
A/B 测试工具专门修的就是"分配"这一环:它按人切分受众,而不是按曝光切分。每个用户在整个测试期间只被分到一个版本,各分区之间不互相竞价。这就是这个工具存在的全部理由——别的事你手工也能做,随机且互不重叠的分组你做不到。
什么变量适合测
工具的设计前提是一次只改一个变量,可测维度是素材、受众、版位、投放优化目标。这个限制不是多余的:如果素材和受众一起改了,结果差异只能告诉你"这两个组合不一样",不能告诉你是哪一半造成的,这个结论也没法迁移到别的广告系列。
实际操作里要比工具的强制更严一档。把钩子、形式、时长、行动号召全换了的"新素材",是四处改动套了一件衣服。这种测试仍然可以跑——有时你就是想知道新概念作为一个整体打不打得过旧的——但复盘时要如实写清你学到的是什么,因为"整包赢了"并不告诉你下一步该改哪里。
学习期会悄悄吃掉小预算测试
每个版本都是一个新广告组,每个新广告组都要重新进学习期。在投放稳定之前,单次成效成本既偏高又偏抖,跟它最终会落到的稳态不是一回事。
常被引用的门槛是每个广告组每周约 50 次优化事件;具体数字请以产品内当前口径为准,Meta 调整过这个指引。真正要紧的是它逼出来的那道算术:测试预算被摊到各版本上,每个版本都得自己攒够事件。同样一笔钱,作为一个广告组本可以轻松走出学习期,一分为二之后可能两半都卡住——而两个都没跑出来、都还在学习期的广告组互相比较,测的是学习期,不是你的素材。Meta 广告学习期 讲了什么会重置它、要多久。
如果诚实的答案是"这笔钱供不起两边都走出学习期",那这个测试就还不该跑。换到量更大的广告系列上跑,或者拉长窗口,或者改测一个攒得更快的指标。
多数拆分测试真正错的地方:统计功效
广告测试大多栽在这里,而且是无声地栽——测试给出一个数字,数字看着像答案,没人回头检查它是否有可能是答案。
转化是稀有事件。如果每一边只出个位数的转化,那么与你观测结果相容的"真实转化率"范围大得吓人。12 比 9 不是 33% 的提升,那是从两个你还分不开的分布里各抽了一次。不太舒服但有用的经验法则是:要检出一个温和的提升——也就是多数素材改动实际能带来的那种量级——需要每边几百个转化,不是几十个;而要检出巨大的差异所需样本要少得多。这正是"两个真正不同的概念"之间的测试很快能出结论、而"按钮换个颜色"永远出不了结论的原因。
开跑前先定三件事:
- 值得据此行动的最小差异。如果 5% 的差别根本不会改变你的投放决策,就别设计一个只能检出 5% 的测试。
- 这个差异所需的转化量你出不出得起。出不起,就要么接受代理指标,要么干脆不跑。
- 停止日期。在第一次曝光发生之前就写下来。
Meta 会随结果给一个置信度。置信度低就照它的字面意思理解——工具在告诉你它分不开这两个版本——而不是把它当成对暂时领先那一版的微弱背书。
为什么不能"看着不错就收"
盯着在跑的测试、一看到某一版拉开就收手,是制造假赢家最有效的办法。测试早期领先者会频繁易主,纯属噪声。只要你允许自己在"差距看着够说服力"的任意时刻停手,那么即使拿两个一模一样的素材去测,你迟早也能找到这样一个时刻。
防线是流程上的,不是统计上的:提前把结束日期钉死,只在结束时读一次结果。如果确实需要中途盯盘,那就盯故障——某一版没花出去、广告被拒、落地页坏了——而不是盯谁赢。
"没结论"本身就是结论
团队容易把"无显著差异"当成白跑一趟。它是个发现:这两个版本之间的差异,小于你出得起钱去测量的差异。这说明该停止在这个维度上继续迭代,转向杠杆更大的地方——报价、受众定义、落地页——而不是再去做第四个标题变体。
它同时还告诉你一件关于这两个版本的事:随便发哪个都行。既然表现分不出高下,就选制作成本更低、后续更好维护的那个。
开跑前的检查清单
- 只改了一个变量,而且你能用一句话把它说清楚。
- 预算够两边各自独立走出学习期。
- 最小差异量与停止日期,两样都事先写下来。
- 测试窗口内没有别的广告系列在打同一批受众,免得分组从外部被污染。
- 事先想好"没结论"时怎么办——趁你还冷静的时候决定。
上游结构理顺了,能在测试开始前就消掉不少噪声:Facebook 广告账户结构 讲一个账户到底需要多少广告系列和广告组,Facebook 广告出价策略 讲那些最容易把测试搅浑的投放设置。
常见问题
拆分测试该跑多久? 长到两边都跑出学习期、并攒够你设定的最小差异所需的转化量,且至少跑满一整周,好让"星期几"的影响平摊到两边。两个条件不一致时,取更长的那个。
能不能拿两个不同的广告目标做拆分测试? 没什么意义。不同目标优化的是不同事件,投放系统在解两道不同的题,你看到的差异是目标带来的,不是素材带来的。
90% 的置信度够不够据此行动? 完全取决于判断错了的代价。以 90% 的把握把一个素材推到一个广告系列上,是笔划算的赌;据此重建整个账户就不是。置信度是决策的输入,不是决策本身。
预算撑不起一个功效足够的测试怎么办? 那就去测更大的差异。小预算账户从"两个真正不同的概念"里学到的,远多于从"同一个概念的若干精修版"里学到的——因为在低量级下,只有大效应才检得出来。

