注册
登录
返回博客
Abstract split test diagram: one audience stream divided into two equal groups feeding separate A and B panels

Facebook 广告 A/B 拆分测试:它到底在测什么,结果什么时候只是噪声

Ethan Cole
Ethan Cole发布于 2026年9月5日 于 技术导航
2026.10.20 Jakarta summit (deepclick)

拆分测试真正解决的问题,复制一个广告组解决不了

想知道素材 A 是不是比 B 好,最顺手的做法是复制一个广告组、改一处。这个测试在开跑之前就已经被污染了。

两个瞄准同一批人的广告组会进同一场竞价。Meta 通常是从符合条件的广告组里挑一个去竞价,而不是让它们同时出价——于是你看到的差异里,混进了投放系统"选谁上场"的判断,而不只是受众对素材的偏好。更麻烦的是同一个人整周下来两个版本都能看到,所谓"赢的那版"可能只是拿到第二次曝光的那版。这和 Facebook 广告受众重叠 说的是同一个结构性问题,只不过那篇从成本角度看,这篇从测量角度看。

A/B 测试工具专门修的就是"分配"这一环:它按人切分受众,而不是按曝光切分。每个用户在整个测试期间只被分到一个版本,各分区之间不互相竞价。这就是这个工具存在的全部理由——别的事你手工也能做,随机且互不重叠的分组你做不到。

什么变量适合测

工具的设计前提是一次只改一个变量,可测维度是素材、受众、版位、投放优化目标。这个限制不是多余的:如果素材和受众一起改了,结果差异只能告诉你"这两个组合不一样",不能告诉你是哪一半造成的,这个结论也没法迁移到别的广告系列。

实际操作里要比工具的强制更严一档。把钩子、形式、时长、行动号召全换了的"新素材",是四处改动套了一件衣服。这种测试仍然可以跑——有时你就是想知道新概念作为一个整体打不打得过旧的——但复盘时要如实写清你学到的是什么,因为"整包赢了"并不告诉你下一步该改哪里。

学习期会悄悄吃掉小预算测试

每个版本都是一个新广告组,每个新广告组都要重新进学习期。在投放稳定之前,单次成效成本既偏高又偏抖,跟它最终会落到的稳态不是一回事。

常被引用的门槛是每个广告组每周约 50 次优化事件;具体数字请以产品内当前口径为准,Meta 调整过这个指引。真正要紧的是它逼出来的那道算术:测试预算被摊到各版本上,每个版本都得自己攒够事件。同样一笔钱,作为一个广告组本可以轻松走出学习期,一分为二之后可能两半都卡住——而两个都没跑出来、都还在学习期的广告组互相比较,测的是学习期,不是你的素材。Meta 广告学习期 讲了什么会重置它、要多久。

如果诚实的答案是"这笔钱供不起两边都走出学习期",那这个测试就还不该跑。换到量更大的广告系列上跑,或者拉长窗口,或者改测一个攒得更快的指标。

多数拆分测试真正错的地方:统计功效

广告测试大多栽在这里,而且是无声地栽——测试给出一个数字,数字看着像答案,没人回头检查它是否有可能是答案。

转化是稀有事件。如果每一边只出个位数的转化,那么与你观测结果相容的"真实转化率"范围大得吓人。12 比 9 不是 33% 的提升,那是从两个你还分不开的分布里各抽了一次。不太舒服但有用的经验法则是:要检出一个温和的提升——也就是多数素材改动实际能带来的那种量级——需要每边几百个转化,不是几十个;而要检出巨大的差异所需样本要少得多。这正是"两个真正不同的概念"之间的测试很快能出结论、而"按钮换个颜色"永远出不了结论的原因。

开跑前先定三件事:

  • 值得据此行动的最小差异。如果 5% 的差别根本不会改变你的投放决策,就别设计一个只能检出 5% 的测试。
  • 这个差异所需的转化量你出不出得起。出不起,就要么接受代理指标,要么干脆不跑。
  • 停止日期。在第一次曝光发生之前就写下来。

Meta 会随结果给一个置信度。置信度低就照它的字面意思理解——工具在告诉你它分不开这两个版本——而不是把它当成对暂时领先那一版的微弱背书。

为什么不能"看着不错就收"

盯着在跑的测试、一看到某一版拉开就收手,是制造假赢家最有效的办法。测试早期领先者会频繁易主,纯属噪声。只要你允许自己在"差距看着够说服力"的任意时刻停手,那么即使拿两个一模一样的素材去测,你迟早也能找到这样一个时刻。

防线是流程上的,不是统计上的:提前把结束日期钉死,只在结束时读一次结果。如果确实需要中途盯盘,那就盯故障——某一版没花出去、广告被拒、落地页坏了——而不是盯谁赢。

"没结论"本身就是结论

团队容易把"无显著差异"当成白跑一趟。它是个发现:这两个版本之间的差异,小于你出得起钱去测量的差异。这说明该停止在这个维度上继续迭代,转向杠杆更大的地方——报价、受众定义、落地页——而不是再去做第四个标题变体。

它同时还告诉你一件关于这两个版本的事:随便发哪个都行。既然表现分不出高下,就选制作成本更低、后续更好维护的那个。

开跑前的检查清单

  • 只改了一个变量,而且你能用一句话把它说清楚。
  • 预算够两边各自独立走出学习期。
  • 最小差异量与停止日期,两样都事先写下来。
  • 测试窗口内没有别的广告系列在打同一批受众,免得分组从外部被污染。
  • 事先想好"没结论"时怎么办——趁你还冷静的时候决定。

上游结构理顺了,能在测试开始前就消掉不少噪声:Facebook 广告账户结构 讲一个账户到底需要多少广告系列和广告组,Facebook 广告出价策略 讲那些最容易把测试搅浑的投放设置。

常见问题

拆分测试该跑多久? 长到两边都跑出学习期、并攒够你设定的最小差异所需的转化量,且至少跑满一整周,好让"星期几"的影响平摊到两边。两个条件不一致时,取更长的那个。

能不能拿两个不同的广告目标做拆分测试? 没什么意义。不同目标优化的是不同事件,投放系统在解两道不同的题,你看到的差异是目标带来的,不是素材带来的。

90% 的置信度够不够据此行动? 完全取决于判断错了的代价。以 90% 的把握把一个素材推到一个广告系列上,是笔划算的赌;据此重建整个账户就不是。置信度是决策的输入,不是决策本身。

预算撑不起一个功效足够的测试怎么办? 那就去测更大的差异。小预算账户从"两个真正不同的概念"里学到的,远多于从"同一个概念的若干精修版"里学到的——因为在低量级下,只有大效应才检得出来。

准备提升广告转化率?

了解 DeepClick 如何优化你的点击后转化链路。

© 2009, DeepClick Limited.
Email: [email protected]
九龙旺角弥敦道625号雅兰中心办公楼二期15楼1508室
回流功能
icon
回流落地页老客落地页受众回流投诉回流智能绿盾推送回流PWA回流
行业方案
icon
AI 社交应用游戏Meta & TikTok 广告主
关于我们
icon
联系商务经理
加入我们
合作伙伴
资源中心
icon
博客全部文章
API Doc
隐私条款用户协议