首页/技能/A/B 测试怎么做:实验流程、交付物与 2026 市场参考价 | 极客豌豆

A/B 测试怎么做:实验流程、交付物与 2026 市场参考价 | 极客豌豆

A/B 测试:实验流程、交付物清单与 2026 市场参考价

A/B 测试是数字营销领域的一项专业技能服务——把同一个入口的两个(或多个)版本同时投放到真实流量上,用统计检验判断哪个版本更能带来你想要的结果,从而把「我觉得」换成「数据显示」。它不负责生产创意,负责建立一套能判断创意好坏的机制,并且规定好什么时候这个判断才算数。

很多人是在连续拍了几次脑袋、上线之后又悄悄回滚、复盘会上谁也说服不了谁之后,才意识到团队缺的其实不是好点子,而是一套能判断点子好坏的流程。这正是 A/B 测试要解决的问题。

一、A/B 测试到底做什么

一句话概括:在有争议的地方,让真实用户替你投票,并且提前规定好票数到多少才算数。

具体拆开是五件事:

  • 把争议翻译成可证伪的假设:不是「把按钮改成绿色」,而是「因为退出调研里 43% 的人说没看懂产品是干什么的,所以把首屏标题从功能描述改成结果描述,预计注册转化率相对提升 10%」。
  • 设计对照组与实验组:确认分流单位(按用户还是按会话)、分流比例、流量是否正交,保证两组用户除了被测变量之外没有系统性差异。
  • 算样本量与最短运行时长:在实验开始前就写死「需要多少样本、至少跑几天」,写进方案里,之后不改。
  • 运行期做数据质量监控:盯 SRM(样本比例失衡)、埋点是否丢数、是否有跨设备串号、是否出现闪烁(flicker)。
  • 出结论并归档:不管输赢都记进实验台账,赢的上线,输的写清「哪条假设被证伪」。

服务边界:A/B 测试不含页面视觉设计与文案创作(归设计和文案),不含前端/后端的功能实现(归研发,但顾问通常要参与方案评审与埋点评审),不含投放买量。它管的是「测什么、怎么测、测多久、结果算不算数、赢了怎么落地」。

二、和多变量测试、灰度发布、CRO 有什么区别

这四个词经常被人混着用,但它们解决的不是同一层的问题:

概念 在解决什么 和 A/B 测试的关系
多变量测试(MVT) 同时测多个元素的组合,找出最优搭配 是 A/B 测试的升级版;需要的样本量按组合数成倍放大,流量不够时用不起来
灰度发布(金丝雀发布) 把新版本先放给 1%–10% 的用户,确认不崩再全量 目标是风险控制,不设假设、不看显著性、通常不做统计检验
转化率优化(CRO) 一整套提升转化的方法论:研究、假设、实验、落地 A/B 测试是 CRO 的验证环节,CRO 还包含热图、录屏、问卷、用户访谈等定性研究
特性开关(Feature Flag) 用配置控制功能对谁可见 是实现分流的技术手段,本身不是实验

一句话区分:灰度发布回答「会不会出事」,A/B 测试回答「哪个更好」,CRO 回答「整体上还能怎么涨」。 把灰度当 A/B 测试用是最常见的误会——灰度只有实验组没有对照组,看到的提升可能只是季节性波动。

三、5 类最值得做实验的决策场景

不是所有改动都值得跑实验。投入产出比最高的,通常是这五类:

  • 高争议、低成本的分歧:两个老板各执一词的按钮文案、价格档位展示顺序。实验的边际成本极低,但能让决策从「谁级别高」变成「数据怎么说」。
  • 高流量页面的关键路径节点:首页首屏、注册/登录入口、购物车、结算第一步。这些位置 1% 的相对提升,绝对金额往往很可观。
  • 投放落地页:已经付了广告费把人拉来了,落地页转化率差 1 个百分点,等于白烧一大笔预算。投放量越大,越该测。
  • 付费墙与定价呈现:年付/月付的默认选项、套餐排序、锚定价的展示方式。这类改动风险高、影响大,适合用小流量实验先验证。
  • 新功能上线前的价值验证:功能开发完了但不确定用户买不买账。先对 10% 用户放量做实验,比全量上线后再回滚成本低得多。

反过来,这几种情况不建议做实验:品牌视觉大改版(用户新鲜感会污染结果,测得是「新奇效应」不是「更好」)、法律合规相关的改动(没得选)、以及流量低到几个月都跑不满样本量的页面(此时应该先做定性研究)。

四、一次完整实验的标准流程

标准流程六步,短则 2 周,长则 2 个月,主要卡在样本量上:

  1. 假设(1–3 天):从数据里找问题——漏斗哪一步掉得最狠、热图上哪个位置被点了却没反应、退出调研里用户在抱怨什么。然后把问题写成一句带原因和预期幅度的假设。
  2. 设计(1–3 天):确定主指标(只能有一个)、护栏指标(不能恶化的指标,如退款率、客诉量)、分流单位与比例、显著性水平(通常 95%)与统计功效(通常 80%)、最小可检测效应 MDE。
  3. 算样本量(几小时):用基线转化率和 MDE 反推所需样本。这一步决定了实验要跑多久,也决定了这个实验到底值不值得做。
  4. 分流与埋点(1–5 天):配置实验平台、校验埋点、QA 各浏览器与各机型、确认无闪烁、确认护栏指标可采集。没做 QA 就上线是实验翻车的头号原因。
  5. 运行(几天到几周):期间只做健康检查(SRM、埋点完整性),不做显著性判断。达到预设样本量才进入分析。
  6. 分析与决策(1–2 天):看主指标是否显著、看分群是否一致、看护栏指标是否恶化,然后给出「上线 / 回滚 / 再测一轮」的建议,并归档。

关键纪律:样本量和停止规则必须在第 3 步写死。到了第 5 步再改,这个实验的统计结论就已经不可信了。

五、最终你会拿到什么交付物

这是判断一次实验做得专不专业的硬标准。一套完整交付至少包含:

  • 实验方案文档(Pre-registration):假设、主指标、护栏指标、MDE、所需样本量、计划运行时长、停止规则。这份文档在实验开始前就签字确认,是防止事后改口径的唯一手段。
  • 实验台账(Experiment Log):一行一个实验,记录编号、假设、起止时间、分流配置、样本量、结论、是否上线。这份台账是复利资产——一年之后它比任何单个实验都值钱。
  • 实验报告:数据总表、分群拆解、显著性解读、异常说明。
  • 决策建议:明确写「上线 / 不上线 / 需要再测」,以及上线的具体做法(全量还是分批)。
  • 埋点与数据质量说明:本次实验用了哪些事件、校验结论、发现的数据问题。
  • 复盘与后续假设清单:不管输赢,从结果里长出来的下 3–5 个可测假设。

只给一张「实验组赢了 3.2%」的截图、没有样本量口径、没有护栏指标、没有停止规则的,基本可以判定为不合格。

六、实验报告里最关键的三个判断

拿到一份实验报告,先看这三件事,比看结论数字重要得多:

1. 样本比例是否失衡(SRM)

你设定了 50/50 分流,实际却跑出了 48.7/51.3。这不是小事——它说明分流或埋点有 bug,此时后面所有数字都不必看了。行业通用的做法是设一个 SRM 告警阈值(常用 p < 0.001 视为失衡),触发即停止排查。

2. 提升是「统计显著」还是「业务显著」

样本量足够大时,0.3% 的差异也能做到 p < 0.05。但 0.3% 的转化率提升,扣除实现成本和维护成本后可能是负收益。所以报告里要同时给出置信区间效应量:「相对提升 8%(95% CI: 2%–14%)」,你能判断这个提升的下限是否还值得上线。

3. 分群结论是否与总体一致

总体赢了,但移动端输了、新客输了、付费渠道输了——这种情况非常常见。如果分群结论不一致,不能简单全量上线,要么按分群差异化上线,要么再跑一轮专门验证。这也是辛普森悖论最容易发生的地方。

七、主流工具怎么选:云端 SaaS 与自建开源

工具分两条路线,选择主要取决于你有没有工程资源和数据仓库。

云端 SaaS(营销侧、可视化编辑器、上手快)

工具 定位 公开价格(采样 2026-09-01)
Microsoft Clarity 热图 + 会话录制 免费
Zoho PageSense 低成本一体化 起价约 $20/月(1 万月访客)
Convert Experiences 隐私优先、明码标价 Growth $399/月、Pro $599/月(10 万测试用户/月)
VWO 一体化 CRO 套件(含热图、录屏、问卷) 官方已改议价;第三方实测 Growth 档约 $314/月
Kameleoon AI 驱动的测试与个性化 Starter 约 $495/月
AB Tasty 电商与零售企业级 议价
Optimizely 企业级全栈实验 议价;第三方记录 Business 档约 $63,700/年

自建 / 开源(工程侧、数仓原生、按事件或按席位计费)

工具 定位 公开价格(采样 2026-09-01)
PostHog 开源一体化(分析 + 实验) 免费额度 100 万事件/月
Statsig 产品实验与分析 免费额度 200 万事件/月
GrowthBook 数仓原生开源(Bayesian + Frequentist) 自托管免费;Cloud Pro $40/席位/月
LaunchDarkly 特性开关 + 渐进式交付 Developer $0;Foundation $10/服务连接/月 + $8.33/千 client-side MAU/月
神策数据 A/B 测试 国产,支持私有化部署 未公开价格,需顾问定制报价
GrowingIO A/B 实验 国产,「平台 + 咨询」双模式 未公开价格,按模块与用量评估

怎么选:营销团队想自己上线测试、没有工程排期 → 选带可视化编辑器的 SaaS;产品/技术团队要在 App 内做功能级实验、公司已有数仓 → 选自建开源,长期成本更低。一个常被忽略的现实:行业统计显示企业平均每月花在 CRO 工具上的钱在 $2,000 上下,但大量团队买了工具却一年跑不了几个实验——工具不是瓶颈,流程和人才是。

八、2026 市场参考价

下面按「谁来做」和「怎么计费」两个维度拆,所有美元价格标注了来源站点与采样日期。

独立顾问 / 自由职业者

  • 小时咨询:$40–300/小时(约 ¥270–2,030/小时),跨度大主要取决于是否有可验证的过往实验记录——来源 personizely.net《Conversion Rate Optimization Services Pricing (2026)》
  • CRO/实验方向自由顾问更常见的区间:$75–200/小时(约 ¥510–1,360/小时)——来源 everestx.com《How Much Does Growth Marketing & Strategy Cost in 2026?》
  • 按月顾问费:$2,000–8,000/月(约 ¥1.4 万–5.4 万/月),通常对应每月 2–4 个实验——来源 personizely.net

小型增长团队 / 精品机构

  • Starter 档:$2,000–5,000/月(约 ¥1.4 万–3.4 万/月),每月 2–3 个测试 + 基础报告——来源 acceleroi.com《CRO Agency Pricing: What to Expect in 2026》
  • Growth 档:$5,000–12,000/月(约 ¥3.4 万–8.1 万/月),每月 4–6 个测试,含设计与开发——来源 acceleroi.com
  • 主流机构月费的中位数区间:$5,000–16,000/月(约 ¥3.4 万–10.8 万/月)——来源 ifda.ai《Conversion Rate Optimization Services Pricing: A 2026 Guide》

企业级驻场 / 全托管项目

  • 企业级全托管:$12,000–25,000+/月(约 ¥8.1 万–17.0 万+/月),含专属团队、无限测试、实验体系搭建——来源 acceleroi.com
  • 全服务月费 $5,000–20,000/月;企业级程序 $20,000–50,000+/月(约 ¥13.6 万–33.9 万+/月)——来源 bknddevelopment.com《How Much Does CRO Cost in 2026?》

按项目(一次性)

  • 一次性 CRO/实验审计:$1,000–5,000(约 ¥0.7 万–3.4 万)——来源 brandedagency.com《Conversion Rate Optimization Services: A 2026 Guide》
  • 深度审计(含用户访谈、可用性测试):$2,800–10,000(约 ¥1.9 万–6.8 万)——来源 ifda.ai
  • 落地页优化项目:$2,000–8,000/页(约 ¥1.4 万–5.4 万/页)——来源 bknddevelopment.com
  • 项目制总包:$5,000–50,000(约 ¥3.4 万–33.9 万)——来源 acceleroi.com

按实验(单价)

  • 单个 A/B 测试的生产成本:$1,500–4,000(约 ¥1.0 万–2.7 万/个),复杂度决定差异——来源 acceleroi.com

培训 / 混合咨询(带内部团队)

  • $2,000–6,000/月(约 ¥1.4 万–4.1 万/月),顾问负责方法论培训 + 定期评审内部产出——来源 brandedagency.com

国内平台参考价(人民币)

  • 猪八戒网某营销数据分析与策略类服务页:基础版 ¥14,500、标准版 ¥25,000、高级版 ¥80,000,交付周期 120 天,单项增值服务 ¥1,000——来源 m.zbj.com/fw/1917328.html,采样 2026-09-01
  • 平台项目平均预算量级:一品威客约 ¥5,000–50,000/项目(平均客单价约 ¥4,200),猪八戒约 ¥3,000–100,000/项目——来源 CSDN《一品威客 vs 猪八戒网 深度对比分析(2026 版)》,采样 2026-09-01,置信度:低(第三方统计,非平台官方口径)

汇率说明:2026-09-01 人民币兑美元中间价 6.7809(中国外汇交易中心发布,新华网转载),本文美元折算统一取 1 USD ≈ 6.78 CNY,仅用于快速估算,签约以当日汇率为准。

>

置信度说明:海外报价为各站点 2026 年公开行情,采样于 2026-09-01,可直接对标;国内数据样本稀少,猪八戒为单个服务页报价、平台预算区间为第三方统计,置信度低,只作量级参考。

九、三种计费模式:按项目 / 按月 / 按实验

模式 典型区间 适合谁 风险点
按项目 ¥1 万–34 万/次 目标明确、有明确交付物(如「结算流程实验方案 + 3 个实验」) 需求蔓延,边界不清会扯皮
按月顾问费 ¥1.4 万–17 万+/月 要持续跑实验、需要有人对实验节奏负责 容易变成「付钱买报告」,没有上线闭环
按实验 ¥1.0 万–2.7 万/个 初期试水、或流量低到每月只能跑 1 个实验 只按个数计费会激励「多测简单的小改动」

怎么选:第一次合作建议从「一次性审计 + 1 个实验」的项目制起步(对应 ¥1 万–5 万这个区间),跑通之后再看要不要转月度。直接签 12 个月月度合同、却从没验证过对方能力的,是甲方最容易踩的坑。

十、影响报价的六个因素

同一个需求,不同人报价差 3–5 倍,主要差在这几点:

  • 流量规模:这决定了实验能不能跑得动。基线转化率越低、想要检测的提升幅度越小,所需样本量越大,实验周期越长,顾问要做的样本量测算与方案设计工作量越大。
  • 是否含实现:只出假设和方案(便宜),还是连设计稿、前端实现、QA 一起做(贵得多)。这一项是最大的价差来源。
  • 技术栈复杂度:标准 Shopify / 有赞页面 vs 自研 App 需要发版、需要服务端分流的实验,后者往往要拉研发进场。
  • 研究与设计深度:只做数据漏斗分析(轻),还是加上用户访谈、问卷、可用性测试(重)。研究做得深,实验胜率会明显提高,但前期成本也上去了。
  • 护栏指标与合规要求:金融、医疗、教育这类行业,实验涉及合规审查,方案设计和评审成本更高。
  • 是否含体系搭建:只是帮你跑几个实验,还是帮你建立实验台账、假设库、评审机制并带内部团队——后者本质是组织能力建设,价格量级完全不同。

询价时必须问清四句话:含不含实现?含几次方案评审?样本量和停止规则谁定?实验台账归谁? 这四个问题不问清楚,比价没有意义。

十一、5 个最容易翻车的坑

坑 1:样本量不足就下结论

跑了 3 天看到实验组高 12%,就宣布胜利。实际上基线转化率 3% 时,要在 95% 置信、80% 功效下检测出 20% 的相对提升,需要约 28,000 个访客——日访 500 的站点要跑 56 天。3 天的结论基本等于噪声。

坑 2:只看总体、不看分群(辛普森悖论)

总体数据显示实验组更好,但拆开看:移动端实验组更好、桌面端实验组更差,只是因为实验组恰好分到了更多移动端流量。总体结论被流量结构扭曲了。任何「赢了」的实验,都必须做一次分群一致性检查。

坑 3:中途偷看、提前停止

这是最经典也最致命的一条。Evan Miller 的研究显示:在实验过程中反复查看结果、一看到显著就停,会把假阳性率从 5% 抬到 26%——你以为的 5 次胜利里有 1 次是假的,变成了 4 次里有 1 次是假的。解法只有一个:样本量提前算好,没到就不看显著性。

坑 4:多实验互相污染

同一批用户同时进了 3 个实验,你无法判断提升来自哪一个。规范做法是做流量分层与正交:同一层内实验互斥,不同层之间流量正交。自建平台和成熟的商业平台都支持,但需要提前规划。

坑 5:赢了不上线,输了不记录

实验跑完,赢了的版本因为「研发排期紧」一直没上;输了的实验没有留下任何记录,半年后新人又把这个假设测了一遍。没有台账的实验项目,做一年等于原地踏步。实验台账是这个行业里唯一能产生复利的资产。

十二、样本量到底要多少

这是决定「能不能测」的硬门槛,也是报价前必须先算清楚的事。几个可直接引用的量级:

  • 基线转化率 3%、想检测 20% 的相对提升(即 3.0% → 3.6%),95% 置信 + 80% 功效,需要约 28,000 个访客;日访 500 的站点需要约 56 天——来源 clickport.io(2026-04 核实)
  • 想检测的 MDE 减半(从 20% 降到 10%),所需样本量大约变成 4 倍,而不是 2 倍
  • 海外 CRO 服务商给的经验线:被测试的页面每月至少要有 5,000 会话,低于这个量级建议先做 UX 审计而不是硬跑实验——来源 kcmobile.pl《Cennik CRO 2026》
  • 另一条常用经验线:月访问量低于 10,000,跑统计显著的分流测试会很吃力,此时更适合做定性研究(会话录制、退出问卷)和个性化——来源 personizely.net

所以流量小的正确做法不是「放弃实验」,而是:只测大胆的改动而不是按钮颜色(改动越大,MDE 越大,所需样本越小)、把主指标换成更上层的指标(如「加入购物车」而不是「支付成功」,因为前者发生频次更高)、以及多个渠道合并计量。

十三、不同行业的典型 ROI 区间

不同行业能拿到的提升幅度差别很大,报价时也应该按行业的价值空间来谈。

行业 公开可查的提升区间 / ROI 来源
通用(跨行业基准) 运转良好的项目,90 天内被优化页面的相对转化率提升 5%–15%;首个统计显著结果出现在第 45–75 天,收入层面影响要到第 75–90 天 brandedagency.com(2026)
电商 典型 CRO ROI 300%–800%;单条算例:10 万月会话、客单价 $100 的站点,转化率 +0.5 个百分点 → 月增收 $50,000,扣除 $8,000/月顾问成本,ROI 约 525% kcmobile.pl(2026)/ everestx.com(2026)
会员 / 订阅制 某信息查询企业会员入口引导文案实验,核心指标提升超 60% 神策数据官方案例(采样 2026-09-01)
本地生活服务 58 到家:搜索环节流失约占预订路径的 25%,优化推荐后搜索→预订转化率提升 25% GrowingIO 案例(innoHere 案例库,采样 2026-09-01)
金融 京东金融:注册流程流失超 40%,优化后注册转化率提升 30% GrowingIO 案例(innoHere 案例库,采样 2026-09-01)

需要说清的是:这些数字都是个案,不是承诺。 真正决定 ROI 的是三件事——基线转化率有多差、流量有多大、赢了之后能不能真的上线。一个赢了却上不了线的实验,ROI 是 0。

十四、自己搭实验能力 vs 请外部顾问

维度 自己搭 请外部顾问
成本 工具 ¥200–4,500/月(或开源免费)+ 1 个人力 ¥1.4 万–17 万+/月,或 ¥1 万–2.7 万/个实验
起步速度 慢,要踩完一遍坑才知道坑在哪 快,有现成的方法论和模板
适合的阶段 已经确定要长期做、有专职增长岗 第一次做、或内部推不动、或需要外部背书
最大风险 方法学跑偏不自知(偷看、样本量不足),得出一堆假结论 交付完就走,内部没沉淀,下次还得再请

折中做法(也是最常见的高性价比路径):请顾问做「审计 + 前 3 个实验 + 体系搭建」,同时指定内部 1–2 个人全程跟着做,把实验台账、假设库、评审流程接过来。合同里写清楚「交付包含内部培训 N 小时」和「台账与模板归甲方所有」,避免做完一轮什么都没留下。

十五、怎么判断一个实验顾问靠不靠谱

四个可验证的指标:

  1. 会不会先问你的流量和基线转化率:不问就报方案、就承诺「提升 30%」的,可以直接排除。没有基线转化率,样本量根本算不出来。
  2. 能不能解释清楚停止规则:问他「这个实验什么时候可以停」,如果回答是「跑到显著为止」,说明他没做过正经实验。正确答案应该是「达到 X 样本量或跑满 Y 天,两者先到为准,中途不看显著性」。
  3. 有没有完整的失败实验记录:只讲成功案例的,大概率是在挑着讲。成熟的实验体系里,真正跑出来的胜率通常在 10%–30% 之间,失败是常态。
  4. 报告里有没有置信区间和护栏指标:只给一个「+8.3%」而不给置信区间、不提护栏指标的,说明统计素养不过关。

红旗信号:承诺具体的提升百分比、实验开始前不肯写死样本量、拒绝把实验台账交给甲方、把灰度发布说成 A/B 测试。

十六、想做这行需要哪些基本功

统计学基础(最硬的一块)

  • 假设检验的完整逻辑:原假设、p 值、两类错误(假阳性 / 假阴性)、统计功效
  • 置信区间与效应量:能解释「提升 8%(95% CI: 2%–14%)」对业务意味着什么
  • 样本量与 MDE 的反推:这是你报价和判断「这个实验该不该做」的依据
  • 频率派与贝叶斯的分歧:至少要知道商业平台的贝叶斯引擎在报什么
  • 顺序检验(Sequential Testing)与多重比较校正:知道为什么「多看几次」会毁掉结论

SQL 与数据能力

  • 能自己从数仓/分析平台拉数,不依赖别人给你导表
  • 会写埋点校验 SQL,能发现「事件丢了 30%」这类问题
  • 懂基本的分流哈希原理,能判断分流是否均匀

工具栈(至少各会一个)

  • 分析平台:GA4 / 神策数据 / GrowingIO
  • 实验平台:云端选一个(VWO / Convert / AB Tasty),自建选一个(GrowthBook / PostHog / Statsig)
  • 定性工具:Microsoft Clarity / Hotjar(热图、会话录制)

起步路径:先在自己或朋友的站点上完整跑通 3–5 个实验(哪怕流量小、结论不显著),把实验方案文档和实验台账做成标准模板。作品集放脱敏后的实验方案 + 台账截图,比放一堆「提升 XX%」的截图有说服力得多。

十七、接单渠道与个人定价节奏

起步阶段(0–10 单):先从「一次性实验审计 + 1 个实验」的小项目切入,报价 ¥5,000–15,000/次。这个阶段的目标是攒可验证的案例与评价,不是赚钱。可以在极客豌豆等技能服务平台注册、完善技能档案并上传作品集,也可以在线上接单平台同步发布服务,多平台铺开比单押一个渠道稳。

成长期(10–50 单):开始接按月顾问,¥1.5 万–3 万/月,对应每月 2–4 个实验。这个阶段要开始挑选垂直行业——只做电商结算、或只做 SaaS 激活,客单价和口碑都会比「什么都接」稳得多。

成熟期:按价值定价,或者转成「体系搭建 + 内部培训」的高客单项目。此时你的收入不再由实验个数决定,而由你帮客户建立的组织能力决定。

一个必须提前想清楚的现实:国内平台上数据分析类项目的预算普遍偏低,且常要求「从清洗到可视化全包 + 免费改 3 次」,这类需求会严重挤压你做实验设计的时间。想做增长实验这一行,客户更多是从垂直社群、内容输出和熟人转介里来,而不是从综合外包平台的竞价池里来。

十八、给甲方的一份决策清单

签约前,确认这 8 件事:

  1. 基线转化率是多少——没有这个数字,任何报价都是猜的
  2. 每月能触达的样本量够不够支撑你想检测的最小提升幅度
  3. 主指标是不是只有一个,护栏指标列了哪几个
  4. 样本量和最短运行时长是否写进了方案文档(实验前签字)
  5. 停止规则是什么,谁有权在实验途中喊停
  6. 分群维度定好了吗(设备、新老客、渠道),是否要做一致性检查
  7. 赢的版本由谁上线、多长时间内上线——不上线的实验 ROI 是 0
  8. 实验台账归谁、以什么格式交付,是否包含内部的培训与交接

这 8 条能对上 6 条以上,你的实验项目大概率不会变成「花钱买一堆截图」。

常见问题

流量不够,还做得了 A/B 测试吗?

能做,但要换打法。样本量与想要检测的最小提升幅度是平方反比关系:基线 3%、想检测 20% 的相对提升需要约 28,000 访客,想检测 10% 就大约需要 4 倍样本(约 11 万)。所以流量小时有三条路:一是只测大胆改动,把 MDE 放大;二是把主指标上移到发生频次更高的事件(如「加入购物车」而不是「支付成功」);三是改用定性研究(会话录制、退出问卷、用户访谈)先找问题,等流量起来再验证。海外 CRO 服务商给的经验线是:被测页面月会话低于 5,000 时,先做 UX 审计比硬跑实验划算。

一次实验到底要跑多久?能不能提前看结果?

时长由样本量决定,不由日历决定。跑多久 = 所需样本量 ÷ 每日进入实验的流量,同时要满足「至少覆盖一个完整业务周期」(通常建议 7 天的整数倍,以消除星期效应)。至于提前看结果——每多看一次,你就多一次「碰巧显著」的机会。研究显示反复偷看会把假阳性率从 5% 抬到 26%。正确的做法是:样本量和停止规则在实验开始前写死并签字,运行期间只做数据健康检查(SRM、埋点完整性),不看显著性;达到预设样本量才做一次判断。

请人做一次大概多少钱?

看计费方式。按实验计:单条实验的生产成本在 $1,500–4,000(约 ¥1.0 万–2.7 万),复杂度决定差异(acceleroi.com,采样 2026-09-01)。按项目计:一次性审计 $1,000–5,000(约 ¥0.7 万–3.4 万),落地页优化项目 $2,000–8,000/页(约 ¥1.4 万–5.4 万/页)。按月计:独立顾问 $2,000–8,000/月(约 ¥1.4 万–5.4 万),精品机构 Growth 档 $5,000–12,000/月(约 ¥3.4 万–8.1 万),企业级全托管 $12,000–25,000+/月(约 ¥8.1 万–17 万+)。国内平台上营销数据分析类服务的公开报价量级在 ¥14,500–80,000/项目。价差主要来自「含不含设计实现」「跑几个实验」「做不做深度用户研究」。

A/B 测试和灰度发布是一回事吗?

不是。灰度发布(金丝雀发布)的目的是控制风险:把新版本先放给 1%–10% 的用户,观察崩溃率、错误日志、性能指标,没问题再逐步全量。它不设假设、没有对照组、通常不做统计检验,所以从灰度里看到的「转化率提升了 5%」无法归因——可能只是季节性波动。A/B 测试的目的是比较优劣:必须有对照组、必须有随机分流、必须预先算样本量、必须做显著性检验。两者的技术实现很像(都是按比例分发版本),但回答的是完全不同的问题:灰度回答「会不会出事」,A/B 测试回答「哪个更好」。

实验做出来「没有显著差异」算失败吗?

不算,而且这是常态。成熟的实验体系里真正的胜率通常在 10%–30% 之间,大部分实验的结论是「没有足够证据说明更好」。这类结果的价值在于:它明确证伪了一条假设,团队不用再在这个方向上争论,也不用承担上线后才发现无效的风险。真正的失败是另外两种情况:一是样本量根本不够,得出的是「没测出来」而不是「测出来没差异」;二是结论出来了却没记进台账,半年后新人把同样的假设又测了一遍。只要进了台账,输的实验就是资产。

已经买了神策、GrowingIO 这类平台,还需要请外部顾问吗?

看瓶颈在哪。工具解决的是「能不能跑起来」,顾问解决的是「测什么、怎么测、结果算不算数」。海外有一组很说明问题的观察:某企业每月在 A/B 测试工具上花约 ¥8,000,八个月里跑了零个实验——缺的不是工具,是流程和人(upgrowth.in,采样 2026-09-01)。所以判断标准很简单:如果你团队里有人能写出带原因和预期幅度的假设、能算样本量、能顶住压力不在中途喊停,那不需要外部顾问;如果这三件事没人对结果负责,买再贵的平台也只是多了一个仪表盘。国产平台(神策、GrowingIO)本身也提供「平台 + 咨询」模式,价格需联系官方顾问定制,可以先问一嘴再做对比。

想入行做实验顾问,需要什么背景?怎么开始接单?

背景上没有硬性门槛,但能持续接单的人通常占其一:数据分析背景(懂 SQL 和埋点)、增长/运营背景(懂漏斗和渠道)、或产品背景(懂用户旅程)。无论哪种,统计学这块必须补齐——假设检验、置信区间、样本量与 MDE、顺序检验,这是区分「跑过实验」和「会做实验」的分水岭。起步建议:先在自己或朋友的站点上完整跑通 3–5 个实验,把实验方案文档和实验台账做成标准模板;作品集放脱敏后的方案与台账,比放「提升 XX%」的截图有说服力。定价从 ¥5,000–15,000/次的小项目起步,攒够案例后转 ¥1.5 万–3 万/月的月度顾问。获客上,垂直社群与持续的内容输出(写实验复盘)比综合外包平台的竞价池更有效——后者的数据分析类需求预算偏低,且常把实验设计挤压成免费附赠。

相关技能服务

参考来源

  • acceleroi.com《CRO Agency Pricing: What to Expect in 2026》——机构月费档位、项目制区间、单个实验生产成本 $1,500–4,000(采样于 2026-09-01)
  • bknddevelopment.com《How Much Does CRO Cost in 2026?》——一次性审计、落地页优化、月度 retainer 与企业级区间(采样于 2026-09-01)
  • everestx.com《How Much Does Growth Marketing & Strategy Cost in 2026?》——CRO 自由顾问时薪、机构月费、ROI 算例(采样于 2026-09-01)
  • personizely.net《Conversion Rate Optimization Services Pricing (2026)》——自由职业者与顾问时薪/月费区间、月流量经验线(采样于 2026-09-01)
  • ifda.ai《Conversion Rate Optimization Services Pricing: A 2026 Guide》——机构月费中位数区间、深度审计与小时咨询价格(采样于 2026-09-01)
  • brandedagency.com《Conversion Rate Optimization Services: A 2026 Guide》——审计/培训报价、90 天提升基准、首个显著结果时间窗(采样于 2026-09-01)
  • clickport.io《How to A/B Test Your Website Without Paying for Tools》——工具价格(2026 年 4 月核实,7 月复核)、样本量与提前偷看的假阳性研究(Evan Miller)(采样于 2026-09-01)
  • humblytics.com《Best A/B Testing Tools for SaaS in 2026》——GrowthBook / Convert / LaunchDarkly 公开定价(2026 年 8 月核实,采样于 2026-09-01)
  • webtonic.io《You Probably Need Two, Not One: 20 CRO Tools Reviewed (2026)》——工具价格横评与企业 CRO 工具平均支出(采样于 2026-09-01)
  • contentsquare.com《15 best A/B testing tools to optimize conversions in 2026》——工具起价对照(采样于 2026-09-01)
  • kcmobile.pl《Ile kosztuje optymalizacja konwersji sklepu? Cennik CRO 2026》——电商典型 ROI 300%–800%、月会话经验线(采样于 2026-09-01)
  • 神策数据官方案例《A/B 测试实战解析,搞定超 60% 会员增长》——会员入口引导文案实验(采样于 2026-09-01)
  • GrowingIO 官网 A/B 实验页 / innoHere 案例库——58 到家、京东金融案例(采样于 2026-09-01)
  • 猪八戒网企业服务页 m.zbj.com/fw/1917328.html——国内营销数据分析类服务公开报价(采样于 2026-09-01)
  • CSDN《一品威客 vs 猪八戒网 深度对比分析(2026 版)》——国内平台项目预算量级(第三方统计,置信度:低,采样于 2026-09-01)
  • 中国外汇交易中心 2026-09-01 人民币汇率中间价 1 USD = 6.7809 CNY(新华网转载)

准备好让技能开始赚钱了吗?

加入极客豌豆,让你的技能被需要的人找到

下载 App
滚动至顶部