AB 转化诊断 · 2026-07-27 ~ 07-29

萤石官方旗舰店 · 高阶版人机转化诊断

商业化 agent 链路试用实验 · 高阶版(最优桶)vs 基础版(对照)

-2.76pp
高阶版售前 cvr 差值
(14.9% vs 17.7%)
p=0.12
不显著
95%CI 跨 0
-0.19pp
核心意图「商品咨询」
几乎持平(p=0.94)
≈60%
「未打标」实为
售后混入
💡一句话结论

"高阶版转化率负向"在当前样本下并不成立。 售前人机转化率 14.9% vs 对照 17.7%,看似低 2.8pp,但样本功效不足、统计不显著(95% 置信区间 -0.7pp ~ +6.2pp,跨 0)。更关键的是——占一半流量的核心意图"商品咨询"两组转化几乎完全相同(16.2% vs 16.4%,p=0.94)。bot 应答能力没变差,问题不在"会不会答",而在"答完能不能收口成交",是典型的"能力已达标、缺临门一脚"的促单闭环问题。

口径警告:这 3 天两组付款人数都在 135~146(分子偏小),任何单指标正负都不足以判决版本"有效/无效";本报告价值在于定位结构性问题而非判决版本。

📊

一、总体四指标对比

指标基础版(对照)高阶版(实验)差值是否显著
售前人机转化率 cvr17.68%(146/826)14.92%(135/905)-2.76pp否(p=0.12)
纯机转化率 auto_cvr15.48%13.14%-2.34pp否(p=0.14)
自动付款贡献率100.0%99.26%基本持平
转人工率极低极低
说白了:两个转化口径都是"方向性微降、统计不显著",不能判为版本变差。自动付款贡献率 99%~100% 说明这家店几乎全靠 bot 独立成交、转人工极少——萤石是高度自动化店,"转人工率"不是这里的矛盾,真正要看的是结构。
📏

二、会话深度分层

对话深度基础版 cvr高阶版 cvr差值高阶版 UV 分布
短(1-2 轮)12.66%9.47%-3.2pp95(基础 158)
中(3-5 轮)18.37%15.88%-2.5pp296
长(6-10 轮)18.43%13.04%-5.4pp(最大)299(占比最高)
超长(>10 轮)22.52%19.02%-3.5pp205(基础 111)
关键洞察:高阶版把用户明显推向更深的对话(长+超长合计 504 UV vs 对照 366)——多轮承接能力更强,是版本正向价值;但长对话层(6-10 轮)收口最差(-5.4pp),恰恰是高阶版流量最集中的一层——聊进去了、没接住。各层降幅统计上均不显著,负向来自"流量向深层重分布 + 深层收口漏损"的叠加。
🎯

三、分意图拆解:辛普森悖论坐实

售前意图流量占比基础版 cvr高阶版 cvr差值
商品咨询(主战场)~一半16.35%(477UV)16.16%(495UV)-0.19pp 持平(p=0.94)
未打标意图~1/319.38%(289UV)16.76%(352UV)-2.6pp
活动咨询32.50%(40UV)27.78%(36UV)-4.7pp(小样本)
商品推荐23.81%(21UV)10.00%(30UV)-13.8pp(3/30)
这就是辛普森悖论:占一半流量的核心意图"商品咨询"两组转化几乎相同,说明单意图应答能力不弱反强。大盘微负来自三处:① 未打标意图(高阶版流量更多 352 vs 289 且转化略低);② 活动/商品推荐等小样本意图波动大;③ 深层对话收口漏损。别据此下"版本无效"的矛盾结论——分意图全都不弱于基础版,恰好坐实"能力已达标、缺临门一脚"。
🔍

四、无转化性质判定

对高阶版长对话的无转化接待逐通看原文,无转化几乎 100% 属于"咨询即走"(bot 答对了、用户咨询完就走),未解决率接近 0;基本没有"以图找货落空 / 找不到货"的能力边界问题
判读口诀:低未解决率的无转化 = 促单问题(要拉回),高未解决率的无转化 = 能力问题(要转人工/登记)。萤石属于前者——纯粹的促单闭环问题,不需要补知识库、不需要建找货兜底,把促单动作做到位即可。这与"乐高型"(有能力缺口)恰好互补,也是这类中高客单标品参数店最容易见效的方向。(附:无转化样本混入了少量从商品页进店却问售后的接待,实际售前"咨询即走"纯度比表面更高。)
🔧

五、诊断结论与产品建议

📌
版本判定:证据不足以判"高阶版转化变差",且核心意图能力持平——版本能力侧达标,价值卡在"临门一脚"。高阶版真实做出的价值是"把用户带进更深的多轮对话",但这份深度还没转化成订单。建议扩到 7+ 天样本复跑确认,同时立即推进下列促单优化(不依赖样本量,见效概率最高)。
1

促单三件套,治"咨询即走"(最大金矿)

现状:用户把参数问清(内存卡兼容/机械钥匙数/是否免费安装/是否插电)后,bot 答完即停,没有一句催单。

动作:应答后强制追加"① 紧迫感(现货速发/活动倒计时/内存卡限时优惠)+ ② 背书(销量/复购/同款都在买)+ ③ 低风险(免费上门/7 天无理由/正品保障)",并以一句"我帮您拍下这款好吗"主动收口。

case:智能锁接待、C6C 接待(答完秒发满意度邀评→用户转头要人工)
2

推荐收敛决断,治"选择困难"

现状:bot 一次给两款让用户"更倾向哪款",把决策踢回用户造成瘫痪。

动作:先问清关键约束(场景/预算/是否要旋转)→ 收敛到 1 款 → 给"就选它"的唯一理由 → 主动催拍。禁止一次甩多张卡片。

case:仓库摄像头推荐(同推 C6C 精灵球 + CB60 小魔方并问"更倾向哪款"→ 无下文流失)
3

收口节奏与邀评时机

现状:bot 答完单个问题就秒发满意度邀评/"确认收货地址",节奏过快,用户还没被说服就被"结束"。

动作:邀评/收口前先做一轮促单动作;识别到明确下单信号再引导确认收货。

4

要人工的售前高意向别直接甩兜底

对"问正品/发票/退换/成交前找人工"等高意向要人工信号,先用 bot 兜一轮促单或明确承诺人工回访时间,避免非营业时段用户白喊一声就流失(这条独立于"临门一脚",是转人工链路的漏损)。

值得延续的正向动作:高阶版在成交后会主动做关联销售(买摄像头后推同一 App 生态的智能锁),是好苗头,建议保留并做成标准收尾话术。
🏷

六、附录:未打标意图打标

"未打标"占约 1/3、且高阶版更多(352 vs 289 UV),是大盘微负的重点嫌疑。回对话表拿买家真实首句逐层打标后——它不改变主结论,反而暴露两个被掩盖的技术性问题(售前分母虚高、要人工接不住)。

附1 · 未打标整体拆解:约六成不是售前

类别基础版 UV高阶版 UV性质
售后混入(关灯/物流/排障)173215不该计入售前分母
无 agent 记录(直接下单/未触发)42忽略
售前有对话但未打标112135见附2 补标
约 60% 的"未打标"其实是售后混入(基础 173/289、高阶 215/352)。高阶版这部分更多(215 vs 173),把售前 UV 分母虚高,直接夸大了"售前转化负向"——大盘微负一个被忽略的技术性原因。

附2 · 售前空标补标(按买家真实首句)

补标意图基础版 cvr(UV)高阶版 cvr(UV)
商品咨询/参数27.6%(29)24.3%(37)
商品推荐/选型33.3%(12)17.7%(17)
活动/价格33.3%(3)16.7%(6)
泛/其他(见附3)15.7%(51)11.1%(54)
补标后主体仍是商品咨询/参数 + 商品推荐/选型,结构与已打标部分一致,没有藏着新的问题意图——不改变"能力持平、缺临门一脚"的结论。

附3 · "其他/待确认"首句重新归类

重新归类基础版高阶版典型原话
商品咨询/参数(关键词漏覆盖)~21~16可以挂墙上吗/能放户外吗/无线吗/双摄的有吗/适配你家锁吗
售后·设备故障(混入)~12~12摄像头坏了/老是掉线/联不上/视频加载不出来
主动要人工/转人工~8~15人工客服/转人工/我需要人工/可以打电话吗
正品·发票·退换~1~3是不是正品/可以开13%专票吗/买回来不好用可以退吧
真·泛开场(无实质诉求)~6~8亲在吗/您好!/听不懂/没找到/这个是什么
新发现:高阶版"主动要人工"明显更多(~15 vs 基础 ~8)且几乎 0 成交。这家店转人工通道很受限(非营业时段直接兜底、直连人工组仅 40 UV),用户喊了人工却没被接住就流失。高阶版负向除了"临门一脚",还有一条链路是"触发用户要人工 → 人工接不住 → 流失"。其中问正品/发票/退换等高意向被 bot 接住的反而成交了。
口径修正提示:由于"未打标"里约六成为售后混入,本报告二~四段的"售前 cvr"分母实际偏大,真实售前人机转化率两组都比表面数字更高,且高阶版被拖累的幅度比表面 -2.76pp 更小。这进一步支持"版本负向不成立、问题在促单与转人工承接"的判断。