恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
ai-engineering-from-scratch 如何用 GrowthBook 与 Statsig 对 LLM 功能做 A/B 测试?
首页
资讯中心
/
ai-engineering-from-scratch 如何用 GrowthBook 与 Statsig 对 LLM 功能做 A/B 测试?
ai-engineering-from-scratch 如何用 GrowthBook 与 Statsig 对 LLM 功能做 A/B 测试?
发布时间:2026/9/12 16:40:09
ai-engineering-from-scratch 如何用 GrowthBook 与 Statsig 对 LLM 功能做 A/B 测试【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch在 ai-engineering-from-scratch 仓库的 Phase 17 · 21A/B Testing LLM Features 中核心任务是当你改了一个 system prompt、换了一个模型、或调了 temperature 之后用一次受控在线实验回答用户在乎吗而不是凭感觉更好就上线。本方案适用的前提是功能已有真实线上流量并且你已准备好一个基线转化率指标实验平台在 GrowthBook 与 Statsig 中二选一。完成本篇后你应能产出一份一页纸的 A/B 计划平台、主指标与护栏、样本量、设计、CUPED、多重比较校正、SRM 策略并附决策规则。先分清 Evals 与 A/B 测试确定要测的轴课程文档对两者的划分是Evals离线评测在标注集上用 rubric、LLM-as-judge 或人工判断回答输出在这条固定分布上是否正确/有用/安全。它捕捉的是暴露给用户之前的回归。A/B 测试线上真实用户、随机分流回答新变体是否移动了真正重要的用户级指标。文档明确两者都不可省略evals 挡在曝光之前A/B 在曝光之后确认产品影响。只靠 vibe check 上线被列为反模式。文档列出三条可测试的轴以及各自的指标选择测试轴内容文档给出的指标Prompt engineering措辞、system prompt 结构、示例任务成功率、用户留存、单次请求成本Model selection如 GPT-4 vs GPT-3.5-Turbo vs 开源模型任务准确率 单次请求成本 延迟 P99多目标Generation parameterstemperature、top-p、max_tokens任务特定指标输出多样性 vs 确定性写计划前先确认你改的是哪条轴——主指标跟着轴走。平台选择Statsig 还是 GrowthBook文档给出的对比依据如下选型判断标准就两条你的仓库 SQL 姿态以及被 OpenAI 收购这件事对你组织是否重要Statsig2025 年 9 月被 OpenAI 以 11 亿美元收购托管 SaaS。支持 sequential testing、CUPED、held-out populations。All-in-onefeature flags 实验 可观测性一体。适合想要捆绑产品、不关心 OpenAI 归属的团队。GrowthBook开源MIT 协议warehouse-native直接从 Snowflake/BigQuery/Redshift 读数。多引擎Bayesian、Frequentist、Sequential。实现 CUPED、SRM、Bonferroni 与 Benjamini-HochbergBH校正。可自托管或用托管云。适合仓库 SQL 团队、数据团队掌控指标层、想要 OSS 的场景。两个平台都实现 CUPED 与 SRM 检查因此统计能力不是区分项区分项是部署形态与数据归属。按七步模板写出一份 A/B 计划仓库中 ab-plan skill 规定了计划的完整结构给定功能变更prompt / model / generation parameter、基线指标、预期 lift 和团队姿态warehouse-native OSS vs bundled SaaS产出一页纸计划包含以下 7 项平台Statsigbundled SaaSOpenAI 所有或 GrowthBookMIT OSSwarehouse-native并给出理由。主指标 护栏guardrails主指标是你要移动的指标护栏是不能回归的东西文档示例为 cost/request、latency P99、refusal rate。样本量经典功效计算 × 1.4LLM 非确定性缓冲。设计fixed-horizon 或 sequential。预期信号强用 sequential变更细微用 fixed。CUPED主指标存在前周期pre-period数据时启用并指定回归变量regressor。校正实验数量少用 Bonferroni多个相关实验用 BH。SRM每个实验都必须有 SRM 检查被标记即停实验并排查分流。文档对这几个统计项的解释是CUPEDControlled-experiments Using Pre-Experiment Data在比较后期之前用前期数据回归掉方差文档给出的典型方差缩减为 30–70%。Sequential testing经典 A/B 假设固定样本量always-valid 的 sequential 过程mSPRT、Howard 的 confidence sequences在重复查看下仍控制假阳率允许在明确赢家处提前停止。多重比较在 95% 置信度下跑 20 个 A/B 会按概率产生一个假阳性Bonferroni 收紧每个检验的 αBH 控制错误发现率。SRM分流 hash 随机分配用户到变体若 50/50 的实际交付变成 47/53说明分流坏了——SRM 检查负责标记。LLM 非确定性对样本量的影响同一 prompt 产生不同输出传统功效计算假设 IID 观测有效样本量低于名义值。文档正文给出的安全余量是乘以约 1.3–1.5x而配套代码中使用的是 ×1.4两者并不矛盾1.4 落在 1.3–1.5 区间内写计划时引用即可。运行配套模拟器样本量计算与 sequential 停止演示课程的 Use It 部分指向 code/main.py这是一个纯 Python 标准库math、random脚本无需安装依赖按仓库内路径直接运行python3 phases/17-infrastructure-and-production/21-ab-testing-llm-features/code/main.py脚本做两件事固定样本量计算。以 baseline 3% 转化率为例对 2%、5%、10% 三档 lift各输出两行传统固定样本量80% powerα0.05每臂所需样本和 LLM 调整后值×1.4 非确定性缓冲。这就是计划第 3 步经典功效计算 × 1.4的可执行版本也是练习 1expected 5% lift、baseline 3%、80% power 需要多少样本的对照答案。Sequential 模拟。三组场景实际 lift 5% / 10% / 50%用户按 50/50 随机分入 A/B 两臂脚本每轮计算两比例 z 统计量并与一个随 log(n) 增长的 always-valid 边界mSPRT 风格比较越过边界即记录停止点并终止模拟。运行后按脚本自身打印的说明判断结果强信号50% lift 场景下 sequential 边界会早期触发输出的 n_a/n_b 反映的是到停止点为止的样本量不是完整模拟时长小效应或零效应下边界故意保守这是 Type-I 保证的体现。脚本用固定随机种子seed7同一输入多次运行结果一致。验证方式SRM、决策规则与硬性拒绝文档给出的实验级验证链条是SRM 先行每个实验都必须跑 SRM 检查被标记实际分流偏离目标比例就先停实验查分流不进入读数环节。决策规则ab-plan 的收尾要求主指标显著 所有护栏均无显著负向 → 上线任何一条护栏被打破 → 无论主指标多好看都不上线。以下是 ab-plan 文档明确写出的拒绝条款触发任一条就不要按常规 A/B 走功能周流量低于 1000 用户拒绝固定 A/B改走 shadow canary 路径见 Phase 17 · 20。同一主指标上跑超过 5 个实验且未做 BH/Bonferroni拒绝多重比较下假发现是必然的。跳过 SRM 检查拒绝分流 bug 很常见。主指标是主观指标如质量且无客观代理指标要求并行人工评测。lift 假设小于 LLM 噪声底拒绝现实样本量下实验检测不到。前置流程Shadow 与 Canary 先于 A/B文档把 A/B 定位为上线序列的最后一步Phase 17 · 20 的衔接新模型若行为差异明显不同行为、成本曲线、语气先 shadow复制生产请求到候选模型、只记录不返回用户再 canary 渐进放量——正文给出的典型阶梯为 1% → 10% → 25% → 50% → 75% → 100%每一步用 5 项指标守门延迟分位数、cost/request、错误/拒绝率、输出长度分布、用户反馈率canary 通过后才在 50% 分流下跑 A/B。若只是同模型的改进版本canary 门通过后可直接推全A/B 这一步是可选的。结果参考文档列出的真实案例文档列出的既有实验结果可作为量级参考是案例数据不是本方案的预期值某 chatbot 奖励模型变体会话长度 70%、留存 30%Nextdoor AI 主题行实验奖励函数精调后 CTR 1%Khan Academy Khanmigo在延迟 vs 数学准确率轴上迭代权衡。【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考