AI 技能人工智能【免费下载链接】marketingskillsMarketing skills for Claude Code and AI agents. CRO, copywriting, SEO, analytics, and growth engineering.项目地址https://gitcode.com/GitHub_Trending/mar/marketingskills点击查看免费下载这篇技术指南围绕开源仓库 marketing-skills 中ab-testing技能的核心参考文档 test-templates.md 展开系统讲解一套覆盖计划 → 运行 → 分析 → 复盘 → 沉淀全生命周期的 A/B 测试文档模板。你将掌握 7 个可直接复制使用的结构化模板测试计划、结果文档、测试仓库条目、快速简报、利益相关者更新、优先级记分卡、假设银行并理解它们与技能主文件 SKILL.md 中假设框架、样本量、指标分层、统计显著性等实验方法论之间的对应关系从而为自己的增长实验项目建立可复用、可检索、可审计的文档体系。模板体系总览在开始写任何实验文档之前先明确这套模板的定位它不是零散的笔记格式而是一套贯穿实验生命周期的文档管线。test-templates.md在开篇的 Contents 中列出 7 个模板覆盖三个阶段的职责阶段模板职责实验前Test Plan Template把想法固化为可执行的测试计划实验前Quick Test Brief Template轻量记录不需要完整文档的简单测试实验前Experiment Prioritization Scorecard决定先跑哪个测试实验前Hypothesis Bank Template持续收集测试想法形成后备池实验中Stakeholder Update Template向利益相关者同步运行状态实验后Results Documentation Template完整记录结果、解读与决策长期Test Repository Entry Template在集中位置追踪全部测试技能主文件 SKILL.md 在 Documentation 一节明确要求记录每一个测试包括假设、变体带截图、结果样本、指标、显著性、决策与学习并直接指向本模板文件。这意味着模板不是孤立的表单而是 SKILL.md 所倡导的实验纪律的落地载体。测试计划模板把假设固化为可执行的实验方案测试计划模板是整个体系的起点它把一次实验从我们试试看升级为我们验证什么、怎么验证、如何判定成败的完整方案。模板原文如下# A/B Test: [Name] ## Overview - **Owner**: [Name] - **Test ID**: [ID in testing tool] - **Page/Feature**: [Whats being tested] - **Planned dates**: [Start] - [End] ## Hypothesis Because [observation/data], we believe [change] will cause [expected outcome] for [audience]. Well know this is true when [metrics]. ## Test Design | Element | Details | |---------|---------| | Test type | A/B / A/B/n / MVT | | Duration | X weeks | | Sample size | X per variant | | Traffic allocation | 50/50 | | Tool | [Tool name] | | Implementation | Client-side / Server-side | ## Variants ### Control (A) [Screenshot] - Current experience - [Key details about current state] ### Variant (B) [Screenshot or mockup] - [Specific change #1] - [Specific change #2] - Rationale: [Why we think this will win] ## Metrics ### Primary - **Metric**: [metric name] - **Definition**: [how its calculated] - **Current baseline**: [X%] - **Minimum detectable effect**: [X%] ### Secondary - [Metric 1]: [what it tells us] - [Metric 2]: [what it tells us] - [Metric 3]: [what it tells us] ### Guardrails - [Metric that shouldnt get worse] - [Another safety metric] ## Segment Analysis Plan - Mobile vs. desktop - New vs. returning visitors - Traffic source - [Other relevant segments] ## Success Criteria - Winner: [Primary metric improves by X% with 95% confidence] - Loser: [Primary metric decreases significantly] - Inconclusive: [What well do if no significant result] ## Pre-Launch Checklist - [ ] Hypothesis documented and reviewed - [ ] Primary metric defined and trackable - [ ] Sample size calculated - [ ] Test duration estimated - [ ] Variants implemented correctly - [ ] Tracking verified in all variants - [ ] QA completed on all variants - [ ] Stakeholders informed - [ ] Calendar hold for analysis date假设部分与技能主文件的假设框架严格对齐测试计划中的 Hypothesis 五句式结构与 SKILL.md 的假设框架完全一致Because [observation/data], we believe [change] will cause [expected outcome] for [audience]. Well know this is true when [metrics].SKILL.md 用一个强弱对比示例说明了这套结构的分量弱假设Changing the button color might increase clicks.改按钮颜色可能增加点击——没有观察依据、没有量化预期、没有目标受众、没有衡量指标。强假设Because users report difficulty finding the CTA (per heatmaps and feedback), we believe making the button larger and using contrasting color will increase CTA clicks by 15% for new visitors. Well measure click-through rate from page view to signup start.依据热力图与用户反馈中的观察预期新访客的 CTA 点击率提升 15% 以上并以页面浏览到注册开始的点击率衡量。把强假设填进模板时Because段应引用真实的数据或观察分析、客户研究、竞品、工单、热力图Well know this is true when段应指向下方 Metrics 中定义的主指标形成假设—指标的闭环。技能评估用例evals.json 中 eval 1也明确要求给定15,000 月访问量、3.2% 注册率等上下文时必须按此框架构建假设并定义主指标、次指标与护栏指标。测试设计表每个字段的取值与含义字段可取值 / 含义Test typeA/B单一变更双版本、A/B/n多版本、MVT多变体组合。SKILL.md 的测试类型表显示 MVT 需要Very high流量A/B/n 需要Higher流量普通 A/B 只需ModerateDuration预估运行周数。依据样本量与日流量的比值计算详见下文样本量一节Sample size每个变体所需样本量而非总流量。它由基线转化率、最小可检测效应MDE、显著性水平通常 95%、统计功效通常 80%四个输入决定可查 sample-size-guide.md 的速查表Traffic allocation默认 50/50保守方案可用 90/10、80/20 限制坏变体的风险也可采用小流量起步再逐步放量的 ramping 策略见 SKILL.md 流量分配一节Tool测试工具名如 PostHog、Optimizely、VWO 等ImplementationClient-sideJS 在页面加载后修改实施快但可能有闪烁或 Server-side渲染前确定变体无闪烁但需要开发工作量。SKILL.md 列出了两类实施各自的代表工具变体设计一次只测一件事Variants 一节要求 Control 描述当前状态Variant 列出每一项具体变更并附 Rationale。这与 SKILL.md 的核心原则Test One Thing——每测只改变一个变量否则你不知道是什么起了作用直接呼应。SKILL.md 同时给出What to Vary参考表帮助你判断什么值得作为变更点类别示例Headlines/Copy信息角度、价值主张、具体程度、语气Visual Design布局、颜色、图片、层次结构CTA按钮文案、大小、位置、数量Content包含的信息、顺序、数量、社会证明指标分层主指标定成败、次指标解释原因、护栏指标防伤害Metrics 一节的三层结构对应 SKILL.md 的指标选择框架Primary主指标唯一决定成败的指标必须直接绑定假设与业务价值。模板要求同时记录其计算定义、当前基线和最小可检测效应——这三个值正是样本量计算的输入。Secondary次指标解释主指标为何变化。SKILL.md 的示例定价页测试主指标是计划选择率次指标是页面停留时间与套餐分布。Guardrails护栏指标不应变差的指标。SKILL.md 示例中定价页测试的护栏指标是支持工单数与退款率并明确若护栏指标显著变负应停止测试。三层指标在技能评估用例中同样被反复要求eval 1 要求定义主/次/护栏指标eval 5 针对加长注册表单的测试要求用三层框架分析转化数量与线索质量的权衡。上线前检查清单把纪律写进流程Pre-Launch Checklist 的 9 项既是执行清单也是 SKILL.md Running the Test 章节 Pre-Launch Checklist 的完整版。其中Calendar hold for analysis date为分析日期预留日历一项尤为关键——它把分析环节提前锁定避免测试结束后被搁置。清单还隐含了样本量先行、跟踪验证、全变体 QA 等硬性要求。结果文档模板用证据链支撑复盘决策结果文档模板是实验完成后的正式记录它把 SKILL.md 的分析清单转化为结构化表格。模板原文如下# A/B Test Results: [Name] ## Summary | Element | Value | |---------|-------| | Test ID | [ID] | | Dates | [Start] - [End] | | Duration | X days | | Result | Winner / Loser / Inconclusive | | Decision | [What were doing] | ## Hypothesis (Reminder) [Copy from test plan] ## Results ### Sample Size | Variant | Target | Actual | % of target | |---------|--------|--------|-------------| | Control | X | Y | Z% | | Variant | X | Y | Z% | ### Primary Metric: [Metric Name] | Variant | Value | 95% CI | vs. Control | |---------|-------|--------|-------------| | Control | X% | [X%, Y%] | — | | Variant | X% | [X%, Y%] | X% | **Statistical significance**: p X.XX (95% sig / not sig) **Practical significance**: [Is this lift meaningful for the business?] ### Secondary Metrics | Metric | Control | Variant | Change | Significant? | |--------|---------|---------|--------|--------------| | [Metric 1] | X | Y | Z% | Yes/No | | [Metric 2] | X | Y | Z% | Yes/No | ### Guardrail Metrics | Metric | Control | Variant | Change | Concern? | |--------|---------|---------|--------|----------| | [Metric 1] | X | Y | Z% | Yes/No | ### Segment Analysis **Mobile vs. Desktop** | Segment | Control | Variant | Lift | |---------|---------|---------|------| | Mobile | X% | Y% | Z% | | Desktop | X% | Y% | Z% | **New vs. Returning** | Segment | Control | Variant | Lift | |---------|---------|---------|------| | New | X% | Y% | Z% | | Returning | X% | Y% | Z% | ## Interpretation ### What happened? [Explanation of results in plain language] ### Why do we think this happened? [Analysis and reasoning] ### Caveats [Any limitations, external factors, or concerns] ## Decision **Winner**: [Control / Variant] **Action**: [Implement variant / Keep control / Re-test] **Timeline**: [When changes will be implemented] ## Learnings ### What we learned - [Key insight 1] - [Key insight 2] ### What to test next - [Follow-up test idea 1] - [Follow-up test idea 2] ### Impact - **Projected lift**: [X% improvement in Y metric] - **Business impact**: [Revenue, conversions, etc.]样本量达成度分析的第一道闸门Results 章节先于一切结果展示 Sample Size 表计算每个变体实际样本 / 目标样本的百分比。这与 SKILL.md 分析清单的第 1 条一致是否达到样本量若未达到结果只能视为初步结论。如果实际样本显著低于目标即使数字看起来漂亮也不能作为结论依据。主指标与统计显著性区分统计显著与实践显著主指标表格要求同时填写变体值、95% 置信区间CI和相对对照的提升。随后用两行分别记录Statistical significance统计显著性p 值是否小于 0.05。SKILL.md 明确95% 置信度即 p 0.05意味着结果有小于 5% 的概率是随机波动但它只是阈值不是保证。Practical significance实践显著性这个提升对业务是否有意义。这是统计显著之外的第二重判断——SKILL.md 的Effect size meaningful?分析项要求把效果量与 MDE、项目影响对比。技能评估用例 eval 7 提供了完整的判断场景定价页测试运行 4 周对照转化率 2.1%、变体 2.4%、每变体 12,000 访问者。按 sample-size-guide.md 的速查表2.1% 基线要检测约 14% 的相对提升0.3 个百分点样本需求远高于 12,000/变体因此需要同时评估样本量是否足以支撑该效应量与统计显著与实践显著的区别并给出是否上线、继续测试还是迭代的建议——这正是结果文档中这两行字段的价值。次指标、护栏指标与分段分析验证结论的一致性与边界Secondary Metrics 表每个次指标记录对照/变体数值、变化百分比与是否显著。SKILL.md 分析清单第 4 条要求确认次指标是否与主指标一致为为什么生效提供证据。Guardrail Metrics 表Concern 列标记护栏指标是否变差。若护栏显著变负应停止测试而非继续扩大。Segment Analysis 表SKILL.md 分析清单第 6 条要求检查移动端 vs. 桌面端、新访客 vs. 回访者等分段差异。模板预置了 Mobile vs. Desktop 和 New vs. Returning 两张表测试计划中的 Segment Analysis Plan 决定了这里分析哪些分段。解读、决策与学习把结果转化为行动Interpretation 用三个问题发生了什么 / 我们为什么认为如此 / 有哪些局限强制复盘其中 Caveats 要求记录外部因素与局限——这正好对应 SKILL.md 运行期间Document external factors的要求。Decision 部分明确 Winner、Action实施变体 / 保留对照 / 重新测试与实施时间线。Learnings 部分则要求输出关键洞察、后续测试想法与影响预估为实验手册Experiment Playbook和假设银行提供原料。测试仓库条目模板建立全局实验台账当多个测试并行运行时需要一个集中位置快速检索全部测试的状态与结果。Test Repository Entry Template 提供一张可追加的汇总表| Test ID | Name | Page | Dates | Primary Metric | Result | Lift | Link | |---------|------|------|-------|----------------|--------|------|------| | 001 | Hero headline test | Homepage | 1/1-1/15 | CTR | Winner | 12% | [Link] | | 002 | Pricing table layout | Pricing | 1/10-1/31 | Plan selection | Loser | -5% | [Link] | | 003 | Signup form fields | Signup | 2/1-2/14 | Completion | Inconclusive | 2% | [Link] |注意示例中的语义Loser 条目-5%与 Inconclusive 条目2%同样值得记录。SKILL.md 强调Significant loser 测试往往揭示值得尝试的新角度因此台账不能只记赢家。每行 Link 应指向对应的完整结果文档使汇总表成为实验体系的索引层。快速测试简报模板降低低复杂度测试的文档负担并非所有测试都需要完整计划与结果文档。Quick Test Brief Template 专为简单测试设计六行结构浓缩了全部关键信息## [Test Name] **What**: [One sentence description] **Why**: [One sentence hypothesis] **Metric**: [Primary metric] **Duration**: [X weeks] **Result**: [TBD / Winner / Loser / Inconclusive] **Learnings**: [Key takeaway]它保留了完整模板中假设、主指标、时长、结果、学习的五个核心要素去掉了变体细节、分段分析等重量级章节。Result字段在测试期间保持 TBD测试结束后回填——这让简报模板既能用于实验前的快速立项也能在实验后转为一则浓缩记录是文档体系中的轻量级选项。利益相关者更新模板在运行期管理预期Stakeholder Update Template 解决测试运行期间如何向团队、管理层或客户同步状态的问题## A/B Test Update: [Name] **Status**: Running / Complete **Days remaining**: X (or complete) **Current sample**: X% of target ### Preliminary observations [What were seeing - without making decisions yet] ### Next steps [What happens next] ### Timeline - [Date]: Analysis complete - [Date]: Decision and recommendation - [Date]: Implementation (if winner)这个模板的设计与 SKILL.md 的运行纪律高度一致Preliminary observations明确标注只陈述所见、不下结论——这正是对窥视问题Peeking Problem的制度化防御。SKILL.md 指出在达到样本量前提前查看结果并停止测试会放大假阳性率在样本量达到前任何赢都可能是随机波动因此更新模板刻意把决策推迟到预定的分析日期。模板末尾的时间线把分析完成 → 决策建议 → 实施三个节点显式列出与测试计划中的Calendar hold for analysis date首尾呼应。实验优先级记分卡用加权评分决定先测什么当假设银行里积累了多个想法时Experiment Prioritization Scorecard 用加权评分给出可比较的排序依据FactorWeightTest ATest BTest CPotential impact30%Confidence in hypothesis25%Ease of implementation20%Risk if wrong15%Strategic alignment10%TotalScoring: 1-5 (5 best)这个记分卡与 SKILL.md 中的 ICE 评分Impact Confidence Ease 三项各 1-10 分求平均一脉相承记分卡把 Impact 拆解为潜在影响30%与战略契合10%把 Confidence 保留为假设信心25%把 Ease 保留为实施难易20%并额外加入错误风险15%维度。两者都指向同一个目标优先运行高影响、高信心、低成本、低风险的测试。SKILL.md 还建议每月按上下文变化重新评分Re-score monthly as context changes记分卡的 Weight 列正是为这种再评估设计的。假设银行模板让实验想法持续流入Hypothesis Bank Template 是实验体系的后备池持续收集来自数据、研究、竞品与反馈的测试想法| ID | Page/Area | Observation | Hypothesis | Potential Impact | Status | |----|-----------|-------------|------------|------------------|--------| | H1 | Homepage | Low scroll depth | Shorter hero will increase scroll | High | Testing | | H2 | Pricing | Users compare plans | Comparison table will help | Medium | Backlog | | H3 | Signup | Drop-off at email | Social login will increase completion | Medium | Backlog |观察Observation与假设Hypothesis两列的分开设计正是对 SKILL.md假设须基于推理或数据而非看看会发生什么原则的落实。Status 列Testing / Backlog与优先级记分卡联动Backlog 中的条目经记分卡排序后进入 Testing。SKILL.md 的假设生成来源表可作为填充此模板的输入清单来源关注什么Analytics流失点、低转化页面、表现不佳的分段Customer research痛点、困惑、未满足的预期Competitor analysis竞品有而你没有的功能、信息或 UX 模式Support tickets转化流程中反复出现的问题或投诉Heatmaps/recordings用户犹豫、rage-click 或放弃的位置Past experiments显著失败的测试常揭示值得尝试的新角度从实验结果中产生的下一轮测试想法结果文档 Learnings 部分也应回填此处形成循环。把模板嵌入持续增长实验体系单独的模板是表单连成流程就是增长引擎。SKILL.md 的 Experiment Loop 定义了这套体系如何自运转1. Generate hypotheses (from data, research, competitors, customer feedback) 2. Prioritize with ICE scoring 3. Design and run the test 4. Analyze results with statistical rigor 5. Promote winners to a playbook 6. Generate new hypotheses from learnings → Repeat模板在其中各司其职假设银行Hypothesis Bank承接第 1 步优先级记分卡承接第 2 步测试计划承接第 3 步结果文档承接第 4 步而第 5 步把赢家推广进手册则由 SKILL.md 提供的 Experiment Playbook 条目格式承接——该格式与结果文档字段对齐假设、样本量、结果含 95% CI 与 p 值、护栏指标结果、分段差异、成败原因、可复用模式、适用范围与状态。第 6 步产生的假设再次进入假设银行循环闭合。SKILL.md 还给出了衡量这套体系运转效率的指标可作为测试仓库条目模板的补充追踪项指标参考目标每月启动的实验数多数团队 4-8 个胜率成熟项目常见 20-30%持续更高可能意味着假设偏保守平均测试时长2-4 周假设银行深度排队 20 个假设累计提升所有赢家的复合收益在节奏上SKILL.md 建议每周用 30 分钟检查运行中实验的技术问题与护栏指标、每两周复盘已完成实验并启动下一个、每月用 1 小时复盘实验速度/胜率/累计提升并重新排优先级、每季度审计手册中哪些模式已规模化推广。常见错误清单模板的每一栏都是防线SKILL.md 的 Common Mistakes 章节总结了测试设计、执行与分析三个阶段的典型错误模板结构正是对这些错误的系统性防御设计阶段变更太小无法检出、一次测太多无法归因、没有明确假设——测试计划模板的 Test Design、Variants一次一件事与假设五句式分别对应。执行阶段提前停止、中途改变体、不核查实施——利益相关者更新模板的不下结论字段与 Pre-Launch Checklist 的跟踪验证项分别对应。分析阶段忽视置信区间、挑选分段、过度解读不显著结果——结果文档的主指标表含 95% CI、分段分析表与 Result 三态Winner/Loser/Inconclusive分别对应。配套参考样本量计算与技能协同样本量速查与时长估算测试计划中Sample size与Duration两个字段的取值依据在 sample-size-guide.md 中。其核心输入是基线转化率、最小可检测效应MDE、统计显著性通常 95%α0.05与统计功效通常 80%β0.20。速查表示例每变体样本量基线 5% 时检测 10% 提升需 72,000/变体检测 50% 提升仅需 3,100/变体基线 1% 时检测 10% 提升需 380,000/变体。多变体A/B/n还需按倍数放大3 变体约 1.5 倍、4 变体约 2 倍并考虑 Bonferroni 校正。时长估算公式为Duration (days) (Sample per variant × Number of variants) / (Daily traffic × % exposed)。例如需 10,000/变体、双变体、日流量 5,000、100% 曝光时时长为 20,000 / 5,000 4 天。即使样本量足够也建议至少运行满 1 个完整星期以覆盖一周内的日期差异B2B 需 2 个业务周期电商需覆盖月初月末的发薪日效应同时避免超过 4-8 周因为新颖性效应会消退、外部因素会介入。当样本量需求过高时可从放大 MDE、降置信度至 90%、削减变体、合并流量、向上游测试或放弃测试改用定性数据等选项中取舍。与其他技能的分工模板体系并非孤立运行。SKILL.md 的 Related Skills 明确了分工边界cro技能负责基于 CRO 原则生成测试想法cro/references/experiments.md 按页面类型列出了首页、定价页、Demo 请求页、落地页等数百条实验假设可直接填充假设银行analytics技能负责测试的埋点与测量对应测试计划中Primary metric defined and trackable与Tracking verifiedcopywriting技能负责创建变体文案对应 Variants 部分。技能评估用例 eval 6 也验证了这一分工当用户请求为落地页写测试文案时应识别这是文案任务而非测试搭建任务转而引用 copywriting 技能。结语test-templates.md提供的 7 个模板构成了一套完整且自洽的实验文档协议测试计划让假设可执行结果文档让结论有证据台账让历史可检索简报与更新模板降低流程负担记分卡与假设银行让实验管线持续供血。结合 SKILL.md 的方法论约束假设先行、单变量、统计严谨、分层指标与 sample-size-guide.md 的量化工具这套模板体系可以直接落地为团队或个人的 A/B 测试标准作业流程并随实验手册的积累逐步沉淀为专属的增长模式库。赞分享AI 技能人工智能【免费下载链接】marketingskillsMarketing skills for Claude Code and AI agents. CRO, copywriting, SEO, analytics, and growth engineering.项目地址https://gitcode.com/GitHub_Trending/mar/marketingskills点击查看免费下载相关推荐A/B 测试文档模板体系实战指南从实验计划、结果复盘到增长实验程序的全套可复用模板A/B 测试文档模板体系实战指南从实验计划、结果复盘到增长实验程序的全套可复用模板 导读 在 A/B 测试中实验的设计质量与文档化程度往往直接决定结论能否被AI 技能AI 插件agentic-awesome-skills A/B 测试技能实战指南从假设设计到增长实验体系agentic awesome skills A/B 测试技能实战指南从假设设计到增长实验体系 A/B 测试又称 split test、对照实验是产品增长AI 技能AI 插件A/B 测试样本量计算实战指南agentic-awesome-skills 中 ab-testing 技能的样本量估算与测试时长规划全解A/B 测试样本量计算实战指南agentic awesome skills 中 ab testing 技能的样本量估算与测试时长规划全解 本文是 agentiAI 技能AI 插件上一篇如何读懂 Weave Router 会话 pin 的3大高级状态overload 追踪、paired model 与 policy group 完全指南下一篇NodeMCU Firmware net 模块完全指南Lua 网络编程从 TCP 到 DNS 与 Ping创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考