跳转到正文
报告库
用途分类 / 其他用途

Ab Testing Skill 安全审计

作者说它能做什么(原文)

When the user wants to plan, design, or implement an A/B test or experiment, or build a growth experimentation program. Also use when the user mentions "A/B test," "split test," "experiment," "test this change," "variant copy," "multivariate test," "hypothesis," "should I test this," "which version is better," "test two versions," "statistical significance," "how long should I run this test," "gro

第三方安全检查结论

发现安全风险

已检查文件
4
发现的风险
2
会不会运行危险命令?检查是否下载程序后直接运行、让他人远程控制电脑,或藏起要运行的命令。未发现风险
会不会泄露文件和密钥?检查是否发送含密码或密钥的文件,以及代码里是否直接写了密钥。未发现风险
会不会删除文件或一直在后台运行?检查是否大范围删除文件、改写磁盘,或设置自动启动。未发现风险
会不会绕过安全保护?检查是否跳过网站安全验证、开放过多文件权限,或取消操作前的确认。未发现风险
会不会误导 AI 或隐藏内容?检查工作说明是否要求 AI 忽略你的指令、干扰检查结果,或夹带看不见的文字。未发现风险
会不会偷偷改推广链接或收款方?检查是否强制替换推广链接或收款对象,同时要求隐瞒更改。发现 2 项风险
中风险

相互矛盾的样本量和时长指引可能使实验过早结束

原文依据:6 处
发现了什么

主文档与详细参考对相同基线和提升幅度给出明显不同的每组样本量。例如,1% 基线、10% 提升分别是 15 万和 38 万。参考文件随后给出包含变体数量的时长公式,但快速决策框架又把“每组样本”直接除以页面总流量,通常会漏掉两组分流因素。

为什么需要注意

采用较小数值或简化时长公式时,实验可能严重欠功效或提前结束,导致把随机波动当成输赢,并据此上线影响转化率或收入的版本。

该风险有原文支持。主文档称在 1% 基线、检测 10% 相对提升时每个变体需 15 万样本,而详细参考称需 38 万,可能令用户按不足样本作决策。参考中的完整时长公式会乘以变体数,但快速框架却把“每变体样本”直接除以页面日流量;若该流量是分给所有变体的总流量,标准双变体测试的预计时长会少算约一半。实际要求取决于统计检验及流量定义,用户应要求作者统一假设、计算方法和单位,并用经过验证的计算器复核。

SKILL.md:83来自说明文档打开原文件
| Baseline | 10% Lift | 20% Lift | 50% Lift ||----------|----------|----------|----------|| 1% | 150k/variant | 39k/variant | 6k/variant || 3% | 47k/variant | 12k/variant | 2k/variant || 5% | 27k/variant | 7k/variant | 1.2k/variant || 10% | 12k/variant | 3k/variant | 550/variant |
查看另外 5 个位置
references/sample-size-guide.md:44来自说明文档打开原文件
| Lift to Detect | Sample per Variant | Total Sample ||----------------|-------------------|--------------|| 5% (1% → 1.05%) | 1,500,000 | 3,000,000 || 10% (1% → 1.1%) | 380,000 | 760,000 || 20% (1% → 1.2%) | 97,000 | 194,000 || 50% (1% → 1.5%) | 16,000 | 32,000 || 100% (1% → 2%) | 4,200 | 8,400 |
references/sample-size-guide.md:98来自说明文档打开原文件
```Duration (days) = (Sample per variant × Number of variants) / (Daily traffic × % exposed)```
references/sample-size-guide.md:252来自说明文档打开原文件
```Daily traffic to page: _____Baseline conversion rate: _____MDE I care about: _____Sample needed per variant: _____ (from tables above)Days to run: Sample / Daily traffic = _____If days > 60: Consider alternativesIf days > 30: Acceptable for high-impact testsIf days < 14: Likely feasible
references/sample-size-guide.md:99来自说明文档打开原文件
```Duration (days) = (Sample per variant × Number of variants) / (Daily traffic × % exposed)```
references/sample-size-guide.md:256来自说明文档打开原文件
Sample needed per variant: _____ (from tables above)Days to run: Sample / Daily traffic = _____
中风险

对 p 值的错误解释可能让用户高估实验结论的确定性

原文依据:2 处
发现了什么

Skill 把 p<0.05 解释为“结果由随机造成的概率低于 5%”。p 值实际表示:在零假设及模型假设成立时,观察到当前或更极端数据的概率;它不是零假设为真或结果随机的概率。

为什么需要注意

用户可能把临界显著性当作约 95% 的获胜概率,忽略先验、实验设计、重复检验和效应区间,从而过度自信地上线或撤销商业变更。

该风险有原文支持,而且错误解释在主文档和参考中重复出现。p 值不是“结果由随机造成的概率”,也不表示结论有 95% 的正确概率;它是在零假设及模型假设成立时,取得当前或更极端数据的概率。用户若按这里的表述决定上线,可能高估证据强度。可要求作者改成条件化定义,并同时报告效应量、置信区间、预定样本量和检验假设。

SKILL.md:195来自说明文档打开原文件
### Statistical Significance- 95% confidence = p-value < 0.05- Means <5% chance result is random- Not a guarantee—just a threshold
查看另外 1 个位置
references/sample-size-guide.md:34来自说明文档打开原文件
**Statistical significance (95%)**: Means there's less than 5% chance the observed difference is due to random chance.**Statistical power (80%)**: Means if there's a real effect of size MDE, you have 80% chance of detecting it.

Skill 逻辑拆解

8 个说明模块

该 Skill 是一套纯文档式 A/B 测试指导,目标是设计具有统计有效性和可执行结果的实验;提供的材料中没有脚本、安装命令或发送数据的指令。

查看原文
SKILL.md:8来自说明文档打开原文件
# A/B Test SetupYou are an expert in experimentation and A/B testing. Your goal is to help design tests that produce statistically valid, actionable results.

运行时会先读取项目中若干约定名称的产品营销文件,并用其中内容减少后续提问。这会让 Skill 接触基线转化率、商业约束等内部信息,但可见指令没有要求对外披露。

查看原文
SKILL.md:14来自说明文档打开原文件
**Check for product marketing context first:**If `.agents/product-marketing.md` exists (or `.claude/product-marketing.md`, or the legacy `product-marketing-context.md` filename, in older setups), read it before asking questions. Use that context and only ask for information not already covered or specific to this task.

指导要求预先确定样本量、避免因中途查看结果而提前停止,并监控防护指标;这些控制意在降低误判和用户伤害。

查看原文
SKILL.md:36来自说明文档打开原文件
### 3. Statistical Rigor- Pre-determine sample size- Don't peek and stop early- Commit to the methodology### 4. Measure What Matters- Primary metric tied to business value- Secondary metrics for context- Guardrail metrics to prevent harm
从这里开始 · 工作说明SKILL.md
ab-testing
连线表示工作说明包含的模块,不是实际运行顺序。点击模块可查看原文。 另有 8 个章节,可在原文件中查看。

文件引用关系图

2 处引用
哪些文件发起引用引用了什么
连线表示真实的文件引用,不是运行顺序。点击节点可高亮相关连线,并查看具体文件和原文位置。虚线表示还有文件需要定位。
文件与检查记录4 个文件

检查范围与遗漏

逐文件查看涉及的内容

下方列出本次涉及的原文范围;纳入检查不代表已查清所有问题。

  • SKILL.md已纳入全文
  • references/sample-size-guide.md已纳入全文
  • references/test-templates.md已纳入全文
  • evals/evals.json已纳入全文

这份报告只针对上方版本。我们看了拿到的代码和说明文件,没有实际运行 Skill,也没有检查它另外安装的软件包。因此,这不是“保证安全”的承诺;换了版本或使用环境,结果也可能不同。

  • SKILL.md工作说明
  • evals/evals.json配套文件
  • references/sample-size-guide.md配套文件
  • references/test-templates.md配套文件

代码和说明中提到的操作

连接外部网站
SKILL.md:91来自说明文档打开原文件
**Calculators:**- [Evan Miller's](https://www.evanmiller.org/ab-testing/sample-size.html)- [Optimizely's](https://www.optimizely.com/sample-size-calculator/)
SKILL.md:92来自说明文档打开原文件
- [Evan Miller's](https://www.evanmiller.org/ab-testing/sample-size.html)- [Optimizely's](https://www.optimizely.com/sample-size-calculator/)
references/sample-size-guide.md:144来自说明文档打开原文件
**Evan Miller's Calculator**https://www.evanmiller.org/ab-testing/sample-size.html- Simple interface
读取了多少行
1,002
文件校验值(用于核对版本)
b49103561db657b6ef2fa393a563506ff99670c92e1863e87e430352e83359c9