Agentic holdout v1RAW 与 LowToHi · 同一模型 · 冻结 holdout
RAW1 / 30
LOWTOHI29 / 30
LowToHi 配对胜出 28 次 · p = 7.45e-09
可测量、可版本化、可复现
LowToHi 为每项结果公开任务、模型、运行时、评估器与统计边界。目标不是营销表演,而是可证伪的进步。
LowToHi 配对胜出 28 次 · p = 7.45e-09
LowToHi 配对胜出 10 次 · p = 0.001953125
LowToHi 配对胜出 16 次 · p < 0.001
同一供应商模型在 RAW 与 LowToHi 条件下接受冻结任务和评估器测试。
输入、fixtures、隐藏测试与评估规则在实验前固定。
RAW 与 LowToHi 使用相同底层模型和声明的生成设置。
响应、结果、token、成本与 manifests 可用于离线验证。
缺失或无法验证的测量不会变成正面营销结论。
LowToHi 把方法、负面结果和主张边界都视为产品的一部分。