跳到主要内容

可测量、可版本化、可复现

证据足够强,能够检查;边界足够窄,值得信任。

LowToHi 为每项结果公开任务、模型、运行时、评估器与统计边界。目标不是营销表演,而是可证伪的进步。

Agentic holdout v1RAW 与 LowToHi · 同一模型 · 冻结 holdout
RAW1 / 30
LOWTOHI29 / 30

LowToHi 配对胜出 28 次 · p = 7.45e-09

Agentic holdout v2独立 20 任务 holdout · 无重试
RAW0 / 20
LOWTOHI10 / 20

LowToHi 配对胜出 10 次 · p = 0.001953125

N20 agentic programming冻结实验 · 温度 0.2 · 最大 4096
RAW3 / 20
LOWTOHI19 / 20

LowToHi 配对胜出 16 次 · p < 0.001

比较如何受到治理

同一供应商模型在 RAW 与 LowToHi 条件下接受冻结任务和评估器测试。

01

冻结任务集

输入、fixtures、隐藏测试与评估规则在实验前固定。

02

配对条件

RAW 与 LowToHi 使用相同底层模型和声明的生成设置。

03

保留证据

响应、结果、token、成本与 manifests 可用于离线验证。

04

主张默认关闭

缺失或无法验证的测量不会变成正面营销结论。

证据能够说明什么,不能说明什么

  • 支持运行时在指定 agentic 编程任务中的显著效果。
  • 不代表通用智能或所有领域的普遍优越。
  • 不意味着每个产品界面都已适合生产。
  • 没有消融实验时不能隔离每个内部机制。
  • 不会赋予模型或运行时任何运营权限。
CLAIM BOUNDARY

新类别应该建立在公开证据上,而不是形容词上。

LowToHi 把方法、负面结果和主张边界都视为产品的一部分。

低成本输入,高信任输出。

构建你的专业领域真正需要的智能。

探索产品、检查证据,了解 LowToHi 如何把可替换模型变成持久专业能力。