Benchmarks
先测量,再声明。
基准测试不是营销,而是这个平台的治理方式。测量结果最好的系统才会交付,弱点是被刻意找出来的,数字只有通过预先登记的评估之后才会公开。
预先登记的指标
版本化的金标准集
始终标注 n
弃答也计入
诚实的状态,而不是空头承诺。
这里的多数数字仍在公开流程中。我们不宣传内部结果,而是让每个维度显示它真实的状态 —— 这与平台对待知识的纪律是同一套。
| 状态 | 含义 |
|---|---|
| 已公开 | 通过了预先登记的评估;数字、n 与混淆矩阵均可查看 |
| 已测量 · 内部 | 已用内部金标准集测量;等待外部验证后公开 |
| 等待公开 | 金标准集或评估正在构建中 |
| UNKNOWN · fail-closed | 该能力在生产中选择弃答,而不是猜测 |
逐个维度地看解析。
| 维度 | 单位 | 状态 | 备注 |
|---|---|---|---|
| 阅读顺序 | F1 对比金标准 | 已测量 · 内部 | 预先登记评估之后公开 |
| 表格 | 结构 F1 | 已测量 · 内部 | 金标准集正在扩充 —— 每个数字都标注 n |
| 文字识别准确率 | CER / WER | 已测量 · 内部 | 按文档族分别测量 |
| 表单 | 字段 F1 | 等待公开 | 金标准集构建中 |
| 长文档 | 60 页以上的保真度 | 等待公开 | 长文档基准进行中 |
| 图表 | 图表转表格 | UNKNOWN · fail-closed | 选择弃答,而不是猜测 |
每一个产品都是被测量的面。
| 维度 | 单位 | 状态 | 备注 |
|---|---|---|---|
| 音频 | 转写保真度 | 已测量 · 内部 | 采集 → 证据,已认证 |
| 确定性 | 完全一致的重跑 | 已测量 · 内部 | 字节级往返校验 |
| 结构对齐 | 输出结构对比原始结构 | 等待公开 | 对照金标准测量 |
| 检索 | 有据可依的召回 | 等待公开 | 在受治理的知识上测量 |
| 主张抽取 | 精确率 / 召回率 | 已测量 · 内部 | 弃答计入统计,从不隐藏 |
| 推理的依据 | 回答可追溯到主张 | 已测量 · 内部 | 包含对抗性数据集 |
| 延迟 | 每单位 p50 / p95 | 等待公开 | 按产品、按部署 |
| 成本 | 每 1,000 单位 | 等待公开 | 与额度单价一同公开 |
刻意设计成让我们无法自夸。
每家厂商都会在自己的基准上取胜。我们的基准是为了先找出自己的弱点而造的。
预先登记
指标、阈值与数据集在运行之前就已确定。绝不事后挑选指标。
带适用范围的数字
没有孤零零的分数:每个公开的数字都附带它的数据集与版本、样本量(n)、纳入标准、比较对象、运行日期以及已知局限。
独立的金标准
金标准集与被测系统保持独立 —— 绝不会从产生被评分结果的同一流程中派生。
金标准可被修正
金标准集是科学产物:版本化、经过裁定、通过有记录的流程修正 —— 绝不悄悄改动。
弃答也参与评分
UNKNOWN 是一个被测量出来的结果。隐藏弃答的系统,优化的是错误的东西。
可复现的评估
评估本身是可复现的:同样的数据集、同样的指标、同样的流程 —— 你可以重跑这次比较,而不只是读一个分数。
持续重新测量
方法一有改进,每项能力都会被重新测量。测量结果最好的才会交付 —— 而且只有在数字站得住时才保住位置,包括我们自己的。
检出能力已被证明
评估层通过刻意注入故障来验证 —— 在相信它的绿灯之前,我们先证明基准确实能抓到失败。
公开方法,而非机器
我们公开的是证据,不是机器。数据集、指标与结果都是开放的;实现这些结果的具体实现不在你审计的范围内 —— 数字才是。
一个不会停下的基准。
持续进行
新的产品版本 → 自动重新测量
每一次发布都会重新对照基准测量。发现回归的是基准,而不是客户。
持续进行
新的金标准数据 → 更广的覆盖
金标准集通过经裁定的标注增长。覆盖缺口会作为债务被公开跟踪。
即将推出
公开排行榜
公开的结果,附带数据集与方法,端到端可验证。