Benchmarks

先测量,再声明。

基准测试不是营销,而是这个平台的治理方式。测量结果最好的系统才会交付,弱点是被刻意找出来的,数字只有通过预先登记的评估之后才会公开。

预先登记的指标 版本化的金标准集 始终标注 n 弃答也计入
如何读这一页

诚实的状态,而不是空头承诺。

这里的多数数字仍在公开流程中。我们不宣传内部结果,而是让每个维度显示它真实的状态 —— 这与平台对待知识的纪律是同一套。

状态含义
已公开通过了预先登记的评估;数字、n 与混淆矩阵均可查看
已测量 · 内部已用内部金标准集测量;等待外部验证后公开
等待公开金标准集或评估正在构建中
UNKNOWN · fail-closed该能力在生产中选择弃答,而不是猜测
文档解析

逐个维度地看解析。

维度单位状态备注
阅读顺序F1 对比金标准已测量 · 内部预先登记评估之后公开
表格结构 F1已测量 · 内部金标准集正在扩充 —— 每个数字都标注 n
文字识别准确率CER / WER已测量 · 内部按文档族分别测量
表单字段 F1等待公开金标准集构建中
长文档60 页以上的保真度等待公开长文档基准进行中
图表图表转表格UNKNOWN · fail-closed选择弃答,而不是猜测
解析之外

每一个产品都是被测量的面。

维度单位状态备注
音频转写保真度已测量 · 内部采集 → 证据,已认证
确定性完全一致的重跑已测量 · 内部字节级往返校验
结构对齐输出结构对比原始结构等待公开对照金标准测量
检索有据可依的召回等待公开在受治理的知识上测量
主张抽取精确率 / 召回率已测量 · 内部弃答计入统计,从不隐藏
推理的依据回答可追溯到主张已测量 · 内部包含对抗性数据集
延迟每单位 p50 / p95等待公开按产品、按部署
成本每 1,000 单位等待公开与额度单价一同公开
方法

刻意设计成让我们无法自夸。

每家厂商都会在自己的基准上取胜。我们的基准是为了先找出自己的弱点而造的。

预先登记

指标、阈值与数据集在运行之前就已确定。绝不事后挑选指标。

带适用范围的数字

没有孤零零的分数:每个公开的数字都附带它的数据集与版本、样本量(n)、纳入标准、比较对象、运行日期以及已知局限。

独立的金标准

金标准集与被测系统保持独立 —— 绝不会从产生被评分结果的同一流程中派生。

金标准可被修正

金标准集是科学产物:版本化、经过裁定、通过有记录的流程修正 —— 绝不悄悄改动。

弃答也参与评分

UNKNOWN 是一个被测量出来的结果。隐藏弃答的系统,优化的是错误的东西。

可复现的评估

评估本身是可复现的:同样的数据集、同样的指标、同样的流程 —— 你可以重跑这次比较,而不只是读一个分数。

持续重新测量

方法一有改进,每项能力都会被重新测量。测量结果最好的才会交付 —— 而且只有在数字站得住时才保住位置,包括我们自己的。

检出能力已被证明

评估层通过刻意注入故障来验证 —— 在相信它的绿灯之前,我们先证明基准确实能抓到失败。

公开方法,而非机器

我们公开的是证据,不是机器。数据集、指标与结果都是开放的;实现这些结果的具体实现不在你审计的范围内 —— 数字才是。

连续性

一个不会停下的基准。

持续进行
新的产品版本 → 自动重新测量

每一次发布都会重新对照基准测量。发现回归的是基准,而不是客户。

持续进行
新的金标准数据 → 更广的覆盖

金标准集通过经裁定的标注增长。覆盖缺口会作为债务被公开跟踪。

即将推出
公开排行榜

公开的结果,附带数据集与方法,端到端可验证。

构建知道每个答案从何而来的 AI 系统。

创建账户即获 15,000 免费额度,今天就能生成 API 密钥。ORIS 处于私有试点,VERI 与 MESH 将在发布时开放。