Research

我们公开我们测量过的东西。

Orves 是当作一个测量项目来运作的:预先登记的评估、版本化的金标准集、对抗性评审。活下来的东西才会公开 —— 以基准、方法与数据集的形式。

论点

为什么每一套 AI 技术栈最终都会变得可验证。

模型正在趋同。真正持久的差异不在模型 —— 而在模型被允许知道什么,以及有没有人能信得过它。

临时拼凑的知识经不起责任的考验。随手攒出来的知识说不清答案从哪来,出了问题修完也重建不起来,更进不了受监管的决策。

所以底座要被重建 —— 一次,做扎实:可验证的表示、恒定的身份、来源、确定性、可验证的变换。这一层,正是 Orves 作为基础设施在建造的东西。

项目

这个研究项目在跑什么。

方向测量什么状态
解析基准阅读顺序、表格、文字识别准确率、表单、长文档 —— 按文档族分别评估已测量 · 内部
确定性字节级往返、还原保真度已测量 · 内部
依据与弃答主张可追溯到证据;证据不足时选择拒答已测量 · 内部
持续采集观测→更新漏斗、准入评分表已测量 · 内部
公开排行榜与数据集公开的结果,端到端可验证等待公开
论文与技术报告方法、金标准集构建、裁定即将

当前的诚实状态,逐个维度:Benchmarks →

方法

刻意设计成让我们无法自夸。

预先登记的指标。版本化且可修正的金标准集。弃答参与评分。检出能力由刻意注入的故障来证明。每个公开的数字都带着它的 n。

构建知道每个答案从何而来的 AI 系统。

创建账户即获 15,000 免费额度,今天就能生成 API 密钥。ORIS 处于私有试点,VERI 与 MESH 将在发布时开放。