Research
我们公开我们测量过的东西。
Orves 是当作一个测量项目来运作的:预先登记的评估、版本化的金标准集、对抗性评审。活下来的东西才会公开 —— 以基准、方法与数据集的形式。
为什么每一套 AI 技术栈最终都会变得可验证。
模型正在趋同。真正持久的差异不在模型 —— 而在模型被允许知道什么,以及有没有人能信得过它。
临时拼凑的知识经不起责任的考验。随手攒出来的知识说不清答案从哪来,出了问题修完也重建不起来,更进不了受监管的决策。
所以底座要被重建 —— 一次,做扎实:可验证的表示、恒定的身份、来源、确定性、可验证的变换。这一层,正是 Orves 作为基础设施在建造的东西。
这个研究项目在跑什么。
| 方向 | 测量什么 | 状态 |
|---|---|---|
| 解析基准 | 阅读顺序、表格、文字识别准确率、表单、长文档 —— 按文档族分别评估 | 已测量 · 内部 |
| 确定性 | 字节级往返、还原保真度 | 已测量 · 内部 |
| 依据与弃答 | 主张可追溯到证据;证据不足时选择拒答 | 已测量 · 内部 |
| 持续采集 | 观测→更新漏斗、准入评分表 | 已测量 · 内部 |
| 公开排行榜与数据集 | 公开的结果,端到端可验证 | 等待公开 |
| 论文与技术报告 | 方法、金标准集构建、裁定 | 即将 |
当前的诚实状态,逐个维度:Benchmarks →
刻意设计成让我们无法自夸。
预先登记的指标。版本化且可修正的金标准集。弃答参与评分。检出能力由刻意注入的故障来证明。每个公开的数字都带着它的 n。