Research
測定したものを公開します。
Orves は測定プログラムとして運営されています。事前登録された評価、バージョン管理されたゴールドセット、敵対的レビュー。生き残ったものが — ベンチマーク、手法、データセットとして — 公開されます。
なぜあらゆる AI スタックが検証可能になるのか。
モデルは収束しつつあります。持続する差別化要因はモデルではありません — モデルが何を知ることを許されているか、そしてそれを誰かが信頼できるかどうかです。
その場しのぎの知識は、責任との接触に耐えません。場当たり的な知識は、答えがどこから来たのかを言えず、修正のあとに再構築できず、規制された判断に入ることもできません。
だから土台を作り直します — 一度、きちんと。検証可能な表現、恒久的な同一性、来歴、決定性、検証可能な変換。その層こそ、Orves がインフラとして構築しているものです。
研究プログラムが動かしているもの。
| 領域 | 測定する対象 | ステータス |
|---|---|---|
| パースのベンチマーク | 読み順、表、テキスト認識の精度、フォーム、長文文書 — 文書ファミリーごとに | 測定済み · 社内 |
| 決定性 | バイト単位の往復、再構成の忠実度 | 測定済み · 社内 |
| 根拠づけと棄権 | 主張を証跡までたどれること。証跡が足りないときは拒むこと | 測定済み · 社内 |
| 継続的な取得 | 観測→更新のファネル、受け入れ基準表 | 測定済み · 社内 |
| 公開リーダーボードとデータセット | 公開された結果、端から端まで検証可能 | 公開保留 |
| 論文と技術レポート | 手法、ゴールドセットの構築、裁定 | 近日 |
現在の正直な状態を、次元ごとに: Benchmarks →
自画自賛できないように設計しています。
事前登録された指標。バージョン管理され訂正可能なゴールドセット。棄権も採点。意図的な障害注入で実証された検知力。公開されるすべての数値が n を伴います。