Research

測定したものを公開します。

Orves は測定プログラムとして運営されています。事前登録された評価、バージョン管理されたゴールドセット、敵対的レビュー。生き残ったものが — ベンチマーク、手法、データセットとして — 公開されます。

命題

なぜあらゆる AI スタックが検証可能になるのか。

モデルは収束しつつあります。持続する差別化要因はモデルではありません — モデルが何を知ることを許されているか、そしてそれを誰かが信頼できるかどうかです。

その場しのぎの知識は、責任との接触に耐えません。場当たり的な知識は、答えがどこから来たのかを言えず、修正のあとに再構築できず、規制された判断に入ることもできません。

だから土台を作り直します — 一度、きちんと。検証可能な表現、恒久的な同一性、来歴、決定性、検証可能な変換。その層こそ、Orves がインフラとして構築しているものです。

プログラム

研究プログラムが動かしているもの。

領域測定する対象ステータス
パースのベンチマーク読み順、表、テキスト認識の精度、フォーム、長文文書 — 文書ファミリーごとに測定済み · 社内
決定性バイト単位の往復、再構成の忠実度測定済み · 社内
根拠づけと棄権主張を証跡までたどれること。証跡が足りないときは拒むこと測定済み · 社内
継続的な取得観測→更新のファネル、受け入れ基準表測定済み · 社内
公開リーダーボードとデータセット公開された結果、端から端まで検証可能公開保留
論文と技術レポート手法、ゴールドセットの構築、裁定近日

現在の正直な状態を、次元ごとに: Benchmarks →

手法

自画自賛できないように設計しています。

事前登録された指標。バージョン管理され訂正可能なゴールドセット。棄権も採点。意図的な障害注入で実証された検知力。公開されるすべての数値が n を伴います。

すべての回答の出どころが分かる AI システムを構築しましょう。

15,000 の無料クレジット付きでアカウントを作成し、今日から API キーを発行できます。ORIS はプライベートパイロット中、VERI と MESH はローンチ時に開きます。