Benchmarks

Gemessen, bevor behauptet.

Der Benchmark ist kein Marketing — er ist die Art, wie die Plattform geführt wird. Das bestmessende System geht live, Schwächen werden absichtlich gesucht, und eine Zahl wird erst veröffentlicht, wenn sie eine vorab registrierte Auswertung übersteht.

vorab registrierte Metriken versionierte Gold-Sets n immer angegeben Enthaltung gezählt
Diese Seite lesen

Ehrliche Zustände, keine leeren Versprechen.

Die meisten Zahlen hier sind noch in Veröffentlichung. Statt interne Ergebnisse zu bewerben, zeigt jede Dimension ihren tatsächlichen Zustand — dieselbe Disziplin, die die Plattform auf Wissen anwendet.

ZustandBedeutung
veröffentlichthat eine vorab registrierte Auswertung überstanden; Zahl, n und Konfusionsmatrix verfügbar
gemessen · interngegen interne Gold-Sets gemessen; Veröffentlichung wartet auf externe Validierung
Veröffentlichung ausstehendGold-Set oder Auswertung im Aufbau
UNKNOWN · fail-closeddie Fähigkeit enthält sich im Betrieb, statt zu raten
Dokumenten-Parsing

Parsing, Dimension für Dimension.

DimensionEinheitStatusAnmerkungen
LesereihenfolgeF1 vs. Goldgemessen · internVeröffentlichung nach vorab registrierter Auswertung
TabellenStruktur-F1gemessen · internGold-Set wächst — n wird zu jeder Zahl angegeben
Genauigkeit der TexterkennungCER / WERgemessen · internje Dokumentfamilie gemessen
FormulareFeld-F1Veröffentlichung ausstehendGold-Set im Aufbau
Lange DokumenteTreue ab 60 SeitenVeröffentlichung ausstehendBench für lange Dokumente läuft
DiagrammeDiagramm zu TabelleUNKNOWN · fail-closedenthält sich, statt zu raten
Jenseits des Parsings

Jedes Produkt ist eine gemessene Fläche.

DimensionEinheitStatusAnmerkungen
AudioTranskriptionstreuegemessen · internErfassung → Beleg, zertifiziert
Determinismusidentische Wiederholungsläufegemessen · internHin-und-zurück-Prüfungen auf Byte-Ebene
StrukturabgleichAusgabe- vs. QuellstrukturVeröffentlichung ausstehendgegen Gold gemessen
Retrievalbelegter RecallVeröffentlichung ausstehendan geregeltem Wissen gemessen
Aussagen-ExtraktionPrecision / Recallgemessen · internEnthaltung gezählt, nie verborgen
Verankerung der SchlussfolgerungAntworten bis zu den Aussagen rückverfolgbargemessen · internadversariale Sets inbegriffen
Latenzp50 / p95 je EinheitVeröffentlichung ausstehendje Produkt, je Deployment
Kostenje 1.000 EinheitenVeröffentlichung ausstehendmit den Kredit-Tarifen veröffentlicht
Methode

So gebaut, dass wir uns nicht selbst schmeicheln können.

Jeder Anbieter gewinnt seinen eigenen Benchmark. Unserer ist gebaut, um zuerst unsere Schwächen zu finden.

Vorab registriert

Metriken, Schwellen und Datensätze werden vor dem Lauf festgelegt. Kein nachträgliches Aussuchen der Metrik.

Zahlen mit Geltungsbereich

Keine nackten Werte: Jede veröffentlichte Zahl trägt ihren Datensatz und dessen Version, die Stichprobengröße (n), die Einschlusskriterien, die Vergleichssysteme, das Laufdatum und die bekannten Grenzen.

Unabhängiges Gold

Gold-Sets werden unabhängig von den geprüften Systemen gehalten — nie aus demselben Prozess abgeleitet, der die bewerteten Ergebnisse erzeugt.

Gold ist korrigierbar

Gold-Sets sind wissenschaftliche Artefakte: versioniert, entschieden, über einen dokumentierten Prozess korrigiert — nie still verändert.

Enthaltung wird bewertet

UNKNOWN ist ein gemessenes Ergebnis. Ein System, das seine Enthaltungen versteckt, optimiert das Falsche.

Reproduzierbare Auswertung

Die Auswertung selbst ist reproduzierbar: dieselben Datensätze, dieselben Metriken, dasselbe Protokoll — Sie können den Vergleich erneut fahren, nicht nur den Wert lesen.

Laufend neu gemessen

Jede Fähigkeit wird neu gemessen, sobald die Methoden besser werden. Das bestgemessene Ergebnis geht live — und behält seinen Platz nur, solange die Zahlen halten, auch unsere.

Erkennung bewiesen

Auswertungsschichten werden durch gezielte Fehlerinjektion validiert — wir beweisen, dass der Benchmark ein Versagen erkennt, bevor wir seinem Grün trauen.

Methode, nicht Mechanik

Wir veröffentlichen den Beweis, nicht die Maschine. Datensätze, Metriken und Ergebnisse sind offen; die Implementierung, die sie erreicht, gehört nicht zu dem, was Sie prüfen — die Zahl schon.

Kontinuität

Ein Benchmark, der nie aufhört.

laufend
Neue Produktversion → automatische Neumessung

Jedes Release wird erneut gegen den Benchmark gemessen. Regressionen findet der Benchmark, nicht die Kundschaft.

laufend
Neue Gold-Daten → breitere Abdeckung

Gold-Sets wachsen durch entschiedene Annotation. Abdeckungslücken werden sichtbar als Schuld geführt.

in Kürze
Öffentliches Ranking

Veröffentlichte Ergebnisse mit Datensätzen und Methodik, durchgängig überprüfbar.

Bauen Sie KI-Systeme, die wissen, woher jede Antwort kommt.

Erstellen Sie Ihr Konto mit 15.000 Gratis-Credits und generieren Sie noch heute Ihre API-Schlüssel. ORIS ist im privaten Pilotbetrieb; VERI und MESH öffnen zum Start.