Gemessen, bevor behauptet.
Der Benchmark ist kein Marketing — er ist die Art, wie die Plattform geführt wird. Das bestmessende System geht live, Schwächen werden absichtlich gesucht, und eine Zahl wird erst veröffentlicht, wenn sie eine vorab registrierte Auswertung übersteht.
Ehrliche Zustände, keine leeren Versprechen.
Die meisten Zahlen hier sind noch in Veröffentlichung. Statt interne Ergebnisse zu bewerben, zeigt jede Dimension ihren tatsächlichen Zustand — dieselbe Disziplin, die die Plattform auf Wissen anwendet.
| Zustand | Bedeutung |
|---|---|
| veröffentlicht | hat eine vorab registrierte Auswertung überstanden; Zahl, n und Konfusionsmatrix verfügbar |
| gemessen · intern | gegen interne Gold-Sets gemessen; Veröffentlichung wartet auf externe Validierung |
| Veröffentlichung ausstehend | Gold-Set oder Auswertung im Aufbau |
| UNKNOWN · fail-closed | die Fähigkeit enthält sich im Betrieb, statt zu raten |
Parsing, Dimension für Dimension.
| Dimension | Einheit | Status | Anmerkungen |
|---|---|---|---|
| Lesereihenfolge | F1 vs. Gold | gemessen · intern | Veröffentlichung nach vorab registrierter Auswertung |
| Tabellen | Struktur-F1 | gemessen · intern | Gold-Set wächst — n wird zu jeder Zahl angegeben |
| Genauigkeit der Texterkennung | CER / WER | gemessen · intern | je Dokumentfamilie gemessen |
| Formulare | Feld-F1 | Veröffentlichung ausstehend | Gold-Set im Aufbau |
| Lange Dokumente | Treue ab 60 Seiten | Veröffentlichung ausstehend | Bench für lange Dokumente läuft |
| Diagramme | Diagramm zu Tabelle | UNKNOWN · fail-closed | enthält sich, statt zu raten |
Jedes Produkt ist eine gemessene Fläche.
| Dimension | Einheit | Status | Anmerkungen |
|---|---|---|---|
| Audio | Transkriptionstreue | gemessen · intern | Erfassung → Beleg, zertifiziert |
| Determinismus | identische Wiederholungsläufe | gemessen · intern | Hin-und-zurück-Prüfungen auf Byte-Ebene |
| Strukturabgleich | Ausgabe- vs. Quellstruktur | Veröffentlichung ausstehend | gegen Gold gemessen |
| Retrieval | belegter Recall | Veröffentlichung ausstehend | an geregeltem Wissen gemessen |
| Aussagen-Extraktion | Precision / Recall | gemessen · intern | Enthaltung gezählt, nie verborgen |
| Verankerung der Schlussfolgerung | Antworten bis zu den Aussagen rückverfolgbar | gemessen · intern | adversariale Sets inbegriffen |
| Latenz | p50 / p95 je Einheit | Veröffentlichung ausstehend | je Produkt, je Deployment |
| Kosten | je 1.000 Einheiten | Veröffentlichung ausstehend | mit den Kredit-Tarifen veröffentlicht |
So gebaut, dass wir uns nicht selbst schmeicheln können.
Jeder Anbieter gewinnt seinen eigenen Benchmark. Unserer ist gebaut, um zuerst unsere Schwächen zu finden.
Vorab registriert
Metriken, Schwellen und Datensätze werden vor dem Lauf festgelegt. Kein nachträgliches Aussuchen der Metrik.
Zahlen mit Geltungsbereich
Keine nackten Werte: Jede veröffentlichte Zahl trägt ihren Datensatz und dessen Version, die Stichprobengröße (n), die Einschlusskriterien, die Vergleichssysteme, das Laufdatum und die bekannten Grenzen.
Unabhängiges Gold
Gold-Sets werden unabhängig von den geprüften Systemen gehalten — nie aus demselben Prozess abgeleitet, der die bewerteten Ergebnisse erzeugt.
Gold ist korrigierbar
Gold-Sets sind wissenschaftliche Artefakte: versioniert, entschieden, über einen dokumentierten Prozess korrigiert — nie still verändert.
Enthaltung wird bewertet
UNKNOWN ist ein gemessenes Ergebnis. Ein System, das seine Enthaltungen versteckt, optimiert das Falsche.
Reproduzierbare Auswertung
Die Auswertung selbst ist reproduzierbar: dieselben Datensätze, dieselben Metriken, dasselbe Protokoll — Sie können den Vergleich erneut fahren, nicht nur den Wert lesen.
Laufend neu gemessen
Jede Fähigkeit wird neu gemessen, sobald die Methoden besser werden. Das bestgemessene Ergebnis geht live — und behält seinen Platz nur, solange die Zahlen halten, auch unsere.
Erkennung bewiesen
Auswertungsschichten werden durch gezielte Fehlerinjektion validiert — wir beweisen, dass der Benchmark ein Versagen erkennt, bevor wir seinem Grün trauen.
Methode, nicht Mechanik
Wir veröffentlichen den Beweis, nicht die Maschine. Datensätze, Metriken und Ergebnisse sind offen; die Implementierung, die sie erreicht, gehört nicht zu dem, was Sie prüfen — die Zahl schon.
Ein Benchmark, der nie aufhört.
Jedes Release wird erneut gegen den Benchmark gemessen. Regressionen findet der Benchmark, nicht die Kundschaft.
Gold-Sets wachsen durch entschiedene Annotation. Abdeckungslücken werden sichtbar als Schuld geführt.
Veröffentlichte Ergebnisse mit Datensätzen und Methodik, durchgängig überprüfbar.