Wir veröffentlichen, was wir messen.
Orves wird als Messprogramm geführt: vorab registrierte Auswertungen, versionierte Gold-Sets, adversariale Begutachtung. Was übersteht, wird öffentlich — als Benchmarks, Methodik und Datensätze.
Warum jeder KI-Stack überprüfbar werden wird.
Die Modelle konvergieren. Das dauerhafte Unterscheidungsmerkmal ist nicht das Modell — es ist, was das Modell wissen darf, und ob irgendjemand dem trauen kann.
Improvisiertes Wissen übersteht die Berührung mit Verantwortung nicht. Ad-hoc-Wissen kann nicht sagen, woher eine Antwort kam, kann nach einer Korrektur nicht neu aufgebaut werden und kann in keine regulierte Entscheidung eingehen.
Also wird das Substrat neu gebaut — einmal, richtig: überprüfbare Repräsentation, dauerhafte Identität, Provenienz, Determinismus, überprüfbare Transformation. Diese Schicht ist das, was Orves als Infrastruktur baut.
Was das Forschungsprogramm betreibt.
| Linie | Was sie misst | Status |
|---|---|---|
| Parsing-Benchmarks | Lesereihenfolge, Tabellen, Genauigkeit der Texterkennung, Formulare, lange Dokumente — je Dokumentfamilie | gemessen · intern |
| Determinismus | Hin-und-zurück auf Byte-Ebene, Rekonstruktionstreue | gemessen · intern |
| Verankerung und Enthaltung | Aussagen bis zum Beleg nachvollziehbar; Verweigerung, wenn der Beleg nicht reicht | gemessen · intern |
| Laufende Erfassung | Trichter Beobachtung→Aktualisierung, Aufnahmeraster | gemessen · intern |
| Öffentliches Ranking und Datensätze | veröffentlichte Ergebnisse, durchgängig überprüfbar | Veröffentlichung ausstehend |
| Aufsätze und technische Berichte | Methodik, Aufbau der Gold-Sets, Entscheidung | bald |
Aktuelle ehrliche Zustände, Dimension für Dimension: Benchmarks →
So gebaut, dass wir uns nicht selbst schmeicheln können.
Vorab registrierte Metriken. Versionierte, korrigierbare Gold-Sets. Enthaltung wird bewertet. Erkennungsstärke durch gezielte Fehlerinjektion bewiesen. Jede veröffentlichte Zahl trägt ihr n.