Benchmarks

Mesuré avant d'être affirmé.

Le benchmark n'est pas du marketing — c'est la façon dont la plateforme est gouvernée. Le meilleur système mesuré est celui qui est livré, les faiblesses sont traquées volontairement, et un chiffre n'est publié qu'après avoir survécu à une évaluation préenregistrée.

métriques préenregistrées jeux gold versionnés n toujours indiqué abstention comptabilisée
Comment lire cette page

Des états honnêtes, pas des promesses vides.

La plupart des chiffres ici sont encore en cours de publication. Plutôt que d'annoncer des résultats internes, chaque dimension affiche son état réel — la même discipline que la plateforme applique au savoir.

ÉtatSignification
publiéa survécu à une évaluation préenregistrée ; chiffre, n et matrice de confusion disponibles
mesuré · internemesuré sur des jeux gold internes ; publication en attente de validation externe
publication en attentejeu gold ou évaluation en construction
UNKNOWN · fail-closedla capacité s'abstient en production plutôt que de deviner
Analyse de documents

L'analyse, dimension par dimension.

DimensionUnitéStatutNotes
Ordre de lectureF1 vs goldmesuré · internepublication après évaluation préenregistrée
TableauxF1 de structuremesuré · internejeu gold en expansion — n indiqué avec chaque chiffre
Précision de reconnaissance du texteCER / WERmesuré · internemesuré par famille de documents
FormulairesF1 de champpublication en attentejeu gold en construction
Documents longsfidélité au-delà de 60 pagespublication en attentebench documents longs en cours
Graphiquesgraphique vers tableauUNKNOWN · fail-closeds'abstient plutôt que de deviner
Au-delà de l'analyse

Chaque produit est une surface mesurée.

DimensionUnitéStatutNotes
Audiofidélité de transcriptionmesuré · interneacquisition → preuve, certifiée
Déterminismeréexécutions identiquesmesuré · internevérifications aller-retour au niveau de l'octet
Alignement de structurestructure de sortie vs sourcepublication en attentemesuré face au gold
Rechercherappel fondépublication en attentemesuré sur du savoir gouverné
Extraction d'assertionsprécision / rappelmesuré · interneabstention comptabilisée, jamais masquée
Ancrage du raisonnementréponses traçables jusqu'aux assertionsmesuré · internejeux adversariaux inclus
Latencep50 / p95 par unitépublication en attentepar produit, par déploiement
Coûtpour 1 k unitéspublication en attentepublié avec les tarifs de crédits
Méthode

Conçu pour que nous ne puissions pas nous flatter.

Chaque fournisseur gagne son propre benchmark. Le nôtre est construit pour trouver nos faiblesses en premier.

Préenregistré

Métriques, seuils et jeux de données sont fixés avant l'exécution. Pas de choix de métrique après coup.

Chiffres avec périmètre

Aucun score nu : chaque chiffre publié porte son jeu de données et sa version, la taille d'échantillon (n), les critères d'inclusion, les comparateurs face auxquels il a été mesuré, sa date d'exécution et les limites connues.

Gold indépendant

Les jeux gold sont tenus indépendants des systèmes évalués — jamais issus du processus qui produit les résultats notés.

Le gold est corrigible

Les jeux gold sont des artefacts scientifiques : versionnés, arbitrés, corrigés par un processus enregistré — jamais modifiés en silence.

L'abstention est notée

UNKNOWN est un résultat mesuré. Un système qui cache ses abstentions optimise la mauvaise chose.

Évaluation reproductible

L'évaluation elle-même est reproductible : mêmes jeux de données, mêmes métriques, même protocole — vous pouvez relancer la comparaison, pas seulement lire le score.

Remesuré en continu

Chaque capacité est remesurée à mesure que les méthodes progressent. Le meilleur résultat mesuré est livré — et ne garde sa place que tant que les chiffres tiennent, les nôtres compris.

Détection prouvée

Les couches d'évaluation sont validées par injection délibérée de fautes — nous prouvons que le benchmark sait détecter l'échec avant de faire confiance à son vert.

Méthode, pas mécanisme

Ce que nous publions, c'est la preuve, pas la machine. Jeux de données, métriques et résultats sont ouverts ; l'implémentation qui les atteint ne fait pas partie de ce que vous auditez — le chiffre, si.

Continuité

Un benchmark qui ne s'arrête jamais.

continu
Nouvelle version produit → remesure automatique

Chaque livraison est remesurée face au benchmark. Les régressions sont détectées par le benchmark, pas par les clients.

continu
Nouvelles données gold → couverture élargie

Les jeux gold grandissent par annotation arbitrée. Les manques de couverture sont suivis comme une dette, visiblement.

à venir
Classement public

Des résultats publiés avec jeux de données et méthodologie, vérifiables de bout en bout.

Construisez des systèmes d'IA qui savent d'où vient chaque réponse.

Créez votre compte avec 15 000 crédits offerts et générez vos clés d'API dès aujourd'hui. ORIS est en pilote privé ; VERI et MESH ouvrent au lancement.