Medido antes de afirmado.
El benchmark no es marketing — es la forma en que se gobierna la plataforma. El mejor sistema medido es el que se publica, las debilidades se buscan a propósito y un número solo se publica después de sobrevivir a una evaluación preregistrada.
Estados honestos, no promesas vacías.
La mayoría de los números aquí siguen en publicación. En lugar de anunciar resultados internos, cada dimensión muestra su estado real — la misma disciplina que la plataforma aplica al conocimiento.
| Estado | Significado |
|---|---|
| publicado | sobrevivió a una evaluación preregistrada; número, n y matriz de confusión disponibles |
| medido · interno | medido contra conjuntos gold internos; publicación pendiente de validación externa |
| publicación pendiente | conjunto gold o evaluación en construcción |
| UNKNOWN · fail-closed | la capacidad se abstiene en producción en lugar de adivinar |
Parsing, dimensión por dimensión.
| Dimensión | Unidad | Estado | Notas |
|---|---|---|---|
| Orden de lectura | F1 vs gold | medido · interno | publicación tras evaluación preregistrada |
| Tablas | F1 de estructura | medido · interno | conjunto gold en expansión — n reportado con cada número |
| Precisión de reconocimiento de texto | CER / WER | medido · interno | medido por familia de documentos |
| Formularios | F1 de campo | publicación pendiente | conjunto gold en construcción |
| Documentos largos | fidelidad a partir de 60 páginas | publicación pendiente | bench de documentos largos en curso |
| Gráficos | gráfico a tabla | UNKNOWN · fail-closed | se abstiene en lugar de adivinar |
Cada producto es una superficie medida.
| Dimensión | Unidad | Estado | Notas |
|---|---|---|---|
| Audio | fidelidad de transcripción | medido · interno | adquisición → evidencia, certificada |
| Determinismo | reejecuciones idénticas | medido · interno | verificaciones de ida y vuelta a nivel de byte |
| Alineación de estructura | estructura de salida vs origen | publicación pendiente | medido contra gold |
| Recuperación | recall fundamentado | publicación pendiente | medido sobre conocimiento gobernado |
| Extracción de afirmaciones | precisión / recall | medido · interno | abstención contabilizada, nunca oculta |
| Fundamentación del razonamiento | respuestas trazables hasta las afirmaciones | medido · interno | incluye conjuntos adversariales |
| Latencia | p50 / p95 por unidad | publicación pendiente | por producto, por despliegue |
| Coste | por cada 1k unidades | publicación pendiente | publicado junto con las tarifas de créditos |
Diseñado para que no podamos halagarnos.
Todo proveedor gana su propio benchmark. El nuestro está construido para encontrar primero nuestras debilidades.
Preregistrado
Métricas, umbrales y conjuntos de datos se fijan antes de la ejecución. Nada de elegir la métrica después de ver el resultado.
Números con alcance
Sin puntuaciones desnudas: cada número publicado lleva su conjunto de datos y versión, tamaño de muestra (n), criterios de inclusión, los comparadores contra los que se midió, su fecha de ejecución y las limitaciones conocidas.
Gold independiente
Los conjuntos gold se mantienen independientes de los sistemas evaluados — nunca derivados del mismo proceso que produce los resultados puntuados.
El gold es corregible
Los conjuntos gold son artefactos científicos: versionados, adjudicados, corregidos mediante un proceso registrado — nunca editados en silencio.
La abstención se puntúa
UNKNOWN es un resultado medido. Un sistema que oculta sus abstenciones está optimizando lo que no debe.
Evaluación reproducible
La evaluación en sí es reproducible: mismos conjuntos de datos, mismas métricas, mismo protocolo — puedes reejecutar la comparación, no solo leer el resultado.
Remedido continuamente
Cada capacidad se vuelve a medir a medida que mejoran los métodos. El mejor resultado medido es el que se publica — y conserva su lugar solo mientras los números aguanten, incluidos los nuestros.
Detección probada
Las capas de evaluación se validan mediante inyección deliberada de fallos — probamos que el benchmark sabe detectar el fallo antes de confiar en su verde.
Método, no mecanismo
Lo que publicamos es la prueba, no la máquina. Conjuntos de datos, métricas y resultados son abiertos; la implementación que los consigue no forma parte de lo que auditas — el número sí.
Un benchmark que nunca se detiene.
Cada release se vuelve a medir contra el benchmark. Las regresiones las detecta el benchmark, no los clientes.
Los conjuntos gold crecen por anotación adjudicada. Los huecos de cobertura se registran como deuda, a la vista.
Resultados publicados con conjuntos de datos y metodología, verificables de principio a fin.