Benchmarks

Medido antes de afirmado.

El benchmark no es marketing — es la forma en que se gobierna la plataforma. El mejor sistema medido es el que se publica, las debilidades se buscan a propósito y un número solo se publica después de sobrevivir a una evaluación preregistrada.

métricas preregistradas conjuntos gold versionados n siempre reportado abstención contabilizada
Cómo leer esta página

Estados honestos, no promesas vacías.

La mayoría de los números aquí siguen en publicación. En lugar de anunciar resultados internos, cada dimensión muestra su estado real — la misma disciplina que la plataforma aplica al conocimiento.

EstadoSignificado
publicadosobrevivió a una evaluación preregistrada; número, n y matriz de confusión disponibles
medido · internomedido contra conjuntos gold internos; publicación pendiente de validación externa
publicación pendienteconjunto gold o evaluación en construcción
UNKNOWN · fail-closedla capacidad se abstiene en producción en lugar de adivinar
Parsing de documentos

Parsing, dimensión por dimensión.

DimensiónUnidadEstadoNotas
Orden de lecturaF1 vs goldmedido · internopublicación tras evaluación preregistrada
TablasF1 de estructuramedido · internoconjunto gold en expansión — n reportado con cada número
Precisión de reconocimiento de textoCER / WERmedido · internomedido por familia de documentos
FormulariosF1 de campopublicación pendienteconjunto gold en construcción
Documentos largosfidelidad a partir de 60 páginaspublicación pendientebench de documentos largos en curso
Gráficosgráfico a tablaUNKNOWN · fail-closedse abstiene en lugar de adivinar
Más allá del parsing

Cada producto es una superficie medida.

DimensiónUnidadEstadoNotas
Audiofidelidad de transcripciónmedido · internoadquisición → evidencia, certificada
Determinismoreejecuciones idénticasmedido · internoverificaciones de ida y vuelta a nivel de byte
Alineación de estructuraestructura de salida vs origenpublicación pendientemedido contra gold
Recuperaciónrecall fundamentadopublicación pendientemedido sobre conocimiento gobernado
Extracción de afirmacionesprecisión / recallmedido · internoabstención contabilizada, nunca oculta
Fundamentación del razonamientorespuestas trazables hasta las afirmacionesmedido · internoincluye conjuntos adversariales
Latenciap50 / p95 por unidadpublicación pendientepor producto, por despliegue
Costepor cada 1k unidadespublicación pendientepublicado junto con las tarifas de créditos
Método

Diseñado para que no podamos halagarnos.

Todo proveedor gana su propio benchmark. El nuestro está construido para encontrar primero nuestras debilidades.

Preregistrado

Métricas, umbrales y conjuntos de datos se fijan antes de la ejecución. Nada de elegir la métrica después de ver el resultado.

Números con alcance

Sin puntuaciones desnudas: cada número publicado lleva su conjunto de datos y versión, tamaño de muestra (n), criterios de inclusión, los comparadores contra los que se midió, su fecha de ejecución y las limitaciones conocidas.

Gold independiente

Los conjuntos gold se mantienen independientes de los sistemas evaluados — nunca derivados del mismo proceso que produce los resultados puntuados.

El gold es corregible

Los conjuntos gold son artefactos científicos: versionados, adjudicados, corregidos mediante un proceso registrado — nunca editados en silencio.

La abstención se puntúa

UNKNOWN es un resultado medido. Un sistema que oculta sus abstenciones está optimizando lo que no debe.

Evaluación reproducible

La evaluación en sí es reproducible: mismos conjuntos de datos, mismas métricas, mismo protocolo — puedes reejecutar la comparación, no solo leer el resultado.

Remedido continuamente

Cada capacidad se vuelve a medir a medida que mejoran los métodos. El mejor resultado medido es el que se publica — y conserva su lugar solo mientras los números aguanten, incluidos los nuestros.

Detección probada

Las capas de evaluación se validan mediante inyección deliberada de fallos — probamos que el benchmark sabe detectar el fallo antes de confiar en su verde.

Método, no mecanismo

Lo que publicamos es la prueba, no la máquina. Conjuntos de datos, métricas y resultados son abiertos; la implementación que los consigue no forma parte de lo que auditas — el número sí.

Continuidad

Un benchmark que nunca se detiene.

continuo
Nueva versión de producto → remedición automática

Cada release se vuelve a medir contra el benchmark. Las regresiones las detecta el benchmark, no los clientes.

continuo
Nuevos datos gold → mayor cobertura

Los conjuntos gold crecen por anotación adjudicada. Los huecos de cobertura se registran como deuda, a la vista.

próximamente
Tabla pública de resultados

Resultados publicados con conjuntos de datos y metodología, verificables de principio a fin.

Construye sistemas de IA que saben de dónde vino cada respuesta.

Cree su cuenta con 15.000 créditos gratuitos y genere sus claves de API hoy. ORIS está en piloto privado; VERI y MESH abren en el lanzamiento.