Benchmarks

Medido antes de afirmado.

O benchmark não é marketing — é como a plataforma é governada. O melhor sistema medido é o que vai ao ar, as fraquezas são caçadas de propósito e um número só é publicado depois de sobreviver a uma avaliação pré-registrada.

métricas pré-registradas conjuntos gold versionados n sempre reportado abstenção contabilizada
Como ler esta página

Estados honestos, não promessas vazias.

A maioria dos números aqui ainda está em publicação. Em vez de anunciar resultados internos, cada dimensão mostra seu estado real — a mesma disciplina que a plataforma aplica ao conhecimento.

EstadoSignificado
publicadosobreviveu a uma avaliação pré-registrada; número, n e matriz de confusão disponíveis
medido · internomedido contra conjuntos gold internos; publicação pendente de validação externa
publicação pendenteconjunto gold ou avaliação em construção
UNKNOWN · fail-closeda capacidade se abstém em produção em vez de chutar
Parsing de documentos

Parsing, dimensão por dimensão.

DimensãoUnidadeStatusNotas
Ordem de leituraF1 vs goldmedido · internopublicação após avaliação pré-registrada
TabelasF1 de estruturamedido · internoconjunto gold em expansão — n reportado com cada número
Precisão do reconhecimento de textoCER / WERmedido · internomedido por família de documentos
FormuláriosF1 de campopublicação pendenteconjunto gold em construção
Documentos longosfidelidade a partir de 60 páginaspublicação pendentebench de documentos longos em andamento
Gráficosgráfico para tabelaUNKNOWN · fail-closedse abstém em vez de chutar
Além do parsing

Todo produto é uma superfície medida.

DimensãoUnidadeStatusNotas
Áudiofidelidade de transcriçãomedido · internoaquisição → evidência, certificada
Determinismoreexecuções idênticasmedido · internoverificações de ida e volta no nível do byte
Alinhamento de estruturaestrutura da saída vs da origempublicação pendentemedido contra gold
Recuperaçãorecall fundamentadopublicação pendentemedido sobre conhecimento governado
Extração de afirmaçõesprecisão / recallmedido · internoabstenção contabilizada, nunca escondida
Fundamentação do raciocíniorespostas rastreáveis até as afirmaçõesmedido · internoinclui conjuntos adversariais
Latênciap50 / p95 por unidadepublicação pendentepor produto, por implantação
Custopor 1k unidadespublicação pendentepublicado junto com as tarifas de créditos
Método

Feito para que não possamos nos elogiar.

Todo fornecedor vence o próprio benchmark. O nosso é construído para achar as nossas fraquezas primeiro.

Pré-registrado

Métricas, limiares e conjuntos de dados são fixados antes da execução. Nada de escolher a métrica depois de ver o resultado.

Números com escopo

Sem notas nuas: todo número publicado carrega seu conjunto de dados e versão, tamanho de amostra (n), critérios de inclusão, os comparadores contra os quais foi medido, a data da execução e as limitações conhecidas.

Gold independente

Os conjuntos gold são mantidos independentes dos sistemas avaliados — nunca derivados do mesmo processo que produz os resultados sendo pontuados.

O gold é corrigível

Conjuntos gold são artefatos científicos: versionados, adjudicados, corrigidos por um processo registrado — nunca editados em silêncio.

A abstenção é pontuada

UNKNOWN é um resultado medido. Um sistema que esconde suas abstenções está otimizando a coisa errada.

Avaliação reproduzível

A própria avaliação é reproduzível: mesmos conjuntos de dados, mesmas métricas, mesmo protocolo — você pode reexecutar a comparação, não apenas ler o resultado.

Remedido continuamente

Toda capacidade é medida de novo conforme os métodos melhoram. O melhor resultado medido é o que vai ao ar — e só mantém seu lugar enquanto os números se sustentarem, inclusive os nossos.

Detecção provada

As camadas de avaliação são validadas por injeção deliberada de falhas — provamos que o benchmark consegue pegar a falha antes de confiar no verde dele.

Método, não mecanismo

O que publicamos é a prova, não a máquina. Conjuntos de dados, métricas e resultados são abertos; a implementação que os alcança não faz parte do que você audita — o número faz.

Continuidade

Um benchmark que nunca para.

contínuo
Nova versão de produto → remedição automática

Cada release é medido de novo contra o benchmark. As regressões são pegas pelo benchmark, não pelos clientes.

contínuo
Novos dados gold → cobertura maior

Os conjuntos gold crescem por anotação adjudicada. Lacunas de cobertura são registradas como dívida, à vista.

em breve
Placar público

Resultados publicados com conjuntos de dados e metodologia, verificáveis de ponta a ponta.

Construa sistemas de IA que sabem de onde veio cada resposta.

Crie sua conta com 15.000 créditos gratuitos e gere suas chaves de API hoje. O ORIS está em piloto privado; VERI e MESH abrem no lançamento.