Publicamos o que medimos.
A Orves é operada como um programa de medição: avaliações pré-registradas, conjuntos gold versionados, revisão adversarial. O que sobrevive vira público — como benchmarks, metodologia e conjuntos de dados.
Por que todo stack de IA vai se tornar verificável.
Os modelos estão convergindo. O diferencial durável não é o modelo — é o que o modelo tem permissão de saber, e se alguém consegue confiar nisso.
Conhecimento improvisado não sobrevive ao contato com a responsabilidade. Conhecimento ad-hoc não consegue dizer de onde veio uma resposta, não pode ser reconstruído depois de uma correção e não entra numa decisão regulada.
Então o substrato é reconstruído — uma vez, direito: representação verificável, identidade permanente, procedência, determinismo, transformação verificável. Essa camada é o que a Orves constrói como infraestrutura.
O que o programa de pesquisa executa.
| Linha | O que mede | Status |
|---|---|---|
| Benchmarks de parsing | ordem de leitura, tabelas, precisão do reconhecimento de texto, formulários, documentos longos — por família de documentos | medido · interno |
| Determinismo | idas e voltas no nível do byte, fidelidade de reconstrução | medido · interno |
| Fundamentação e abstenção | afirmações rastreáveis até a evidência; recusar quando a evidência é insuficiente | medido · interno |
| Aquisição contínua | funil observação→atualização, rubricas de admissão | medido · interno |
| Placar público e conjuntos de dados | resultados publicados, verificáveis de ponta a ponta | publicação pendente |
| Artigos e relatórios técnicos | metodologia, construção de conjuntos gold, adjudicação | em breve |
Estados honestos atuais, dimensão por dimensão: Benchmarks →
Feito para que não possamos nos elogiar.
Métricas pré-registradas. Conjuntos gold versionados e corrigíveis. Abstenção pontuada. Poder de detecção provado por injeção deliberada de falhas. Todo número publicado carrega seu n.