Publicamos lo que medimos.
Orves se opera como un programa de medición: evaluaciones preregistradas, conjuntos gold versionados, revisión adversarial. Lo que sobrevive se hace público — como benchmarks, metodología y conjuntos de datos.
Por qué todo stack de IA acabará siendo verificable.
Los modelos están convergiendo. El diferenciador duradero no es el modelo — es lo que al modelo se le permite saber, y si alguien puede confiar en ello.
El conocimiento improvisado no sobrevive al contacto con la responsabilidad. El conocimiento ad-hoc no puede decir de dónde salió una respuesta, no puede reconstruirse después de una corrección y no puede entrar en una decisión regulada.
Así que el sustrato se reconstruye — una vez, bien hecho: representación verificable, identidad permanente, procedencia, determinismo, transformación verificable. Esa capa es lo que Orves construye como infraestructura.
Lo que ejecuta el programa de investigación.
| Línea | Qué mide | Estado |
|---|---|---|
| Benchmarks de parsing | orden de lectura, tablas, precisión del reconocimiento de texto, formularios, documentos largos — por familia de documentos | medido · interno |
| Determinismo | idas y vueltas a nivel de byte, fidelidad de reconstrucción | medido · interno |
| Fundamentación y abstención | afirmaciones trazables hasta la evidencia; negarse cuando la evidencia es insuficiente | medido · interno |
| Adquisición continua | embudo observación→actualización, rúbricas de admisión | medido · interno |
| Tabla pública de resultados y conjuntos de datos | resultados publicados, verificables de principio a fin | publicación pendiente |
| Artículos e informes técnicos | metodología, construcción de conjuntos gold, adjudicación | pronto |
Estados honestos actuales, dimensión por dimensión: Benchmarks →
Diseñado para que no podamos halagarnos.
Métricas preregistradas. Conjuntos gold versionados y corregibles. Abstención puntuada. Poder de detección probado por inyección deliberada de fallos. Cada número publicado lleva su n.