Research
측정한 것을 공개합니다.
Orves는 측정 프로그램으로 운영됩니다. 사전 등록된 평가, 버전 관리된 골드셋, 적대적 검토. 살아남은 것이 — 벤치마크, 방법론, 데이터셋으로 — 공개됩니다.
왜 모든 AI 스택이 검증 가능해질 것인가.
모델은 수렴하고 있습니다. 오래가는 차별점은 모델이 아닙니다 — 모델이 무엇을 알도록 허용되는가, 그리고 그것을 누군가 믿을 수 있는가입니다.
즉석에서 만든 지식은 책임과의 접촉을 견디지 못합니다. 임시방편의 지식은 답이 어디서 왔는지 말하지 못하고, 수정 뒤에 다시 세울 수 없으며, 규제된 결정에 들어갈 수도 없습니다.
그래서 토대를 다시 만듭니다 — 한 번, 제대로. 검증 가능한 표현, 영구적인 동일성, 출처, 결정성, 검증 가능한 변환. 그 계층이 바로 Orves가 인프라로 만드는 것입니다.
연구 프로그램이 돌리는 것.
| 영역 | 측정 대상 | 상태 |
|---|---|---|
| 파싱 벤치마크 | 읽기 순서, 표, 텍스트 인식 정확도, 양식, 장문 문서 — 문서 계열별로 | 측정됨 · 내부 |
| 결정성 | 바이트 단위 왕복, 재구성 충실도 | 측정됨 · 내부 |
| 근거 연결과 기권 | 주장을 증거까지 추적할 수 있을 것. 증거가 부족하면 거부할 것 | 측정됨 · 내부 |
| 지속적 수집 | 관측→갱신 퍼널, 수용 기준표 | 측정됨 · 내부 |
| 공개 리더보드와 데이터셋 | 공개된 결과, 처음부터 끝까지 검증 가능 | 공개 대기 |
| 논문과 기술 보고서 | 방법론, 골드셋 구축, 심의 | 곧 |
현재의 정직한 상태를, 차원별로: Benchmarks →
스스로를 치켜세울 수 없도록 설계했습니다.
사전 등록된 지표. 버전 관리되고 교정 가능한 골드셋. 기권도 채점. 의도적인 결함 주입으로 입증된 탐지력. 공개되는 모든 수치가 n을 지닙니다.