接入引擎 · parse · 试点
非结构化进去,结构化数据出来。
Orves ORIS 通过一次经过认证的 API 调用,把复杂文档变成结构化、与来源相连的数据。设计上就是异步的:提交文档、轮询任务、取回结果。这是一个可独立使用的 API,目前处于私有试点;它是第一层,不是终点。
PDF · 试点中异步任务保住结构可复现
POST /v1/oris
# submit a document (multipart) POST /v1/oris file=@contract_2024.pdf # 202 Accepted { "id": "prs_9f2c41…", "object": "oris", "status": "queued" } # poll until completed GET /v1/oriss/prs_9f2c41… { "status": "completed", "result": { "json_url": "…/result" } }
AI 系统开始说谎的地方,就是解析。
多数解析器把文档压成一串文本。结构、几何、表格与来源,在任何模型看到内容之前就被毁掉了 —— 之后的任何环节都补不回解析丢失的东西。
被压平的表格丢失的阅读顺序掉队的脚注没有来源片段无声的读取错误
通常的结果文档→「一长串文本」→LLM→语气笃定,内容出错
用 ORIS 的话文档→产物 + 片段→LLM→有依据,可核对
要结构,不要一锅粥。
结构化输出
- 标题
- 表格
- 阅读顺序
试点今天返回的:把文档的结构保留为干净的 Markdown。
异步任务
- 任务 ID
- 轮询
- 幂等性
提交时返回 202,轮询任务,取回结果。失败的解析从不计费。
设计上就与来源相连
- 来源
- 版本化
- 路线图
输出始终与产生它的文档绑定。带类型的元素、坐标与证书是已公开的方向 —— 只有在交付时才会宣布。
从输入,到受治理的输出。
PDF 进入→ORIS→任务→结果→结构化输出
一个响应,正是 API 返回的样子。
左边:页面。右边:你收到的东西 —— 把文档的结构保留为干净、结构化的 Markdown。
GET /v1/oriss/{id}/result
# 200 OK { "markdown": "# Q2 Report\n\n## Revenue by segment\n\n| Segment | Q2 |\n| --- | --- |\n| Cloud | 104.2 |\n| Devices | 61.8 |\n\nRenewal is scheduled for…" }
来自线上试点契约的响应。带几何与坐标的类型化结构单元是已公开的方向 —— 交付时才会宣布,绝不提前。
先测量,再声明。
我们测量的:阅读顺序、表格结构、文字准确率、表单字段与长文档保真度 —— 以及图表,在图表上解析会选择弃答而不是猜测。
公开结果只在预先登记的评估之后发布 —— 在那之前,本站不会出现任何数字。我们如何做基准测试 →
这是一种性质,不是一个产品
每一个产物都可验证。
认证贯穿 Orves 产出的一切。验证被设计成公开、可复现,并且不依赖 Orves 账户。
API 优先
几分钟完成集成。
一切都通过托管 API 提供 —— 无需再部署额外的基础设施。
REST APIPythonTypeScriptGoJavaOpenAPI示例