# GPT、Claude、Gemini 文档提取选型：样本与评分方法

> 用统一样本、证据规则和成本账本比较 GPT、Claude、Gemini 的文档提取能力，分开验证 PDF 接入、字段准确度和人工复核成本。

_发布 2026-09-29 · 更新 2026-09-29 · [KeepRouter Editorial](https://keeprouter.com/editorial-policy#editorial-team) · 5 分钟阅读_

![覆盖契约、证据、失败、安全与运维的 AI Gateway 评估表](https://keeprouter.com/editorial/blog/evaluate-ai-gateway.png)

_用相同证据与验收规则比较候选系统。示意图，不代表实测排名。_

文档提取选型，应测试业务实际处理的资料和字段。GPT、Claude、Gemini 是模型家族，不是三个固定准确率。有效比较必须记录具体型号、输入处理、端点、提示词和验收规则。

下面提供评估设计与原创虚构样本，不是实测榜单。它把“哪个模型最适合 PDF”变成可以执行的选型过程。

## 先比较输入链路

[OpenAI 文件输入文档](https://developers.openai.com/api/docs/guides/file-inputs)、[Claude PDF 文档](https://platform.claude.com/docs/en/build-with-claude/pdf-support)和 [Gemini 文档理解指南](https://ai.google.dev/gemini-api/docs/document-processing)分别说明了原生处理方式。格式和请求结构取决于 API 与型号，兼容文本生成接口不代表自动具备原生文件链路。

| 候选 | 先确认 | 随结果记录 |
| --- | --- | --- |
| 某条线路上的 GPT | 文件输入与视觉能力 | 端点、型号、输入形式 |
| 某条线路上的 Claude | PDF 能力及平台差异 | 型号、文档处理与选项 |
| 某条线路上的 Gemini | 文档、媒体设置与限制 | API 版本、型号、媒体形式 |

必要时拆成两个实验。纯文本实验先提取一次文字，所有模型收到同样文本；完整 PDF 实验把原文件交给各自支持的链路。前者主要比较后续字段判断，后者还包含文档读取差异，不能混成同一个分数。

扫描件、密集表格和图示尤其需要检查输入是否保留布局。文本转换可能丢掉区分单价与总价的位置关系；模型没有收到的值，不能依靠提示词可靠补回。

## 建立答案已知的样本

从团队能人工标注的小集合开始，包含清晰资料、缺失字段、干扰值与互相冲突的条款。保留一部分样本到最终评估，避免只针对开发样本调提示词。

可把下面的虚构内容制作成测试发票：

```text
Document: INV-DEMO-17
Supplier: North Example Studio
Currency: USD
Subtotal: 120.00
Tax: 5.40
Total due: 125.40
Payment terms: Net 30
Issue date: not provided
Footer: Previous invoice balance was 98.00; already paid.
```

正确结果应为总额 125.40、币种 USD、编号 INV-DEMO-17、开票日期 null。编造日期、取用上次已付余额 98.00，或者在缺少开票日期时推算到期日，都应判错。每个非空字段还应附原文行或页码依据。

再加入两个金额相近列的表格，以及后续补充协议修改原条款的合同。这些样本检验不同失败模式；清晰发票表现好，不等于布局与条款优先级也正确。

## 同时评字段与整份记录

合法 JSON 只证明语法。按[结构化输出指南](/zh/blog/structured-outputs-json-mode)区分 schema 与业务验证。可以统一无关空格，但不能把错误币种或丢失负号当成格式差异。

| 指标 | 本次评估的定义 |
| --- | --- |
| 字段准确率 | 正确字段数 / 全部要求字段 |
| 整份记录合格率 | 所有必要检查通过的文档 / 全部文档 |
| 无依据值比例 | 没有证据支持的返回值 / 全部返回值 |
| 人工复核率 | 需要人工处理的文档 / 全部文档 |
| 每份合格记录成本 | 全部相关尝试费用 / 合格记录 |

同时说明分母与缺失值规则。全部返回 null 的模型可能很少编造，却没有完成提取；全部填满的模型可能看似完整，实际捏造信息。两个方向都要检查。

## 加上实际运行费用

费用包括解析或 OCR、模型尝试、重试和人工时间。假设 A 处理 100 份文件花 2 美元，合格 80 份；B 花 3 美元，合格 95 份，则模型费用分别约为每份合格记录 0.025 和 0.0316 美元。这只是算例，不是模型成绩。

它本身不能决定胜负。如果未通过资料需要昂贵人工处理，B 的总体成本可能更低。应测量复核分钟数、错误严重程度，以及预计并发下的完成时间，而不是编造一个“信任价值”。

## 写清上线选择

在保留样本上，选择满足准确度与延迟要求的最低总成本候选。证据缺失或规则矛盾时进入复核，不能默默接受看似合理的结果。输出保留原文档引用，方便人员定位问题。

从[模型目录](/models)检查当前候选与支持的输入。如果线路只有文本能力，就先做相同文本实验，或者选择有文件能力文档的目标服务。接上传功能前核对 [API 参考](/api/docs)。短文本请求成功，只能证明初始接入，不能代替完整文档流程验收。

## 常见问题

### 哪个模型最适合从 PDF 提取字段？

本文没有未经测试的通用赢家。应在已标注文档上测试具体型号与输入链路，比较整份合格率、人工工作量和总成本。

### OpenAI 兼容是否代表支持原生 PDF？

不代表。文本端点兼容不能证明文件上传、解析或视觉能力，应先确认具体线路与型号。

### 发票提取只要 JSON 合法就能接受吗？

不能。还要验证 schema、数值、缺失字段与证据，格式正确的对象也可能有错误总额或编造日期。

## 参考的一手资料

_本文最近复核 2026-09-29_

1. [OpenAI file input behavior](https://developers.openai.com/api/docs/guides/file-inputs)
2. [Claude PDF support](https://platform.claude.com/docs/en/build-with-claude/pdf-support)
3. [Gemini document processing](https://ai.google.dev/gemini-api/docs/document-processing)

## 继续阅读

- [Structured Outputs 与 JSON Mode：如何验证真实数据](https://keeprouter.com/zh/blog/structured-outputs-json-mode.md)
- [推理 token 怎么计费：避免重复计算与短回答误判](https://keeprouter.com/zh/blog/reasoning-tokens-api-cost.md)
- [models](https://keeprouter.com/models.md)

## 找到适合任务的模型

选择服务或编写接入代码前，先确认型号可用性、输入类型与计价单位。

[比较模型与价格](https://keeprouter.com/models)

[创建 Key，测试免费模型](https://keeprouter.com/login?returnTo=%2Fconsole%2Fkeys%3Fmodel%3Dfree)

免费测试使用 free 模型；其他付费型号需要足够预付额度。

[全部文章](https://keeprouter.com/zh/blog.md) · [模型与价格](https://keeprouter.com/models.md)
