张坤的博客

PDF 直接丢给 AI,到底划不划算?

PDF 直接上传会不会更费 Token,不能一刀切。要分开看处理量、产品额度和自己花的时间,还要看转文字有没有丢信息。

张坤7 分钟1 阅读
PDF 直接丢给 AI,到底划不划算?

也在公众号发布

微信公众号 张坤zkun 二维码

张坤zkun

扫码关注公众号,这篇也在那边。

阅读公众号原文 →

网上经常能看到一种经验说法:PDF 直接上传会消耗更多 Token,最好先转成文字。我刚看到时也觉得有道理,后来处理的文件多了,才发现这句话不能当成通用结论。

有些 PDF 只是装在固定格式里的纯文字,有些却靠表格、图表和版面传递信息。它们都叫 PDF,交给 AI 的方式却很难一刀切。

我现在算的是几笔分开的账:模型处理了多少内容,产品扣了什么额度,我实际付了多少钱,自己还花了多少时间。我还会看转换文件有没有丢信息。

01 Token、额度和费用,是三件事

Token 可以粗略理解成模型处理输入、生成回答时使用的一种计量单位。一段文字会被拆成许多小块,页面图像也可能按产品规则计入模型的处理量。

产品额度是另一回事。它可能限制文件大小、上传次数、存储空间、消息次数或使用频率。订阅套餐里看到的“剩余额度”,未必就是 Token。

实际费用还要再单独看。调用接口时,费用可能按输入、输出 Token 等项目计算;包月产品常见的是固定订阅费配合各种使用上限。模型处理量增加,有可能影响接口账单,也可能只让订阅用户更快碰到某项限制,不代表每上传一次 PDF 都会新增一笔费用。

PDF 视觉处理会不会增加输入量、增加多少,取决于模型、页面内容、产品入口和当时的计费规则。没有一个固定倍率适用于所有 PDF。真正在意成本时,我会去看正在使用的产品说明和账单页面,不拿网上的倍率替自己算账。

02 上传以后,AI 怎么读 PDF?

这个问题也没有统一流程。

不同产品、套餐和上传入口,可能提取 PDF 里的数字文本,也可能使用文字识别、页面视觉,或者把几种方式混在一起。同一家公司的聊天产品、项目文件和开发接口,处理方式也可能不同。

所以我不会再笼统地说“AI 会一页一页看 PDF”。上传前,我会确认当前入口是否支持 PDF 视觉、扫描件和内嵌图片,再看页数、文件大小等限制。官方说明没写清楚时,我只把处理方式当成未知条件。

视觉支持的意义,是页面里的图表和版面有机会进入上下文。它不承诺结果准确,模型仍可能看错数字、弄乱表格行列,或者漏掉小字号内容。

03 纯文字材料,可以先复制一小段试试

如果文件以连续文字为主,我的问题只涉及其中几段,复制相关内容通常能减少模型接收的无关文字。适用条件也要看清:粘贴后的阅读顺序正常,脚注、公式和页码关系不影响问题,答案也不依赖其他章节。

双栏论文、带大量脚注的资料,复制后很容易串行。长文拆分时,我会保留章节标题和页码,并检查段落顺序。先抽一两个有代表性的页面贴进纯文本编辑器,只是快速初筛。人眼还能读通,仍需结合任务判断要不要保留原 PDF。

04 表格和图表多,我更愿意保留页面

财务报告、调研报告和项目方案里,表格的行列关系、图例颜色、坐标位置都可能影响理解。直接抽取文字后,数字还在,数字之间的关系可能已经散了。

这种情况下,我倾向于使用明确支持 PDF 视觉的入口,或者只上传相关页面。这样做是为了保留更多上下文,准确性仍要另行检查。转换格式、清理文本、重新配图也会占用时间,这部分操作成本同样要算进去。

涉及报价、金额、合同条款、财务数据、医疗信息或正式决策时,我会让 AI 标出页码、表格行列和对应的原文短句,然后回到原页逐项核对。模型给出的定位也可能出错,只能帮助查找。影响较大的内容,还要交给律师、会计师、医生或组织内有权限的人确认。

05 扫描件,先抽查最容易出错的页面

扫描版 PDF 可能没有可选中的文字。产品怎样处理,要看它是否支持扫描件,以及是否使用文字识别、页面视觉或其他流程。清晰打印件、模糊复印件和手写材料的结果差别也会很大。

我会先选几类代表性页面:清晰的首页、最模糊的一页、带表格的一页、带手写批注的一页。测试时要求 AI 返回页码、表格行列和一小段原文,再逐字对照 PDF。抽查只能帮助判断风险,不能证明整份文件都读对了。

如果连续出现错字、错列或漏字,我会换文字识别工具、重新扫描,或者干脆人工处理。金额、日期、姓名和条款无论来自数字版还是扫描版,都要回原页核对。

06 上传之前,还有一笔隐私账

我会先确认自己有没有权利上传这份文件,也会检查公司制度和当前产品的数据政策。消费版、企业版和开发接口在数据使用、保留时间、训练设置与删除规则上可能不同。“不用于训练”也不代表文件完全不保存。

需要脱敏时,我只处理副本,并使用能永久删除内容的工具。页面上盖黑框不够,删除敏感页也不能说明剩余文件已经干净。隐藏文本或 OCR 文本层、批注、附件、表单脚本和元数据,都可能带出信息。

导出后,我会重新打开副本,尝试搜索和复制被删内容,再检查文档属性、批注与附件。上传范围尽量缩到完成任务所需的几页。上传授权、脱敏结果或平台规则有一项无法确认,我就不把文件交给在线服务。

现在遇到 PDF,我会先看问题是否依赖页面结构,再分别核对处理量、产品限制和付费方式。能用几段干净文字解决,就不传整份文件;表格、图表和版面影响理解时,我会保留相关页面,同时把人工核验留在流程里。

07 参考来源

张坤

张坤专注企业 AI Agent 落地的项目经理

我是张坤,专注企业 AI Agent 落地的项目经理。 这里沉淀 RAG、知识库、数据治理、Agent 项目从立项、落地交付到成本算账的一手实践,也坦诚记录项目失败与踩坑复盘。 少聊大模型纸面能力,聚焦 AI 在真实企业场景里如何落地、存活,真正产生业务价值。

PDF 直接丢给 AI,到底划不划算? · 张坤的博客