张坤的博客

甲方想把一堆历史合同交给 AI 分析,这事难的真不是识别文字

张坤10 分钟4 阅读
甲方想把一堆历史合同交给 AI 分析,这事难的真不是识别文字

也在公众号发布

微信公众号 张坤zkun 二维码

张坤zkun

扫码关注公众号,这篇也在那边。

大家好,我是张坤

前阵子接了个需求,客户是做建筑的,手里有很多年积累下来的合同。

他一上来讲得很直接:这些合同不能一直躺在文件夹里,能不能让 AI 统一分析一下。最好以后新项目来了,系统先帮着看一遍,把关键条款、潜在风险、历史上踩过的坑,先捞出来。

这话听着很顺。

现在大家对 AI 的直觉也差不多都是这样:合同喂进去,条款抽出来,风险做标注,再和历史项目一对比,一套分析报告不就出来了吗?

但这类项目真做下去,你很快就会发现, 最难的地方根本不是 OCR,也不是 PDF 解析,更不是模型能不能把字段抽出来。

真正难的是,你表面上在分析合同,实际上是在逼着一家建筑公司把过去很多年分散在人脑子里、项目里、聊天记录里、合同细节里的判断经验,第一次系统化地整理出来。

这事一旦看偏,后面越做越容易变成一个看起来很忙、实际上没那么好用的系统。

建筑行业合同AI分析场景图

建筑行业合同AI分析场景图

01 一、很多项目一开始就做偏了

这类需求最容易掉进去的地方,就是一上来把注意力全放在“提取”上。

比如合同金额怎么抽,付款节点怎么识别,工期、违约责任、质保期限、发包方、项目类型这些字段怎么结构化。再往下就是文件格式兼容,扫描件识别,表格抽取,多版本合同对齐。

这些当然都要做,而且还得做好。

但问题是,你把这些都做完,也不代表这个系统就真的有用。

因为业务真正在意的,往往不是一份合同里有没有“合同金额”这几个字,也不是付款条款有没有被完整抽出来。真正让他们皱眉的,通常是另一类东西。

比如这类条款看着正常,但后面执行起来特别容易扯皮。比如这个甲方过往合同风格一直偏强势,很多责任会习惯性往乙方压。再比如有些项目金额不小,可付款条件很差,账期一拖,项目团队会非常难受。

这些东西,业务人员平时当然知道一点。

可你真让他在项目第一天就把所有关键判断维度列成一张清单,他大概率也列不完整。因为很多经验本来就不是写在制度里的,而是散在过去做过的项目里,谁踩过坑,谁心里有数。

所以这类项目真正难的, 不是“模型能不能抽字段”,而是“你到底希望系统替你看出什么”。

这个问题如果没先想明白,最后就很容易出现一种很常见的情况:系统抽出来的信息很多,页面看着也很满,但真到新合同需要分析的时候,业务最关心的那几个点,它还是抓不住。

说白了,这不是一个单纯的合同解析项目。

它更像是在借着 AI,把企业过去 零零散散的合同经验,一点一点翻出来、理清楚、沉淀下来。

02 二、你以为在抽字段,其实是在找判断依据

后来我对这类项目的理解慢慢变了。

它不是先有一份很完整的字段表,然后模型照着提就完事。现实里更常见的情况是,最开始大家只能说出一部分明确字段,比如合同总价、付款比例、开工时间、结算方式,这些相对清楚。

可真正影响判断的,往往恰恰不是这些最显眼的字段。

很多风险信号,是藏在合同细节里的,而且不一定长得很标准。

有的是一段补充协议里的措辞,有的是责任边界写得模糊,有的是付款条件看着不夸张,但组合起来就意味着后期回款压力很大。还有一些内容,单拿出来看没什么问题,可一旦和同类项目历史放在一起,就会发现它明显不太对劲。

所以这类项目比较靠谱的做法,通常都不是一把梭。

更像是先抽一轮,再看一轮;先让模型把能识别的东西尽量提出来,再让业务去看哪些真的有价值,哪些只是噪音;然后把确认过的重要维度补进模板里,继续往下做。

这个过程本质上不是“让 AI 自动分析合同”。

而是“让 AI 帮你把过去模糊的经验慢慢整理成结构”。

这一点不接受,项目就很容易急。

总想第一版就做得很全,总想系统一上来就特别聪明。可这种事偏偏不是靠堆模型能力就能解决的,它一定是边做边收敛。

合同经验沉淀迭代流程图

合同经验沉淀迭代流程图

03 三、模型最大的问题,不是看不懂,而是太会顺着你说

还有一个坑,几乎每个项目都会碰到。

就是模型太会“接话”了。

合同这种文本本来就很适合它发挥。句子完整,语气正式,逻辑上看起来还都说得过去。于是模型特别容易顺着上下文,把一句偏原则的话总结成一个更明确的判断。

你第一次看,经常会觉得它说得还挺像那么回事。

但回头一对原文,就会发现有些内容其实是它自己补出来的。

这件事如果只是用来辅助阅读,还只是烦一点。可如果你准备把这些结果沉淀成历史数据,后面还要拿来做比对、做统计、做判断,那问题就大了。

因为一旦底层数据开始掺进模型的脑补,后面所有分析都会跟着失真。

所以这种场景里,我一直觉得有条线不能退。

模型可以帮忙整理,但不能无依据地下结论。

它说某个付款节点有风险,就得能回到原文里,指出是哪一段、哪一句。它说某条违约责任明显偏向某一方,也得让人能顺着看到对应条款。

只有这样,后面的人工复核才有抓手,业务判断也才有底。

不然系统看起来是在提效, 实际上是在批量制造一种“好像很专业”的错觉。

模型结论与原文依据对比图

模型结论与原文依据对比图

04 四、真正有用的系统,都不是拿来替你拍板的

做着做着,很多甲方都会有一个很自然的期待。

既然历史合同能分析,历史项目也能比对,那系统最后能不能直接告诉我,这合同能不能签,这项目值不值得做?

坦白说, 这就是这类项目最容易高估 AI 的地方。

因为合同当然重要,但合同从来不是唯一变量。

最后真拍板的时候,业务看的是一整套现实问题:项目利润够不够,甲方过往合作情况怎么样,付款有没有风险,工期紧不紧,现场执行难不难,内部资源能不能接得住,出了问题谁来兜。

这些东西,不可能都从合同正文里长出来。

所以这类系统真正合理的位置, 不是替人做决策,而是帮人缩短判断时间。

它应该做的是,把和判断有关的历史信息先整理好。

告诉你这类条款过去在哪些项目里出现过,类似付款条件以前有没有踩过坑,这个客户的合同风格在历史上是不是一贯如此,哪些条款组合一出现就值得多看一眼。

做到这一步,系统就已经很有价值了。

但最后那句“签不签”,还是得人来定。

这条边界如果不提前讲清楚,后面很容易出现预期错位。 甲方以为自己要的是一个“合同智能决策助手”,你实际能交付的,其实更接近“历史合同分析和辅助判断系统”。

这两个东西只差几个字,落地难度和用户预期差得非常远。

系统边界对比图

系统边界对比图

05 五、这类项目真正值钱的,是把经验从人身上拿下来

所以如果你问我,这类项目到底值不值得做,我会说,值得。

但前提是,你别把它理解成一个“把合同读一遍”的工具。

它真正值钱的地方,不是 OCR,不是字段提取,也不是模型能写出一段多漂亮的分析结论。

它真正值钱的地方,是它有机会帮一家建筑公司 把过去那些散在不同项目、不同合同、不同人脑子里的经验,慢慢沉淀成一套能复用的东西。

这套东西一旦开始成形,受益的就不只是合同分析。

后面的新项目评估、风险复盘、客户判断,甚至很多内部协同动作,都会跟着变轻。

说到底, AI 在这里更像一个整理经验的工具。

它能帮你翻得更快,归得更快,连得更快。

但它不是那个最后替你拍板的人。

这件事想明白了,方案才不会做偏,客户预期也不会一开始就冲到一个不现实的位置上。

企业经验库复用价值图

企业经验库复用价值图


如果你也在做 AI 落地、知识库、文档分析 这类项目,欢迎加我微信交流。

图片

张坤

张坤专注企业 AI Agent 落地的项目经理

我是张坤,专注企业 AI Agent 落地的项目经理。 这里沉淀 RAG、知识库、数据治理、Agent 项目从立项、落地交付到成本算账的一手实践,也坦诚记录项目失败与踩坑复盘。 少聊大模型纸面能力,聚焦 AI 在真实企业场景里如何落地、存活,真正产生业务价值。

甲方想把一堆历史合同交给 AI 分析,这事难的真不是识别文字 · 张坤的博客