张坤的博客

AI问答的下一步:把散装知识织成网

张坤7 分钟1 阅读
AI问答的下一步:把散装知识织成网

也在公众号发布

微信公众号 张坤zkun 二维码

张坤zkun

扫码关注公众号,这篇也在那边。

做企业AI问答的人应该都有一个感受:简单问题答得还行,一到复杂问题就拉胯。你问"报销流程是什么",AI基本能答上来。但你问"A项目和B项目是不是用了同一个供应商",它大概率答不上来。

不是模型不行。是它压根看不到这层关系。

企业文档从来不是孤立存在的。 合同和项目有关系,项目和人有关系,人和部门有关系。但你把这些文档扔进RAG系统之后,每一篇都变成了独立的文本块。文档之间的关系,就这么丢了。

01 传统检索的盲区

现在企业做AI问答,主流方案是RAG,先从知识库里捞相关文档,再让大模型根据这些文档生成答案。检索这一步,大部分企业用的是向量检索,原理不复杂,把文档和问题都转成向量,算一下相似度,把最像的那几篇捞出来。

这个方案处理单文档问题够用。“我们的年假政策是什么”,找到那篇《年假管理制度》,问题就解决了。

但企业里很多问题不是单文档能回答的。

"这个合同修订了几次,每次改了什么?"这需要AI知道几份合同之间的版本关系。"张工负责的项目里有哪些涉及XX技术?"这需要跨人、项目、技术三个维度去关联。"去年和A供应商签的所有合同总金额是多少?"这需要从一堆合同里先筛出特定供应商,再做汇总。

你拿这些问题去试你的AI问答系统,大概率会失望。不是答得不对,就是压根答不上来。

因为向量检索只做语义匹配。它能找到"最像的那篇文章",但它不知道文章之间有什么关系。你问它合同修订了几次,它可能把三版合同都捞出来了,但它不知道这三份之间是"版本1→版本2→版本3"的关系。在它眼里,这三份合同跟三篇毫不相关的文档没有区别。

你的AI不是不聪明。是它看到的世界本身就是碎片化的。

02 知识图谱到底做了什么

做的事情不复杂,把文档里的实体和关系抽出来,织成一张网。你文档里反复出现的那些东西,人名、项目名、合同编号、供应商名称,这些就是实体。这些东西之间的联系,谁负责什么项目,哪个供应商给哪个项目供货,哪份合同是哪份的修订版,这些就是关系。

你可以想象一个微信群的关系图。群里50个人,有的人是同一个部门的,有的人一起做过某个项目,有的人是上下级。你只知道名字的话,就只能搜"张三是谁"。但你要是知道这些关系,就能回答"A部门去年参与过哪些项目"这种跨维度的问题。知识图谱对企业文档做的就是同样的事。

回到刚才那个合同的问题。用户问"这个合同修订了几次",AI有了知识图谱之后,不再是做文本相似度匹配了。它顺着"合同→修订关系→版本"这条链走一遍,三个版本直接找出来,还能告诉你每次改了什么。这就是多跳推理,顺着关系链跳几步,把散落在不同文档里的信息串起来。

GraphRAG,就是用知识图谱增强的检索方案,在复杂问题上的准确率比传统RAG提升20-40%。在法律、金融这种对逻辑链条要求高的行业,提升幅度能到54%。你花几十万上一套AI问答系统,准确率可能从60%提到了70%。加一层知识图谱,同样的问题可能从60%到80%。投入产出比不低。

03 企业文档的知识图谱怎么建

大方向是三步:实体抽取、关系抽取、存进图数据库。

第一步,从文档里把关键实体识别出来。一份合同里涉及哪些公司、哪些人、金额多少、签署日期是什么,一篇项目文档里提到了哪些技术栈、哪些供应商。以前做实体抽取得靠传统NLP工具链,配置一堆东西,准确率还一般。现在大模型直接就能干这个活,你扔一篇合同给它,它能把里面的主体、金额、日期、条款都给你提出来,比以前靠谱不少。

第二步,识别实体之间的关系。A公司和B公司之间是供应商关系,合同A是合同B的修订版,张工负责XX项目。这一步也可以交给大模型来做,给它两段文本,让它判断里面的实体之间是什么关系。难点在于,文档里不会每次都把关系写得明明白白,很多时候需要根据上下文推断。

第三步,把抽取出来的实体和关系存进图数据库。Neo4j、NebulaGraph这些都可以选。为什么不用传统数据库?因为关系型数据库做多跳查询效率很低,你要查"A供应商通过哪些项目关联到了B技术",在MySQL里可能要写好几层JOIN,图数据库顺着边走一圈就出来了。

实际操作中还有不少坑。比如实体消歧,文档里的"张工"和"张伟"到底是不是同一个人?"阿里"和"阿里巴巴"要不要合并成一个节点?再比如关系的时效性,去年是你的供应商,今年不是了,这条关系要不要保留?还有增量更新的问题,新文档进来之后,怎么在不破坏已有图谱结构的情况下把新的实体和关系加进去?

这一块内容比较多,也涉及到不少工程细节,如果感兴趣的话后面可以单独开一篇来写。

04 不是必须的,但有些场景值得投

大部分企业AI问答不准,不是因为缺知识图谱。你的基础检索优化做好了吗?chunk切得合理吗?做了混合检索吗?Prompt写得够好吗?这些都没做好的话,先把这些解决了,性价比更高。

但如果你已经把基础检索做到80分了,发现剩下的问题集中在一类,AI找不到文档之间的关联。 问单篇文档能答,问跨文档的关联就懵。这种情况,知识图谱就是下一步该补的东西。

合同管理场景最典型。版本追踪、条款关联、供应商交叉查询,这些全都需要文档之间的关系。项目管理也是,人员-项目-成果的交叉查询,没有关系网络根本答不了。产品研发也一样,技术方案、专利、标准之间的关联检索,靠纯向量匹配基本没戏。

AI降低的是使用知识的门槛,但提高的是组织知识的要求。 知识图谱就是在帮你把知识的结构理清楚。这个活儿不管上不上AI,迟早都得干。

张坤

张坤专注企业 AI Agent 落地的项目经理

我是张坤,专注企业 AI Agent 落地的项目经理。 这里沉淀 RAG、知识库、数据治理、Agent 项目从立项、落地交付到成本算账的一手实践,也坦诚记录项目失败与踩坑复盘。 少聊大模型纸面能力,聚焦 AI 在真实企业场景里如何落地、存活,真正产生业务价值。

AI问答的下一步:把散装知识织成网 · 张坤的博客