读完蚂蚁大规模知识图谱构建及其应用后思考

💡
蚂蚁集团算法专家贾强槐的文章《蚂蚁大规模知识图谱构建及其应用》,让我看到了互联网大厂和传统企业在知识图谱应用上的巨大鸿沟。

一、蚂蚁做了什么

1.1 知识图谱不是"画关系图"

读完蚂蚁大规模知识图谱构建及其应用后思考

很多人对知识图谱的理解还停留在"把实体和关系画成图"的阶段。但这份蚂蚁的实践告诉我们:知识图谱是语义+结构的双建模。

什么叫双建模?
结构建模

实体之间的关联关系(比如"用户A购买了产品B")
语义建模

实体本身的属性和含义(比如"产品B是意外险,保障期限1年")
只有结构,没有语义,那就是普通的关系数据库;只有语义,没有结构,那就是知识库。两者结合,才是真正的知识图谱。

1.2 蚂蚁的5步构建路径

蚂蚁的图谱构建不是一蹴而就的,而是遵循一个渐进式融合的路径:
业务数据冷启动:用现有的业务数据(用户、商品、交易)作为初始种子
外部知识图谱融合:对接维基百科、DBpedia等公开知识图谱,做实体对齐
结构化领域知识库融合:接入行业知识库(比如医保目录、商品分类体系)
非结构化信息抽取:从文本、图片、日志中抽取实体和关系
领域概念体系和专家规则融入:让业务专家定义概念层级和推理规则

这个路径的精妙之处在于:先用数据冷启动,再逐步引入外部知识和专家经验。

不是"先建好完美图谱再上线",而是"边建边用,持续学习"。

1.3 核心技术:实体对齐和分类

蚂蚁在图谱构建中用了三个关键技术,我都觉得挺有意思:

技术1:融合专家知识的实体分类
用语义增强(让模型理解实体含义)
对比学习(让相似实体在向量空间中靠近)
逻辑规则约束(比如"如果是意外险,就一定有保险期限")

技术2:注入领域词表的实体识别
边界对比学习(准确识别实体边界,比如"支付宝"是一个词,不能切成"支付"和"宝")
语义对比学习(理解实体在上下文中的含义)

技术3:少样本关系抽取
借助外部知识库(不用大量标注数据)
逻辑规则推理(通过规则推导隐含关系)

最让我印象深刻的是实体对齐技术:用BERT-INT算法,把不同来源的知识融合到同一个图谱里。

想象一下:支付宝有上亿用户,每个用户有几百个标签,怎么把这些信息融合成一个统一的用户画像?这就是实体对齐要解决的问题。

二、知识图谱为什么重要

2.1 传统数据建模的局限

我们做数据的,最熟悉的就是E-R模型(实体-关系模型)和维度建模(星型模型、雪花模型)。

这两种建模方法有什么问题?

问题1:只管结构,不管语义

E-R模型能表达"用户表"和"订单表"之间的外键关系,但它表达不了"订单是一种合同,合同具有法律效力"这种语义。

问题2:难以做推理

维度建模能支持OLAP分析(比如"按地区统计销售额"),但它做不了"买了A产品的用户,大概率也需要B服务"这种推理。

问题3:知识难以复用

每个系统的数据模型都是定制的,A系统的"客户"和B系统的"投保人"可能是同一个概念,但没有人知道,也没有工具能自动发现。

2.2 知识图谱的四大价值

蚂蚁在实践中总结了知识图谱的四大价值,我觉得总结得很好:

价值1:语义标准化

把不同系统、不同口径的数据,映射到统一的知识体系。

比如:"客户""投保人""被保险人"在保险行业是有区别的,但在很多系统里被混为一谈。知识图谱可以明确它们的定义和关系。

价值2:领域知识沉淀

把专家经验固化到图谱里,形成可复用的知识资产。

比如:核保规则("患有糖尿病的客户,不能投保重疾险")可以写成图谱中的推理规则,系统自动执行。

价值3:知识复用

一旦建成图谱,多个应用可以共享。

比如:同一个"产品知识图谱",可以支撑产品搜索、智能推荐、合规审查等多个场景。

价值4:知识推理和发现

这是知识图谱最核心的价值——发现隐含的知识。

比如:图谱可以发现"购买过癌症险的用户,60%会在6个月内购买住院医疗险",这种规律靠传统统计分析很难发现。

2.3 蚂蚁的4个应用场景

蚂蚁把知识图谱用在了4个场景,都是高频、高价值的:
结构化匹配召回(比如商品搜索,理解用户意图,精准匹配商品)
用户意图预测(比如根据用户历史行为,预测下一步可能的行为)
营销券推荐(比如预测用户对哪种优惠券感兴趣)
智能理赔推理(比如根据医疗知识图谱,自动审核理赔申请)

这4个场景有一个共同特点:都需要理解语义,而不只是匹配关键词。

三、为什么传统企业还没大规模用图谱

3.1 数据分散,语义对齐难

传统企业(尤其是央企、国企)的数据环境,比互联网大厂复杂得多:
系统多一个大型保险集团,可能有几百个系统(核心业务系统、CRM、财务系统、HR系统…)
数据分散同一个客户的信息,可能分散在10个不同的系统里
口径不一A系统叫"客户",B系统叫"投保人",C系统叫"被保险人",其实是同一个人

要把这些分散的数据融合成统一的图谱,语义对齐的工作量巨大。

蚂蚁可以从头设计图谱架构,传统企业得在存量系统上"打补丁"。

3.2 标注成本高,持续维护难

知识图谱的核心是"高质量的知识",而高质量的知识需要大量标注。

比如:
实体分类:需要人工标注"什么是意外险""什么是健康险"
关系抽取:需要人工标注"哪些文本表示购买关系"
规则定义:需要业务专家定义推理规则

互联网大厂可以雇几百个标注员,传统企业很难有这样的资源。

更麻烦的是:业务在变,图谱也要变。

比如:新产品上线了,图谱里没有这个产品的知识,就得重新标注、重新训练模型。

3.3 业务闭环难,技术业务两张皮

这是最扎心的一点。

很多传统企业的数据部门,建了知识图谱,但业务部门不会用、不敢用。

为什么?

原因1:业务不理解图谱的价值

业务人员习惯了看报表、做统计分析,突然给他们一个"知识图谱",他们不知道能干什么。

原因2:图谱的推理结果不可解释

图谱可以推理出"用户A可能需要产品B",但说不清楚"为什么需要"。

业务人员不敢基于一个"不可解释"的推荐去做决策。

原因3:没有业务闭环

建了图谱,但没有应用场景,图谱就成了"摆设"。

蚂蚁的图谱是业务倒逼技术(搜索、推荐、风控场景强烈需求),传统企业往往是技术倒逼业务(先建图谱,再找场景)。

3.4 人才缺口大

知识图谱是一个跨学科的领域:
需要懂图算法(Graph Neural Networks、图挖掘)
需要懂自然语言处理(实体识别、关系抽取)
需要懂领域知识(保险、金融、医疗…)
需要懂工程化(图谱存储、查询优化、实时计算)

这样的人才,互联网大厂可以高薪挖,传统企业很难吸引和留住。

四、知识图谱 × 大模型:下一代智能的核心(技术趋势)

4.1 大模型和知识图谱,谁更强?

2023年以来,大模型(LLM)火了。很多人开始问:还要知识图谱吗?大模型能不能替代知识图谱?

蚂蚁的文章给了一个很好的答案:

大模型 = 参数化知识库(隐式)
优势:通用性强,能理解自然语言,能生成内容
劣势:幻觉问题(会编造事实)、时效性差(训练数据截止某个时间点)、不可解释

知识图谱 = 显式知识库
优势:准确(每一条知识都经过验证)、可解释(可以追溯推理路径)、时效性好(可以实时更新)
劣势:覆盖面窄(只能覆盖预设的领域)、通用性差(换一个领域就得重新建图谱)

两者不是替代关系,而是互补关系。

4.2 三种融合路线

蚂蚁提出了三种融合路线:

路线1:图谱增强大模型
用知识图谱的事实,纠正大模型的幻觉
用知识图谱的实时数据,弥补大模型的时效性不足
用知识图谱的推理路径,增强大模型的可解释性

路线2:大模型增强图谱
用大模型做信息抽取(从非结构化文本中抽取实体和关系)
用大模型做实体对齐(理解不同实体是否是同一个)
用大模型做图谱补全(预测缺失的关系)

路线3:协同并进
图谱和大模型各司其职,共同服务应用
比如:用图谱做领域知识管理(准确、可解释),用大模型做自然语言交互(易用、友好)

4.3 知识增强的问答系统

蚂蚁展示了一个知识增强的问答系统:
用户提问(自然语言)
大模型理解问题,生成查询
查询知识图谱,获取准确答案
大模型基于答案,生成自然语言回复
同时提供可解释的推理路径(比如"根据知识图谱,A和B的关系是…")

这个系统的优势:
准确性答案来自知识图谱
时效性知识图谱可以实时更新
可解释性可以提供推理路径,让用户信任结果

五、给央企/国企数据人的建议(行动指南)

读完蚂蚁的实践,我觉得传统企业的数据人,应该从以下几个方面入手:

5.1 别急着买图谱工具

很多企业的第一反应是:"我们要建知识图谱,先买个工具吧。"

错!

知识图谱的核心不是工具,而是数据和场景。

在买工具之前,先问自己三个问题:
我们的数据质量够好吗?(实体是否唯一、属性是否完整、关系是否准确)
我们有高价值的应用场景吗?(不是为了"建图谱"而建图谱)
我们有持续维护图谱的机制吗?(业务在变,图谱也要变)

建议:先把现有数据资产梳理清楚(指标体系、数据标准、元数据),再谈图谱。

5.2 选一个高价值场景试点

知识图谱不是"大而全"的工程,而是"小步快跑"的迭代。

读完蚂蚁大规模知识图谱构建及其应用后思考

建议从一个高价值、边界清晰的场景开始:
风控场景构建"企业关联关系图谱",发现隐蔽的利益输送
推荐场景构建"产品知识图谱",做个性化推荐
问答场景构建"法规知识图谱",做智能客服
合规场景构建"监管要求知识图谱",做合规审查

选场景的标准:
数据基础好(有现成的数据源)
业务价值高(能量化收益)
技术难度适中(不要一开始就挑战"全集团统一图谱")

5.3 图谱 + 大模型协同

这是未来的方向。

建议:
用知识图谱做领域知识管理(准确、可解释、实时)
用大模型做自然语言交互(降低使用门槛)
两者结合,才能发挥最大价值

比如:
合规人员问:"这个新条款符合监管要求吗?"
大模型理解问题,查询"监管知识图谱"
图谱返回相关法规、相似案例、推理结果
大模型生成自然语言回复,并附上图谱的推理路径

5.4 培养复合型人才

知识图谱需要复合型人才,但这样的人才很稀缺。

建议:
内部培养让数据工程师学习图算法和自然语言处理
外部合作和高校、科研院所合作,引入外部智力
工具降低门槛选择低代码/无代码的图谱工具,让业务人员也能参与

六、结语:

读完蚂蚁的图谱实践,我发现了一个扎心的事实:

互联网大厂和传统企业的差距,不在技术,而在思维。

蚂蚁的思维是:
场景驱动(先有场景,再建图谱)
渐进式构建(边建边用,持续学习)
业务技术融合(技术方案和业务需求深度耦合)

传统企业的思维是:
技术驱动(先建平台,再找场景)
完美主义(想一次性建成完美的图谱)
业务技术分离(技术部门建图谱,业务部门不会用)

这个差距,不是靠买几个工具、招几个专家就能弥补的。

需要的是思维的转变。

前沿技术新闻资讯知识图谱

你的 AI Agent 为什么总听不懂业务?缺的就是这层东西

2026-7-23 23:52:01

前沿技术新闻资讯知识图谱

下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知

2026-7-24 1:52:43

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
购物车
优惠劵
搜索