VISHAM-KG 是一种多模态框架,通过整合文本与视觉实体,从印地语视觉文档中构建知识图谱。该框架结合基于规则的语言学分析与计算机视觉技术,在资源匮乏的印度语言环境下生成主语-关系-宾语三元组。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
VISHAM-KG 是一种多模态框架,通过整合文本与视觉实体,从印地语视觉文档中构建知识图谱。该框架结合基于规则的语言学分析与计算机视觉技术,在资源匮乏的印度语言环境下生成主语-关系-宾语三元组。
视觉-语义印地语对齐的多模态知识图谱(VISHAM-KG)是一种旨在通过系统地对齐视觉与文本实体,从印地语视觉文档中构建一致的多模态知识图谱(KGs)的框架。本研究的目标是将基于规则的语言学分析与基于计算机视觉的目标检测相结合,以支持低资源印度语系语言中的结构化语义表示和基于实体的推理。所提出的算法首先准备自然语言处理(NLP)用的印地语视觉文档,随后对天城文脚本进行光学字符识别(OCR)提取,并进行语言学预处理,包括分词、词形还原、词性标注和依存句法分析等步骤。与此同时,通过目标检测从图像中提取视觉实体,并使用置信度阈值进行筛选。文本和视觉实体通过多语言Transformer模型XLM-R以及CLIP-ViT嵌入到共享的语义空间中,并基于余弦相似度阈值进行对齐。这些对齐后的实体与基于规则的依存关系相结合,生成多模态三元组。该方案生成一个结构化的多模态知识图谱,以主语-关系-宾语三元组形式编码,并基于印度知识库实现明确的视觉关联。该输出结果将支持对印地语视觉文档的跨模态查询、实体对齐和知识图谱推理,并为低资源语言环境下的多模态知识构建提供可复现的框架。
知识图谱(KG)是一种结构化的语义图形表示方法,其中实体被建模为节点,关系被建模为边。它能够支持高效的知识检索和上下文推理,广泛应用于问答系统、推荐系统和信息抽取等领域1。在过去十年中,知识图谱的构建方法得到了显著发展。然而,大多数现有方法主要面向资源丰富的语言,依赖于大规模的文本语料库2。因此,资源匮乏的语言在知识图谱中仍处于代表性不足的状态,限制了基于知识图谱的技术在文化和语言多样性环境中的应用3。与此同时,越来越多的真实世界文档——特别是在教育、文化和遗产领域——包含丰富的视觉信息,而以文本为中心的图谱构建方法难以充分捕捉这些信息4。
多模态知识图谱(MMKGs)通过整合图像、音频或视频等非文本模态,扩展了传统知识图谱的功能,从而实现基于感知的语义表示5。先前的多模态知识图谱框架,如 IMGpedia、Richpedia 和 ImageGraph,展示了将视觉信息与文本实体关联在提升语义查询与推理能力方面的价值6,7,8。尽管取得了这些进展,现有方法仍主要以英语为中心,依赖人工整理的元数据或静态数据集,并且在如何直接从非结构化视觉文档构建多模态知识图谱方面提供的操作指导十分有限。此外,这些框架并未明确应对资源匮乏语言所特有的挑战,例如特定文字的光学字符识别(OCR)错误、形态变化多样性以及标注数据稀疏等问题9,10.
该框架的目标是通过系统地对齐文本和视觉实体,从印地语视觉文档中逐步构建多模态知识图谱。所提出的框架——视觉-语义印地语对齐多模态知识图谱(VISHAM-KG)——结合了基于规则的语言学分析与基于目标提取的计算机视觉技术,以实现对视觉文档的动态图谱构建。与现有的多模态知识图谱(MMKG)方法不同,VISHAM-KG 直接从原始印地语文本和图像中提取实体和关系,采用基于依存关系的语法规则进行关系识别,并通过基于嵌入相似性阈值的方法实现跨模态实体对齐,而非依赖外部资源11,12。
VISHAM-KG 旨在用于文本与视觉内容在语义上相关联的图文文档,例如儿童故事13、教育材料、新闻报道11以及基于文化背景的叙事文本。在执行该框架过程中,遇到了一些局限性,例如对光学字符识别质量的依赖、对象检测覆盖范围的限制,以及特定领域词汇可用性的不足。通过明确记录每一个操作步骤,VISHAM-KG 为在资源匮乏的语言环境中构建多模态知识图谱提供了一套可复现的协议,同时支持基于文本的语义推理和跨模态分析。
VISHAM-KG 与现有的多模态知识图谱(MMKG)方法不同,它直接从非结构化的印地语文本和图像中提取实体和关系;采用基于规则的依存句法分析进行关系抽取;并通过基于嵌入相似性阈值对齐文本与视觉实体,而非通过元数据匹配8,10(图1)。

图1:端到端框架。 该图展示了多模态知识图谱VISHAM-KG的端到端框架。请点击此处查看此图的放大版本。
本方案适用于文本与图像内容对齐的图解文档,例如教育材料和文化叙事。在此框架中,选用 YOLOv8 是因其在视觉文档上的目标检测具有高效性和鲁棒性;选用 XLM-R 是因其具备强大的跨语言表征能力,非常适合资源匮乏的印地语文本处理;同时采用 CLIP-ViT,因其在学习视觉-文本共享嵌入空间方面已得到验证,能够实现有效的跨模态对齐。但该方法受限于 OCR 准确性、目标检测覆盖范围以及特定领域词汇的局限性。
相关工作
传统的知识图谱 G=(E,R,F) 由实体 E、关系 R 和事实三元组 F 构成,其中每个三元组的形式为 (h,r,t)8。在此基础上扩展,多模态知识图谱(MMKG)引入了与非文本模态(如图像、音频和视频)相关联的 E 个实体14。
在 MMKG 中表示视觉数据主要有两种策略:
作为附加到文本实体的属性
作为通过特定标注关系连接的视觉实体
一项重要的研究是IMGpedia,它通过整合视觉描述符和相似性度量来增强Wikimedia的图像数据。该模型解决了传统数据集主要包含元数据的局限性,通过将图像与DBpedia Commons关联,实现了视觉-语义查询和相似性评估9。
类似地,另一个 MMKG Richpedia 致力于解决学术研究中知识图谱不完整的问题。该系统从 Wikipedia 中聚合了 2,883,162 个视觉实体,并从 Wikidata 中整合了 30,638 个文本实体。Richpedia 支持面向特定方面的查询,并采用多种方法从非结构化内容中提取语义关系,包括图像元素、相关文本以及超链接15。
ImageGraph 通过基于 FB15K 数据集构建关系型知识图谱,并整合了从网络爬取的 829,931 张图像及其说明文字,进一步拓展了本研究。该图谱包含 14,870 个实体和 1,330 种关系类型,支持基于概念的查询参数,从而实现视觉-上下文联合查询并提供更准确的响应16。
VisualSem 是另一个整合了视觉与文本信息的综合性多语言知识图谱。它包含 89,896 个实体、超过 130 万条术语释义以及 938,100 张图像。VisualSem 专为数据增强和语义关联等应用而设计,可提升跨语言的语义理解能力,并能无缝集成到多种处理流程中1。
还开发了多种多模态知识图谱(MMKG)模型,以支持链接预测、三元组分类和实体匹配等任务。这些模型解决了单模态图谱的局限性,尤其是其难以捕捉跨模态信息复杂性的不足16,17,18。
基于语言的 MMKG 模型与 VISHAM-KG 之间的关键比较见表 1。该比较特别关注这些模型在处理印地语、泰米尔语或梵语等低资源语言时的优势与局限性。这些方法通常假定能够获取高质量的文本语料库、可靠的语言学标注以及大规模的预训练模型,而这些因素限制了它们在低资源语言中的适用性。特别是,依赖光学字符识别(OCR)的处理流程通常针对拉丁字母脚本进行优化,在处理印度系文字脚本时准确率显著下降,导致文本提取结果存在噪声或不完整。此外,语言学预处理、词性标注和命名实体识别通常在高资源语言上进行训练,当应用于印地语等形态丰富、句法灵活的语言时,其性能会大幅下降。
| MMKG 模型 | 优势 | 在资源匮乏环境中的局限性 |
| IMGpedia | 将图像与 DBpedia 集成 | 仅关注英文内容 |
| 支持基于视觉相似性的查询 | 不支持非拉丁字母脚本 | |
| 对区域性视觉内容的文化背景支持有限 | ||
| Richpedia | 整合来自 Wikipedia 和 Wikidata 的视觉与文本实体 | 对印度本土或民间知识的表征不足 |
| 支持细粒度层面的查询 | 依赖高质量的数据对齐,而区域性数据集中缺乏此类对齐 | |
| ImageGraph | 包含图像与说明文字的关系型知识图谱 | 实体与关系抽取针对英文语料库优化 |
| 支持扩展的三元组查询 | 在说明文字稀疏或元数据缺失的环境中表现不佳 | |
| VisualSem | 支持多语言 | 对亚洲低资源语言的表征较差 |
| 适用于神经语义处理流程 | 不支持天城文或基于文化的视觉语义 | |
| VISHAM-KG | 包含印度语言图像的关系型知识图谱 | 依赖特定语言 |
| 支持形态丰富语法的语义处理流程 | 依赖不同语言的不同词性标注体系 |
表1:低资源语言中MMKGs的局限性关键比较。
现有的多模态知识图谱(MMKG)模型依赖静态知识图谱,由于其基于单一数据集进行训练,无法适应现实世界中不断变化的动态环境,其中新的实体类型和关联关系持续涌现,因此开发具备动态能力的模型至关重要16。在此背景下存在以下局限性:在物体识别、提取和标注等视觉任务中对文本数据的使用不当;缺乏可扩展的方法以从异构来源构建多模态知识图谱;以及未能将上下文信息有效融入多模态知识图谱,从而限制了对内容的理解与解释能力。
在这些条件下,VISHAM-KG 通过采用先进的视觉提取技术,直接从视觉文档中定义节点和关系,从而区别于早期方法。该方法结合了分词、停用词去除和词性标注等标准文本处理步骤与语义图技术,以结构化提取出的知识。通过融合计算机视觉与本体论,该系统具备多项优势19:更强的适应性,使知识库能够随特定应用需求而演化;改进的语义表示能力,支持跨系统的互操作性;以及更优的语义推理与检索能力,实现基于上下文的知识库增强。
访问受限。请登录或开始试用以查看此内容。
本方案仅使用公开的、非人类的、非敏感的视觉和文本数据,因此无需伦理审批。表2列出了所有工具和技术及其依赖项。用于复现多模态知识图谱构建流程的全部源代码、配置文件和脚本均公开于GitHub仓库(preeti017phdit22-wq/VISHAM_KG.)。该仓库包含安装说明和依赖项说明,以促进研究的可重复性。
| 模块 | 模型 / 工具 | 版本 | 框架 | 用途 |
| OCR | EasyOCR | v1.7.1 | PyTorch | 印地语文本提取 |
| 词性标注 + 依存句法分析 | Stanza (hi) | v1.6.1 | PyTorch | 语言学解析 |
| 命名实体识别 | BiLSTM-CRF | 自定义训练 | PyTorch | 印地语实体识别 |
| 目标检测 | YOLOv8 | v8.0.208 | Ultralytics | 视觉实体提取 |
| 文本嵌入 | XLM-R Base | 2023-05 | HuggingFace | 多语言文本编码 |
| 视觉嵌入 | CLIP-ViT-B/32 | 2022-09 | OpenAI | 图像编码 |
| 图存储 | Neo4j | v5.13 | Neo4j | 知识图谱构建 |
| 相似性计算 | Cosine Similarity | – | NumPy | 跨模态对齐 |
表2:构建VISHAM-KG各步骤中使用的工具与技术。
1. 知识图谱构建

图 2:使用仅基于动词的关系从印地语文本中提取简单的主谓宾三元组。 该流程图描述了如何利用仅基于动词的关系,从印地语文本中提取简单的主谓宾三元组。请点击此处查看该图的高清版本。

图 3:扩展的动词-介词关系。 该图展示了扩展的动词-介词关系,用于识别三元组的形成。请点击此处查看此图的放大版本。

图4:目标检测。 该图展示了使用 YOLOv8 进行目标检测的过程。请点击此处查看此图的放大版本。

图 5:视觉特征提取与目标检测和识别。 该图展示了使用卷积层和 YOLOv8 进行视觉特征提取,随后基于相似性得分进行区域优化与对齐的过程。请点击此处查看该图的放大版本。

图6:视觉目标检测与词性标注融合。 该图展示了用于知识图谱三元组提取的视觉目标检测与词性标注(POS)的融合过程。YOLO 和 CIFAR-100 用于识别物体,以实现多模态对齐。请点击此处查看该图的放大版本。

图 7:多模态知识图谱构建流程。 该流程图展示了 VISHAM-KG 的构建流程。请点击此处查看该图的放大版本。
2. 评估步骤
注意:选择印地语儿童故事用于评估 VISHAM-KG 框架,因为这些故事提供了受控的、以视觉为依托的叙述,具有明确的实体和关系,能够在领域规模部署之前,可靠地验证多模态对齐、图谱构建和推理效果。所有超参数设置均见表 3。
| 模块 | 超参数 | 维度 |
| OCR | 置信度阈值 | 0.5 |
| 实体提取 | 嵌入维度 | 300 |
| 目标检测 | 置信度阈值 | 0.5 |
| 输入图像尺寸 | 640 × 640 | |
| 文本嵌入 | 语言模型 | XLM-R |
| 嵌入维度 | 768 | |
| 图像嵌入 | 视觉模型 | CLIP-ViT-B/32 |
| 嵌入维度 | 768 | |
| 对齐 | 相似性度量 | 余弦相似度 |
| 文本-图像对齐 | 余弦相似度阈值 (τ) | 0.6 |
| 链接预测 | 嵌入维度 | 100 |
| 训练轮数 | 50 | |
| 负采样 | 均匀采样 | |
| 评估 | 训练–测试划分 | 80 / 20 |
表3:框架的超参数设置。
| 组件 | 数量 |
| 文档图像 | 10 |
| 文本实体 | 186 |
| 视觉实体 | 97 |
| 基于文本的关系 | 105 |
| 基于视觉的关系 | 41 |
| 文本与视觉三元组 | 312 |
表4:知识图谱与三元组统计。
| 文本实体 | 视觉实体 | 余弦相似度 |
| शेर | ![]() | 0.78 |
| लोमड़ी | ![]() | 0.82 |
表5:文本与图像嵌入之间的余弦相似度得分。
| 模型 | MRR | Hits@1 | Hits@3 | Hits@10 |
| TransE | 0.42 | 0.21 | 0.48 | 0.72 |
| ComplEx | 0.47 | 0.26 | 0.52 | 0.74 |
| RotatE | 0.51 | 0.31 | 0.58 | 0.74 |
| VISHAM-KG(文本) | 0.49 | 0.36 | 0.62 | 0.76 |
表6:仅文本三元组上的链接预测性能。
| 模型 | MRR | Hits@1 | Hits@3 | Hits@10 |
| IKRL | 0.46 | 0.34 | 0.63 | 0.72 |
| VisualBERT | 0.52 | 0.35 | 0.61 | 0.72 |
| ViLBERT | 0.54 | 0.38 | 0.64 | 0.75 |
| VISHAM-KG | 0.57 | 0.41 | 0.66 | 0.79 |
表7:跨模态三元组预测任务的性能表现。
访问受限。请登录或开始试用以查看此内容。
通过在知识表示基准数据集上常用的相似性评分计算和链接预测任务,对所提出的 VISHAM-KG 进行了评估。
实验设置
使用两个已建立的任务评估构建的多模态知识图谱:(i)跨模态相似性评估和(ii)知识图谱链接预测。所有评估均仅在协议终点生成的最终图输出上进行。在评估前固定所有随机种子,并在各实验中应用相同的预处理流程(图8)。

图8:基于印地语短篇故事构建的文本与多模态知识图谱示意图。 第一个图表...
访问受限。请登录或开始试用以查看此内容。
VISHAM-KG 框架的性能主要依赖于三个关键组成部分:用于天城文文本的光学字符识别(步骤 1.2)、基于置信度的视觉目标检测(使用 Clip-ViT,步骤 1.3)以及基于嵌入的跨模态对齐(步骤 1.4)。光学字符识别的准确性直接影响下游的语言解析和实体抽取。此阶段引入的错误会传播至关系识别过程,并降低对齐精度。该问题通过针对印地语的规范化、词形还原以及基于依存关系的规则约束得以缓解,从而在三元组生成之前稳定实体表示10。所有比较结果如下表 10 所示。
| 方面 | 文本知识图谱 | 多模态知识图谱 | 改进 |
访问受限。请登录或开始试用以查看此内容。
作者声明,本文发表不存在任何利益冲突。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| BiLSTM-CRF 和印地语命名实体识别模型 | 自定义训练 | PyTorch | 命名实体识别 |
| CLIP-ViT-B/32 | 2022-09 | OpenAI | 视觉嵌入生成 |
| CPU | Intel i9 | Intel | 通用计算 |
| EasyOCR | v1.7.1 | Jaided AI | 从图像中提取印地语文本 |
| GPU | NVIDIA RTX 3090 | NVIDIA | 模型推理加速 |
| 印地语儿童故事 | 10 个故事 | 精选数据集 | 评估语料库 |
| Neo4j | v5.13 | Neo4j Inc. | 知识图谱存储 |
| NumPy | v1.24 | NumPy 社区 | 数值计算 |
| Pandas | v2.0 | Pandas 社区 | 数据处理 |
| Python | v3.10 | Python 软件基金会 | 流程实现 |
| PyTorch | v2.0 | Meta AI | 深度学习框架 |
| Stanza(印地语模型) | v1.6.1 | Stanford NLP | 词性标注与依存句法分析 |
| XLM-R(基础版) | 2023-05 | HuggingFace | 文本嵌入生成 |
| YOLOv8 | v8.0.208 | Ultralytics | 视觉目标检测 |
访问受限。请登录或开始试用以查看此内容。