需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

基于规则语言分析与计算机视觉的多模态知识图谱

232 次观看

DOI:

10.3791/69803

2026年4月3日

本文内容

摘要

VISHAM-KG 是一种多模态框架,通过整合文本与视觉实体,从印地语视觉文档中构建知识图谱。该框架结合基于规则的语言学分析与计算机视觉技术,在资源匮乏的印度语言环境下生成主语-关系-宾语三元组。

摘要

视觉-语义印地语对齐的多模态知识图谱(VISHAM-KG)是一种旨在通过系统地对齐视觉与文本实体,从印地语视觉文档中构建一致的多模态知识图谱(KGs)的框架。本研究的目标是将基于规则的语言学分析与基于计算机视觉的目标检测相结合,以支持低资源印度语系语言中的结构化语义表示和基于实体的推理。所提出的算法首先准备自然语言处理(NLP)用的印地语视觉文档,随后对天城文脚本进行光学字符识别(OCR)提取,并进行语言学预处理,包括分词、词形还原、词性标注和依存句法分析等步骤。与此同时,通过目标检测从图像中提取视觉实体,并使用置信度阈值进行筛选。文本和视觉实体通过多语言Transformer模型XLM-R以及CLIP-ViT嵌入到共享的语义空间中,并基于余弦相似度阈值进行对齐。这些对齐后的实体与基于规则的依存关系相结合,生成多模态三元组。该方案生成一个结构化的多模态知识图谱,以主语-关系-宾语三元组形式编码,并基于印度知识库实现明确的视觉关联。该输出结果将支持对印地语视觉文档的跨模态查询、实体对齐和知识图谱推理,并为低资源语言环境下的多模态知识构建提供可复现的框架。

引言

知识图谱(KG)是一种结构化的语义图形表示方法,其中实体被建模为节点,关系被建模为边。它能够支持高效的知识检索和上下文推理,广泛应用于问答系统、推荐系统和信息抽取等领域1。在过去十年中,知识图谱的构建方法得到了显著发展。然而,大多数现有方法主要面向资源丰富的语言,依赖于大规模的文本语料库2。因此,资源匮乏的语言在知识图谱中仍处于代表性不足的状态,限制了基于知识图谱的技术在文化和语言多样性环境中的应用3。与此同时,越来越多的真实世界文档——特别是在教育、文化和遗产领域——包含丰富的视觉信息,而以文本为中心的图谱构建方法难以充分捕捉这些信息4

多模态知识图谱(MMKGs)通过整合图像、音频或视频等非文本模态,扩展了传统知识图谱的功能,从而实现基于感知的语义表示5。先前的多模态知识图谱框架,如 IMGpedia、Richpedia 和 ImageGraph,展示了将视觉信息与文本实体关联在提升语义查询与推理能力方面的价值6,7,8。尽管取得了这些进展,现有方法仍主要以英语为中心,依赖人工整理的元数据或静态数据集,并且在如何直接从非结构化视觉文档构建多模态知识图谱方面提供的操作指导十分有限。此外,这些框架并未明确应对资源匮乏语言所特有的挑战,例如特定文字的光学字符识别(OCR)错误、形态变化多样性以及标注数据稀疏等问题9,10.

该框架的目标是通过系统地对齐文本和视觉实体,从印地语视觉文档中逐步构建多模态知识图谱。所提出的框架——视觉-语义印地语对齐多模态知识图谱(VISHAM-KG)——结合了基于规则的语言学分析与基于目标提取的计算机视觉技术,以实现对视觉文档的动态图谱构建。与现有的多模态知识图谱(MMKG)方法不同,VISHAM-KG 直接从原始印地语文本和图像中提取实体和关系,采用基于依存关系的语法规则进行关系识别,并通过基于嵌入相似性阈值的方法实现跨模态实体对齐,而非依赖外部资源11,12

VISHAM-KG 旨在用于文本与视觉内容在语义上相关联的图文文档,例如儿童故事13、教育材料、新闻报道11以及基于文化背景的叙事文本。在执行该框架过程中,遇到了一些局限性,例如对光学字符识别质量的依赖、对象检测覆盖范围的限制,以及特定领域词汇可用性的不足。通过明确记录每一个操作步骤,VISHAM-KG 为在资源匮乏的语言环境中构建多模态知识图谱提供了一套可复现的协议,同时支持基于文本的语义推理和跨模态分析。

VISHAM-KG 与现有的多模态知识图谱(MMKG)方法不同,它直接从非结构化的印地语文本和图像中提取实体和关系;采用基于规则的依存句法分析进行关系抽取;并通过基于嵌入相似性阈值对齐文本与视觉实体,而非通过元数据匹配8,10图1)。

使用YOLOv4和知识图谱进行视觉-语义提取的网页文档OCR流程图。
图1:端到端框架。 该图展示了多模态知识图谱VISHAM-KG的端到端框架。请点击此处查看此图的放大版本。

本方案适用于文本与图像内容对齐的图解文档,例如教育材料和文化叙事。在此框架中,选用 YOLOv8 是因其在视觉文档上的目标检测具有高效性和鲁棒性;选用 XLM-R 是因其具备强大的跨语言表征能力,非常适合资源匮乏的印地语文本处理;同时采用 CLIP-ViT,因其在学习视觉-文本共享嵌入空间方面已得到验证,能够实现有效的跨模态对齐。但该方法受限于 OCR 准确性、目标检测覆盖范围以及特定领域词汇的局限性。

相关工作

传统的知识图谱 G=(E,R,F) 由实体 E、关系 R 和事实三元组 F 构成,其中每个三元组的形式为 (h,r,t)8。在此基础上扩展,多模态知识图谱(MMKG)引入了与非文本模态(如图像、音频和视频)相关联的 E 个实体14

在 MMKG 中表示视觉数据主要有两种策略:
作为附加到文本实体的属性
作为通过特定标注关系连接的视觉实体

一项重要的研究是IMGpedia,它通过整合视觉描述符和相似性度量来增强Wikimedia的图像数据。该模型解决了传统数据集主要包含元数据的局限性,通过将图像与DBpedia Commons关联,实现了视觉-语义查询和相似性评估9

类似地,另一个 MMKG Richpedia 致力于解决学术研究中知识图谱不完整的问题。该系统从 Wikipedia 中聚合了 2,883,162 个视觉实体,并从 Wikidata 中整合了 30,638 个文本实体。Richpedia 支持面向特定方面的查询,并采用多种方法从非结构化内容中提取语义关系,包括图像元素、相关文本以及超链接15

ImageGraph 通过基于 FB15K 数据集构建关系型知识图谱,并整合了从网络爬取的 829,931 张图像及其说明文字,进一步拓展了本研究。该图谱包含 14,870 个实体和 1,330 种关系类型,支持基于概念的查询参数,从而实现视觉-上下文联合查询并提供更准确的响应16

VisualSem 是另一个整合了视觉与文本信息的综合性多语言知识图谱。它包含 89,896 个实体、超过 130 万条术语释义以及 938,100 张图像。VisualSem 专为数据增强和语义关联等应用而设计,可提升跨语言的语义理解能力,并能无缝集成到多种处理流程中1

还开发了多种多模态知识图谱(MMKG)模型,以支持链接预测、三元组分类和实体匹配等任务。这些模型解决了单模态图谱的局限性,尤其是其难以捕捉跨模态信息复杂性的不足16,17,18

基于语言的 MMKG 模型与 VISHAM-KG 之间的关键比较见表 1。该比较特别关注这些模型在处理印地语、泰米尔语或梵语等低资源语言时的优势与局限性。这些方法通常假定能够获取高质量的文本语料库、可靠的语言学标注以及大规模的预训练模型,而这些因素限制了它们在低资源语言中的适用性。特别是,依赖光学字符识别(OCR)的处理流程通常针对拉丁字母脚本进行优化,在处理印度系文字脚本时准确率显著下降,导致文本提取结果存在噪声或不完整。此外,语言学预处理、词性标注和命名实体识别通常在高资源语言上进行训练,当应用于印地语等形态丰富、句法灵活的语言时,其性能会大幅下降。

MMKG 模型优势在资源匮乏环境中的局限性
IMGpedia 将图像与 DBpedia 集成 仅关注英文内容
 支持基于视觉相似性的查询 不支持非拉丁字母脚本
 对区域性视觉内容的文化背景支持有限
Richpedia 整合来自 Wikipedia 和 Wikidata 的视觉与文本实体 对印度本土或民间知识的表征不足
 支持细粒度层面的查询 依赖高质量的数据对齐,而区域性数据集中缺乏此类对齐
ImageGraph 包含图像与说明文字的关系型知识图谱 实体与关系抽取针对英文语料库优化
 支持扩展的三元组查询 在说明文字稀疏或元数据缺失的环境中表现不佳
VisualSem 支持多语言 对亚洲低资源语言的表征较差
 适用于神经语义处理流程 不支持天城文或基于文化的视觉语义
VISHAM-KG 包含印度语言图像的关系型知识图谱 依赖特定语言
 支持形态丰富语法的语义处理流程 依赖不同语言的不同词性标注体系

表1:低资源语言中MMKGs的局限性关键比较。

现有的多模态知识图谱(MMKG)模型依赖静态知识图谱,由于其基于单一数据集进行训练,无法适应现实世界中不断变化的动态环境,其中新的实体类型和关联关系持续涌现,因此开发具备动态能力的模型至关重要16。在此背景下存在以下局限性:在物体识别、提取和标注等视觉任务中对文本数据的使用不当;缺乏可扩展的方法以从异构来源构建多模态知识图谱;以及未能将上下文信息有效融入多模态知识图谱,从而限制了对内容的理解与解释能力。

在这些条件下,VISHAM-KG 通过采用先进的视觉提取技术,直接从视觉文档中定义节点和关系,从而区别于早期方法。该方法结合了分词、停用词去除和词性标注等标准文本处理步骤与语义图技术,以结构化提取出的知识。通过融合计算机视觉与本体论,该系统具备多项优势19:更强的适应性,使知识库能够随特定应用需求而演化;改进的语义表示能力,支持跨系统的互操作性;以及更优的语义推理与检索能力,实现基于上下文的知识库增强。

访问受限。请登录或开始试用以查看此内容。

方案

本方案仅使用公开的、非人类的、非敏感的视觉和文本数据,因此无需伦理审批。表2列出了所有工具和技术及其依赖项。用于复现多模态知识图谱构建流程的全部源代码、配置文件和脚本均公开于GitHub仓库(preeti017phdit22-wq/VISHAM_KG.)。该仓库包含安装说明和依赖项说明,以促进研究的可重复性。

模块模型 / 工具版本框架用途
OCREasyOCRv1.7.1PyTorch印地语文本提取
词性标注 + 依存句法分析Stanza (hi)v1.6.1PyTorch语言学解析
命名实体识别BiLSTM-CRF自定义训练PyTorch印地语实体识别
目标检测YOLOv8v8.0.208Ultralytics视觉实体提取
文本嵌入XLM-R Base2023-05HuggingFace多语言文本编码
视觉嵌入CLIP-ViT-B/322022-09OpenAI图像编码
图存储Neo4jv5.13Neo4j知识图谱构建
相似性计算Cosine SimilarityNumPy跨模态对齐

表2:构建VISHAM-KG各步骤中使用的工具与技术。

1. 知识图谱构建

  1. 数据准备
    1. 从上述来源收集 10 个儿童故事文档11,13。确认每个文档均有对应的图像文件。
    2. 将每个文档存储为包含图像文件(PNG 或 JPG 格式)及相应印地语文本的结构化单元。
    3. 为每个文档分配唯一的标识符,以关联每幅图像与其对应的文本。
  2. 文本提取与预处理
    1. 使用 EasyOCR(配置为支持天城文脚本)从扫描图像中提取文档中的印地语文本(图 2)。
    2. 对提取的文本进行归一化处理,去除 OCR 产生的噪声及多余符号。
    3. 进行句子切分和分词处理,将文本分解为单词单位,并利用预定义的印地语停用词列表去除停用词。
    4. 使用支持印地语的自然语言处理工具 Stanza (Hi) 进行词性标注和依存句法分析。
    5. 采用 BiLSTM-CRF 模型识别命名实体。
    6. 利用依存句法规则模板提取主语-关系-宾语三元组。生成带有标注语法关系的依存句法树,以构建有意义的三元组(图 3)。

使用词性标注、依存句法分析和知识图谱三元组展示动词关系规则的句子结构图。
图 2:使用仅基于动词的关系从印地语文本中提取简单的主谓宾三元组。 该流程图描述了如何利用仅基于动词的关系,从印地语文本中提取简单的主谓宾三元组。请点击此处查看该图的高清版本。

展示句子结构、语法、词性标注和知识图谱三元组抽取的依存句法分析图。
图 3:扩展的动词-介词关系。 该图展示了扩展的动词-介词关系,用于识别三元组的形成。请点击此处查看此图的放大版本。

  1. 视觉实体提取
    1. 加载每张图像,并使用 YOLOv8 目标检测模型进行目标检测(图 4)。
    2. 提取图像中已识别目标的边界框、类别标签和置信度分数(图 5)。
    3. 通过保留置信度分数 ≥ 0.50 的检测结果来筛选检测到的目标。将筛选后的目标记录为视觉实体(可选)。保存带有边界框坐标的视觉实体,并生成这些实体的列表。

目标检测过程;YOLO V8 方法;图中文字突出显示对狮子、狐狸的识别。
图4:目标检测。 该图展示了使用 YOLOv8 进行目标检测的过程。请点击此处查看此图的放大版本。

使用 YOLO V8 的视觉特征提取模型示意图,用于目标检测与识别。
图 5:视觉特征提取与目标检测和识别。 该图展示了使用卷积层和 YOLOv8 进行视觉特征提取,随后基于相似性得分进行区域优化与对齐的过程。请点击此处查看该图的放大版本。

  1. 实体嵌入与对齐
    1. 使用 XLM-R 嵌入生成文本实体的上下文嵌入。使用 CLIP-ViT 嵌入生成检测到的对象的视觉嵌入(图6)。
    2. 将文本和视觉嵌入投影到共享的潜在空间,并将其归一化为单位长度。
    3. 计算每对文本嵌入与视觉嵌入之间的余弦相似度。当相似度 ≥ 预定义阈值 τ 时进行实体对齐(默认 τ = 0.65)。生成对齐的文本-图像实体对列表。

使用YOLO、CIFAR-100的图文关系示意图;用于句法、依存句法分析和知识图谱三元组的自然语言处理。
图6:视觉目标检测与词性标注融合。 该图展示了用于知识图谱三元组提取的视觉目标检测与词性标注(POS)的融合过程。YOLO 和 CIFAR-100 用于识别物体,以实现多模态对齐。请点击此处查看该图的放大版本。

  1. 三元组提取
    1. 使用依存规则提取文本三元组,这些规则映射主语-谓语-宾语结构。
    2. 利用空间邻近性和共现规则推导视觉关系。
    3. 通过使用关系标签关联对齐的文本和视觉实体生成多模态三元组。对三元组进行句法和语义一致性的验证。
  2. 知识图谱构建
    1. 将对齐的实体转换为符合RDF格式的三元组。将文本三元组和视觉三元组合并为一个统一的图谱。
    2. 将实体作为节点插入,关系作为边插入。使用显式谓词编码多模态链接。将生成的图谱存储于Neo4j中(可选)。至此,已生成一个包含对齐文本-图像三元组的完整多模态知识图谱。
      注:图 7 展示了从印地语视觉文档构建多模态知识图谱的系统性方法。

知识图谱构建流程图,包括实体识别和跨模态融合。
图 7:多模态知识图谱构建流程。 该流程图展示了 VISHAM-KG 的构建流程。请点击此处查看该图的放大版本。

  1. 使用下面的伪代码进行知识图谱构建。
    输入:
    D :印地语文本-图像文档集合
    τ :对齐的相似度阈值
    预处理每对文档 (T,I)D
    T 为扫描件,使用 OCR 提取文本 T';执行分词、词形还原和停用词去除
    使用 Stanza 进行词性标注和依存句法分析
    使用 YOLOv8 检测图像 I 中的对象
    提取边界框、标签 Li 和置信度分数 > 0.5
    生成嵌入
    使用 BiLSTM-CRF 从 T' 中识别命名实体 E
    从 Li 中提取视觉实体 E
    使用 XLM-R 计算文本嵌入 ET
    使用 CLIP-ViT 计算视觉嵌入 EV
    基于三元组提取的实体对齐
    对于 ET × EV 中的每一对 (et,ev):
    计算余弦相似度 S = cos(EV,ET)
    设置阈值 τ=0.6
    如果 s≥τ,则将三元组 (et, has_image,ev) 添加到集合 F 中。
    使用依存规则从 T' 中提取 (h,r,t) 三元组。
    从空间或基于字幕的共现关系中推导视觉关系。
    将 Et 和 Ev 投影到共享的潜在空间中。
    对三元组打分,并保留高于置信度阈值的三元组。
    将验证后的三元组和实体添加到图 G 中。
    输出:最终的 Neo4j 知识图谱。

2. 评估步骤

注意:选择印地语儿童故事用于评估 VISHAM-KG 框架,因为这些故事提供了受控的、以视觉为依托的叙述,具有明确的实体和关系,能够在领域规模部署之前,可靠地验证多模态对齐、图谱构建和推理效果。所有超参数设置均见表 3

模块超参数维度
OCR置信度阈值0.5
实体提取嵌入维度300
目标检测置信度阈值0.5
输入图像尺寸640 × 640
文本嵌入语言模型XLM-R
嵌入维度768
图像嵌入视觉模型CLIP-ViT-B/32
嵌入维度768
对齐相似性度量余弦相似度
文本-图像对齐余弦相似度阈值 (τ)0.6
链接预测嵌入维度100
训练轮数50
负采样均匀采样
评估训练–测试划分80 / 20

表3:框架的超参数设置。

组件数量
文档图像10
文本实体186
视觉实体97
基于文本的关系105
基于视觉的关系41
文本与视觉三元组312

表4:知识图谱与三元组统计。

  1. 数据集构成与划分
    1. 评估数据集包含10个儿童故事,每个故事均配有插图。执行步骤1.2–1.4中提到的实体提取过程。结果如表4所示。
    2. 构建两种图谱变体:一种为仅基于文本三元组的纯文本知识图谱(T-KG),另一种为融合文本与视觉三元组的多模态知识图谱(MM-KG)。
    3. 为确保受控评估,对两种图谱采用相同的数据划分方式。
    4. 将提取出的三元组以80:20的比例随机划分,即80%用于图谱构建(训练集),20%保留用于评估(测试集)。在文本知识图谱和MMKG中一致应用此划分方式,以确保公平比较。
  2. 基线模型与评估指标
    1. 文本知识图谱作为基线模型。所提出的框架VISHAM KG代表所提出的方法。对于两种图谱,使用相同的本体、实体标识符和评估查询。两种图谱之间的唯一区别在于VISHAM-KG中包含了视觉实体。
  3. 评估指标与链接预测
    1. 采用标准的链接预测指标20:平均倒数排名(MRR)、Hits@1、Hits@3、Hits@10。Hits@K定义为正确实体出现在前K个排名中的情况所占比例。
    2. 对于每个测试三元组(头实体,关系,尾实体),遮蔽头实体或尾实体之一。基于共享嵌入空间中的余弦相似度对所有候选实体进行排序(表5)。
文本实体视觉实体余弦相似度
शेर静力平衡示意图,ΣFx=0,力矢量,工程力学概念,用于教学。0.78
लोमड़ी静力平衡示意图;方程 ΣFx=0,ΣFy=0;矢量力分析;用于教学。0.82

表5:文本与图像嵌入之间的余弦相似度得分。

  1. 分别对纯文本嵌入和多模态嵌入(VISHAM-KG)独立生成预测。
  2. 使用平均倒数排名(Mean Reciprocal Rank, MRR)计算结果,即在所有查询中正确实体的倒数排名的平均值21。根据表6,将所有结果以小数形式表示,以确保实验间的一致性22
模型MRRHits@1Hits@3Hits@10
TransE0.420.210.480.72
ComplEx0.470.260.520.74
RotatE0.510.310.580.74
VISHAM-KG(文本)0.490.360.620.76

表6:仅文本三元组上的链接预测性能。

  1. 利用这些指标验证多模态知识图谱在恢复缺失链接方面的预测能力,如表7所示。
模型MRRHits@1Hits@3Hits@10
IKRL0.460.340.630.72
VisualBERT0.520.350.610.72
ViLBERT0.540.380.640.75
VISHAM-KG0.570.410.660.79

表7:跨模态三元组预测任务的性能表现。

  1. 使用以下伪代码进行评估。
    对于每个知识图谱变体 G∈{GT,GMM}
    三元组划分

    从 G 中提取所有三元组 Tall
    将 Tall 随机划分为训练集(80%)和测试集 Ttest(20%)。
    使用 Ttrain 中的三元组构建图 Gtrain
    相似性评分与嵌入
    对于每个测试三元组 (h,r,t)∈Ttest
    遮蔽头实体或尾实体以形成查询 (h,r,?) 或 (?,r,t)。
    从 Gtrain 中的实体生成候选实体集 C。
    对每个 ec∈ C,计算嵌入相似性得分 S=cos(equery,ec)。
    根据相似性得分降序对所有候选实体进行排序。
    指标计算
    计算每个查询中正确实体的排名。
    计算所有测试查询的平均倒数排名(MRR)。
    计算 Hits@1、Hits@3 和 Hits@10。
    比较纯文本知识图谱 GT 与多模态知识图谱 GMM 的评估得分。
    输出: 提供可直接归因于多模态融合的定性与定量结果
  2. 跨模态相似性
    1. 计算相似性得分以评估文本嵌入与视觉嵌入之间的对齐程度。将文本嵌入和视觉嵌入均归一化为单位长度,以确保尺度一致性。以余弦相似性作为主要度量指标22
    2. 对于每对文本实体嵌入 et 和视觉实体嵌入 ev,计算相似性得分23
      Score(et,ev) = λ · simtext(et,ev) + (1-λ) · simvisual (et,ev)
      其中:
      λ∈ [0,1] 为模态加权参数,
      simtext 表示文本嵌入之间的余弦相似性,
      simvisual 表示视觉嵌入之间的余弦相似性。

访问受限。请登录或开始试用以查看此内容。

结果

通过在知识表示基准数据集上常用的相似性评分计算和链接预测任务,对所提出的 VISHAM-KG 进行了评估。

实验设置

使用两个已建立的任务评估构建的多模态知识图谱:(i)跨模态相似性评估和(ii)知识图谱链接预测。所有评估均仅在协议终点生成的最终图输出上进行。在评估前固定所有随机种子,并在各实验中应用相同的预处理流程(图8)。

使用图像和印地语文字描述动物互动层级的流程图。
图8:基于印地语短篇故事构建的文本与多模态知识图谱示意图。 第一个图表...

访问受限。请登录或开始试用以查看此内容。

讨论

VISHAM-KG 框架的性能主要依赖于三个关键组成部分:用于天城文文本的光学字符识别(步骤 1.2)、基于置信度的视觉目标检测(使用 Clip-ViT,步骤 1.3)以及基于嵌入的跨模态对齐(步骤 1.4)。光学字符识别的准确性直接影响下游的语言解析和实体抽取。此阶段引入的错误会传播至关系识别过程,并降低对齐精度。该问题通过针对印地语的规范化、词形还原以及基于依存关系的规则约束得以缓解,从而在三元组生成之前稳定实体表示10。所有比较结果如下表 10 所示。

方面文本知识图谱多模态知识图谱改进

访问受限。请登录或开始试用以查看此内容。

披露

作者声明,本文发表不存在任何利益冲突。

材料

本文使用的材料清单
姓名公司目录编号评论
BiLSTM-CRF 和印地语命名实体识别模型自定义训练PyTorch命名实体识别
CLIP-ViT-B/322022-09OpenAI视觉嵌入生成
CPUIntel i9Intel通用计算
EasyOCRv1.7.1Jaided AI从图像中提取印地语文本
GPUNVIDIA RTX 3090NVIDIA模型推理加速
印地语儿童故事10 个故事精选数据集评估语料库
Neo4jv5.13Neo4j Inc.知识图谱存储
NumPyv1.24NumPy 社区数值计算
Pandasv2.0Pandas 社区数据处理
Pythonv3.10Python 软件基金会流程实现
PyTorchv2.0Meta AI深度学习框架
Stanza(印地语模型)v1.6.1Stanford NLP词性标注与依存句法分析
XLM-R(基础版)2023-05HuggingFace文本嵌入生成
YOLOv8v8.0.208Ultralytics视觉目标检测

参考文献

  1. Alberts, A., et al. VisualSem: A high-quality knowledge graph for vision and language. arXiv. , (2020).
  2. Chen, Y., et al. A survey on multimodal knowledge graphs: Construction, completion and applications. Mathematics. 11 (8), 1815-1835 (2023).
  3. Ektefaie, Y., et al. Generalized multimodal models for life sciences. Nat Mach Intell. 5 (4), 340-350 (2023).
  4. Exner, P., Nugues, P. Entity extraction: From unstructured text to DBpedia RDF triples. Proc CEUR Workshop. , 58-69 (2012).
  5. Fan, T., Wang, H., Hodel, T. Multimodal knowledge graph construction of Chinese traditional operas and sentiment and genre recognition. J Cultural Heritage. 62, 32-44 (2023).
  6. Fang, Q., Zhang, X., Hu, J., Wu, X., Xu, C. Contrastive multimodal knowledge graph representation learning. IEEE Trans Knowl Data Eng. 35 (9), 8983-8996 (2022).
  7. Fang, Y., Kuan, K., Lin, J., Tan, C., Chandrasekhar, V. Object detection meets knowledge graphs. Proc IJCAI. , 1-8 (2017).
  8. Fensel, D., et al. Introduction: What is a knowledge graph. , Semant WebSpringer. 1-10 (2020).
  9. Ferrada, S., Bustos, B., Hogan, A. IMGpedia: A linked dataset with content-based analysis of Wikimedia images. , Semant WebSpringer. 84-93 (2017).
  10. Gong, D., Wang, D. Z. Extracting visual knowledge from the web with multimodal learning. Proc IJCAI. , 1718-1724 (2017).
  11. Hollink, L., Bedjeti, A., Van Harmelen, M., Elliott, D. A corpus of images and text in online news. Proc LREC. , 1377-1382 (2016).
  12. Jain, P., Darbari, H., Bhavsar, V. C. Vishit: A visualizer for Hindi text. Proc IEEE Conf. , 886-890 (2014).
  13. StoryWeaver: Free multilingual story platform for children. , Pratham Books. https://storyweaver.org.in/en (2025).
  14. Zhu, B., et al. MMIEA: Multimodal interaction entity alignment model for knowledge graphs. Inf Fusion. 100, 101935(2023).
  15. Wang, M., Wang, H., Qi, G., Zheng, Q. Richpedia: A large-scale, comprehensive multimodal knowledge graph. Big Data Res. 22, 100159(2020).
  16. Liu, Y., et al. MMKG: Multimodal knowledge graphs. , Semant WebSpringer. 459-474 (2019).
  17. Liang, W., Meo, P. D., Tang, Y., Zhu, J. A survey of multimodal knowledge graphs: Technologies and trends. ACM Comput Surv. 56 (11), 1-41 (2024).
  18. Troussas, C., Krouska, A., Tselenti, P., Kardaras, D. K., Barbounaki, S. Enhancing personalized educational content recommendation through cosine similarity-based knowledge graphs and contextual signals. Information. 14 (9), 505(2023).
  19. Vats, P., Sharma, N., Sharma, D. K. HKG: A novel approach for low resource Indic languages to automatic knowledge graph construction. ACM Trans Asian Low-Resour Lang Inf Process. , (2023).
  20. Wang, D., et al. MM-transformer: A transformer-based knowledge graph link prediction model that fuses multimodal features. Symmetry. 16 (8), 961(2024).
  21. Wang, Z., Liu, X., Liu, Z., Weng, Y. A link prediction method for multimodal knowledge graphs based on adaptive fusion and modality information enhancement. Neural Netw. 191, 107771(2025).
  22. Huang, S., Cai, Y., Yuan, L., Wang, J. A knowledge-enhanced network for joint multimodal entity-relation extraction. Inf Process Manag. 62 (3), 104033(2025).
  23. Wang, L., Cheng, H., Wang, R., Huang, X. Machining scheme selection of features based on process knowledge graph and improved cosine similarity matching. Machines. 13 (3), 1-20 (2025).
  24. Zhu, J., et al. A novel cosine-derived probability distribution: Theory and data modeling with computer knowledge graph. Alex Eng J. 103, 1-11 (2024).
  25. Li, Z., Tang, J., Mei, T. Deep collaborative embedding for social image understanding. IEEE Trans Pattern Anal Mach Intell. 41 (9), 2070-2083 (2018).
  26. Qian, Y., Pan, L. Leveraging multimodal features for knowledge graph entity alignment based on dynamic self-attention networks. Expert Syst Appl. 228, 120363(2023).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

Transformer