Methodenartikel

Multimodale kennisgrafieken gebaseerd op regelgebaseerde linguïstische analyse en computer vision

DOI:

10.3791/69803

3 april 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

VISHAM-KG is een multimodaal kader dat kennisgrafieken construeert uit Hindi visuele documenten door tekstuele en visuele entiteiten op één lijn te brengen. Het combineert regelgebaseerde taalkundige analyse met computer vision-technieken om subject-relatie-object-triplets te produceren in Indica-omgevingen met weinig hulpbronnen.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De Visual-Semantic Hindi-Aligned Multimodal Knowledge Graph (VISHAM-KG) is een framework dat is ontworpen om consistente multimodale kennisgrafieken (KG's) te construeren uit Hindi visuele documenten door visuele tekstentiteiten systematisch uit te lijnen. Het doel van deze studie is het integreren van regelgebaseerde linguïstische analyse met computervisie-gebaseerde objectdetectie, die de gestructureerde semantische representatie en onderbouwde redenering in Indicische talen met weinig middelen ondersteunt. Het voorgestelde algoritme begint met de voorbereiding van Natural Language Processing (NLP) Hindi visuele documenten, gevolgd door optische tekenherkenning (OCR) voor Devanagari-scriptextractie en linguïstische preprocessing, die verschillende processen omvat zoals tokenisatie, lemmatisering, woordsoort-tagging en afhankelijkheidsparsing. Parallel worden visuele entiteiten uit afbeeldingen gehaald met objectdetectie en gefilterd met betrouwbaarheidsdrempels. Tekstuele en visuele entiteiten worden ingebed in een gedeelde semantische ruimte met behulp van het meertalige transformermodel XLM-R, samen met CLIP-ViT, en uitgelijnd met behulp van op cosinusgelijkenis gebaseerde drempels. Deze uitgelijnde entiteiten worden gecombineerd met regelgebaseerde afhankelijkheidsrelaties om multimodale triplets te genereren. Het protocol produceert een gestructureerde multimodale kennisgrafiek gecodeerd als subject-relatie-object-triplets met expliciete visuele basis gebaseerd op de Indiase kennisbasis. Deze resulterende output ondersteunt cross-modale query, entiteitsuitlijning en knowledge graph reasoning voor Hindi visuele documenten en biedt een reproduceerbaar kader voor multimodale kennisconstructie in taalkundige omgevingen met weinig middelen.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kennisgrafieken (KGs) zijn gestructureerde semantische grafische representaties waarin entiteiten als knooppunten worden gemodelleerd en relaties als randen. Het maakt efficiënte kennisopwinning en contextuele redenering mogelijk in diverse toepassingen zoals het beantwoorden van vragen, aanbevelingssystemen en informatie-extractie1. In het afgelopen decennium zijn KG-constructiemethodologieën aanzienlijk ontwikkeld. De meeste bestaande benaderingen zijn echter ontworpen voor bronrijke talen, die voornamelijk vertrouwen op grootschalige tekstcorpora2. Als gevolg hiervan blijven talen met weinig middelen ondervertegenwoordigd, wat de toepasbaarheid van op KG gebaseerde technologieën in cultureel en taalkundig diverse omgevingen beperkt3. Tegelijkertijd bevat een groeiend aandeel van de documenten uit de echte wereld – vooral op het gebied van educatieve, culturele en erfgoedgebieden – rijke visuele informatie die onvoldoende wordt vastgelegd door tekstgerichte grafconstructiemethoden4.

Multimodale kennisgrafieken (MMKG's) breiden conventionele KGs uit door niet-tekstuele modaliteiten zoals afbeeldingen, audio of video te integreren om gegronde semantische representatiemogelijk te maken 5. Eerdere MMKG-frameworks, waaronder IMGpedia, Richpedia en ImageGraph, tonen de waarde aan van het associëren van visuele informatie met tekstuele entiteiten voor verbeterde semantische zoekopdrachten en redenering 6,7,8. Ondanks deze vooruitgang zijn bestaande methoden grotendeels Engels-georiënteerd, afhankelijk van gecureerde metadata of statische datasets, en bieden ze beperkte procedurele richtlijnen voor het direct construeren van MMKG's uit ongestructureerde visuele documenten. Bovendien pakken deze frameworks niet expliciet de uitdagingen aan die inherent zijn aan laag-resource talen, zoals script-specifieke Optical Character Recognition (OCR)-fouten, morfologische variabiliteit en schaarzame geannoteerde data 9,10.

Het doel van dit kader is het uitvoeren van een stapsgewijze methodologie voor het construeren van een multimodale kennisgrafiek uit Hindi visuele documenten door tekstuele en visuele entiteiten systematisch op elkaar af te stemmen. Het voorgestelde raamwerk, Visual-Semantic Hindi-Aligned Multimodal Knowledge Graph (VISHAM-KG), integreert regelgebaseerde taalkundige analyse met computer vision, dat gebaseerd is op objectextractie, om dynamische grafiekconstructie van visuele documenten mogelijk te maken. In tegenstelling tot bestaande MMKG-benaderingen extraht VISHAM-KG direct entiteiten en relaties uit ruwe Hindi-tekst en afbeeldingen, past afhankelijkheidsgebaseerde grammaticale regels toe voor relatieidentificatie, en voert cross-modale entiteitsuitlijning uit met embedding-gebaseerde gelijkenisdrempels in plaats van te vertrouwen op externe11,12.

VISHAM-KG is bedoeld voor geïllustreerde documenten waarin tekstuele en visuele inhoud semantisch met elkaar verbonden zijn, zoals kinderverhalen13, educatief materiaal, krant11 en cultureel onderbouwde verhalen. Enkele beperkingen, zoals afhankelijkheid van optische tekenherkenning, objectdetectiedekking en domeinspecifieke woordenschatbeschikbaarheid, zijn tegengekomen bij het uitvoeren van het genoemde framework. Door elke procedurele stap expliciet te documenteren, biedt VISHAM-KG een reproduceerbaar protocol voor multimodale kennisgrafiekconstructie in linguïstische contexten met weinig bronnen, terwijl het onderbouwd semantisch redeneren en cross-modale analyse ondersteunt.

VISHAM-KG verschilt van bestaande MMKG-benaderingen door direct entiteiten en relaties te extraheren uit ongestructureerde Hindi-tekst en afbeeldingen; het gebruik van regelgebaseerde afhankelijkheidsparsing voor relatie-extractie; en het afstemmen van tekstuele en visuele entiteiten via embedding-gebaseerde gelijkenisdrempels in plaats van metadata-matching 8,10 (Figuur 1).

figure-introduction-1
Figuur 1: End-to-end framework. De figuur illustreert het end-to-end framework voor multimodale kennisgraaf VISHAM-KG. Klik hier om een grotere versie van deze figuur te bekijken.

Dit protocol is van toepassing op geïllustreerde documenten met uitgelijnde tekst-afbeeldingsinhoud, zoals educatief materiaal en culturele verhalen. In dit kader wordt YOLOv8 gekozen vanwege zijn efficiëntie en robuustheid in objectdetectie op visuele documenten. XLM-R wordt gekozen vanwege zijn sterke cross-linguale representaties, die goed geschikt zijn voor Hindi-tekstverwerking met weinig middelen, en CLIP-ViT wordt gebruikt vanwege zijn bewezen vermogen om gedeelde visuele tekst-embeddingruimtes te leren, wat effectieve cross-modale uitlijning mogelijk maakt. Maar het wordt beperkt door OCR-nauwkeurigheid, objectdetectiedekking en domeinspecifieke woordenschatbeperkingen.

Gerelateerd werk

Een traditionele kennisgraaf G=(E,R,F) bestaat uit entiteiten E, relaties R en feitelijke drietal F, waarbij elke drietal de vorm (h,r,t)8 heeft. Hierop wordt voortgezet met een Multi-Modal Knowledge Graph (MMKG) die E-entiteiten omvatten die geassocieerd zijn met niet-tekstuele modaliteiten zoals afbeeldingen, audio en video14.

Twee hoofdstrategieën worden gebruikt in MMKG's om visuele data weer te geven:
Als attributen gekoppeld aan tekstuele entiteiten
Als visuele entiteiten verbonden via een specifieke geannoteerde relatie

Een opmerkelijke studie is IMGpedia, die Wikimedia-beeldgegevens verbetert door visuele beschrijvingen en overeenkomstmetingen te integreren. Dit model pakt de beperkingen aan van traditionele datasets die voornamelijk metadata bevatten, waardoor visuele-semantische querys en gelijkenisbeoordeling mogelijk zijn door afbeeldingen te koppelen met DBpedia Commons9.

Evenzo pakt een andere MMKG Richpedia de uitdaging aan van onvolledige kennisgrafieken in wetenschappelijk onderzoek. Het verzamelt 2.883.162 visuele entiteiten van Wikipedia en 30.638 tekstuele entiteiten van Wikidata. Richpedia ondersteunt query's op aspect-niveau en gebruikt methoden om semantische relaties uit ongestructureerde inhoud te extraheren, waaronder afbeeldingselementen, bijbehorende tekst en hyperlinks15.

ImageGraph breidt deze studie uit door een relationele kennisgrafiek te construeren op basis van de FB15K-dataset, verrijkt met 829.931 webgecrawlde afbeeldingen en bijschriften. Het bevat 14.870 entiteiten en 1.330 relatietypen, waardoor visueel-contextuele zoekopdrachten en nauwkeurigere antwoorden mogelijk zijn door conceptgebaseerde queryparameters16 te ondersteunen.

VisualSem is een andere uitgebreide meertalige kennisgrafiek die visuele en tekstuele informatie integreert. Het bestaat uit 89.896 entiteiten, meer dan 1,3 miljoen glossen en 938.100 afbeeldingen. VisualSem, ontworpen voor toepassingen zoals data-augmentatie en aarding, verbetert semantische interpretatie tussen talen en kan naadloos worden geïntegreerd in verschillende verwerkingspijplijnen1.

Er zijn ook verschillende MMKG-modellen ontwikkeld om taken zoals linkvoorspelling, tripletclassificatie en entiteitsmatching te ondersteunen. Deze modellen pakken beperkingen van enkelmodale grafen aan, met name hun onvermogen om de complexiteit van cross-modale informatie te vatten 16,17,18.

De kritische vergelijking tussen taalgebaseerde MMKG-modellen samen met VISHAM-KG wordt gegeven in Tabel 1. Het richt zich specifiek op hun kracht en beperkingen in de context van talen met weinig middelen zoals Hindi, Tamil of Sanskriet. Deze methoden gaan vaak uit van toegang tot hoogwaardige tekstcorpora, betrouwbare taalkundige annotaties en grootschalige voorgetrainde modellen. Deze factoren beperken hun toepasbaarheid op talen met weinig bronnen. In het bijzonder zijn OCR-afhankelijke pijplijnen vaak geoptimaliseerd voor Latijnse schriften en vertonen ze een verminderde nauwkeurigheid voor Indische schriften, wat leidt tot ruis of onvolledige tekstextractie. Bovendien worden linguïstische voorverwerking, woordsoorttagging en herkenning van benoemde entiteiten vaak getraind op talen met veel bronnen. Ze vertonen drastisch verminderde prestaties wanneer ze worden toegepast op morfologisch rijke, syntactisch flexibele talen zoals Hindi.

MMKG-modelSterke puntenBeperkingen in omgevingen met weinig middelen
IMGpediaIntegreert afbeeldingen met DBpediaRicht zich alleen op Engelse inhoud
Ondersteunt visuele gelijkeniszoekopdrachtenGeen ondersteuning voor niet-Latijnse schriften
Beperkte culturele context voor regionale visuele elementen
RichpediaCombineert visuele en tekstuele entiteiten van Wikipedia en WikidataOnvoldoende weergave van Indische of volkskennis
Aspectlevel-query's beschikbaarGaat uit van hoge kwaliteit uitlijning, wat ontbreekt in regionale datasets
ImageGraphRelationele KG met afbeeldingen en bijschriftenEntiteit- en relatie-extractie afgestemd op Engelse corpora
Ondersteunt uitgebreide triplet-gebaseerde querysFaalt in omgevingen met weinig onderschriften of ontbrekende metadata
VisualSemMeertalige ondersteuningSlechte representatie van Aziatische talen met weinig hulpbronnen
Nuttig in neurale semantische pijplijnenGeen steun voor Devanagari of cultureel onderbouwde visuele semantiek
VISHAM-KGRelationele KG met afbeeldingen in Indische taalTaalafhankelijk
Semantische pijplijnen voor morfologisch rijke syntaxisHet hangt af van verschillende POS-tags van verschillende talen.

Tabel 1: Kritische vergelijking van MMKG's met beperkingen in talen met weinig bronnen.

Bestaande MMKG-modellen vertrouwen op statische kennisgrafieken en passen zich niet aan dynamische real-world contexten waar nieuwe entiteitstypen en associaties ontstaan door hun training op één dataset. Dit maakt het cruciaal om modellen te ontwikkelen met dynamische mogelijkheden16. De volgende beperkingen zijn in deze context aanwezig: onjuist gebruik van tekstuele gegevens bij visuele activiteiten zoals objectidentificatie, extractie en annotatie; het ontwikkelen van schaalbare methoden voor het construeren van multimodale kennisgrafieken uit heterogene bronnen; en het integreren van contextuele informatie in multimodale kennisgrafieken voor beter begrip en interpretatie.

In deze omstandigheden verschilt VISHAM-KG van eerdere benaderingen door gebruik te maken van geavanceerde visuele extractietechnieken om knooppunten en relaties direct uit visuele documenten te definiëren. Het combineert standaard tekstverwerkingsstappen zoals tokenisatie, stopwoordverwijdering en woordsoort tagging met semantische graaftechnieken om de geëxtraheerde kennis te structureren. Door computer vision en ontologie te combineren biedt het systeem verschillende voordelen:19: verbeterde aanpassingsvermogen, waardoor de kennisbasis kan evolueren met toepassingspecifieke behoeften; verbeterde semantische representatie die interoperabiliteit tussen systemen ondersteunt; en betere semantische inferentie en opvraging, waardoor contextuele kennisbasisverbetering mogelijk wordt.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Voor dit protocol is geen ethische goedkeuring vereist, omdat het uitsluitend gebruikmaakt van openbaar beschikbaare, niet-menselijke, niet-gevoelige visuele en tekstuele gegevens. Tabel 2 geeft alle hulpmiddelen en technieken samen met hun afhankelijkheden. Alle broncode, configuratiebestanden en scripts die nodig zijn om de multimodale kennisgraafconstructiepijplijn te reproduceren, zijn beschikbaar in een openbare GitHub-repository (preeti017phdit22-wq/VISHAM_KG.). De repository bevat installatie-instructies en afhankelijkheidsspecificaties om reproduceerbaarheid te vergemakkelijken.

ModuleModel / ToolVersieRaamwerkDoel
OCREasyOCRv1.7.1PyTorchHindi-tekstextractie
POS + AfhankelijkheidsparsingStrofe (hoi)v1.6.1PyTorchTaalkundige parsing
NERBiLSTM-CRFOp maat getraindPyTorchHindi-entiteitserkenning
ObjectdetectieYOLOv8v8.0.208UltralyticaVisuele entiteitsextractie
Tekst-embeddingsXLM-R Basis2023-05HuggingFaceMeertalige tekstcodering
Visuele embeddingsCLIP-ViT-B/322022-09OpenAIBeeldcodering
GrafopslagNeo4jv5.13Neo4jKG-constructie
GelijkenisCosinusgelijkenisNumPyCross-modale uitlijning

Tabel 2: Gereedschappen en technieken die bij elke stap in de bouw van VISHAM-KG worden gebruikt.

1. Kennisgrafiekconstructie

  1. Datavoorbereiding
    1. Verzamel 10 kinderverhalendocumenten uit de genoemde bronnen.11,13. Controleer de beschikbaarheid van afbeeldingsdocumenten voor elk document.
    2. Sla elk document op als een gestructureerde eenheid met afbeeldingsbestanden (PNG of JPG) en bijbehorende Hindi-tekst.
    3. Wijs een unieke documentidentificatie toe die elke afbeelding koppelt aan de bijbehorende tekst.
  2. Tekstextractie en voorbewerking
    1. Haal tekst uit gescande afbeeldingen met EasyOCR (geconfigureerd voor Devanagari-script) om Hindi-tekst uit documentafbeeldingen te halen (Figuur 2).
    2. Normaliseer geëxtraheerde tekst door OCR-artefacten te verwijderen en overbodige symbolen te verwijderen.
    3. Voer zinssegmentatie en tokenisatie uit. Tokeniseer de tekst in woorden. Verwijder stopwoorden met behulp van een vooraf bepaalde Hindi-stopwoordlijst.
    4. Voer woordsoorttagging en afhankelijkheidsparsing uit met een Hindi-compatibele NLP met Stanza (Hi).
    5. Identificeer benoemde entiteiten met behulp van een BiLSTM-CRF-model.
    6. Extraheer subject-relation-object-triplets met behulp van afhankelijkheidsregelsjablonen. Genereer een afhankelijkheidsboom met gelabelde grammaticale relaties voor het construeren van betekenisvolle triplets (Figuur 3).

figure-protocol-1
Figuur 2: Extractie van een eenvoudige onderwerp-werkwoord-object triplet uit Hindi-tekst met behulp van alleen-werkwoordrelaties. Het stroomdiagram beschrijft het extraheren van een eenvoudige onderwerp-werkwoord-object triplet uit Hindi-tekst met behulp van alleen-werkwoordrelaties. Klik hier om een grotere versie van deze figuur te bekijken.

figure-protocol-2
Figuur 3: Uitgebreide verb-voorzetselrelatie. De figuur illustreert de uitgebreide verb-voorzetselrelatie om de trioolvorming te identificeren. Klik hier om een grotere versie van deze figuur te bekijken.

  1. Visuele entiteitsextractie
    1. Laad elke afbeelding en pas objectdetectie toe met behulp van het YOLOv8 objectdetectiemodel (Figuur 4).
    2. Extraheren begrenzingsboxen, klasselabels en betrouwbaarheidsscores van geïdentificeerde objecten in de afbeelding (Figuur 5).
    3. Filter gedetecteerde objecten door detecties met betrouwbaarheidsscores ≥ 0,50 te behouden. Registreer gefilterde objecten als visuele entiteiten (OPTIONEEL). Sla visuele entiteiten op met coördinaten van de begrenzende doos en genereer een lijst van deze entiteiten.

figure-protocol-3
Figuur 4: Objectdetectie. De figuur illustreert objectdetectie met behulp van YOLOv8. Klik hier om een grotere versie van deze figuur te bekijken.

figure-protocol-4
Figuur 5: Visuele feature-extractie en objectdetectie en identificatie. De figuur illustreert visuele feature-extractie met behulp van convolutionele lagen en YOLOv8, gevolgd door regioverfijning en uitlijning op basis van gelijkenisscores. Klik hier om een grotere versie van deze figuur te bekijken.

  1. Entiteits-embedding en uitlijning
    1. Genereer contextuele embeddings voor tekstuele entiteiten met behulp van XLM-R embeddings. Genereer visuele embeddings voor gedetecteerde objecten met behulp van CLIP-ViT embeddings (Figuur 6).
    2. Project tekst en visuele embeddings in een gedeelde latente ruimte en normaliseer deze tot eenheidslengte.
    3. Bereken cosinusgelijkenis tussen elk tekstueel en visueel embeddingpaar. Lijn entiteiten uit wanneer gelijkenis ≥ vooraf gedefinieerde drempel τ (standaard τ = 0,65). Maak een lijst van uitgelijnde tekst-beeld entiteitenparen.

figure-protocol-5
Figuur 6: Visuele objectdetectie en POS-tags fusie. De figuur illustreert visuele objectdetectie en POS-tags fusie voor het extractie van kennisgrafiek-triplet. YOLO en CIFAR-100 identificeren objecten die multimodale uitlijning aantonen. Klik hier om een grotere versie van deze figuur te bekijken.

  1. Triplet-extractie
    1. Extraheer tekstuele triplets met behulp van afhankelijkheidsregels die onderwerp-werkwoord-objectstructuren in kaart brengen.
    2. Leid visuele relaties af met behulp van regels voor ruimtelijke nabijheid en co-occurrence.
    3. Genereer multimodale triplets door uitgelijnde tekstuele en visuele entiteiten te koppelen met behulp van relatielabels. Valideer triolen voor syntactische en semantische consistentie.
  2. Kennisgrafiekconstructie
    1. Zet uitgelijnde entiteiten om in RDF-compatibele triplets. Voeg tekstuele en visuele triool samen tot een uniforme grafiek.
    2. Voeg entiteiten in als knopen en relaties als randen. Codeer multimodale links met expliciete predicaten. Sla de resulterende grafiek op in Neo4j (OPTIONEEL). Een definitieve multimodale kennisgrafiek met uitgelijnde tekst-beeld triplets wordt nu gegenereerd.
      OPMERKING: Een systematische aanpak voor het construeren van een multimodale kennisgrafiek uit Hindi visuele documenten is weergegeven in Figuur 7.

figure-protocol-6
Figuur 7: Pijplijn voor multimodale kennisgrafiekconstructie. Het stroomdiagram stelt pijpleidingen voor VISHAM-KG weer voor. Klik hier om een grotere versie van deze figuur te bekijken.

  1. Gebruik de onderstaande pseudocode voor het opstellen van kennisgrafieken.
    Input:
    D : Set van Hindi tekst-afbeeldingsdocumenten
    τ : Gelijkenisdrempel voor uitlijning
    Preprocessing elk documentpaar (T,I)D
    Als T wordt gescand, haal dan tekst T' uit met behulp van OCRPerform-tokenisatie, lemmatisering en stopwoordverwijdering
    Pas POS-tagging en afhankelijkheidsparsing toe met behulp van Stanza
    Detecteer objecten in I met YOLOv8
    Extraheren van bounding boxes, labels Li en betrouwbaarheidsscores > 0,5
    Genereer Embedding
    Identificeer benoemde entiteiten ET van T' met behulp van BiLSTM-CRF
    Haal visuele entiteiten EV uit Li
    Bereken tekstuele embeddings ET met XLM-R.
    Bereken visuele embeddings EV met CLIP-ViT
    Entiteitsuitlijning met triplet-extractie
    Voor elk paar (et,e v) in ET x EV:
    Bereken cosinusgelijkenis S = cos(EV,E T)
    Set Threshold τ=0.6
    Als s≥τ, voeg dan triplet (et, has_image,ev) toe aan de verzameling F.
    Haal (h,r,t) triplets uit T' met behulp van afhankelijkheidsregels.
    Leid visuele relaties af uit ruimtelijke of op bijschriften gebaseerde co-incidentie.
    Project Et en Ev in een gedeelde latente ruimte.
    Behaal triolen en behoud degenen boven de betrouwbaarheidsgrens.
    Voeg gevalideerde triplets en entiteiten toe aan graaf G.
    Output: eind-KG in Neo4j.

2. Evaluatieprocedure

OPMERKING: Verhalen van Hindi-kinderen worden gekozen voor evaluatie van het VISHAM-KG-framework omdat ze gecontroleerde, visueel onderbouwde verhalen bieden met duidelijke entiteiten en relaties, waardoor betrouwbare validatie van multimodale uitlijning, grafiekconstructie en inferentie mogelijk is vóór domeinschaal-implementatie. Alle hyperparameterinstellingen worden weergegeven in Tabel 3.

ModuleHyperparameterAfmetingen
OCRBetrouwbaarheidsdrempel0.5
EntiteitsextractieEmbedding-dimensie300
ObjectdetectieBetrouwbaarheidsdrempel0.5
Grootte van de invoerafbeelding640 × 640
Tekst-embeddingTaalmodelXLM-R
Embedding-dimensie768
Beeld-embeddingVisiemodelCLIP-ViT-B/32
Embedding-dimensie768
UitlijningGelijkenismaatstafCosinusgelijkenis
Tekst-beeld uitlijningCosinusgelijkenisdrempel (τ)0.6
LinkvoorspellingEmbedding-dimensie100
Opleidingsperiodes50
Negatieve steekproefnemingUniform
EvaluatieTrein-testsplitsing80 / 20

Tabel 3: Hyperparameterinstelling voor het framework.

ComponentGraaf
Documentafbeeldingen10
Tekstuele entiteiten186
Visuele entiteiten97
Tekstafgeleide relaties105
Visueel-afgeleide relaties41
Tekstuele en visuele trioolen312

Tabel 4: Kennisgrafiek en tripletsstatistieken.

  1. Samenstelling en partitionering van datasets
    1. De evaluatiedataset bestaat uit 10 kinderverhalen, elk vergezeld van illustratieve afbeeldingen. Voer het entiteitsextractieproces uit dat in stappen 1.2-1.4 wordt genoemd. De resultaten worden weergegeven in Tabel 4.
    2. Bouw twee grafiekvarianten: één tekst-only kennisgraaf (T-KG) met alleen tekstuele trioolen en een andere Multimodale kennisgrafiek (MM-KG) met samengevoegde tekstuele en visuele trioolen.
    3. Om een gecontroleerde evaluatie te garanderen, gebruik voor beide grafieken identieke datasplitsen.
    4. Willekeurig partitioneerde de extractieve triplets op 80:20, dat wil zeggen 80% voor graafconstructie (trainingsset) en 20% voor evaluatie (testset). Pas deze splitsing consequent toe op zowel tekstuele KG als MMKG om een eerlijke vergelijking te garanderen.
  2. Baseline- en evaluatiemetrieken
    1. De tekstuele KG dient als basislijn. Het voorgestelde kader, VISHAM KG, vertegenwoordigt de voorgestelde methode. Voor beide grafen gebruik je een identieke ontologie met entiteitsidentificaties en evaluatiezoekopdrachten. Het enige verschil tussen de twee grafieken is de opname van visuele entiteiten in VISHAM-KG.
  3. Evaluatiemetrics en linkvoorspelling
    1. Gebruik de standaard linkvoorspellingsmetrics20: Mean Reciprocal Rank (MRR), Hits@1, Hits@3, Hits@10. Hit@K, gedefinieerd als het aandeel gevallen waarin de juiste entiteit in de top N rangen voorkomt.
    2. Voor elke testtriplet (kop, relatie, staart) maskeert u ofwel het hoofd- of staart-entiteit. Rangschik alle kandidaat-entiteiten op basis van cosinusgelijkenis in de gedeelde embeddingruimte (Tabel 5).
Tekstuele entiteitVisuele entiteitCosinusgelijkenis
शेरfigure-protocol-70.78
लोमड़ीfigure-protocol-80.82

Tabel 5: Cosinusgelijkenisscores tussen tekst- en beeld-embeddings.

  1. Genereer onafhankelijk voorspellingen voor tekst-only embeddings en multimodale embeddings (VISHAM-KG).
  2. Bereken de resultaten met behulp van de Gemiddelde Wederkerige Rang (MRR), als het gemiddelde van de wederkerige rangen van de juiste entiteit over alle zoekopdrachten21. Gebruik Tabel 6 om alle resultaten in decimale vorm uit te drukken voor consistentie tussen experimenten22.
ModelMRRHits@1Hits@3Hits@10
TransE0.420.210.480.72
ComplEx0.470.260.520.74
RotatE0.510.310.580.74
VISHAM-KG (tekstueel)0.490.360.620.76

Tabel 6: Voorspellingsprestaties van linken op tekst-only triplets.

  1. Gebruik de metrieken om de voorspellende kracht van de multimodale kennisgrafiek te valideren bij het terugvinden van ontbrekende schakels, zoals weergegeven in Tabel 7.
ModelMRRHits@1Hits@3Hits@10
IKRL0.460.340.630.72
VisualBERT0.520.350.610.72
ViLBERT0.540.380.640.75
VISHAM-KG0.570.410.660.79

Tabel 7: Prestaties bij cross-modale tripletvoorspellingstaken.

  1. Gebruik de onderstaande pseudocode voor de evaluatie.
    Voor elke Knowledge Graph-variant G∈{GT,G MM}:
    Triplet-partitionering

    Haal alle trioolen Tallemaal uit G.
    Verdeel Twillekeurig in trainingsset (80%) en testsetT-test (20%).
    Bouw grafiekG-trein met triplets inT-trein.
    Gelijkenisscore en Embedding
    Voor elke test triolen (h,r,t)∈Ttest:
    Masker hoofd- of staartentiteit om query te vormen (h,r,?) of (?,r,t).
    Genereer kandidaat-entity set C uit entities in Gtrain.
    Bereken de embedding-similariteitsscore S=cos(equery,e c) voor elke ec ∈ C.
    Rangschik alle kandidaat-entiteiten op basis van dalende gelijkenisscore.
    Metrische berekening
    Bereken de rang van de juiste entiteit voor elke query.
    Bereken de Gemiddelde Reciproke Rang (MRR) over alle testzoekopdrachten.
    Bereken Hits@1, Hits@3 en Hits@10.
    Vergelijk de evaluatiescores tussen alleen tekstgebaseerde KG GT en multimodale KG GMM.
    Output: Kwalitatieve en kwantitatieve resultaten leveren die direct toegeschreven kunnen worden aan multimodale integratie
  2. Cross-modale gelijkenis
    1. Bereken gelijkenisscores om de uitlijning tussen tekstuele en visuele embeddings te evalueren. Normaliseer zowel tekstuele embeddings als visuele embeddings op eenheidslengte om consistentie in schaal te waarborgen. Gebruik cosinusgelijkenis als primaire maatstaf22.
    2. Voor elk paar (et, ev) van tekstuele entiteit-embedding en visuele entiteit-embedding, bereken je de gelijkenisscore23.
      Score(et,e v) = λ ·simtekst(et,e v) + (1-λ) ·sim-visueel (et,e v) .
      waarbij:
      λ∈ [0,1] is de modaliteitswegingsparameter,
      Simtekst is de cosinusgelijkenis tussen tekstuele embeddings,
      Sim-visueel is de cosinusgelijkenis tussen visuele embeddings.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De voorgestelde VISHAM-KG wordt geëvalueerd via similarity score-computation en linkvoorspellingstaken die vaak worden gebruikt in de knowledge representation benchmark dataset.

Experimentele opstelling

Evalueer de geconstrueerde multimodale kennisgrafiek met behulp van twee vastgestelde taken: (i) cross-modale gelijkenisbeoordeling en (ii) voorspelling van kennisgrafiekverbindingen. Voer alle evaluaties uitsluitend...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De prestaties van het VISHAM-KG-framework zijn voornamelijk gebaseerd op drie kritieke componenten: OCR voor Devanagari-tekst (stap 1.2), betrouwbaarheidsgebaseerde visuele objectdetectie met Clip-ViT (stap 1.3) en embedding-gebaseerde cross-modale uitlijning (stap 1.4). OCR-nauwkeurigheid beïnvloedt direct de downstream linguïstische parsing en entiteitsextractie. De fouten die in deze fase worden geïntroduceerd, verspreiden zich naar relatie-identificatie en verminderen de uitlijningsp...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat er geen belangenconflicten zijn met betrekking tot de publicatie van dit artikel.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
BiLSTM-CRF en Indic NER ModelOp maat getraindPyTorchNaamherkenning
CLIP-ViT-B/322022-09OpenAIGeneratie van visuele inbedding
CPUIntel i9IntelAlgemene berekening
EasyOCRv1.7.1Jaided AIExtractie van Hindi-tekst uit afbeeldingen
GPUNVIDIA RTX 3090NVIDIAVersnelling van modelinferensie
Hindi Kids Stories10 verhalenGekeurde datasetEvaluatiecorpus
Neo4jv5.13Neo4j Inc.Kennisgraafopslag
NumPyv1.24NumPy CommunityNumerieke berekeningen
Pandasv2.0Pandas CommunityGegevensbehandeling
Pythonv3.10Python Software FoundationPijplijnimplementatie
PyTorchv2.0Meta AIDeep learning-framework
Stanza (Hindi Model)v1.6.1Stanford NLPPOS-tagging en afhankelijkheidsanalyse
XLM-R (Basis)2023-05HuggingFaceGeneratie van tekstinbedding
YOLOv8v8.0.208UltralyticsDetectie van visuele objecten

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Alberts, A., et al. VisualSem: A high-quality knowledge graph for vision and language. arXiv. , (2020).
  2. Chen, Y., et al. A survey on multimodal knowledge graphs: Construction, completion and applications. Mathematics. 11 (8), 1815-1835 (2023).
  3. Ektefaie, Y., et al. Generalized multimodal models for life sciences. Nat Mach Intell. 5 (4), 340-350 (2023).
  4. Exner, P., Nugues, P. Entity extraction: From unstructured text to DBpedia RDF triples. Proc CEUR Workshop. , 58-69 (2012).
  5. Fan, T., Wang, H., Hodel, T. Multimodal knowledge graph construction of Chinese traditional operas and sentiment and genre recognition. J Cultural Heritage. 62, 32-44 (2023).
  6. Fang, Q., Zhang, X., Hu, J., Wu, X., Xu, C. Contrastive multimodal knowledge graph representation learning. IEEE Trans Knowl Data Eng. 35 (9), 8983-8996 (2022).
  7. Fang, Y., Kuan, K., Lin, J., Tan, C., Chandrasekhar, V. Object detection meets knowledge graphs. Proc IJCAI. , 1-8 (2017).
  8. Fensel, D., et al. Introduction: What is a knowledge graph. , Semant WebSpringer. 1-10 (2020).
  9. Ferrada, S., Bustos, B., Hogan, A. IMGpedia: A linked dataset with content-based analysis of Wikimedia images. , Semant WebSpringer. 84-93 (2017).
  10. Gong, D., Wang, D. Z. Extracting visual knowledge from the web with multimodal learning. Proc IJCAI. , 1718-1724 (2017).
  11. Hollink, L., Bedjeti, A., Van Harmelen, M., Elliott, D. A corpus of images and text in online news. Proc LREC. , 1377-1382 (2016).
  12. Jain, P., Darbari, H., Bhavsar, V. C. Vishit: A visualizer for Hindi text. Proc IEEE Conf. , 886-890 (2014).
  13. StoryWeaver: Free multilingual story platform for children. , Pratham Books. https://storyweaver.org.in/en (2025).
  14. Zhu, B., et al. MMIEA: Multimodal interaction entity alignment model for knowledge graphs. Inf Fusion. 100, 101935(2023).
  15. Wang, M., Wang, H., Qi, G., Zheng, Q. Richpedia: A large-scale, comprehensive multimodal knowledge graph. Big Data Res. 22, 100159(2020).
  16. Liu, Y., et al. MMKG: Multimodal knowledge graphs. , Semant WebSpringer. 459-474 (2019).
  17. Liang, W., Meo, P. D., Tang, Y., Zhu, J. A survey of multimodal knowledge graphs: Technologies and trends. ACM Comput Surv. 56 (11), 1-41 (2024).
  18. Troussas, C., Krouska, A., Tselenti, P., Kardaras, D. K., Barbounaki, S. Enhancing personalized educational content recommendation through cosine similarity-based knowledge graphs and contextual signals. Information. 14 (9), 505(2023).
  19. Vats, P., Sharma, N., Sharma, D. K. HKG: A novel approach for low resource Indic languages to automatic knowledge graph construction. ACM Trans Asian Low-Resour Lang Inf Process. , (2023).
  20. Wang, D., et al. MM-transformer: A transformer-based knowledge graph link prediction model that fuses multimodal features. Symmetry. 16 (8), 961(2024).
  21. Wang, Z., Liu, X., Liu, Z., Weng, Y. A link prediction method for multimodal knowledge graphs based on adaptive fusion and modality information enhancement. Neural Netw. 191, 107771(2025).
  22. Huang, S., Cai, Y., Yuan, L., Wang, J. A knowledge-enhanced network for joint multimodal entity-relation extraction. Inf Process Manag. 62 (3), 104033(2025).
  23. Wang, L., Cheng, H., Wang, R., Huang, X. Machining scheme selection of features based on process knowledge graph and improved cosine similarity matching. Machines. 13 (3), 1-20 (2025).
  24. Zhu, J., et al. A novel cosine-derived probability distribution: Theory and data modeling with computer knowledge graph. Alex Eng J. 103, 1-11 (2024).
  25. Li, Z., Tang, J., Mei, T. Deep collaborative embedding for social image understanding. IEEE Trans Pattern Anal Mach Intell. 41 (9), 2070-2083 (2018).
  26. Qian, Y., Pan, L. Leveraging multimodal features for knowledge graph entity alignment based on dynamic self-attention networks. Expert Syst Appl. 228, 120363(2023).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Visual Entity ExtractionHindi Visual DocumentsOptical Character RecognitionDependency ParsingEntity AlignmentMultilingual TransformerKnowledge Graph Reasoning

Gerelateerde artikelen