Method Article

Wielomodalne wykresy wiedzy oparte na analizie językowej opartej na regułach i widzeniu komputerowym

DOI:

10.3791/69803

April 3rd, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

VISHAM-KG to ramy multimodalne, które konstruują grafy wiedzy z dokumentów wizualnych w języku hindi poprzez dopasowywanie bytów tekstowych i wizualnych. Łączy analizę językową opartą na regułach z technikami widzenia komputerowego, tworząc trójki podmiot-relacja-obiekt w językach indyjskich o ograniczonych zasobach.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Visual-Semantic Hindi-Aligned Multimodal Knowledge Graph (VISHAM-KG) to ramy zaprojektowane do tworzenia spójnych multimodalnych grafów wiedzy (KG) z dokumentów wizualnych w języku hindi poprzez systematyczne wyrównywanie jednostek tekstu wizualnego. Celem tego badania jest integracja analizy językowej opartej na regułach z detekcją obiektów opartą na wizji komputerowej, która wspiera ustrukturyzowaną reprezentację semantyczną i ugruntowane rozumowanie w językach indyjskich o niskich zasobach. Proponowany algorytm rozpoczyna się przygotowaniem wizualnych dokumentów wizualnych w języku hindi (NLP), a następnie stosuje optyczne rozpoznawanie znaków (OCR) do ekstrakcji pisma devanagari i wstępnego przetwarzania językowego, które obejmuje różne procesy, takie jak tokenizacja, lemmatyzacja, tagowanie części mowy oraz parsowanie zależności. Równolegle obiekty wizualne są wyodrębniane z obrazów za pomocą wykrywania obiektów i filtrowane za pomocą progów ufności. Byty tekstowe i wizualne są osadzone w wspólnej przestrzeni semantycznej za pomocą wielojęzycznego modelu transformera XLM-R, wraz z CLIP-ViT, i wyrównane za pomocą progów opartych na podobieństwie kosinusowym. Te wyrównane byty są łączone z relacjami zależnościami opartymi na regułach, aby generować wielomodalne trójki. Protokół generuje ustrukturyzowany multimodalny graf wiedzy zakodowany jako trójaczki podmiot-relacja-obiekt z wyraźnym wizualnym podstawą opartą na indyjskiej bazie wiedzy. Uzyskany wynik będzie wspierał zapytania międzymodalne, wyrównywanie encji oraz rozumowanie na grafach wiedzy dla dokumentów wizualnych w języku hindi oraz zapewnił replikowalne ramy do wielomodalnej konstrukcji wiedzy w językach językowych o niskich zasobach.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Grafy wiedzy (KG) to ustrukturyzowane semantyczne reprezentacje graficzne, w których byty są modelowane jako węzły, a relacje jako krawędzie. Umożliwiają efektywne wyszukiwanie wiedzy i rozumowanie kontekstowe w różnych zastosowaniach, takich jak odpowiadanie na pytania, systemy rekomendacji czy ekstrakcja informacji1. W ciągu ostatniej dekady metodologie konstrukcji KG zostały znacząco rozwinięte. Jednak większość istniejących podejść jest zaprojektowana dla języków bogatych w zasoby, które opierają się głównie na dużych korpusach tekstowych2. W rezultacie języki o niskich zasobach pozostają niedostatecznie reprezentowane, ograniczając zastosowanie technologii opartych na KG w kulturowo i językowo zróżnicowanych środowiskach3. Równolegle rosnący odsetek dokumentów rzeczywistych – szczególnie w dziedzinach edukacyjnych, kulturowych i dziedzictwa, zawiera bogate informacje wizualne, które są niewystarczająco uchwycone metodami budowy grafów skoncentrowanych na tekście4.

Multimodalne grafy wiedzy (MMKG) rozszerzają konwencjonalne KG, integrując modalności nietekstowe, takie jak obrazy, audio czy wideo, umożliwiając ugruntowaną reprezentację semantyczną5. Wcześniejsze frameworki MMKG, w tym IMGpedia, Richpedia i ImageGraph, pokazują wartość łączenia informacji wizualnych z bytami tekstowymi dla lepszego zapytań semantycznych i rozumowania 6,7,8. Pomimo tych postępów, istniejące metody są w dużej mierze skoncentrowane na języku angielskim, opierają się na wyselekcjonowanych metadanych lub statycznych zbiorach danych i oferują ograniczone wskazówki proceduralne dla konstruowania MMKG bezpośrednio z nieustrukturyzowanych dokumentów wizualnych. Co więcej, te ramy nie rozwiązują wyraźnie wyzwań związanych z językami o ograniczonych zasobach, takich jak specyficzne dla skryptów błędy OCR w optycznym rozpoznawaniu znaków, zmienność morfologiczna oraz rzadko opatrzone adnotacjami 9,10.

Celem tego frameworka jest wdrożenie metodologii krok po kroku do budowy multimodalnego grafu wiedzy z dokumentów wizualnych w języku hindi poprzez systematyczne wyrównanie bytów tekstowych i wizualnych. Proponowany framework, Visual-Semantic Hindi-Aligned Multimodal Knowledge Graph (VISHAM-KG), integruje analizę językową opartą na regułach z komputerowym widzeniem oparty na ekstrakcji obiektów, umożliwiając dynamiczną konstrukcję grafów dokumentów wizualnych. W przeciwieństwie do istniejących podejść MMKG, VISHAM-KG bezpośrednio wyodrębnia entity i relacje z surowego tekstu i obrazów w języku hindi, stosuje reguły gramatyczne oparte na zależności do identyfikacji relacji oraz wykonuje wyrównanie między jednostkami przy użyciu progów podobności opartych na osadzaniu, zamiast polegać nazewnętrznych 11,12.

VISHAM-KG jest przeznaczony dla ilustrowanych dokumentów, w których treści tekstowe i wizualne są semantycznie powiązane, takich jak opowieścidla dzieci 13, materiały edukacyjne, gazeta11 oraz narracje o kulturowym podstawie. Podczas realizacji wspomnianego frameworka napotkano pewne ograniczenia, takie jak zależność od optycznego rozpoznawania znaków, zasięgu wykrywania obiektów oraz dostępności słownictwa specyficznego dla danej dziedziny. Dzięki wyraźnej dokumentacji każdego kroku proceduralnego, VISHAM-KG zapewnia powtarzalny protokół do budowy multimodalnych grafów wiedzy w kontekstach językowych o niskich zasobach, wspierając jednocześnie ugruntowane rozumowanie semantyczne i analizę międzymodalną.

VISHAM-KG różni się od istniejących podejść MMKG bezpośrednim wyodrębnieniem encji i relacji z nieustrukturyzowanego tekstu i obrazów w języku hindi; stosowaniem parsowania zależności opartego na regułach do ekstrakcji relacji; oraz wyrównywaniem encji tekstowych i wizualnych poprzez progi podobieństwa oparte na osadzeniu, zamiast metadanych zgodnych z 8,10 (Rysunek 1).

Rysunek 1
Rysunek 1: Ramy end-to-end. Rysunek ilustruje ramy end-to-end dla multimodalnej wiedzy Graf VISHAM-KG. Prosimy kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Protokół ten jest stosowany do ilustrowanych dokumentów z dopasowaną treścią tekstowo-obrazową, takich jak materiały edukacyjne i narracje kulturowe. W tym systemie YOLOv8 został wybrany ze względu na efektywność i odporność w wykrywaniu obiektów w dokumentach wizualnych. XLM-R został wybrany ze względu na silne reprezentacje międzyjęzykowe, które doskonale nadają się do niskozasobowego przetwarzania tekstu w języku hindi, a CLIP-ViT ze względu na udowodnioną zdolność do nauki wspólnych przestrzeni osadzania tekstu wizualnego, co umożliwia skuteczne dopasowanie między modami. Jednak jest ograniczony przez dokładność OCR, pokrycie detekcją obiektów oraz specyficzne dla danej dziedziny ograniczenia słownictwa.

Powiązane dzieła

Tradycyjny graf wiedzy G=(E,R,F) składa się z jednostek E, relacji R oraz faktycznych trójek F, gdzie każda trójka ma postać (h,r,t)8. Rozszerzając to, Multi-Modal Knowledge Graph (MMKG) zawiera E podmioty powiązane z modalnościami nietekstowymi, takimi jak obrazy, dźwięk i wideo14.

W MMKG stosuje się dwie główne strategie reprezentowania danych wizualnych:
Jako atrybuty przypisane do bytów tekstowych
Jako byty wizualne połączone przez konkretną relację adnotowaną

Jednym z godnych uwagi badań jest IMGpedia, która wzbogaca dane obrazowe Wikimedia poprzez włączenie wizualnych deskryptorów i miar podobieństwa. Model ten odpowiada na ograniczenia tradycyjnych zbiorów danych, które głównie zawierają metadane, umożliwiając wizualne zapytania semantyczne i ocenę podobieństwa poprzez łączenie obrazów z DBpedia Commons9.

Podobnie inna MMKG Richpedia podejmuje wyzwanie niekompletnych wykresów wiedzy w badaniach naukowych. Agreguje 2 883 162 byty wizualne z Wikipedii oraz 30 638 jednostek tekstowych z Wikidanych. Richpedia obsługuje zapytania na poziomie aspektowym i stosuje metody wydobywania relacji semantycznych z nieustrukturyzowanych treści, w tym elementów obrazów, powiązanego tekstu i hiperłączy15.

ImageGraph rozwija to badanie, tworząc relacyjny graf wiedzy oparty na zbiorze danych FB15K, wzbogacony o 829 931 obrazów i podpisów przeszukanych przez internet. Zawiera 14 870 encji i 1 330 typów relacji, umożliwiając wizualne zapytania kontekstowe oraz dokładniejsze odpowiedzi dzięki wspieraniu parametrów zapytań opartych na koncepcjach16.

VisualSem to kolejny kompleksowy, wielojęzyczny graf wiedzy integrujący informacje wizualne i tekstowe. Składa się z 89 896 podmiotów, ponad 1,3 miliona glosów oraz 938 100 obrazów. Zaprojektowany do zastosowań takich jak augmentacja danych i uziemienie, VisualSem usprawnia interpretację semantyczną w różnych językach i może być płynnie włączany do różnych potoków przetwarzania1.

Opracowano także kilka modeli MMKG wspierających zadania takie jak predykcja łącza, klasyfikacja tripletów oraz dopasowywanie encji. Modele te odpowiadają na ograniczenia grafów jednomodalnych, w szczególności na ich niezdolność do uchwycenia złożoności informacji międzymodalnych 16,17,18.

Krytyczne porównanie między modelami MMKG opartymi na językach a VISHAM-KG przedstawiono w Tabeli 1. Skupia się ona szczególnie na ich mocnych stronach i ograniczeniach w kontekście języków o niskich zasobach, takich jak hindi, tamilski czy sanskryt. Metody te często zakładają dostęp do wysokiej jakości korpusów tekstowych, wiarygodnych adnotacji językowych oraz dużych modeli, które są wcześniej trenowane. Czynniki te ograniczają ich zastosowanie do języków o niskich zasobach. W szczególności potoki zależne od OCR są często optymalizowane pod kątem alfabetu łacińskiego i wykazują obniżoną dokładność dla alfabetu indyjskiego, co prowadzi do szumów lub niekompletnej ekstrakcji tekstu. Ponadto wstępne przetwarzanie językowe, tagowanie części mowy oraz rozpoznawanie nazw jednostek są często trenowane w językach o wysokich zasobach. Wykazują one drastyczną obniżoną wydajność w przypadku morfologicznie bogatych, składniowo elastycznych języków, takich jak hindi.

MMKG ModelMocne stronyOgraniczenia w warunkach o niskiej osłabieniu zasobów
IMGpediaIntegruje obrazy z DBpediaSkupia się wyłącznie na treściach angielskich
Obsługuje zapytania o podobieństwo wizualneBrak wsparcia dla pisma niełacińskiego
Ograniczony kontekst kulturowy dla regionalnych – wizualizacje
RichpediaŁączy wizualne i tekstowe byty z Wikipedii i WikidanychNiewystarczająca reprezentacja wiedzy indyjskiej lub ludowej
Dostępne zapytania na poziomie aspektówZakłada wysoką jakość dopasowania, czego brakuje w zbiorach danych regionalnych
ImageGraphRelational KG z obrazami i podpisamiEkstrakcja encji i relacji dostrojona do korpusów angielskich
Obsługuje rozszerzone zapytania oparte na tripletachAwarie w środowiskach z rzadkimi podpisami lub brakującymi metadanymi
VisualSemWsparcie wielojęzyczneSłaba reprezentacja języków azjatyckich o niskich zasobach
Przydatne w neuronowych pipeline'ach semantycznychBrak poparcia dla devanagari ani kulturowo ugruntowanej wizualnej semantyki
VISHAM-KGRelational KG z obrazami w językach indyjskichZależności od języka
Potoki semantyczne dla morfologicznie bogatej składniTo zależy od różnych tagów POS w różnych językach.

Tabela 1: Krytyczne porównanie MMKG z ograniczeniami w językach o niskich zasobach.

Istniejące modele MMKG opierają się na statycznych grafach wiedzy, nie dostosowując się do dynamicznych kontekstów rzeczywistych, gdzie nowe typy encji i asocjacji powstają dzięki trenowaniu na pojedynczym zbiorze danych. Dlatego kluczowe jest opracowanie modeli o możliwościach dynamicznych16. W tym kontekście występują następujące ograniczenia: nieprawidłowe wykorzystanie danych tekstowych w działaniach wizualnych, takich jak identyfikacja obiektów, ekstrakcja i adnotacja; opracowywanie skalowalnych metod konstruowania wielomodalnych grafów wiedzy z heterogenicznych źródeł; oraz włączanie informacji kontekstowych do wielomodalnych grafów wiedzy dla lepszego zrozumienia i interpretacji.

W tych warunkach VISHAM-KG różni się od wcześniejszych metod wykorzystując zaawansowane techniki ekstrakcji wizualnej do definiowania węzłów i relacji bezpośrednio z dokumentów wizualnych. Łączy standardowe etapy przetwarzania tekstu, takie jak tokenizacja, usuwanie wyrazów stopowych i tagowanie części mowy z technikami grafów semantycznych, aby ustrukturyzować wyodrębnioną wiedzę. Łącząc widzenie komputerowe z ontologią, system oferuje kilka zalet:19: zwiększoną elastyczność, pozwalającą bazie wiedzy na ewolucję zgodnie z potrzebami aplikacji; ulepszoną reprezentację semantyczną wspierającą interoperacyjność między systemami; oraz lepsze wnioskowanie i wyszukiwanie semantyczne, umożliwiające rozszerzenie bazy wiedzy na poziomie kontekstowym.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nie jest wymagana etyczna zgoda dla tego protokołu, ponieważ wykorzystuje wyłącznie publicznie dostępne, nieludzkie, niewrażliwe dane wizualne i tekstowe. Tabela 2 zawiera wszystkie narzędzia i techniki wraz z ich zależnościami. Cały kod źródłowy, pliki konfiguracyjne i skrypty potrzebne do odtworzenia wielomodalnego pipeline'u budowy grafów wiedzy są dostępne w publicznym repozytorium GitHub (preeti017phdit22-wq/VISHAM_KG.). Repozytorium zawiera instrukcje instalacji oraz specyfikacje zależności ułatwiające powtarzalność.

ModułModel / NarzędzieWersjaRamyCel
OCREasyOCRv1.7.1PyTorchEkstrakcja tekstu hindi
POS + Parsowanie zależnościStrofa (cześć)v1.6.1PyTorchAnaliza językowa
NERBiLSTM-CRFSzkolony na zamówieniePyTorchUznanie podmiotów w języku hindi
Detekcja obiektówYOLOv8v8.0.208UltralitykiEkstrakcja wizualnych bytów
Osadzenia tekstuBaza XLM-R2023-05HuggingFaceWielojęzyczne kodowanie tekstu
Wizualne osadzeniaCLIP-ViT-B/322022-09OpenAIKodowanie obrazu
Przechowywanie grafówNeo4jv5.13Neo4jBudowa KG
PodobieństwoPodobieństwo cosinusoweNumPyMiędzymodalne wyrównanie

Tabela 2: Narzędzia i techniki stosowane na każdym etapie budowy VISHAM-KG.

1. Konstrukcja grafu wiedzy

  1. Przygotowanie danych
    1. Zbierz 10 dokumentów z bajek dla dzieci z wymienionych źródeł 11,13. Potwierdź dostępność dokumentów obrazkowych dla każdego dokumentu.
    2. Przechowuj każdy dokument jako uporządkowaną jednostkę zawierającą pliki obrazów (PNG lub JPG) oraz odpowiadający mu tekst w języku hindi.
    3. Przypisz unikalny identyfikator dokumentu łączący każdy obraz z powiązanym tekstem.
  2. Ekstrakcja tekstu i wstępne przetwarzanie
    1. Wyodrębniaj tekst ze skanowanych obrazów za pomocą EasyOCR (skonfigurowanego dla pisma devanagari), aby wyodrębnić tekst hindi z obrazów dokumentów (Rysunek 2).
    2. Normalizuj wyodrębniony tekst poprzez usunięcie artefaktów OCR i usuwanie zbędnych symboli.
    3. Wykonaj segmentację zdań i tokenizację. Tokenizuj tekst na słowa. Usuń słowa stop, korzystając z wcześniej zdefiniowanej listy słów stopi w języku hindi.
    4. Wykonaj tagowanie części mowy i parsowanie zależności za pomocą NLP zgodnego z językiem hindi za pomocą Stanza (Hi).
    5. Identyfikacja nazwanych jednostek za pomocą modelu BiLSTM-CRF.
    6. Wyodrębnij trójki podmiot-relacja-obiekt za pomocą szablonów reguł zależności. Wygeneruj drzewo zależności z oznaczonymi relacjami gramatycznymi do konstruowania znaczących trójek (Rysunek 3).

Rysunek 2
Rysunek 2: Ekstrakcja prostego tripletu podmiot-czasownik-dopełnienie z tekstu hindi z użyciem relacji tylko czasownikow . Schemat blokowy opisuje wyodrębnienie prostego tryletu podmiot-czasownik-dopełnienie z tekstu hindi, używając relacji wyłącznie czasownikowe. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 3
Rysunek 3: Relacja rozszerzonych przyimków czasownikowych. Rysunek ilustruje rozszerzoną relację przyimków czasownikowych w celu identyfikacji formacji trypletów. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

  1. Ekstrakcja wizualnych bytów
    1. Załaduj każdy obraz i zastosuj wykrywanie obiektów za pomocą modelu wykrywania obiektów YOLOv8 (Rysunek 4).
    2. Wyodrębnij ramki ograniczające, etykiety klas oraz oceny zaufania zidentyfikowanych obiektów na obrazie (Rysunek 5).
    3. Filtruj wykryte obiekty, zachowując wykrycia z ocenami pewności ≥ 0,50. Rejestruj filtrowane obiekty jako byty wizualne (OPCJONALNIE). Zapisuj wizualne obiekty z współrzędnymi ramek ograniczających i generuj listę tych obiektów.

Rysunek 4
Rysunek 4: Wykrywanie obiektów. Ilustracja ilustruje wykrywanie obiektów za pomocą YOLOv8. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 5
Rysunek 5: Ekstrakcja cech wizualnych oraz wykrywanie i identyfikacja obiektów. Rysunek ilustruje ekstrakcję cech wizualnych za pomocą warstw splotowych i YOLOv8, a następnie doprecyzowanie regionu i wyrównanie na podstawie wyników podobieństwa. Prosimy kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

  1. Osadzanie i wyrównanie encji
    1. Generuj kontekstowe osadzenia dla encji tekstowych z wykorzystaniem osadzeń XLM-R. Generuj wizualne osadzenia dla wykrytych obiektów za pomocą osadzeń CLIP-ViT (Rysunek 6).
    2. Projektuj teksty i wizualne osadzenia w wspólnej przestrzeni ukrytej i normalizuj je do długości jednostki.
    3. Oblicz podobieństwo cosinusowe między każdą parą tekstową i wizualną embedding. Wyrównuj byty, gdy podobieństwo ≥ zdefiniowanym progu τ (domyślnie τ = 0,65). Stwórz listę wyrównanych par encji tekst-obraz.

Rysunek 6
Rysunek 6: Wizualne wykrywanie obiektów i fuzja tagów POS. Rysunek ilustruje fuzję detekcji obiektów wizualnych i tagów POS dla ekstrakcji tripletów z grafu wiedzy. YOLO i CIFAR-100 identyfikują obiekty wykazujące wielomodalne wyrównanie. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

  1. Ekstrakcja tripletowa
    1. Wyodrębniaj tekstowe trójki za pomocą reguł zależności, które odwzorowują struktury podmiot-czasownik-dopełnienie.
    2. Wyprowadzanie relacji wizualnych za pomocą zasad bliskości przestrzennej i współwystępowania.
    3. Generuj wielomodalne trójki poprzez łączenie wyrównanych bytów tekstowych i wizualnych za pomocą etykiet relacji. Weryfikuj trójki pod kątem spójności składniowej i semantycznej.
  2. Budowa grafu wiedzy
    1. Przekonwertowanie wyrównanych encji w trójki zgodne z RDF. Łączenie trójek tekstowych i wizualnych w zunifikowany graf.
    2. Wstaw encje jako węzły, a relacje jako krawędzie. Zakoduj linki multimodalne za pomocą jawnych predykatów. Zapisz powstały graf w Neo4j (OPCJONALNIE). Obecnie generowany jest finalizowany multimodalny graf wiedzy z wyrównanymi trójkami tekstowo-obrazowymi.
      UWAGA: Systematyczne podejście do konstruowania multimodalnego grafu wiedzy na podstawie dokumentów wizualnych w języku hindi pokazano na Rysunku 7.

Rysunek 7
Rysunek 7: Potok do budowy multimodalnych grafów wiedzy. Diagram blokowy przedstawia potoki dla VISHAM-KG. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

  1. Użyj poniższego pseudokodu do konstrukcji grafu wiedzy.
    Input:
    D : Zestaw dokumentów tekstowo-obrazowych w języku hindi
    τ : Próg podobieństwa dla wyrównania
    Każdą parę dokumentów wstępnie przetwarzaj (T, I)D
    Jeśli T zostanie zeskanowane, wyodrębnij tekst T' za pomocą tokenizacji OCRPerform, lemmatyzacji i usuwania słów stop
    Zastosowanie tagowania POS i parsowania zależności za pomocą Stanza
    Wykrywanie obiektów w I za pomocą YOLOv8
    Wyodrębniaj ramki ograniczające, etykiety Li oraz wskaźniki ufności > 0,5
    Generowanie osadzania
    Identyfikacja nazwanych jednostek ET od T' za pomocą BiLSTM-CRF
    Wyodrębniaj byty wizualne EV z Li
    Oblicz tekstowe osadzenia ET z XLM-R.
    Oblicz wizualne osadzenia EV z CLIP-ViT
    Dopasowanie jednostek z ekstrakcją tripletową
    Dla każdej pary (et,e v) w ET x EV:
    Oblicz podobieństwo cosinusowe S = cos(EV,E T)
    Ustaw próg τ=0,6
    Jeśli s≥τ, dodaj tryplo (et, has_image,ev) do zbioru F.
    Wyodrębniaj (h,r,t) trojki z T' za pomocą reguł zależności.
    Wywodź relacje wizualne z współwystępowania przestrzennego lub opartego na podpisach.
    Projekty Et iE v w wspólną, ukrytą przestrzeń.
    Oceniaj trójki i zachowuj te powyżej progu pewności.
    Dodaj zweryfikowane tryfle i encje do wykresu G.
    Wydajność: ostatni KG w Neo4j.

2. Procedura oceny

UWAGA: Historie dla dzieci w języku hindi są wybierane do oceny ram VISHAM-KG, ponieważ zapewniają kontrolowane, wizualnie ugruntowane narracje z jasnymi bytami i relacjami, umożliwiając wiarygodną weryfikację wielomodalnego wyrównania, konstrukcji grafów i wnioskowania przed wdrożeniem na skalę domeny. Wszystkie ustawienia hiperparametrów przedstawiono w Tabeli 3.

ModułHiperparametrWymiary
OCRPróg ufności0.5
Ekstrakcja bytuWymiar osadzenia300
Detekcja obiektówPróg ufności0.5
Rozmiar obrazu wejściowego640 × 640
Osadzanie tekstuModel językowyXLM-R
Wymiar osadzenia768
Osadzanie obrazówModel wizjiCLIP-ViT-B/32
Wymiar osadzenia768
Przebieg trasyMetryka podobieństwaPodobieństwo cosinusowe
Dopasowanie tekstu do obrazuPróg podobieństwa kosinusowego (τ)0.6
Przewidywanie łączaWymiar osadzenia100
Epoki szkolenia50
Próbkowanie ujemneMundur
OcenaPodział pociągu na test80 / 20

Tabela 3: Ustawianie hiperparametrów dla frameworka.

SkładnikHrabia
Obrazy dokumentów10
Byty tekstowe186
Byty wizualne97
Relacje pochodzące z tekstu105
Relacje pochodzące z wizualnych41
Trylety tekstowe i wizualne312

Tabela 4: Wykres wiedzy i statystyka trójek.

  1. Składanie i podział zbiorów danych
    1. Zbiór danych ewaluacyjnych składa się z 10 opowieści dla dzieci, z których każda jest opatrzona ilustracyjnymi obrazkami. Wykonaj proces ekstrakcji encji opisany w krokach 1.2-1.4. Wyniki przedstawiono w Tabeli 4.
    2. Skonstruuj dwa warianty grafu: jeden Tekstowy Graf Wiedzy (T-KG) używający wyłącznie tekstowych trójek oraz drugi Multimodalny Graf Wiedzy (MM-KG) z połączonymi trójkami tekstowymi i wizualnymi.
    3. Aby zapewnić kontrolowaną ocenę, dla obu grafów należy stosować identyczne podziały danych.
    4. Losowo podzielić trójki wyodrębnione na partie w 80:20, czyli 80% dla konstrukcji grafu (zbiór treningowy) i 20% zachowane do oceny (zestaw testowy). Stosuj ten podział konsekwentnie zarówno do tekstowego KG, jak i MMKG, aby zapewnić uczciwe porównanie.
  2. Baza i metryki oceny
    1. Tekstowa KG stanowi punkt wyjścia. Proponowany framework, VISHAM KG, reprezentuje proponowaną metodę. Dla obu grafów używamy identycznej ontologii z identyfikatorami encji i zapytaniami ewaluacyjnymi. Jedyną różnicą między tymi dwoma grafami jest uwzględnienie obiektów wizualnych w VISHAM-KG.
  3. Metryki ewaluacyjne i predykcja łącza
    1. Użyj standardowych metryk predykcji linków20: Średnia Ranga Wzajemności (MRR), Hits@1, Hits@3, Hits@10. Hit@K, zdefiniowana jako odsetek przypadków, gdy właściwy podmiot pojawia się w górnych N rankingach.
    2. Dla każdego tryletu testowego (głowa, relacja, ogon) zamaskuj albo główkę, albo ogon. Uszereguj wszystkie kandydujące byty na podstawie podobieństwa cosinus w przestrzeni współdzielonej embedding (Tabela 5).
Byt tekstowyByt wizualnyPodobieństwo cosinusowe
शेर Równanie 1000.78
लोमड़ीRównanie 1010.82

Tabela 5: Wyniki podobieństwa cosinusowego między osadzeniami tekstu i obrazów.

  1. Generuj przewidywania niezależnie dla osadzeń tylko tekstowych i wielomodalnych (VISHAM-KG).
  2. Oblicz wyniki za pomocą średniej rangi odwrotności (MRR) jako średniej odwzajemnionych rang właściwej jednostki we wszystkich zapytaniach21. Korzystając z Tabeli 6, wyraź wszystkie wyniki w formacie dziesiętnym dla spójności w eksperymentach22.
ModelMRRHits@1Hits@3Hits@10
TransE0.420.210.480.72
ComplEx0.470.260.520.74
RotatE0.510.310.580.74
VISHAM-KG (tekst)0.490.360.620.76

Tabela 6: Wydajność przewidywania łącza na tryletach tylko tekstowych.

  1. Wykorzystaj te metryki do weryfikacji mocy predykcyjnej multimodalnego grafu wiedzy w odzyskiwaniu brakujących ogniw, jak pokazano w Tabeli 7.
ModelMRRHits@1Hits@3Hits@10
IKRL0.460.340.630.72
VisualBERT0.520.350.610.72
ViLBERT0.540.380.640.75
VISHAM-KG0.570.410.660.79

Tabela 7: Wydajność w zadaniach przewidywania tripletów międzymodalnych.

  1. Do oceny użyj poniższego pseudokodu.
    Dla każdego wariantu grafu wiedzy G∈{GT,G MM}:
    Podział tripletowy

    Wyodrębnij wszystkie tryple Tall z G.
    Losowo podziel Tna zbiór treningowy (80%) itest testowy T (20%).
    Skonstruuj grafG train używając trójek wciągu T.
    Wskaźnik podobieństwa i osadzenie
    Dlakażdego testowego tryletu (h,r,t)∈T test:
    Maskuj jednostkę typu head lub tail, aby utworzyć zapytanie (h,r,?) lub (?,r,t).
    Wygeneruj kandydata na zbiór encji C z encji wpociągu G.
    Oblicz współczynnik podobieństwa osadzenia S=cos(equery,e c) dla każdego ec ∈ C.
    Uszereguj wszystkie kandydujące podmioty na podstawie malejącego wyniku podobieństwa.
    Obliczenia metryczne
    Oblicz rangę właściwej jednostki dla każdego zapytania.
    Oblicz średnią odwzajemnioną rangę (MRR) dla wszystkich zapytań testowych.
    Oblicz Hits@1, Hits@3 i Hits@10.
    Porównaj wyniki oceny między KG GG T wyłącznie tekstowym a multimodalnym KG GMM.
    Efekt: Dostarczanie wyników jakościowych i ilościowych bezpośrednio przypisywanych do integracji multimodalnej
  2. Podobieństwo międzymodalne
    1. Oblicz wyniki podobieństwa, aby ocenić zgodność między osadzeniami tekstowymi a wizualnymi. Normalizuj zarówno osadzenia tekstowe, jak i wizualne do długości jednostkowej, aby zapewnić spójność skali. Użyj podobieństwa cosinusowego jako głównej metryki22.
    2. Dla każdej pary (et, ev) osadzania encji tekstowej i wizualnej encji obliczamy wynik podobieństwa23.
      Score(et,e v) = λ ·sim text(et,e v) + (1-λ) ·sim visual (et,e v) .
      gdzie:
      λ∈ [0,1] to parametr ważenia modalności,
      Tekst symulacyjny to podobieństwo cosinusowe między osadzeniami tekstowymi,
      Sim Visual to podobieństwo cosinusowe między osadzeniami wizualnymi.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Proponowany VISHAM-KG jest oceniany na podstawie obliczeń wyniku podobieństwa oraz zadań predykcji powiązań, które są powszechnie stosowane w benchmarku reprezentacji wiedzy.

Układ eksperymentalny

Ocenić skonstruowany multimodalny graf wiedzy przy użyciu dwóch ustalonych zadań: (i) oceny podobieństwa międzymodalnego oraz (ii) przewidywania łącza w grafie wiedzy. Wszystkie oceny przeprowadź wyłącznie na finalnym wyjściu grafu wygenerowanym na końcu p...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wydajność frameworka VISHAM-KG opiera się głównie na trzech kluczowych komponentach: OCR dla tekstu w języku Devanagari (krok 1.2), wykrywaniu obiektów wizualnych opartych na zaufaniu za pomocą Clip-ViT (krok 1.3) oraz osadzaniu opartym na wyrównaniu międzymodalnym (krok 1.4). Dokładność OCR bezpośrednio wpływa na dalsze analizowanie językowe i ekstrakcję encji. Błędy wprowadzone na tym etapie propagują się w identyfikacji relacji i zmniejszają precyzję wyrównania. Efekt ten jest łagodzony poprzez specyficzną dla hindi n...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie ma konfliktów interesów dotyczących publikacji tego artykułu.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
BiLSTM-CRF i indyjski model NERSzkolony na zamówieniePyTorchRozpoznawanie nazwanych podmiotów
CLIP-ViT-B/322022-09OpenAIGenerowanie wizualnego osadzania
CPUIntel i9IntelObliczenia ogólne
EasyOCRv1.7.1Zamknięta AIEkstrakcja tekstu hindi z obrazów
GPUNVIDIA RTX 3090NVIDIAPrzyspieszenie wnioskowania modelu
Historie o hinduskich dzieciach10 opowieściKuratorowany zbiór danychKorpus ewaluacyjny
Neo4jv5.13Neo4j Inc.Przechowywanie grafów wiedzy
NumPyv1.24Społeczność NumPyObliczenia numeryczne
Pandyv2.0Społeczność PandasObsługa danych
Pythonv3.10Python Software FoundationImplementacja potoku
PyTorchv2.0Meta AIRamy uczenia głębokiego
Strofa (model hindi)v1.6.1Stanford NLPTagowanie POS i parsowanie zależności
XLM-R (Baza)2023-05HuggingFaceGenerowanie osadzenia tekstu
YOLOv8v8.0.208UltralitykiWizualne wykrywanie obiektów

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Alberts, A., et al. VisualSem: A high-quality knowledge graph for vision and language. arXiv. , (2020).
  2. Chen, Y., et al. A survey on multimodal knowledge graphs: Construction, completion and applications. Mathematics. 11 (8), 1815-1835 (2023).
  3. Ektefaie, Y., et al. Generalized multimodal models for life sciences. Nat Mach Intell. 5 (4), 340-350 (2023).
  4. Exner, P., Nugues, P. Entity extraction: From unstructured text to DBpedia RDF triples. Proc CEUR Workshop. , 58-69 (2012).
  5. Fan, T., Wang, H., Hodel, T. Multimodal knowledge graph construction of Chinese traditional operas and sentiment and genre recognition. J Cultural Heritage. 62, 32-44 (2023).
  6. Fang, Q., Zhang, X., Hu, J., Wu, X., Xu, C. Contrastive multimodal knowledge graph representation learning. IEEE Trans Knowl Data Eng. 35 (9), 8983-8996 (2022).
  7. Fang, Y., Kuan, K., Lin, J., Tan, C., Chandrasekhar, V. Object detection meets knowledge graphs. Proc IJCAI. , 1-8 (2017).
  8. Fensel, D., et al. Introduction: What is a knowledge graph. , Semant WebSpringer. 1-10 (2020).
  9. Ferrada, S., Bustos, B., Hogan, A. IMGpedia: A linked dataset with content-based analysis of Wikimedia images. , Semant WebSpringer. 84-93 (2017).
  10. Gong, D., Wang, D. Z. Extracting visual knowledge from the web with multimodal learning. Proc IJCAI. , 1718-1724 (2017).
  11. Hollink, L., Bedjeti, A., Van Harmelen, M., Elliott, D. A corpus of images and text in online news. Proc LREC. , 1377-1382 (2016).
  12. Jain, P., Darbari, H., Bhavsar, V. C. Vishit: A visualizer for Hindi text. Proc IEEE Conf. , 886-890 (2014).
  13. StoryWeaver: Free multilingual story platform for children. , Pratham Books. https://storyweaver.org.in/en (2025).
  14. Zhu, B., et al. MMIEA: Multimodal interaction entity alignment model for knowledge graphs. Inf Fusion. 100, 101935(2023).
  15. Wang, M., Wang, H., Qi, G., Zheng, Q. Richpedia: A large-scale, comprehensive multimodal knowledge graph. Big Data Res. 22, 100159(2020).
  16. Liu, Y., et al. MMKG: Multimodal knowledge graphs. , Semant WebSpringer. 459-474 (2019).
  17. Liang, W., Meo, P. D., Tang, Y., Zhu, J. A survey of multimodal knowledge graphs: Technologies and trends. ACM Comput Surv. 56 (11), 1-41 (2024).
  18. Troussas, C., Krouska, A., Tselenti, P., Kardaras, D. K., Barbounaki, S. Enhancing personalized educational content recommendation through cosine similarity-based knowledge graphs and contextual signals. Information. 14 (9), 505(2023).
  19. Vats, P., Sharma, N., Sharma, D. K. HKG: A novel approach for low resource Indic languages to automatic knowledge graph construction. ACM Trans Asian Low-Resour Lang Inf Process. , (2023).
  20. Wang, D., et al. MM-transformer: A transformer-based knowledge graph link prediction model that fuses multimodal features. Symmetry. 16 (8), 961(2024).
  21. Wang, Z., Liu, X., Liu, Z., Weng, Y. A link prediction method for multimodal knowledge graphs based on adaptive fusion and modality information enhancement. Neural Netw. 191, 107771(2025).
  22. Huang, S., Cai, Y., Yuan, L., Wang, J. A knowledge-enhanced network for joint multimodal entity-relation extraction. Inf Process Manag. 62 (3), 104033(2025).
  23. Wang, L., Cheng, H., Wang, R., Huang, X. Machining scheme selection of features based on process knowledge graph and improved cosine similarity matching. Machines. 13 (3), 1-20 (2025).
  24. Zhu, J., et al. A novel cosine-derived probability distribution: Theory and data modeling with computer knowledge graph. Alex Eng J. 103, 1-11 (2024).
  25. Li, Z., Tang, J., Mei, T. Deep collaborative embedding for social image understanding. IEEE Trans Pattern Anal Mach Intell. 41 (9), 2070-2083 (2018).
  26. Qian, Y., Pan, L. Leveraging multimodal features for knowledge graph entity alignment based on dynamic self-attention networks. Expert Syst Appl. 228, 120363(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Multimodal Knowledge GraphsRule Based Linguistic AnalysisComputer VisionVisual Entity ExtractionHindi Visual DocumentsOptical Character RecognitionDependency ParsingEntity AlignmentMultilingual TransformerKnowledge Graph Reasoning

Related Articles