$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bilgi grafikleri (KG'ler), varlıkların düğüm olarak modellendiği, ilişkilerin kenar olarak modellendiği yapılandırılmış anlamsal grafiksel temsillerdir. Soru yanıtlama, öneri sistemleri ve bilgi çıkarma gibi çeşitli uygulamalarda verimli bilgi bulgusu ve bağlamsal akılyürütmeyi sağlar 1. Son on yılda, KG yapım metodolojileri önemli ölçüde geliştirilmiştir. Ancak, mevcut yaklaşımların çoğu, ağırlıklı olarak büyük ölçekli metinkorpusları 2'ye dayanan kaynak açısından zengin diller için tasarlanmıştır. Sonuç olarak, düşük kaynaklı diller az temsil edilmeye devam eder ve KG tabanlı teknolojilerin kültürel ve dilsel olarak çeşitli ortamlarda uygulanabilirliğinisınırlar 3. Paralel olarak, özellikle eğitim, kültürel ve miras alanlarındaki gerçek dünya belgelerinin giderek artan bir kısmı, metin merkezli grafik oluşturma yöntemleriyle yeterince yakalanmayan zengin görselbilgiye sahiptir 4.
Multimodal bilgi grafikleri (MMKG'ler), görsel, ses veya video gibi metin dışı modaliteleri entegre ederek geleneksel KG'leri genişleterek temelli anlamsal temsil5. IMGpedia, Richpedia ve ImageGraph gibi önceki MMKG çerçeveleri, görsel bilgiyi metin varlıklarıyla ilişkilendirmenin daha iyi anlamsal sorgulama ve mantık oluşturma için değerinigöstermektedir 6,7,8. Bu gelişmelere rağmen, mevcut yöntemler büyük ölçüde İngilizce merkezlidir, kürenmiş meta verilere veya statik veri setlerine dayanır ve yapılandırılmamış görsel belgelerden doğrudan MMKG'ler oluşturmak için sınırlı prosedürel rehberlik sağlar. Ayrıca, bu çerçeveler düşük kaynaklı dillere özgü betibe özgü Optik Karakter Tanıma (OCR) hataları, morfolojik değişkenlik ve seyrek açıklamalı veriler 9,10 gibi sorunları açıkça ele almaz.
Bu çerçevenin amacı, metin ve görsel varlıkları sistematik olarak hizalayarak, Hintçe görsel belgelerden çoklu modal bir bilgi grafiği oluşturmak için adım adım bir metodolojiyi uygulamaktır. Önerilen çerçeve, Görsel Anlamsal Hintçe Uyumlu Çok Modal Bilgi Grafiği (VISHAM-KG), kural tabanlı dilbilimsel analizi nesnelerin çıkarımına dayanan bilgisayar görüşü ile bütünleştirerek görsel belgelerin dinamik grafik yapısını mümkün kılmaktadır. Mevcut MMKG yaklaşımlarının aksine, VISHAM-KG, ham Hintçe metin ve görsellerden doğrudan varlıkları ve ilişkileri çıkarır, ilişki tanımlama için bağımlılığa dayalı dilbilgisi kuralları uygular ve dış 11,12'ye dayanmak yerine gömüme tabanlı benzerlik eşikleri kullanarak çapraz modal varlık hizalanması gerçekleştirir.
VISHAM-KG, metinsel ve görsel içeriklerin anlamsal olarak ilişkilendirildiği resimli belgeler için tasarlanmıştır; örneğin çocukhikayeleri 13, eğitim materyalleri, gazete11 ve kültürel temelli anlatımlar. Bahsedilen çerçeve yürütülürken optik karakter tanıma kalitesi, nesne algılama kapsamı ve alana özgü kelime dağarcığına bağımlılık gibi bazı sınırlamalarla karşılaşılmıştır. Her prosedürel adımı açıkça belgeleyerek, VISHAM-KG, düşük kaynaklı dilsel bağlamlarda çoklu modlu bilgi grafiği inşamı için tekrarlanabilir bir protokol sunarken, temelli anlamsal akıl yürütmeyi ve çapraz modal analizi destekler.
VISHAM-KG, mevcut MMKG yaklaşımlarından farklıdır; çünkü yapılandırılmamış Hintçe metin ve görsellerden doğrudan varlıkları ve ilişkileri çıkarır; ilişki çıkarımı için kural tabanlı bağımlılık ayrıştırmasının kullanılması; ve metin ve görsel varlıkları, meta veri eşleştirmesi yerine göme tabanlı benzerlik eşikleriylehizalamak 8,10 (Şekil 1).

Şekil 1: Uçtan uca çerçeve. Şekil, çok modlu bilgi için uçtan uca çerçeveyi göstermektedir Grafik VISHAM-KG. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Bu protokol, eğitim materyalleri ve kültürel anlatılar gibi metin-görüntü içeriğiyle uyumlu olan resimli belgeler için geçerlidir. Bu çerçevede, YOLOv8, görsel belgelerde nesne algılamadaki verimliliği ve dayanıklılığı nedeniyle seçilmiştir. XLM-R, düşük kaynaklı Hintçe metin işleme için oldukça uygun olan güçlü çapraz dillerarası temsilleri nedeniyle seçilir ve CLIP-ViT, paylaşılan görsel metin göme alanlarını öğrenme konusunda kanıtlanmış yeteneği nedeniyle kullanılır; bu da etkili çapraz modal hizalama sağlar. Ancak OCR doğruluğu, nesne algılama kapsamı ve alana özgü kelime kısıtlamaları ile sınırlıdır.
İlgili çalışmalar
Geleneksel bir bilgi grafiği G=(E,R,F), varlıklar E, ilişkiler R ve her üçlü (h,r,t)8 biçimindedir. Bunu genişleterek, Multi-Modal Bilgi Grafiği (MMKG), görüntü, ses ve video gibi metin dışı modalitelerle ilişkili Evarlıklarını içerir 14.
MMKG'lerde görsel verileri temsil etmek için iki ana strateji kullanılır:
Metin varlıklarına bağlı öznitelikler olarak
Belirli bir notlanmış ilişki aracılığıyla bağlı görsel varlıklar olarak
Dikkate değer bir çalışma, görsel tanımlayıcılar ve benzerlik ölçütleri kullanarak Wikimedia görsel verilerini geliştiren IMGpedia'dır. Bu model, öncelikle meta verileri içeren geleneksel veri setlerinin sınırlamalarını ele alır; görselleri DBpediaCommons 9 ile bağlayarak görsel anlamsal sorgulama ve benzerlik değerlendirmesini mümkün kılar.
Benzer şekilde, başka bir MMKG Richpedia ise akademik araştırmalarda eksik bilgi grafiklerinin sorununu ele almaktadır. Wikipedia'dan 2.883.162 görsel varlığı ve Wikidata'dan 30.638 metinsel varlığı toplar. Richpedia, görsel öğeler, ilgili metin ve hiperlinkler dahil olmak üzere, yapılandırılmamış içerikten anlamsal ilişkiler çıkarmak için yöntemlerkullanır 15.
ImageGraph, bu çalışmayı FB15K veri setine dayanan ve 829.931 web taramalı görsel ve başlıkla zenginleştirilmiş ilişkisel bir bilgi grafiği oluşturarak genişletiyor. 14.870 varlık ve 1.330 ilişki tipi içerir; bu da kavram tabanlı sorgu parametrelerini destekleyerek görsel-bağlamsal sorgulama ve daha doğru yanıtlar sağlar16.
VisualSem, görsel ve metinsel bilgileri bütünleyen kapsamlı bir çok dilli bilgi grafiğidir. 89.896 kuruluş, 1,3 milyondan fazla parlatma ve 938.100 görselden oluşmaktadır. Veri artırma ve topraklama gibi uygulamalar için tasarlanmış olan VisualSem, diller arasında anlamsal yorumu geliştirir ve çeşitli işlem boru hatlarına sorunsuz entegreedilebilir 1.
Bağlantı tahmini, üçlü sınıflandırma ve varlık eşleştirme gibi görevleri desteklemek için birkaç MMKG modeli de geliştirilmiştir. Bu modeller, tek modal grafiklerin sınırlamalarını, özellikle çapraz modal bilginin karmaşıklığını yakalayamalarınıele alır 16,17,18.
Dil tabanlı MMKG modelleri ile VISHAM-KG arasındaki kritik karşılaştırma Tablo 1'de sunulmaktadır. Özellikle Hintçe, Tamil veya Sanskritçe gibi düşük kaynaklı diller bağlamında onların güçleri ve sınırlamaları üzerine odaklanıyor. Bu yöntemler genellikle yüksek kaliteli metin korpuslarına, güvenilir dilbilimsel açıklamalara ve büyük ölçekli önceden eğitilmiş modellere erişim varsayar. Bu faktörler, düşük kaynaklı dillere uygulanabilirliklerini sınırlar. Özellikle, OCR'ye bağlı boru hatları sıklıkla Latince alfabeler için optimize edilir ve Hint yazımları için hassasiyet azalır; bu da gürültülü veya eksik metin çıkarımına yol açar. Ayrıca, dilsel ön işleme, konuşma parçası etiketleme ve adlandırılmış varlık tanıma genellikle yüksek kaynaklı dillerde eğitilmektedir. Hintçe gibi morfolojik olarak zengin, sözdizimi olarak esnek dillere uygulandığında performansları ciddi şekilde azalmıştır.
| MMKG Modeli | Güçlü Yönler | Düşük Kaynak Ortamlarında Sınırlamalar |
| IMGpedia | Görüntüleri DBpedia ile entegre eder | Sadece İngilizce içeriklere odaklanır |
| Görsel benzerlik sorgularını destekler | Latin dışı alfabeler için destek yok |
| Bölgesel görseller için sınırlı kültürel bağlam |
| Richpedia | Wikipedia ve Wikidata'dan görsel ve metinsel varlıkları birleştirir | Hint veya halk bilgisinin yetersiz temsili |
| Aspectlevel sorgulama mevcut | Yüksek kaliteli uyum varsayar, ki bu bölgesel veri setlerinde eksik |
| ImageGraph | İlişkisel KG, görseller ve başlıklarla | İngiliz korpusları için ayarlanmış varlık ve ilişki çıkarımı |
| Genişletilmiş üçlü tabanlı sorgulama destekler | Az altyazılı veya eksik meta verilerin olduğu ortamlarda başarısız olur |
| VisualSem | Çok dilli destek | Asya düşük kaynaklı dillerinin kötü temsili |
| Sinirsel anlamsal boru hatlarında faydalı | Devanagari veya kültürel temelli görsel anlam desteği yok |
| VISHAM-KG | İlişkisel KG, Hintçe dillerinde görsellerle | Dil bağımlısı |
| Morfolojik olarak zengin sözdizimimi için anlamsal boru hatları | Farklı dil dillerinin farklı POS etiketine bağlı. |
Tablo 1: MMKG'lerin düşük kaynaklı dillerdeki sınırlamalarla kritik karşılaştırılması.
Mevcut MMKG modelleri, tek veri seti eğitimi nedeniyle yeni varlık türleri ve ilişkilerin geliştiği dinamik gerçek dünya bağlamlarına uyum sağlamayan, statik bilgi grafiklerine dayanır. Bu da dinamik yeteneklere sahip modeller geliştirmeyi kritikkılar 16. Bu bağlamda aşağıdaki sınırlamalar vardır: nesne tanımlama, çıkarma ve açıklama gibi görsel faaliyetlerde metinsel verilerin yanlış kullanımı; heterojen kaynaklardan çok modlu bilgi grafikleri oluşturmak için ölçeklenebilir yöntemler geliştirmek; ve daha iyi anlama ve yorumlama için çok modlu bilgi grafiklerine bağlamsal bilginin dahil edilmesi.
Bu koşullarda, VISHAM-KG, görsel belgelerden doğrudan düğümleri ve ilişkileri tanımlamak için gelişmiş görsel çıkarma teknikleri kullanmasıyla önceki yaklaşımlardan farklıdır. Tokenizasyon, kesinti kelimesi kaldırma ve kelime kısmı etiketleme gibi standart metin işleme adımlarını, çıkarılan bilgiyi yapılandırmak için anlamsal grafik teknikleriyle birleştirir. Bilgisayar görüşü ve ontolojiyi birleştirerek, sistem birkaç avantajsunar 19: gelişmiş uyum sağlama, bilgi tabanının uygulamaya özgü ihtiyaçlarla evrülmesine olanak tanır; sistemler arasında birlikte çalışabilirliği destekleyen geliştirilmiş anlamsal temsil; ve daha iyi anlamsal çıkarım ve geri getirme, bağlamsal düzeyde bilgi tabanı geliştirmeyi mümkün kılar.