Research Article

Karmaşık Sistem Teorisine Dayalı Derin Öğrenme ile Hafif İngilizce Metin Sınıflandırması

DOI:

10.3791/69344

June 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, İngilizce metin sınıflandırmasını iyileştirmek için meta-damıtma ve meta-öğrenme ile hafif bir grafik sinir ağı önermektedir. Düşük veri ve alanlararası ayarlarda genelleştirmeyi artırırken, hesaplama maliyetini azaltır ve yüksek performansı korur.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Küreselleşme ve bilgi teknolojisinin gelişimi, İngilizce metin verilerinde bir artışa yol açtı ve etkin sınıflandırmaya acil bir ihtiyaç var. Küçük örneklem ve alanlararası senaryolarda İngilizce metin sınıflandırmasının genelleştirme yeteneğini artırmak ve hafif modeller elde etmek için, bu çalışma karmaşık sistemler teorisini derin öğrenme ile birleştirerek metin örneklerinin dağılımsal özelliklerini tam olarak hesaba katan bir grafik sinir ağı modeli oluşturmaktadır. İki seviyeli bir meta-damıtma yöntemi, meta-öğrenme stratejileriyle birleşerek öğretmen modelinin parametrelerini dinamik olarak ayarlar ve tüm bilgi aktarım sürecini optimize eder. Deneysel sonuçlar, önerilen modelin sınıflandırma performansının, az sayılı ve alanlar arası metin sınıflandırma görevlerinde geleneksel grafik sinir ağları ve diğer ana akım karşılaştırmalı modellerden önemli ölçüde üstün olduğunu göstermektedir. Hafif ağırlık açısından, iki aşamalı meta-damıtma mekanizması tarafından üretilen SM, çok konulu metin sınıflandırma veri setlerinde son derece yüksek performans tutumunu korur ve hesaplama süresini önemli ölçüde azaltır. Ayrıca, bu yöntem uzun metin işleme senaryolarında yüksek verimlilik ve istikrarlı sınıflandırma performansını koruyabilir ve geleneksel damıtma yöntemleri ile literatürde bildirilen diğer yöntemlere kıyasla hesaplama verimliliğinde açık avantajlar sunar. Önerilen yöntem, İngilizce metnin düşük örneklem ve alanlar arası uygulama senaryolarında sınıflandırma performansını etkili bir şekilde artırırken, hesaplama maliyetini önemli ölçüde azaltarak, kaynak kısıtlı ortamlarda İngilizce metin sınıflandırması için uygulanabilir ve verimli bir teknik çözüm sunar.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Küreselleşmenin hızlanması ve bilgi teknolojisindeki ilerlemeler, sosyal medya, akademik araştırma ve iş iletişimi gibi alanlarda İngilizce metin verilerinin patlayıcı büyümesine yol açmıştır. Bu metinleri bilgi erişimi, duygu analizi, içerik yönetimi ve diğer işlevler için verimli şekilde sınıflandırmak, doğal dil işlemede önemli bir görevhaline gelmiştir 1. İngilizce Metin Sınıflandırmasının (ETC) amacı, metinleri anlamsal içeriklerine göre önceden tanımlanmış kategorilere ayırmaktır. Ancak, doğal dilin karmaşıklığı, belirsizliği, bağlama bağımlılığı ve ifade çeşitliliği metin sınıflandırma görevlerinde birçok zorlukyaratmaktadır 2. Şu anda, Derin Öğrenme (DL) teknolojisinin gelişimi, metin sınıflandırması için yeni fırsatlar yaratmıştır. Transformers (BERT) ve onun varyantları tarafından sunulan Çiftyönlü Kodlayıcı Temsilleriyle temsil edilen önceden eğitilmiş dil modelleri, büyük ölçekli korporasyonlarda ön eğitim yoluyla zengin bağlamsal anlamsal bilgi öğrenebilir ve metin sınıflandırma performansınıönemli ölçüde artırır 3. Ancak, mevcut ETC yöntemleri hâlâ iki önemli sınırlamayla karşı karşıyadır: birincisi, genellikle tek bir modelin veya özelliğin optimize edilmesini vurgularak, dilin karmaşık bir sistem olarak dinamiliği ve ortaya çıkan davranışı gibi özetsel özelliklerini ihmal ederler; bu da düşük veri veya alanlararası senaryolarda yetersiz genellemeye yol açar; İkinci olarak, önceden eğitilmiş modellerin güçlü performansına rağmen, yüksek hesaplama maliyeti ve büyük parametre sayıları, kaynak kısıtlı ortamlarda pratik dağıtımı ciddi şekildeengelliyor 4,5. Bu sorunları ele almak için, bu çalışma Karmaşık Sistemler Teorisi (CST) ve İki Aşamalı Meta-Damıtma Mekanizması (TSMDM) ile bütünleşen hafif bir metin sınıflandırma çerçevesi önermektedir.

Bu çalışma bağlamında, CST, doğal dili dinamik evrim, anlamsal ortaya çıkış ve sözcük düğüm etkisinin heterojen dağılımına sahip tipik karmaşık bir sistem olarak gören teorik çerçeveyi ifade eder. Anlamsal yayılımda temel kelime dağarcığının baskın rolünü ve yerel sözcük özelliklerinden ortaya çıkan genel anlam yasasını simüle etmek için uygulanır; böylece modelin metin anlamanlamını derinlemesine anlamasını ve az çekimli ve alanlar arası veri senaryolarına uyum sağlama yeteneğini artırır. Temel katkıları şunlardır: Teorik olarak, bildiğimiz kadarıyla, CST metin sınıflandırma görevlerine sistematik olarak dahil edilmiş, dil sistemlerinin dinamik evrimini ve anlamsal ortaya çıkışını simüle ederek modelin az tabanlı ve alanlar arası verilere derin anlayışını ve uyum sağlayabilmesini artırmaktadır. Metodolojik olarak, örnek dağılım özelliklerini içeren bir Grafik Sinir Ağı (GNN) tasarlanmıştır. Birleşik yenilikçi TSMDM, standart bilgi damıtmacılığından esasen farklıdır. Standart bilgi damıtılması, sabit parametreli Öğretmen Modelinden (TM) hafif bir Öğrenci Modeline (SM) tek yönlü bilgi transferini gerçekleştirir. Bu çalışmadaki meta-damıtma, damıtım temelinde meta-öğrenme stratejilerini entegre eder ve SM'nin öğrenme geri bildirimine göre TM'nin parametrelerini dinamik olarak ayarlayabilir. İki aşamalı tasarım, TM ve SM arasındaki aşırı karmaşıklık boşluklarından kaynaklanan bilgi kaybını azaltmak için ara tampon katmanı olarak bir öğretim asistanı modeli oluşturur; böylece yüksek doğruluk sağlarken önemli bir model hafifliği sağlar ve böylece kaynak kısıtlı senaryolar için verimli bir sınıflandırma çözümü sunar.

ETC alanında araştırmacılar, farklı özellikler ve model mimarileri entegre eden kapsamlı araştırmalar yürütmüş ve farklı senaryolarda teknik zorlukları ele almak için çeşitli çözümler önermiştir. R. Zhang ve ark., mevcut DL yöntemleriyle ETC'de uzun menzilli bağlamsal yapısal bilginin yetersiz yakalanma sorununu ele almak için Çok Dilli Ön Eğitilmiş Çok Özellikli Birleşme Modeli (MP-MFFM) tasarlamıştır. Bu yöntem, çok dilli BERT, BiLSTM ve metin CNN'i birleştirerek derin anlamsal, küresel ve yerel yapısal bilgileri çıkarır ve birleştirir. Bu yöntem, üç veri setinde doğruluğu, hassasiyeti ve hassasiyeti artırarak etkinliğini doğruladı6. C. Madhu ve arkadaşları, sosyal ağlarda yapılandırılmamış ve düşük notlu verilerin metin sınıflandırma ihtiyaçlarını ve lehçe farklılıklarının uluslararası İngilizce sınıflandırması üzerindeki etkisini karşılamak için Lehçe Özellik Tabanlı Bulanık Grafik Öğrenme Çerçevesi (DF-FGLF) benimsemiştir. Anlamsal ve lehçe farkı öğrenme özelliklerini birleştirerek optimize edilmiş bulanık bir grafik oluşturdular. Sadece 10 annotlu örnek olduğunda, lehçe tanıma ve metin sınıflandırması için F1 değeri %93 ve %80'i aşmıştır; bu da benzer yöntemlerden üstün ve pratik sınıflandırmaiçin uygundur 7. B. Shannaq ve ark., farklı yazı sistemlerinde metin sınıflandırması üzerindeki n-gram uzunluğunun etkisini ve dil özelliklerinin optimal n-gram uzunluğu üzerindeki etkisini araştırmak için İngilizce ve Arapça veri setlerini kullanarak deneyler yürütmüştürler. İngilizce 2-gramın performansı en iyiydi (doğruluk 0.482, geri çağırma 0.489, F1 değeri =0.472), Arapça 6-gram ise en iyiydi (F1 değeri yaklaşık 0.85). Dil morfolojisi ve sözdizimsel özellikler, n-gram modellerinin performansını önemli ölçüdeetkilemiştir 8. N. S. Lagutina ve ark., öğrenci öğrenimini değerlendirmek için İngilizce kısa metinlerin otomatik sınıflandırılmasını sağlamak amacıyla karakter, kelime dağarcığı ve cümle yapısı bibliyometrik özelliklerine dayalı bir metin vektörünü kullandılar; bu sınıflandırma SVM gibi standart makine öğrenimi sınıflandırıcılarıyla birleştirildi. Ortak Avrupa Referans Çerçevesi için Diller Korpusunda SVM'nin F1 değeri %67, en iyi BERT modelinin (bert-baz-kase) F1 değeri ise %69'du. Hatalar çoğunlukla bitişik seviyelerdeydi ve sınıflandırma kalitesi korpus9'a bağlıydı.

Bilgi damıtılması, model hafifletmesini sağlamak, küçük örneklem senaryolarında model performansını iyileştirmek ve hesaplama maliyetlerini azaltmak için etkili bir yöntem olarak, ilgili araştırmalarda da önemli ilerleme kaydetmiştir. Önceki araştırmalar, temel doğal dil işleme zorluklarını çözmek için bilgi damıtma uygulamasını incelemiştir; bunlar arasında: düşük etiketli koşullarda küçük parametreli modellerin performansını artırmak, çok dilli metin sınıflandırma görevlerini optimize etmek, hibrit sıkıştırma stratejileri yoluyla büyük ölçekli önceden eğitilmiş modelleri sıkıştırmak ve donanıma uyum sağlarken büyük ve küçük dil modelleri arasındaki performans farkını daraltmak için etkili cümle temsillerini damıtmak kısıtlamalar 10,11,12,13. Bu gelişmelere rağmen, mevcut bilgi damıtma yaklaşımlarının ETC için kritik sınırlamaları vardır: bilgi aktarım süreci için dinamik optimizasyon mekanizmalarından yoksundurlar, çok karmaşık TM'ler ile hafif SM'ler arasında damıtma yaparken genellikle ciddi bilgi kaybı yaşarlar ve metin verilerinin doğasında bulunan dağılım özellikleriyle etkili bir şekilde entegre olamırlar. Bu dezavantajlar, az çekimli ve alanlararası senaryolarda genelleme performansının optimal olmamasına yol açar. Bu tür yöntemlerle elde edilen hafif modeller, kaynak kısıtlı ortamlarda sınıflandırma etkinliği ile hesaplama verimliliği arasında denge kurmakta genellikle zorlanır. Bu makaledeki araştırmanın ele almayı amaçladığı temel boşluk budur.

Bu çalışma aşağıdaki araştırma hipotezini test eder: Birincisi, CST'nin ETC'ye entegre edilmesi, doğal dil sistemlerinin dinamik evrimini ve anlamsal ortaya çıkış özelliklerini etkili bir şekilde simüle edebilir. Bu teorik entegrasyon, dilin karmaşık sistem özelliklerini görmezden gelen geleneksel metin sınıflandırma modellerine kıyasla az sayılı ve alanlar arası senaryolarda modelin genelleme yeteneğini önemli ölçüde artırabilir. İkincisi, metin örnek dağılım özelliklerinin açıkça dikkate alınarak tasarlanmış bir GNN modeli, yalnızca örnek düzeyinde ilişkisel modellemeye odaklanan geleneksel GNN'lerin sınırlamasını telafi edebilir ve İngilizce metinlerde küresel ve yerel anlamsal bilgilerin daha derin madenciliğini gerçekleştirebilir. Üçüncü olarak, TSMDM, meta-öğrenme stratejileri ve bir öğretim asistanı modeliyle birleşince, karmaşık TM'lerden hafif SM'lere verimli ve düşük kayıplı bilgi transferi sağlayabilir. Bu, modelin hesaplama maliyetini ve parametre ölçeğini önemli ölçüde azaltırken yüksek sınıflandırma performansını koruyabilir. Ayrıca, bu mekanizmadan türetilen hafif model karmaşık anlamsal yapılara sahip uzun metin işleme senaryolarında kararlı ve verimli sınıflandırma performansını koruyabilir.

Özetle, ilgili araştırmalar çok özellikli füzyon, diyalekt özellik öğrenimi, n-gram optimizasyonu ve stilistik metrik özellikler yoluyla metin sınıflandırma performansını geliştirmiş ve bilgi damıtılması yoluyla model hafifliği sağlanmıştır. Ancak, mevcut yöntemler uzun mesafe bilgi yakalama, küçük örneklem genellemesi ve karmaşık, basit modellerin uyarlanması konusunda hâlâ eksikliklere sahiptir. ETC modelinin hesaplama maliyetini azaltırken doğruluğunu sağlamak için, bu çalışma CST ve TSMDM'yi birleştirerek modelin genelleştirme kapasitesini ve hesaplama verimliliğini artırarak hafif bir model oluşturur.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ETC'nin küçük örnekler ve çapraz alanlar senaryolarında genelleştirme yeteneğini artırmak ve hafif bir model oluşturmak için, bu çalışma CST ve TSMDM'yi entegre eden bir metin sınıflandırma çerçevesi önermektedir. Bu çerçevenin genel süreci Şekil 1'de gösterilmiştir.

figure-protocol-1
Şekil 1: CST ve TSMDM'yi entegre eden dört aşamalı hafif İngilizce metin sınıflandırma çerçevesinin görselleştirilmesi. İş akışı dört aşamadan oluşur. Aşama 1, giriş İngilizce metninden BERT tabanlı dinamik gömmeler kullanarak metin temsili gerçekleştirir. Aşama 2, metin grafiği oluşturarak ve örnek düzeyi ile dağılım düzeyindeki ilişkileri hesaplayarak grafik sinir ağı modellemesini uygular. Aşama 3, düğüm merkeziliği yeniden yapılandırması ve çok katmanlı prototip oluşturma çerçevesi yoluyla anlamsal ortaya çıkışı modelleyerek nihai kategori prototipini elde eder. 4. aşama, öğretmen modeli eğitildiği ve bilgi meta-damıtma yoluyla aktarıldığı iki aşamalı element damıtımı uygular; nihai öğrenci modeli üretilir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

İlk olarak, metin temsili ve dinamik gömme aşamasında, BERT modeli giriş metnini dinamik olarak gömmek ve bağlamsal anlamsal bilgiyi yakalamak için kullanılır. İkinci aşama, örneklerin dağılım özelliklerini dikkate alan, bir GNN modeli oluşturan ve örnek düzeyinde ve dağılım düzeyinde çift bilgi etkileşimi yoluyla özellik temsilini artıran dağılım-bilinçli GNN modellemesidir. Üçüncü aşama, hibrit sistem teorisi tarafından yönlendirilen anlamsal ortaya çıkış modellemesidir; düğüm merkeziliği yeniden yapılandırması ve dil sisteminin dinamiklerini ve ortaya çıkışını simüle etmek için üç seviyeli prototip üretim mekanizması getirilir. Son olarak, dördüncü aşamada iki seviyeli meta-distilasyon hafif operasyonu gerçekleştirilir. Bilgi damıtma süreci, asistan modeli ve meta-öğrenme stratejisi aracılığıyla optimize edilip verimli model sıkıştırma ve hızlandırma sağlanır.

Dağılım özellikleri ve CST temelli ETC modeli
Model Mimarisi Genel Bakış
Önerilen metin sınıflandırma modeli, giriş metninin dinamik bağlamsal kodlamasını gerçekleştirmek için önceden eğitilmiş bir BERT kullanır; böylece anlamsal olarak zengin kelime gömmeleri ve küresel bir temsil oluşturur. Sonra, bu özelliklerden bir örnek grafiği ve dağılım grafiği oluşturulur: örnek grafiği, çift bazda örnek benzerliklerini yakalarken, dağılım grafiği genel veri dağılımını modeller; İki grafik arasındaki yinelemeli bilgi alışverişi, bireysel özelliklerin ve küresel yapının sinerjik şekilde geliştirilmesini sağlar. Daha sonra, CST entegre edilip grafik ağını derinlemesine güçlendirir. Node merkeziyeti yeniden yapılandırması, PageRank'i kullanarak sözcüksel etkiyi nicelikten ölçer; bu da dil ağlarındaki temel unsurların baskın rolünü simüle eder. Bu, karmaşık ağ topolojilerinde düğümlerin küresel etkisini ölçmek için yaygın olarak doğrulanmış bir yöntemdir ve dil sistemlerinde çekirdek sözcük düğümlerin asimetrik anlamsal yayılımını yakalamak için oldukça uygundur. Üç seviyeli "mikro–mezo–makro" prototip üretim çerçevesi, yerel anlamsaldan bütünsel kategori temsillerine kadar ortaya çıkan süreci taklit eder. Son olarak, geliştirilmiş özellik temsilleri bir sınıflandırıcıya aktarılır ve nihai sınıf olasılıkları üretilir.

Dağıtım Farkında GNN ile Özellik Etkileşimi
ETC'nin genelleştirme yeteneğini optimize etmek ve metinler ile Örnek Dağılım Özellikleri (SDF) arasındaki karmaşık anlamsal ilişkileri etkili bir şekilde yakalamak için, bu çalışma dağıtım özellikleri ve CST temelinde bir ETC modeli oluşturur. GNN ve dinamik metin gömme gibi mekanizmaları entegre ederek metin içindeki küresel ve yerel bilginin derinlemesine madenciliğini sağlar. GNN, grafik yapılandırılmış verileri işlemek için özel olarak tasarlanmış bir DL modelidir. Temel ilke, grafikteki her düğümün komşu düğümlerinin özellik bilgilerini topladığı bir mesaj iletimi mekanizması kullanmak ve bunu kendi durumuyla birleştirmektir. Birden fazla yineleme turu sayesinde, topoloji yapısını da içeren yüksek boyutlu bir temsil öğrenir. Bu süreç, düğümlerin yerel komşuluğun ve hatta küresel grafiğin yapı ve özellik bağımlılıklarını yakalamasını sağlar. Uzun vadeli bağımlılıklar ve küresel ilişkiler modellemedeki geleneksel dizi modellerinin sınırlamalarını aşmak için, bu çalışma GNN'yi kullanarak örnekler arasındaki karmaşık anlamsal ilişkileri ve yapısal ilişkileri yakalar. GNN'nin bireysel örnekler arasındaki doğrudan korelasyon bilgisine odaklanması nedeniyle, örneklemkümesi 14,15,16'nın genel dağılım özelliklerini görmezden gelir. Bu nedenle, bu çalışma SDF'yi dikkate alan bir GNN modeli önermektedir. Bu model, dinamik metin gömme için BERT'i tanıtır ve örneklerin özellik farklarını hesaplamak için prototip bir ağ ile birleştirilir. BERT, Transformer mimarisine dayalı önceden eğitilmiş bir dil modelidir. Temel ilke, bağlamdaki her kelimenin anlamsal bilgisini çift yönlü bir kodlayıcı aracılığıyla aynı anda yakalamak ve büyük ölçekli bir korpusta iki görevle önceden eğitmektir: "maskeli dil modeli" ve "bir sonraki cümle tahmini". Maskeli dil modellerinde, girdideki bazı kelimeler rastgele maskelenir ve modelin bağlam temelinde orijinal kelimeyi tahmin etmesini gerektirir. Bir sonraki tahmin, iki cümlenin ardışık olup olmadığını belirler. Ön eğitimden sonra, BERT ince ayar yoluyla çeşitli doğal dil işleme görevlerine hızla uyum sağlayabilir, performansı önemli ölçüde artırır ve sonraki grafik yapısı için yüksek kaliteli özellik temsilleri sağlar. Bu çalışmada inşa edilen ETC modelinin özel yapısı Şekil 2'de gösterilmiştir.

figure-protocol-2
Şekil 2: CST entegre İngilizce metin sınıflandırma modelinin örnek dağılım özelliklerini dikkate alan mimari tasarımı. Şekil, karmaşık sistem teorisi (CST) ile entegre edilmiş ve metin örnek dağılımı özelliklerinin hesablanması ile İngilizce metin sınıflandırma modelinin mimari tasarımını göstermektedir. Mimari, BERT tabanlı dinamik bağlamsal gömme, dağıtıma duyarlı grafik sinir ağı (GNN) ve CST geliştirme mekanizmalarını birleştirir ve çok modüllü işbirlikçi modelleme yoluyla İngilizce metinlerde küresel ve yerel anlamsal bilgilerin derinlemesine madenciliğini gerçekleştirir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Bu modelde, genel bir veri seti için, BERT modeline İngilizce metin girdisi, bir tokenizer aracılığıyla bir token dizisi oluşturur. Dizi oluşturma yöntemi denklem (1)'de gösterilmiştir.

[CLS], bir 1,bir 2,... an, [SEP] (1)

Denklem (1)'de, [CLS] dizinin başında bulunan sınıflandırma işaretidir. BERT, eğitim sürecinde [CLS] için sabit bir konum gizli durumu üretir. Bu durum, tüm metnin küresel anlamsal temsili için doğrudan kullanılır. 1, 2,... n, metindeki bir kelimeyi veya alt kelimeyi temsil eder. [SEP] cümlenin sonunu belirtmek için kullanılan bir ayırıcıdır. Bert'in yukarıdaki diziyi işlemesiyle birlikte, her tokenın özellikleri elde edilir ve model için yapılandırılmış bağlamsal bilgi sağlanır. Varlıkları içeren özel veri setleri için, geleneksel dizi oluşturma yöntemleri kullanılırsa, varlıkların içerdiği konumsal bilgiler kaybolur. Bu nedenle, bu çalışma denklem (2)'de gösterilen yöntemle diziyi oluşturur.

figure-protocol-3(2)

(2) denkleminde, [E1], [/E1], [E2] ve [/E2] iki varlığın başlangıç ve bitiş konumlarını belirlemek için belirlenen belirtetörlerdir. Benzer şekilde, Bert işlemesinden sonra, bu tokenların çıktı özellikleri ilgili varlıkların anlamsal bilgilerini taşıyacak ve böylece varlığın konumuna dair önemli bilgileri daha iyi kullanılır. Sonrasında, bu çalışma, örneklerin dağılımı ve örnek özelliklerini geliştirmek için SDF'yi dikkate alan bir GNN modeli kullanmaktadır. Modelin yapısı Şekil 3'te gösterilmiştir.

figure-protocol-4
Şekil 3: Dağılım-farkında grafik sinir ağı modelinin çift grafik özellik etkileşim mimarisi. Şekil, İngilizce metin sınıflandırması için dağıtıma duyarlı GNN modelinin çift grafikli özellik etkileşim mimarisini sunmaktadır. Mimari, örnek düzeyinde benzerlik kodlaması için bir nokta grafiği ve dağılım düzeyinde benzerlik kodlaması için bir dağılım grafiği oluşturur ve iki grafik arasındaki yinelemeli bilgi etkileşimi sayesinde özellik geliştirme sağlar; böylece örnek özellikleri ve dağıtım özelliklerinin çapraz seviyeli bilgi döngüsünü tamamlar. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Model, iki aşamalı bir etkileşim mekanizması aracılığıyla özellik geliştirme sağlar. İlk olarak, veri örneklerinin örnek düzeyindeki ilişkilerinden dağılım özelliklerini ayrıştırır ve ardından dağılım düzeyinde bilgi alışverişi yoluyla örnek özelliklerini dinamik olarak optimize eder. Örneklerin ve dağıtım seviyelerinin özelliklerini yinelemeli olarak güçlendirerek, nihayetinde sınıflandırma görevini tamamlar. Özellikle, model bilgi alışverişini sağlamak için nokta grafikleri ve dağılım grafikleri kullanır. Nokta haritası, metin örnek özellik vektörünü (BERT'in son iki katmanı tarafından güncellenen) bir düğüm olarak kullanır, örnek özellik farkını nicel olarak hesaplayarak kenar ağırlığını özel bir kodlama ağı üzerinden hesaplar (bir sigmoid katman + iki konvolüsyon toplu normalizasyon katmanı) ve [0,1 aralığına] normalleştirmek için min-max normalizasyon kullanır. Kenar eşiği için ampirik benzerlik eşiği 0.2 olarak belirlenir; burada bu eşiğin altında ağırlıklı kenarlar zayıf örnek düzeyindeki korelasyonları ortadan kaldırmak için budanır. Dağılım grafiği, birleşmiş metin dağılım özelliklerini düğüm olarak alır; kenar ağırlıkları dağılım özellik vektörlerinin kosinüs benzerliğine göre hesaplanır ve metrik tutarlılığı sağlamak için L2 normalizasyonu ile normalleştirilir. 0.15 kenar eşiği benimsenir ve bu değerin altında ağırlıklı kenarlar çıkarılır; kalan geçerli kenar ağırlıkları ise dağılım düzeyindeki ilişkilerin ayırt edilebilirliğini artırmak için çok katmanlı bir perceptron ile daha da haritalanır ve standartlaştırılır. Bu çalışma, l-katman yinelemesi için bir nokta grafiği figure-protocol-5 tanımlar; burada düğüm figure-protocol-6 örnek özellikleri temsil eder ve kenar figure-protocol-7 örnek düzeyinde benzerliği kodlar. Dağılım haritasıfigure-protocol-8, düğüm figure-protocol-9 örnek özellikleri temsil eder ve kenar figure-protocol-10 dağılım seviyesi benzerliğini kodlar. Örnek olarak l-den l+1-e kadar olan çarkı alırsak, örnek düzeyinde ilişki hesaplaması, denklem (3)'te gösterildiği gibi, özellik farkları üzerinden puan benzerliğini hesaplar.

figure-protocol-11 (3)

(3) denkleminde, figure-protocol-12 ve figure-protocol-13 nokta grafiğinin l-yinelenmesinde i ve j düğümleri arasındaki kenar ağırlıklarıdır ve örnek özelliklerin benzerliğini yansıtır. figure-protocol-14 düğüm özellik farklılıklarını kenar ağırlık ölçeklerine dönüştürmek için kullanılan bir kodlama ağıdır; bir Sigmoid katmanı ve iki katman konvolüsyon parti normalizasyon aktivasyon fonksiyonlarından oluşur. figure-protocol-15 ve figure-protocol-16 ise l-1-ci yineleme olduğunda, i ve j düğümlerinin özvektörleri Bert tarafından son iki katmanda güncellenir. Daha sonra, dağılım özellikleri, denklem (4)'te gösterildiği gibi örnek ilişkileri temelinde hesaplanır.

figure-protocol-17(4)

(4) denkleminde, figure-protocol-18 l-th katman dağılım grafiğindeki i düğümünün özvektörüdür. MLP1, aktivasyon fonksiyonları ve tamamen bağlı katmanlardan oluşan çok katmanlı bir perceptrondur ve birleşik bileşik özellikleri yeni dağıtım özelliklerine eşlerler. Daha sonra, dağılım ilişkisi dağılım özelliklerine göre hesaplanır ve örnek özellikleri dağılım ilişkisinden hesaplanarak çapraz seviye bilgi döngüsü tamamlanır.

Karmaşık Sistemlerin Geliştirme Mekanizmaları
Genelleştirme yeteneğini daha da geliştirmek için, bu çalışmada yukarıdaki modele CST uygulanmıştır. Karmaşık sistemlerin dinamik evrimi, düğüm etkisinin heterojen dağılımı ile kendini gösterir. Dil sistemlerinde anlamsal yayılımda temel kelime dağarcığının baskın rolünü simüle etmek için, bu çalışma bilgi yayılım mekanizmasını yeniden inşa etmek için düğüm merkezilik indeksini tanıtmaktadır. Her senaryo görevi için oluşturulan nokta grafiği H p, PageRank algoritmasını kullanarak düğüm C(hi)'nin merkeziliğini nicelikle ölçer; bu da denklem (5)17'de gösterilmiştir.

figure-protocol-19(5)

(5) denkleminde , α sönümleme katsayısıdır, α = 0.85. N(hi) komşu düğümlerin kümesini temsil eder ve L(hj) düğüm derecesidir. Denklem (5), simüle edilmiş dil ağlarında kelime dağarcığı etkisinin zincirli yayılma sürecinin yerini alır ve temel kelime dağarcığının (fiiller ve konu kelimeleri gibi) daha yüksek merkezilik kazanmasına olanak tanır. Daha sonra, düğüm merkeziyeti kenar ağırlıklarıyla birleştirilerek düğümler arasında bilgi yayılım gücünü dinamik olarak ayarlar. Bağlama fonksiyonu λij denklem (6)'da gösterilmiştir.

figure-protocol-20(6)

(6) denkleminde, σ Sigmoid aktivasyon fonksiyonudur, WT öğrenilebilir ağırlık vektörüdür ve b önyargı terimi anlamına gelir. Merkeziyetlik ve kenar ağırlıklarının birleşimi, yerel ilişkileri küresel önemle dinamik olarak dengeler ve böylece modelin görevlerdeki dinamik değişikliklere uyum sağlayabilmesini artırır. CST'nin ortaya çıkışı, İngilizce dilinde genel anlamanlamın yerel kelime dağarcığının toplamını aşmasıolarak kendini gösterir 18. Bu özelliği ETC'de kullanmak için, bu çalışma, Şekil 4'te gösterildiği gibi mikro özelliklerden makro kategorilere çıkış sürecini simüle etmek için üç seviyeli bir prototip üretim çerçevesi tasarlamaktadır.

figure-protocol-21
Şekil 4: Dilsel anlamsal ortaya çıkış için mikro-mezo-makro üç seviyeli prototip üretim çerçevesinin adımlı inşası. Şekil, İngilizce metin sınıflandırmasında dilsel anlamsal ortaya çıkışı simüle etmek için mikro-mezo-makro üç seviyeli prototip üretim çerçevesinin adım adım inşasını göstermektedir. Çerçeve, K-ortalamalarla mikro alt sınıf kümeleme, dağılım benzerlik ağırlıklarına dayalı mezo alt sınıf prototip füzyonu ve dikkat mekanizmasıyla makro doğrusal olmayan entegrasyon yoluyla hiyerarşik metin kategorisi temsilleri oluşturur; bu da dil sistemlerinde "bütün, parçalarının toplamından büyüktür" gibi ortaya çıkan karakteristikliği simüle eder. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Yukarıdaki süreç, modelin genelleme yeteneğini artırmak için metin kategorisi temsillerini mikrodan makroya adım adım oluşturur. Mikro düzeyde, K alt sınıfı, her metin kategorisinin örnek göme temsillerinin kümelenmesiyle oluşturulur. K-ortalama, kategorideki örnekleri alt gruplara bölmek için kullanılır ve her alt grubun merkez konumu alt sınıfprototipi 19 olarak hesaplanır. Mezoskopik düzeyde, her alt sınıf prototipinin dağılımsal benzerliği hesaplanır, bir benzerlik matrisi oluşturulur ve ardından alt sınıf prototipleri benzerlik ağırlıklarına göre yeniden birleştirilerek alt sınıflar arasındaki korelasyonu nicelikle ölçer. Alt sınıf benzerlik ağırlığı wij hesaplanması denklem (7)'de gösterilmiştir.

figure-protocol-22 (7)

(7) denkleminde, figure-protocol-23 iki alt sınıf figure-protocol-24 ile figure-protocol-2520 arasındaki dağılım farkını ölçmek için kullanılan Jensen Shannon divergensiyasıdır. Son olarak, alt sınıf prototipleri ağırlıklandırılır ve birleştirilir ve sınıf dağılımı temsilleri figure-protocol-26seti elde edilir. Makro düzeyde, her alt sınıfın önem ağırlıkları dikkat mekanizmalarıyla öğrenilir ve ortaya çıkış sürecini simüle etmek için doğrusal olmayan dönüşümler uygulanır; bu da denklem (8)'de gösterildiği gibi son sınıf prototipi cfinal'e ulaşır.

figure-protocol-27(8)

(8) denkleminde, αk, k-sınıfının dikkat ağırlığı anlamına gelir. U, doğrusal olmayan dönüşüm ağırlık matrisini gösterir. tanh(·), doğrusal olmayan temsili geliştirmek ve karmaşık sistemlere özgü parça toplamından büyük genel olarak simüle etmek için kullanılır. Her seviye, kategoriler içindeki çeşitliliği alt sınıf yapısı aracılığıyla yakalar, dağılımın benzerliğini ağırlıklarla vurgulayarak gürültülü alt sınıfların etkisini azaltır ve modelin genelleme yeteneğini artırmak için dikkat mekanizmalarıyla ayırt edici özelliklere dinamik olarak odaklanır. CST esas olarak GNN ile iki mekanizma aracılığıyla entegre edilmiştir. İlki, bilgi yayım sürecini yeniden inşa etmek ve dil sistemindeki sözcük etkinin heterojen dağılımını simüle etmek için düğüm merkeziyeti getirmek. Düğüm merkeziyeti, PageRank algoritması aracılığıyla nicelendirilir ve dinamik olarak kenar ağırlıklarıyla birleştirilir; böylece temel kelime dağarcığı anlamsal yayılımda baskın hale gelir ve modelin görevlerin dinamik değişimlerine uyum sağlamasını sağlar. İkincisi, mikro-alt sınıf kümelemesinden makro-kategori prototip birleşimine kadar üç seviyeli bir prototip üretim çerçevesi tasarlamak; dil sisteminde ortaya çıkan "bütün, parçalarının toplamından daha büyük" özelliğini simüle etmektir. Bu çerçeve, dağılım, benzerlik ağırlıkları ve dikkat mekanizmaları aracılığıyla yerel özelliklerden küresel anlamlara hiyerarşik entegrasyonu sağlar.

Özetle, inşa edilmiş ETC modelinin temel yeniliği, CST fikirlerini GNN çerçevesine derinlemesine entegre etmekte yatmaktadır. Bilgi yayım mekanizmasını düğüm merkeziyeti yoluyla yeniden inşa ederek, model dil sistemindeki temel unsurların öncü rolünü simüle eder ve görev dinamiklerine uyum sağlar. Üç katmanlı prototip oluşturma çerçevesi sayesinde, model yerel özelliklerden küresel anlamanlamlılığa dönüş sürecini gerçekleştirir ve böylece modelin kategorideki çeşitlilik ve ayırt edici özellikleri yakalama yeteneğini artırır. Bu yöntem, yalnızca örnek düzeyinde ilişkilere dayanan geleneksel GNN'lerin sınırlamasından kaçınır. Dağılım düzeyinde etkileşim ve karmaşık sistem özellikleri sayesinde, modelin az sayılı ve çapraz alan senaryolarında genelleştirme yeteneğini geliştirmek için yeni bir çözüm sunar.

CST'nin ortaya çıkan özellikleri, üç seviyeli bir prototip üretim çerçevesine karşılık gelir. Dil sistemlerinde, "bütün, parçalarının toplamından daha büyüktür" ilkesi, yerel kelime anlamlarından genel metin kategorilerine anlamsal bir sıçrama olarak ortaya çıkar. Bu çalışma, bu süreci "mikro-mezo-makro" üç seviyeli prototip üretim mekanizmasıyla simüle etmektedir: mikro düzeyde, örnek gömmeleri alt sınıf prototipleri oluşturmak için kümelenir; Mezo düzeyinde, bu prototipler dağılım benzerliğine göre ağırlıklandırılır ve birleştirilir; ve makro düzeyde, nihai kategori prototipleri dikkat mekanizması ile doğrusal olmayan şekilde sentezlenir. Örneğin, duygu sınıflandırmasında, "hayal kırıklığı yaratan", "yavaş" ve "pahalı" gibi birden fazla olumsuz kelime lineer olmayan şekilde birleşip güçlü bir genel "negatif değerlendirme" duygusu olarak ortaya çıkar. CST'de düğüm merkeziyeti ve heterojenlik, düğüm merkeziyeti rekonstrüksiyonuna dayalı bilgi yayılım mekanizmasıyla uyumludur. Dil ağları içinde, kelimelerin etkisi eşit dağılmamıştır; temel kelimeler (örneğin, fiiller, tematik terimler) anlamsal yayılımda baskın roller oynar. Bu çalışma, PageRank algoritması kullanarak düğüm merkeziyetini nicelikle ölçüyor ve bunu dinamik olarak kenar ağırlıklarıyla eşleştirerek düğümler arasındaki bilgi yayılımının yoğunluğunu ayarlıyor. Örneğin, haber kategorisinde, "seçim" terimi siyasi metinlerde yüksek bir merkeziyete sahiptir; bu da "oy" ve "kampanya" gibi bitişik düğümlerin bilgi toplama sırasında daha yüksek ağırlık kazanmasına yol açar ve böylece konunun anlamsal temsilini güçlendirir. CST'nin dinamik ve uyarlanabilir doğası, dağılım farkında GNN'lere ve meta-damıtma içinde öğretici deney mekanizmasına karşılık gelir. Dil sistemleri, bağlam ve görev gereksinimlerine göre dinamik olarak evrilir. Modeller, veri setlerindeki genel dağılım değişikliklerini dağılımlara duyarlı GNN'ler aracılığıyla yakalar. Aynı zamanda, TSMDM'de meta-öğrenme ile yönlendirilen bir öğretim deney mekanizması tanıtılır; bu mekanizma, TM'lerin SM'lerden gelen geri bildirimlere göre parametreleri dinamik olarak ayarlamasına olanak tanır. Örneğin, alanlararası duyarlılık analizinde, model hedef alanın veri dağılımına göre özellik ağırlıklarını hızla uyarlayabilir ve meta-damıtım sırasında TM'nin parametrelerini iyileştirerek yeni alanlar için uyum verimliliğini artırabilir.

TSMDM tabanlı LTC modeli
İki Aşamalı Meta-Damıtma Boru Hattı
Kaynak kısıtlı ortamlarda yüksek hesaplama maliyeti ve dağıtım zorluklarının sorunlarını ele almak için, TSMDM tabanlı hafif bir metin sınıflandırma modeli önerilmektedir. Bu meta-damıtma yöntemi, damıtma sürecini iki farklı aşamadan oluşan sıkı bir sıralı sırayla gerçekleştirir. İkinci aşama ise ancak birinci aşamanın eğitimi tamamlanıp birleştikten sonra başlatılır: 1) Öğretmenden Öğretim Asistanına (TA) bilgi sıkıştırma aşaması ve 2) meta-öğrenme parametre uyarlamasıyla entegre edilmiş TA-Öğrenciye hafif damıtma aşaması. Bu yaklaşım, karmaşık bir TM'den hafif bir SM'ye iki aşamalı damıtma yoluyla verimli bilgi transferi sağlarken, süreç boyunca bilgi transfer stratejisini dinamik olarak optimize etmek için meta-öğrenme mekanizması içerir21,22. Genel ürün hattı Şekil 5'te gösterilmiştir.

figure-protocol-28
Şekil 5: İki aşamalı meta-damıtma mekanizmasıyla hafif metin sınıflandırma modelinin boru hattı tasarımı. Şekil, iki aşamalı meta-damıtma mekanizması (TSMDM) ile hafif metin sınıflandırma modelinin boru hattını tasarlar. Bu hatt, öğretmen modeli (yüksek karmaşıklıkta bilgi kaynağı), öğretim asistanı modeli (orta karmaşıklık tampon katmanı) ve öğrenci modeli (hafif hedef model) içerir ve iki ardışık aşamada verimli bilgi transferini uygular: öğretmenden öğretmene asistan bilgi sıkıştırması ve öğretmen asistanından öğrenciye hafif damıtma meta-öğrenme ile entegre edilir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Yöntem üç rolü içerir: TM, TA modeli ve SM; damıtma süreci iki aşamaya ayrılır: öğretmen-TA damıtma ve TA-öğrenci damıtma. İlk Öğretmenden TA'ya bilgi sıkıştırma aşamasında, TM'den gelen bilgi, doğrudan damıtımda aşırı kapasite boşluklarından kaynaklanan bilgi kaybını azaltmak için orta karmaşıklıkta bir TA modeline sıkıştırılır. TM, bilgi kaynağı olarak hizmet eder ve hem çıktı sınıflandırma olasılıklarını hem de ara katman özelliklerini TA modeline aktarır. TA modeli, çıktılarını ve özellik temsillerini öğretmenin temsilleriyle hizalayarak, sınıflandırma kaybı ile özellik hizalama kaybı21'i entegre eden birleşik kayıp fonksiyonu kullanılarak eğitilir. TA modelinin birleşmesiyle başlatılan ikinci TA-Öğrenciye hafif damıtma aşamasında, bilgi TA modelinden nihai hafif SM'ye daha da damıtılır. Bu aşama ayrıca çift denetim (sınıflandırma logitleri ve ara özellikler) kullanır ve bir meta-öğrenme mekanizması içerir: TM, öğrencinin öğrenme durumunu değerlendirmek için yardımcı görevlerde "öğretim deneyleri" yapar ve daha uyarlanabilir ve hedefli rehberlik sağlamak için kendi parametrelerini dinamik olarak ayarlar. SM, hem çıktı uyumsuzluğunu hem de özellik mesafesini TA modeline göre en aza indirerek eğitimi tamamlar; böylece önemli parametre azaltımı sağlarken sınıflandırma performansını mümkün olan en yüksekölçüde korur 22.

Öğretim Deneyleriyle Meta-Öğrenme
Geleneksel bilgi damıtma yöntemlerinde, eğitilmiş TM kayıp hesaplamasına katılarak SM'yi yönlendirir. Ancak, sabit parametreli TM'lerin SM'lerin gerçek öğrenme durumunu değerlendirmesi zordur ve rehberliklerinin SMparametreleri güncellemeye ne kadar katkı sağladığını niceleyemezler. Bu nedenle, bu çalışma damıtma sürecine meta öğrenme fikirleri katıyor ve TM'nin SM'nin öğrenme geri bildirimine göre kendi parametrelerini ayarlamasını sağlıyor. Damıtım süreci Şekil 6'da gösterilmiştir.

figure-protocol-29
Şekil 6: Meta-damıtmanın yinelemeli parametre optimizasyon süreci ve öğretim deney mekanizması. Şekil, meta-damıtmanın yinelemeli parametre optimizasyon sürecini İngilizce metin sınıflandırma modeli hafifletmesi için öğretim deney mekanizması ile birleştirerek göstermektedir. Süreç, öğrenci modelinden geçici bir iç öğrenen oluşturur, iç öğrenenin simüle edilmiş eğitim performansı aracılığıyla öğretim etkisi kaybını nicelikle ölçüler ve öğretmen modelinin kaybın geriye yayılması yoluyla kendi parametrelerini ayarlamasını sağlar, böylece sonraki bilgi aktarım stratejisini optimize eder. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

TM, kendi eğitim aşamasında geleneksel sınıflandırma görevleriyle parametreleri optimize eder ve bu da orijinal performansını yansıtan temel bir sınıflandırma kaybı LT ile sonuçlanır. Eğitim tamamlandıktan sonra, SM S çoğaltılır ve iç öğrenen S1'in geçici bir kopyasını oluşturur. TM, S1 üzerinde öğretim deneyleri yapar ve bu simüle edilmiş eğitimde S1'in gösterdiği kapsamlı performans hatası, kayıp LQ olarak nicelendirilir. Bu sinyal, öğretim etkinliğinin değerlendirilmesi için TM'ye geri bildirim olarak kullanılır. LQ'nun geri yayılması sayesinde, TM kendi parametrelerini aktif olarak ayarlar ve bilgi iletimi yöntemini optimize eder. Meta öğrenme optimizasyonu tamamlandıktan sonra, TM orijinal SM S üzerinde resmi bilgi damıtımı yapar ve ayrıca model kaybı LS'yi TM'ye öğretim etkinliği değerlendirmesi için geri bildirim olarak kullanır. ETC modelinin hafifletilmesini sağlamak için, bu çalışma, SDF GNN modelinin öğretim deney sürecine TM olarak dahil edilmesini düşünecektir; Şekil 7'de gösterildiği gibi.

figure-protocol-30
Şekil 7: Meta-damıtımasyonda öğretmen modeli optimizasyonu için öğretim deneyi mekanizmasının parametre güncelleme akışı. Şekil, meta-damıtma sürecinde öğretmen modeli optimizasyonu için öğretim deneyi mekanizmasının parametre güncelleme akışını göstermektedir. Akış önce iç öğrenenin tahmini ile öğretmen modelinin tahmini arasındaki yumuşak kaybı ortalama kare hata kaybı fonksiyonuyla hesaplar, yumuşak kaybı sert etiket hatasıyla birleştirerek toplam eğitim kaybını oluşturur ve öğretmen modelinin parametrelerini, ağırlıklı toplam hatanın geri yayılması yoluyla güncelleyerek öğretim etkinliğini artırır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Bilgi damıtma eğitimi tamamlandıktan sonra, SM önce TM'nin öngörülen sonuçları ile gerçek etiketler arasındaki farkı hesaplar. Daha sonra, MSE kayıp fonksiyonu SM tahmini (iç öğrenen S1) ile TM tahmini arasındaki mesafeyi ölçmek için kullanılır. Bu mesafe değeri yumuşak kayıp25 olarak kullanılır. Son eğitim amacı, sert etiket hatası ve yumuşak kayıp ağırlıklı bir kombinasyondan oluşur. Ağırlıklı toplam hata geriye yayımlanarak, TM'nin parametreleri güncellenir ve böylece TM'nin öğretim etkinliği artırılır. Dahili öğrenici S1'in parametre hesaplaması denklem (9)'da gösterilmiştir.

figure-protocol-31(9)

Denklem (9) içinde, figure-protocol-32 ve figure-protocol-33 iç öğrenici parametreleri ve bunların TM parametresi tarafından etkilenen başlangıç parametreleri γT. λ (öğrenme oranı, λ = 0.005), meta-damıtma26 sırasında iç öğrenenler (yani SM kopyaları) için parametre güncelleme adım boyutunu kontrol eder. Denklem (9) kayıp gradyanlarını geri yayılma yoluyla hesaplarken, λ iç öğrenenlerin parametrelerini günceller. Bu mekanizma, SM'lerin öğrenme özelliklerini yansıtır; TM'lerin geri bildirim almasını ve öğretim stratejilerini ayarlamasını sağlar, böylece sonraki bilgi damıtma etkinliğini artırır. Meta öğrenmede kayıp LS hesaplaması denklem (10)'da gösterilmiştir.

figure-protocol-34 (10)

(10) denkleminde, B meta-öğrenme örnek dizisidir.

Kayıp Tasarımı ve Yardımcı Model ile Bilgi Transferinin Optimize Edilmesi
Bilgi damıtılmasının etkinliğini daha da artırmak için, bu çalışma sınıflandırma kaybı ve özellik kaybı hesaplanarak toplam kaybı elde etmektedir. Bunlar arasında, özellik kaybı, TM'nin sığ ve güncel özellik çıktılarını kullanarak SM'yi yönlendirerek geriye dönük bir mekanizma benimser; bu denklem (11)'de ifade edilir.

figure-protocol-35(11)

(11) denkleminde, I özellik katmanı indekslerinin kümesidir. D, iki özellik temsili arasındaki farkı hesaplamak için alınan bir mesafe fonksiyonudur. figure-protocol-36 ve figure-protocol-37 TM ile SM'deki nesnel temsil fonksiyonlarıdır; bu fonksiyonlar i-ci ve j-ci katmanların özellik çıktılarını figure-protocol-38 figure-protocol-39 dikkat matrislerine dönüştürür. Sınıflandırma kaybı, SM çıkışı ile gerçek etiket arasındaki çapraz entropi kaybını, ayrıca iki model çıkışı arasındaki MSE'yi yumuşak kayıp27,28 olarak birleştirir. Sonuç olarak, genel kayıp iki kişinin ağırlıklandırılmasıyla elde edilir ve SM'nin TM'den daha iyi rehberlik almasına yardımcı olur. Bilgi damıtma sürecinde performans kaybını en aza indirmek için, bu çalışma, Şekil 8'de gösterildiği gibi öğretim asistanı modelini iki model arasında konumlandırmaktadır.

figure-protocol-40
Şekil 8: Ara tampon katmanı olarak öğretim asistanı modeliyle iki aşamalı bilgi damıtma işleme akışı. Şekil, öğretim asistanı modelinin ara tampon katmanı olarak kullanıldığı iki aşamalı bilgi damıtma işleme akışını göstermektedir. Birinci aşama füzeleri, toplam damıtma kaybını oluşturmak için kayıp ve sınıflandırma kaybı içerir ve öğretmen asistanı modelini öğretmen modelinin bilgisiyle eğitir; İkinci aşamada ise aynı kayıp birleşme stratejisini benimseyerek öğretmen asistanı modelinin bilgisini öğrenci modeline damıtarak öğretmen ve öğrenci modelleri arasındaki aşırı karmaşıklık boşluklarından kaynaklanan bilgi kaybını azaltır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Meta damıtma aşaması tamamlandıktan sonra, TA modeli ve TM geleneksel bilgi damıtımına tabi tutulur. Bu süreçte, her ikisinin özellikleri eşzamanlı olarak çıkarılır ve karşılık gelen kayıp La hesaplanır. Daha sonra, bu özellik kaybı, modelin sınıflandırma kaybı LM1 ile birleştirilerek (12) denkleminde gösterildiği gibi ilk aşamada damıtma kaybı fonksiyonu figure-protocol-41 oluşturulur.

figure-protocol-42(12)

(12) denkleminde, β, toplam kayıptaki özellik kaybı ve sınıflandırma kaybının oranını kontrol etmek için kullanılan ağırlık katsayısıdır. figure-protocol-43 ve figure-protocol-44 öğretim asistanı modeli ile TM'deki nesnel temsil fonksiyonlarıdır; bu fonksiyonlar i-ci ve j-th katmanlarının özellik çıktılarını figure-protocol-45 figure-protocol-46 dikkat matrislerine dönüştürür. zT ve z M , TM ve asistan modelinin çıktılarıdır. Öğretim asistanı modelinden SM'ye damıtma süreci, yukarıdaki süreçle aynıdır ve bilgi transferini tamamlamak için birden fazla yinelemeyle SM'nin kaybını en aza indirir.

Sonuç olarak, önerilen TSMDM'nin temel katkısı, meta-öğrenme mekanizması yoluyla bilgi aktarım sürecinin optimize edilmesidir. Geleneksel damıtma ile karşılaştırıldığında, bu yöntemin temel avantajı dinamik öğretim yeteneğindedir: TM, SM'nin gerçek zamanlı geri bildirimine dayalı öğretim deney mekanizması aracılığıyla kendi parametrelerini ayarlayabilir ve böylece daha hedefli rehberlik sağlar. Bu arada, öğretim asistanı modeli tampon katmanı olarak tanıtılır; bu da TM'ler ile SM'ler arasındaki karmaşıklık boşluğunu etkili bir şekilde kapatır ve bilgi transferinde bilgi kaybını azaltır. Bu "meta-öğrenme optimizasyonu öğretim stratejisi" ve "transfer zorluğunu azaltmak için iki seviyeli tamponlama"nın işbirlikçi tasarımı, nihai SM'nin karmaşık TM'den çıkarılan temel bilgiyi en büyük ölçüde korurken önemli hafiflik kazanmasını sağlar.

Veri Erişilebilirliği
Mevcut çalışma sırasında oluşturulan ve/veya analiz edilen veri setleri, Ek Dosya 1'de sağlanmıştır.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deneysel kurulum ve veri seti:
Önerilen modelin performansını ve hafif verimliliğini küçük örneklem çapraz alan sınıflandırma görevlerinde kapsamlı değerlendirmek için deneyler dört veri setinde gerçekleştirilir: FewRel (küçük örneklem ilişkisel sınıflandırma), ARSC (alanlar arası duyarlılık analizi), Reuters-21578 (çoklu konu haber kategorizesi) ve ArXiv (uzun biçimli akademik özetler). Wikipedia'dan alınan yaygın kullanılan küçük örneklemli ilişkisel sınıflandırma v...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ETC'nin az sayılı ve alanlar arası senaryolarda genelleştirme yeteneğini artırmak ve hesaplama maliyetlerini azaltmak için, bu çalışma CST'yi TSMDM ile entegre eden hafif bir metin sınıflandırma çerçevesi önermektedir. CST'yi bir TSMDM çerçevesiyle entegre etmek, mevcut ETC yöntemlerinin temel sınırlamalarını (zayıf birkaç atış/alanlar arası genelleme ve yüksek hesaplama maliyetleri) giderir; dil sistemi dinamikleri ve ortaya çıkan anlamsal özellikleri model tasarımına dahil eder ve hafi...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların açıklayacak hiçbir şeyi yok.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların kabul edecek hiçbir şeyi yok.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Central Processing Unit (CPU)Ticari donanım satıcıları (Intel, Dell, Lenovo)Intel i5-7300HQDonanım Özellikleri
Graphics Processing Unit (GPU)Ticari donanım satıcıları (NVIDIA, ASUS)NVIDIA GeForce RTX 3060, 12 GB VRAMDonanım Özellikleri
Random Access Memory (RAM)Ticari donanım satıcıları16 GB DDR4Donanım Özellikleri
Solid State Drive (SSD)Ticari donanım satıcıları1 TB NVMe SSDDonanım Özellikleri
Operating SystemMicrosoft Resmi Web SitesiWindows 10 (64-bit)Sistem Yazılımı
PythonPython Resmi Web Sitesi (python.org)Python 3.8Programlama Dili
PyTorchPyTorch Resmi Web Sitesi (pytorch.org)PyTorch 1.11.0Derin Öğrenme Çerçeveleri & Temel Kütüphaneler
CUDANVIDIA Resmi Web SitesiCUDA 11.3Derin Öğrenme Çerçeveleri & Temel Kütüphaneler
Hugging Face TransformersHugging Face Hub (huggingface.co)Kararlı sürüm (Python 3.8/PyTorch 1.11.0'a uyarlanmış)Derin Öğrenme Çerçeveleri & Temel Kütüphaneler
NumPyPyPI (pypi.org)Kararlı sürüm (Python 3.8'e uyarlanmış)Veri İşleme & İstatistiksel Kütüphaneler
PandasPyPI (pypi.org)Kararlı sürüm (Python 3.8'e uyarlanmış)Veri İşleme & İstatistiksel Kütüphaneler
Scikit-learnPyPI (pypi.org)Kararlı sürüm (Python 3.8'e uyarlanmış)Veri İşleme & İstatistiksel Kütüphaneler
SciPyPyPI (pypi.org)Kararlı sürüm (Python 3.8'e uyarlanmış)Veri İşleme & İstatistiksel Kütüphaneler
MatplotlibPyPI (pypi.org)Kararlı sürüm (Python 3.8'e uyarlanmış)Görselleştirme Kütüphanesi
AdamWPyTorch dahiliPyTorch 1.11.0'da entegreOptimizasyon
BERTHugging Face Hub (huggingface.co)BERT-base (bert-base-cased)Ön Eğitimli Modeller
FewRelFewRel Resmi Deposu (GitHub) / Wikipedia100 anlamsal ilişki kategorisi, her kategoride 700 cümle; eğitim/doğrulama/test bölme (5:2:3)Veri Kümeleri
ARSCKamu çapraz alan duyarlılık analizi veri kümeleri (GitHub/ACL Anthology)23 Amazon ürün kategorisi, 69 ikili duyarlılık analizi görevi; eğitim/doğrulama/test bölme (4:2:3)Veri Kümeleri
Reuters-21578UCI Makine Öğrenme Deposu / Reuters Resmi Arşivi21,578 haber makalesi, 90 tematik kategori; ModApte bölme yöntemiVeri Kümeleri
ArXivArXiv Kamusal API (arxiv.org)Bilgisayar bilimi bildiri özetleri; eğitim/doğrulama/test bölme (7:2:1)Veri Kümeleri
TokenizerHugging Face Hub (huggingface.co)BERT-base-cased TokenizerDiğer Temel Araçlar
GitGit Resmi Web Sitesi (git-scm.com)En yeni kararlı sürümDiğer Temel Araçlar

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wen, J., Liu, P. A classification method for English texts based on hybrid recurrent neural network and graph construction in social recommendation systems. IEEE Syst J. 17 (4), 5272-5279 (2023).
  2. Choudhuri, S., Adeniye, S., Sen, A. Distribution alignment using complement entropy objective and adaptive consensus-based label refinement for partial domain adaptation. Artif. Intell. Appl. 1 (1), 43-51 (2023).
  3. Li, X., Jia, L. English text topic classification using BERT-based model. J. Comput. Methods Sci. Eng. 25 (1), 669-684 (2025).
  4. Peng, B., Zhang, T., Han, K., Zhang, Z., Ma, Y., et al. BVMHA: text classification model with variable multihead hybrid attention based on BERT. J. Intell. Fuzzy Syst. 46 (1), 1443-1454 (2024).
  5. De Santis, E., Martino, A., Rizzi, A. Human versus machine intelligence: assessing natural language generation models through complex systems theory. IEEE Trans. Pattern Anal. Mach. Intell. 46 (7), 4812-4829 (2024).
  6. Zhang, R. Multilingual pretrained based multi-feature fusion model for English text classification. Comput. Sci. Inf. Syst. 22 (1), 133-152 (2025).
  7. Madhu, C., et al. Dialectic feature-based fuzzy graph learning for label propagation assisting text classification. IEEE Trans. Fuzzy Syst. 32 (10), 5598-5612 (2024).
  8. Shannaq, B., Boumedyen, A. Optimizing n-gram lengths for cross-linguistic text classification: a comparative analysis of English and Arabic morphosyntactic structures. Int. J. Adv. Appl. Sci. 12 (4), 136-145 (2025).
  9. Lagutina, N. S., Lagutina, K. V., Brederman, A. M., Kasatkina, N. N. Text classification by CEFR levels using machine learning methods and the BERT language model. Autom. Control Comput. Sci. 58 (7), 869-878 (2024).
  10. Rahman, M. H., et al. Optimizing BERT for Bengali emotion classification: evaluating knowledge distillation, pruning, and quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  11. Ševerdija, D., et al. Efficient sentence representation learning via knowledge distillation with maximum coding rate reduction. J. Comput. Inf. Technol. 31 (4), 251-266 (2023).
  12. Liu, T., Ren, X., Yin, J., Ni, W. Knowledge distillation with few labeled samples. Data Anal. Knowl. Discov. 8 (1), 104-113 (2024).
  13. Ye, E., et al. Multilingual taxonomic web page categorization through ensemble knowledge distillation. IEEE Trans. Knowl. Data Eng. 36 (11), 6614-6627 (2024).
  14. Sun, G., Li, J., Cheng, Y., Zhang, Z. LMTCSG: multilabel text classification combining sequence-based and GNN-based features. IEEE Trans. Ind. Inform. 21 (1), 849-857 (2025).
  15. Pham, P., Nguyen, L. T. T., Pedrycz, W., Vo, B. Deep learning, graph-based text representation and classification: a survey, perspectives and challenges. Artif. Intell. Rev. 56 (6), 4893-4927 (2023).
  16. Samseer, R. H., et al. A new conceptualization of self as an energetic node in cultural dynamics: transitioning from classical theories to complex systems. Appl. Math. Inf. Sci. 19 (2), 259-270 (2025).
  17. Bentbib, A. H., Boubekraoui, M., Jbilou, K. Extrapolation methods for multilinear PageRank. Numer. Algorithms. 98 (2), 1013-1043 (2025).
  18. Baniata, L. H., Kang, S. Switching self-attention text classification model with innovative reverse positional encoding for right-to-left languages: a focus on Arabic dialects. Mathematics. 12 (6), 1-15 (2024).
  19. Tang, L., Wang, Z., Wang, S., Fan, J., Yue, G. A novel rough semi-supervised k-means algorithm for text clustering. Int. J. Bio-Inspired Comput. 21 (2), 57-68 (2023).
  20. Hu, Z., Li, D., Yang, K., Xu, Y., Peng, B. Optimizing data distributions based on Jensen-Shannon divergence for federated learning. Tsinghua Sci. Technol. 30 (2), 670-681 (2025).
  21. Ling, Y., Nie, F., Yu, W., Li, X. Self-labeling and self-knowledge distillation unsupervised feature selection. IEEE Trans. Knowl. Data Eng. 37 (7), 4270-4284 (2025).
  22. Feng, K., Miao, Y., Li, C., Yuan, Y., Wang, G. Shared growth of graph neural networks via prompted free-direction knowledge distillation. IEEE Trans. Pattern Anal. Mach. Intell. 47 (6), 4377-4394 (2025).
  23. Song, Y., Zhang, P., Huang, W., Zha, Y., Zhang, Y. Flexible temperature parallel distillation for dense object detection: make response-based knowledge distillation great again. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4963-4975 (2025).
  24. Yang, Y., et al. Uncertainty-aware self-knowledge distillation. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4464-4478 (2025).
  25. Mao, L., Zhao, L., Yu, D., Sun, B. Enterprise-named entity recognition model based on knowledge distillation. J. Comput. Eng. 49 (5), 90-96 (2023).
  26. Chen, Z., Tian, P., Liao, W., Chen, X., Xu, G., et al. Resource-aware knowledge distillation for federated learning. IEEE Trans. Emerg. Top. Comput. 11 (3), 706-719 (2023).
  27. Kuang, Z., Wang, J., Sun, D., Zhao, J., Shi, L., et al. Incremental attribute learning by knowledge distillation method. J. Comput. Des. Eng. 11 (5), 259-283 (2024).
  28. Li, Y., Tian, T., Zhuang, M., Sun, Y. De-biased knowledge distillation framework based on knowledge infusion and label de-biasing techniques. J. Electron. Sci. Technol. 22 (3), 57-68 (2024).
  29. Wang, Z., Wang, L., Huang, C., Sun, S., Luo, X. BERT-based Chinese text classification for emergency management with a novel loss function. Appl. Intell. 53 (9), 10417-10428 (2023).
  30. Braun, A., Kohler, M., Langer, S., Walk, H. Convergence rates for shallow neural networks learned by gradient descent. Bernoulli. 30 (1), 475-502 (2024).
  31. Taha, K., Yoo, P. D., Yeun, C., Taha, A. Text Classification Techniques: A Holistic Review, Observational Analysis, and Experimental Investigation. Big Data Min. Anal. 8 (3), 624-660 (2025).
  32. Zhou, N., Yao, N. M., Li, Q. B. Neural Network Based on Inter-layer Perturbation Strategy for Text Classification. Mach. Intell. Res. 22 (1), 176-188 (2025).
  33. Ige, O. P., Gan, K. H. Ensemble Filter-Wrapper Text Feature Selection Methods for Text Classification. Comput. Model. Eng. Sci. 141 (11), 1847-1865 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

English Text ClassificationDeep LearningComplex System TheoryGraph Neural NetworkMeta LearningMeta DistillationFew Shot ClassificationCross Domain ClassificationLightweight ModelKnowledge Transfer

Related Articles