Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł badawczy

Uczenie maszynowe i oparte na regułach leksykalnych, ekonomiczne adnotacje emocji wypowiedzi Hinglish

523 wyświetleń

DOI:

10.3791/68437

19 sierpnia 2025

W tym artykule

Podsumowanie

To badanie łączy strategię opartą na regułach z uczeniem maszynowym i pomocą ekspertów w celu dodawania adnotacji do tekstu w języku Hinglish i angielskim. Dane są testowane na 19 000 tweetów z 81% dokładnością i są znacznie tańsze niż robienie tego ręcznie. Może być przydatny do śledzenia emocji podczas kryzysu.

Streszczenie

Adnotacja emocji w językach mieszanych, takich jak Hinglish (hindi-angielski), stawia wyjątkowe wyzwania ze względu na złożoność lingwistyczną i ograniczone zasoby. Niniejsze badanie wprowadza hybrydowy schemat aktywnego uczenia, który łączy reguły leksykalne, uczenie maszynowe i iteracyjne informacje zwrotne od ekspertów, aby osiągnąć kosztowo efektywną i wysoką dokładność adnotacji emocji. Oparty na psychologicznych teoriach emocji, w tym na teorii dyskretnych emocji i teorii poznawczej oceny, schemat wykorzystuje dwujęzyczne słowniki emocji (np. mapowanie słów gussa i rage na gniew), tokenizację podsłów dla terminów złożonych (np. podział figure-abstract-1 na figure-abstract-2) oraz aktywne uczenie w celu nadania priorytetu próbkom niejednoznacznym. Ewaluowany na zbiorze 19 0 tweetów w języku Hinglish dotyczących wojen i konfliktów, schemat osiągnął dokładność 81% (F-score: 0,76), redukując jednocześnie koszty operacyjne o 40% w porównaniu z adnotacją ręczną. Reguły leksykalne rozwiązały 89% niejednoznaczności wynikających z przełączania kodów, a iteracyjne ulepszenia pozwoliły na stopniowy wzrost dokładności z 72% do 81%. Efektywność systemu wynika z ograniczenia nakładu pracy ludzkiej do 73% zbioru danych, przy zautomatyzowanym przetwarzaniu wstępnym emoji, hashtagów i slangu. Badanie to opiera się na hipotezie, że integracja metod opartych na regułach leksykalnych z aktywnym uczeniem i uczeniem maszynowym może zwiększyć dokładność adnotacji emocji w tekstach w języku Hinglish, jednocześnie redukując ręczne etykietowanie i całkowny wysiłek związany z adnotacją.

Wprowadzenie

Gdy dwa lub więcej języków jest zmieszanych ze sobą w jednym wierszu lub mowie, nazywa się to językiem mieszanym z kodem. Jest to powszechne w swobodnych dialogach, takich jak Hinglish. Istnieje wiele sposobów, w jakie ludzkie emocje mogą być zrozumiane, a obliczeniowe modelowanie serii emocjonalnych stwierdzeń polega na dodawaniu do nich adnotacji przez osoby, które wypowiedziały te zdania. Można to rozumieć w kategoriach poziomu biologicznego, fizjologicznego, psychologicznego i tak dalej. Według naukowców, takich jak Roger Penrose, wiele zjawisk w naszym świecie nie jest obliczeniowych, a naukowcy tacy jak Wolfram uważają, że wszystko (każde zjawisko) można modelowaćobliczeniowo1. Penrose uważa, że świadomość obejmuje procesy (być może związane z mechaniką kwantową w mózgu), które wykraczają poza to, co może osiągnąć jakakolwiek procedura algorytmiczna krok po kroku. Często cytuje twierdzenia Gödla o niezupełności, aby poprzeć ideę, że na przykład ludzka wnikliwość matematyczna wykraczapoza systemy formalne. Jeśli świadomość nie jest obliczeniowa, to emocje, jako kluczowy aspekt świadomego doświadczenia, mogą również zawierać elementy nieobliczeniowe. Stephen Wolfram, znany z Mathematica i swojej pracy nad automatami komórkowymi, proponuje "Zasadę Równoważności Obliczeniowej". Sugeruje to, że nawet bardzo złożone systemy, w tym potencjalnie sam wszechświat i zjawiska w nim zachodzące (takie jak emocje), mogą być ostatecznie opisane i modelowane przez reguły obliczeniowe, nawet jeśli te reguły są bardzo proste, generując złożone zachowanie. Ale w praktyce nie jest to możliwe i potrzebujemy kogoś, kto jest określany jako ekspert lub po prostu anotator, który może przeprowadzić analizę emocji3.

W niniejszym badaniu propagujemy ideę budowania modeli obliczeniowych. Ale ten model będzie quasi-obliczeniowy. Nasze badania w tym kontekście mają na celu uzyskanie formy obliczeniowej, ale mogą nie uchwycić idealnie wszystkich aspektów, być może pozostawiając miejsce na zawiłości, które są trudne lub niemożliwe do pełnego obliczenia. Emocje są trudne do modelowania obliczeniowego, ponieważ zależą od subiektywnych doświadczeń, kontekstu kulturowego i zniuansowanych wyrażeń, których nie można w pełni uchwycić za pomocą ustalonych algorytmów.

Dlatego, aby modelować ludzkie emocje przy użyciu podejść obliczeniowych opartych na zmiennych, konieczne jest opisywanie ludzkich wypowiedzi emocjonalnych. Adnotacja ta powinna być wykonana przez eksperta lub anotatora wykwalifikowanego w analizie emocji¹. Zrozumienie złożoności ludzkich emocji nie jest łatwym zadaniem, zwłaszcza gdy mamy do czynienia z językami mieszanymi. Co więcej, problemy związane ze skalą oznaczają, że poleganie wyłącznie na ręcznych adnotacjach przez ludzi nie jest realną opcją. Ostatnie badania wskazują na konsekwentne zapotrzebowanie na podejście human-in-the-loop podczas tworzenia systemów do tak złożonych zadań. W związku z tym podejście półautomatyczne, które polega na automatyzacji prostszych części przy jednoczesnym zarezerwowaniu zadań wymagających ludzkich niuansów dla adnotatorów, wydaje się najbardziej odpowiednie do tworzenia systemów języka naturalnego w tej dziedzinie.

Ludzki adnotator będzie oczywiście wykonywał pracę ręcznie, a w dobie obliczeń nie jest to to, czego oczekuje się od współczesnych naukowców. Jeśli anotator (ręczny, półautomatyczny lub w pełni automatyczny) jest w stanie inteligentnie odgadnąć rodzaj emocji ucieleśnionej w wypowiedziach, wypowiedziach, które składają się z wielu rodzajów emocji wyrażonych w symbolach, z kolokwializmem lub mieszanym kodem i przy użyciu wielu modalności, to zadanie jest jednocześnie trudne i łatwe. Złożoność adnotacji emocji w wypowiedziach Hinglish zależy od charakteru wyrażenia. Gdy emocje są wyraźnie przekazywane za pomocą znanych słów lub emotikonów, adnotacje są stosunkowo proste. Zadanie staje się jednak trudne, gdy wypowiedzi obejmują wiele emocji, mieszanie kodów lub niejednoznaczne wyrażenia symboliczne. Dlatego adnotacja może być zarówno łatwa, jak i trudna, w zależności od tego, jak bezpośrednio wyrażona jest emocja.

Współczesne podejścia do identyfikacji emocji i sentymentów radzą sobie z tymi wyzwaniami, w tym z subiektywną naturą emocji, niejednoznacznością ludzkich wyrażeń, złożonością języków mieszanych z kodem, takich jak Hinglish, oraz czasochłonnym i niespójnym charakterem ręcznych adnotacji. związany z konstruowaniem modeli obliczeniowych i zarządzaniem żmudnymi zadaniami adnotacji. Ostatnie badania wskazują, że naukowcy stosują w tym celu różnorodne metody, w tym uczenie maszynowe, uczenie głębokie i różne podejścia hybrydowe. Ostatnie badania pokazują, że aby przezwyciężyć te problemy, naukowcy stosują różne techniki, takie jak uczenie maszynowe, głębokie uczenie i modele hybrydowe.

Ostatnie badania pokazują, że naukowcy stosują wszelkiego rodzaju podejścia, w tym uczenie maszynowe, głębokie uczenie3 i podejścia hybrydowe. Termin analiza sentymentu odnosi się do procedury stosowanej, gdy uważa się, że biegunowość emocji jest markerem do zrozumienia surowych emocji ludzi 3,4. Rozwój takiej technologii pomógł w rozpoznawaniu nastroju, nastrojów, mowy, emocji twarzy i sygnałów niewerbalnych, a także przyczynił się już do powstania aplikacji, które umożliwiają tłumaczenie w czasie rzeczywistym2. Podejście multimodalne może zostać wykorzystane do przetłumaczenia języka Hinglish na język angielski i może być pomocne w przyszłości w zwiększaniu dostępności kina indyjskiego dla odległych społeczeństw 5,6. Na przykład w Indiach angielski jest często drugim językiem. Badania w tym kontekście pokazują, że poprawiło to jakość nauczania języka angielskiego poprzez analizę mowy indyjskiej (język mix-code) pod kątem ekspresji, czyli stopnia uczuć i emocji każdego słowa.

W tym kontekście badawczym wykazano, że stosowanie języka mieszanego w połączeniu z tłumaczeniem poprawia jakość nauczania języka angielskiego. Osiąga się to poprzez analizę mowy indyjskiej (język mieszanego kodu) w celu określenia wyrazistości lub wartości emocjonalnej każdego słowa. Dzięki zastosowaniu głębokiego uczenia się do szkolenia komputerów w zakresie interpretacji mowy, badania te już poprawiły dokładność komputerowej analizy mowy i ułatwiły lepsze zrozumienie komunikacji 4,5. Zgodnie z wynikami spisu powszechnego z 2001 roku, język hinglish, który jest mieszanką hindi i angielskiego, jest obecnie używany przez około 120 milionów ludzi w Indiach6.

Ze współczesnego krajobrazu algorytmów uczenia się jasno wynika, że aktywne uczenie się stało się potężnym narzędziem do znacznego zmniejszenia ludzkiego wysiłku związanego z opisywaniem dużych zbiorów danych, szczególnie w dziedzinie identyfikacji i rozpoznawania emocji. To iteracyjne podejście, które selektywnie dodaje adnotacje o dużym znaczeniu (z odpowiednimi metrykami), nie tylko zwiększa dokładność adnotacji, ale także poprawia wydajność5. Wcześniejsze badania wykazały jego skuteczność w osiąganiu znacznego zmniejszenia obciążenia ręcznymi adnotacjami przy jednoczesnym utrzymaniu lub nawet poprawie wydajności przy mniejszych zestawach danych treningowych i zaproponowaniu opartej na analizie skupień metody informacyjnej selekcji instancji 7,8. W specyficznym kontekście rozpoznawania emocji Hinglish naukowcy wnieśli cenny wkład dzięki modelom głębokiego uczenia i zestawowi danychz wieloma adnotacjami 9,10,11. Poprzednie badania12,13 wprowadziły metody aktywnego uczenia się i częściowo nadzorowane, aby zminimalizować zależność od danych oznaczonych przez człowieka, co jeszcze bardziej zwiększyło wydajność i zmniejszyło koszty adnotacji. Co więcej, w wielu projektach wykazano, że aktywne uczenie się zwiększa wydajność klasyfikacji, szczególnie w przypadku klasyfikacji emocji opartej na wielu etykietach14.

Skuteczność aktywnego uczenia się w poprawie wydajności klasyfikatora została uznana w różnych aplikacjach uczenia maszynowego. Badania15,16 podkreśliły jego kluczową rolę w zwiększaniu wydajności poprzez skupienie się na zastosowaniach edukacyjnych. Podobnie, we wczesnym badaniu wprowadzono nowatorski algorytm aktywnego uczenia się z maszynami wektorów nośnych, znacznie zmniejszając zapotrzebowanie na oznaczone instancje17. W innej pracy zbadano również jego zastosowanie w zadaniach obejmujących ustrukturyzowane instancje, takie jak klasyfikacja tekstu18. Wpływ aktywnego uczenia się na zadania związane z rozpoznawaniem emocji wykracza poza wzrost wydajności, szczególnie w zakresie minimalizacji zależności od danych oznaczonych przez człowieka. W jednym z badań wprowadzono wielozadaniowe ramy klasyfikacji i regresji emocji, przewyższając wydajność metod jednozadaniowych10.

Co więcej, badacze19poczynili znaczące postępy w rozpoznawaniu emocji mowy i tekstu za pomocą aktywnego uczenia się, wykazującjednocześnie jego skuteczność w spersonalizowanej klasyfikacji emocji muzycznych. Jednak proces kategoryzowania i etykietowania emocji stanowi poważne wyzwanie, jak podkreślonow 21,22, szczególnie w kontekście analizy sentymentu. Zauważa, że użycie etykiety może znacząco wpłynąć na kategoryzację emocji, szczególnie w przypadku kategorii wyuczonychpóźniej 23. Aby sprostać tym wyzwaniom, opracowano różne algorytmy, w tym metody oparte na słowach kluczowych i uczeniu się, które osiągają znaczące wskaźniki dokładności24. Badania nad emocjami na podstawie pisemnych wypowiedzi i tekstów były badane w licznych modelach, a podejścia te wprowadziły model wymiarowy wykorzystujący normatywne bazy danych do skutecznego wykrywania emocji25. W innym badaniu26 model emocji poznawczych udoskonalił sekwencyjną metodę stosowaną do identyfikacji przyczyn emocji społecznych. Autor przedstawił komputerowo-lingwistyczną interpretację modelu emocji OCC, podczas gdy w podobnym badaniu27zaproponowano system wykorzystujący ontologie do reprezentowania relacji zależności słów i emocji. Autorzyjednego z badańomówili sygnały, które korelują z emocjonalnym przetwarzaniem tekstu, podkreślając adaptację mózgu do wyrażania emocji w języku pisanym. Adnotacja wielu tablic surowych emocji, w tym danych z wielu modeli, jest wyzwaniem. Niemniej jednak badanie emocji związanych z wojną i konfliktem dostarcza naukowego i systematycznego okna na ludzką psychikę w ekstremalnych okolicznościach, pozwalając nam lepiej zrozumieć, w jaki sposób jednostki i społeczności radzą sobie z traumą, stratą i niepewnością5. Inne badanie wykazało, że technika adnotacji skutecznie poprawiła klasyfikację gatunków, a cecha tytułu odegrała w tym procesie kluczową rolę29. W jednym z badań stworzono zestaw danych 44K vision-touch z ekspertem i GPT-4V w celu wytrenowania kodera dotykowego i modelu TVL do generowania tekstu30. W innym badaniu analizowano wyszukiwanie opinii i trendów na tweetach politycznych, koncentrując się na procesie aktywnego uczenia się w celu automatycznego dodawania adnotacji do francuskojęzycznych tweetów na temat polityków41. W innym badaniu przedstawiono CloudFlows, opartą na chmurze platformę naukowego przepływu pracy przeznaczoną do dynamicznej, adaptacyjnej analizy centralnej w strumieniach danych. Umożliwia aktywne uczenie się w celu poprawy klasyfikacji sentymentu, umożliwiając algorytmowi dostosowanie się do zmian danych w czasie rzeczywistym42.

Istnieje wyraźne napięcie między złożonością ludzkich emocji a pragnieniem zautomatyzowanej analizy emocji. Istnieje nieodłączne napięcie między złożonością ludzkich emocji a celem automatycznej analizy emocji. Większość współczesnych prac uznaje ograniczenia ręcznych adnotacji i podkreśla potrzebę wyrafinowanych metod obliczeniowych, aby sprostać wyzwaniom związanym ze zrozumieniem emocji w różnych formach komunikacji. Ten idealny scenariusz jest w dużej mierze niepraktyczny, tj. otrzymywanie adnotacji od osób, które napisały lub wypowiedziały zdania43. Idealny scenariusz uzyskiwania danych, w szczególności uzyskiwania adnotacji bezpośrednio od osób, które napisały lub wypowiedziały zdania, jest w dużej mierze niepraktyczny. Ta niepraktyczność wynika z braku możliwości gromadzenia i przetwarzania takich spersonalizowanych adnotacji na dużą skalę. Dlatego obecne wysiłki muszą opierać się na eksperckich adnotatorach lub zautomatyzowanych algorytmach wykrywania emocji w celu analizy i oznaczania emocji wyrażonych w tekście. W niniejszej pracy badawczej staraliśmy się przezwyciężyć niektóre aspekty tych wyzwań związanych z tą dziedziną. Najważniejsze uwagi w tym obszarze problemowym przedstawiono poniżej44.

Dlatego musimy polegać na ekspertach lub adnotatorach i algorytmach wykrywania emocji, aby analizować i oznaczać emocje wyrażone w tekście. Niemożliwe jest gromadzenie i przetwarzanie takich spersonalizowanych adnotacji na dużą skalę. Dlatego w niniejszej pracy badawczej staraliśmy się przezwyciężyć niektóre aspekty tej wiedzy dziedzinowej. Poniżej przedstawiono kluczowe wkłady w ten obszar problemowy.

Struktura współpracuje z metodami opartymi na regułach, takimi jak tagowanie emocji, wykrywanie mieszanego kodu i interpretacja emotikonów, z technikami uczenia maszynowego, takimi jak Random Forest i osadzanie słów, poprawiając dokładność adnotacji przy jednoczesnym zmniejszeniu wysiłku ręcznego. Iteracyjne uczenie się klasyfikatora wykorzystuje aktywne uczenie się, a także uczenie transferowe, aby nadać priorytet niejednoznacznym próbkom funkcji, zmniejszając potrzebę ciężkiej pracy. Takie podejście obniżyło koszty operacyjne o 40% w porównaniu z twardym etykietowaniem ręcznym.

Aby poradzić sobie z niuansami Hinglish na poziomie szczegółowym, opracowano niestandardową metodę tokenizacji kontekstowej. Takie podejście przetwarza tekst mieszany z kodem, uwzględniając przełączanie języków, interpunkcję, emotikony i segmentację podsłów, umożliwiając dokładniejsze adnotacje emocji w mieszanym tekście hindi-angielskim. Na poziomie szczegółowym opracowaliśmy niestandardową tokenizację kontekstową dla tekstu Hinglish. Struktura rozwiązuje problemy związane z tekstem mieszanym z kodem, uwzględniając dwujęzyczne słowniki emocji, tokenizację podsłów i niestandardową tokenizację kontekstową. Reguły leksykalne rozwiązały 89% niejasności związanych z przełączaniem kodu.

Nasza praca opiera się na uznanych psychologicznych teoriach emocji, takich jak teoria emocji dyskretnych i teoria oceny poznawczej. Badania pokazują skalowalność podejścia do reagowania kryzysowego i monitorowania mediów społecznościowych, dostarczając planu dla wielojęzycznych aplikacji NLP o niskich zasobach.

W tabeli 1 przedstawiono dostępne badania dotyczące tej samej dziedziny problemowej. Z przeglądu literatury i tabelarycznego podsumowania można wywnioskować, że większość badań nie może uniknąć wstępnej pracy nad adnotacjami przy użyciu metod ręcznych. Niewielu badaczy stosuje podejścia półautomatyczne41. Jednak prawdziwa różnica w wydajności wynika z zastosowania skutecznego modelu uczenia się, który może zautomatyzować proces adnotacji. Emocjonalna treść tweetów musi pasować do teorii, które wyjaśniają ścieżki ludzkich emocji i organizację uczuć. Następna sekcja definiuje problem w oparciu o ograniczenia istniejących podejść i wyniki empiryczne artykułów.

StudiowaćDatasetEmocjaMetodyDomenaProces etykietowaniaLukiPrzyszły zakres
[31]9 000 000 tweetównapięcie, depresja, złość, wigor, zmęczenie,Profil splątania stanów nastrojuAngielskiBrak etykietowaniaBadanie pomija subtelne różnice emocjonalne, takie jak zaskoczenie, radość lub strach, sugerując, że etykietowanie emocji może zwiększyć interpretowalność i szczegółowość trendów sentymentu, szczególnie w odniesieniu do wydarzeń społeczno-ekonomicznych.Mógłby on zbadać, w jaki sposób lepiej uchwycić i zbadać szereg ekspresji emocjonalnych w danych z mediów społecznościowych, wykorzystując zautomatyzowane metody kategoryzacji i dobrze ugruntowane taksonomie emocji.
[32]7000 tweetówzłość, wstręt, strach, radość, miłość, smutek,Maszyna wektorów nośnychAngielskiRęcznieMożliwość uogólnienia zbioru danych jest ograniczona ze względu na jego specyfikę tematyczną i brak reprezentatywności ogólnego korzystania z Twittera. Ze względu na subiektywną interpretację i minimalny kontekst, który jest pokazany w skromnej zgodzie między komentatorami, trudno jest opisać emocje w krótkich, swobodnych tweetach.Przyszłe prace będą koncentrować się na opracowaniu ulepszonych modeli wykrywania emocji poprzez uwzględnienie rozróżnienia między stylami językowymi specyficznymi dla tematu i emocji, co umożliwi dokładniejszą klasyfikację w różnych kontekstach tweetów.
[33]21 000 Tweetówzłość, wstręt, strach, radość, smutek, zaskoczenieMaszyna wektorów nośnych------Korzystanie z hashtaguIstniejące korpusy oznaczone emocjami są ograniczone pod względem rozmiaru i domeny, brakuje dużych, zróżnicowanych zbiorów danych dla mikroblogów. Tweety są krótkie, hałaśliwe i ograniczone kontekstowo, co utrudnia dokładne wykrywanie emocji i dodawanie adnotacji.W przyszłych badaniach może dojść do rozszerzenia leksykonu emocji o synonimy i dodatkowe hashtagi w celu poprawy zasięgu i dokładności wykrywania.
[34]16485 Tweetyzłość, wstręt, strach, radość, smutek, zaskoczenieRegresja wektora nośnegoChińskiRęcznieTradycyjne metody klasyfikacji emocji często pomijają podstawową przyczynę emocji, ograniczając jakość cech.
Dokładne wydobycie przyczyn emocji z krótkich, nieformalnych postów na mikroblogu wymaga solidnych systemów opartych na regułach i wiedzy domenowej.
 
Dalsza eksploracja analizy przyczyn emocji może udoskonalić modele wykrywania emocji i otworzyć nowe kierunki w rozumieniu emocji tekstowych.
[35]10 040 TweetStrach, nadzieja, radość, złość, zaskoczenie, smutek, wstrętLDA, porozumienie między oceniającymiHinglish powiedział:RęcznieBrakuje publicznie dostępnych, ustrukturyzowanych zbiorów danych dla Hinglish, zwłaszcza tych, które ujmują pragmatyczne i emocjonalne niuanse w treściach związanych z kryzysem. Hinglish jest niestandardowym, mieszanym z kodem językiem, a odmiany regionalne komplikują dokładną analizę tonacji i adnotacje.
 

Aby rozszerzyć multimodalne zestawy danych, zintegruj głęboką analizę pragmatyczną z modelami uczenia maszynowego i zajmij się skalowalnością w celu śledzenia emocji w czasie rzeczywistym w dyskursie konfliktowym.
[36]134 000 tweetówaktywny, nieaktywny szczęśliwy, nieszczęśliwyMaszyna wektorów nośnych i k-najbliżsi sąsiedziHinglish powiedział:Używanie hashtagówRęczne oznaczanie tweetów pod kątem emocji jest pracochłonne i niespójne, co ogranicza wysiłki związane z klasyfikacją emocji na dużą skalę
Adnotacje crowdsourcingowe są nierzetelne, zwłaszcza w identyfikowaniu poziomów pobudzenia emocji, podkreślając subiektywność w interpretacji emocji.
 
Skoncentruj się na udoskonaleniu etykietowania opartego na hashtagach i rozszerzeniu modeli wykrywania emocji, aby zwiększyć dokładność i możliwość uogólnienia w różnych kontekstach emocjonalnych.
[37]3 000 studentów, psychologów i nie-psychologów z 37 krajówradość, strach, złość, smutek, wstręt, wstyd i poczucie winy.-------RęcznieOgraniczone badanie wpływu czynników kulturowych na regulację i ekspresję określonych emocji w różnych społeczeństwach. Zrównoważenie dowodów na istnienie uniwersalnych wzorców emocjonalnych z kulturowo specyficznymi różnicami w wywoływaniu i interpretacji emocji pozostaje złożone.
 
Dalsze badania powinny dotyczyć interakcji między uniwersalnością biologiczną a kontekstem kulturowym w kształtowaniu doświadczeń emocjonalnych i komunikacji
[38]12000Szczęście, smutek i złośćPorozumienie między oceniającymihindi+angielskiRęcznieW obecnych badaniach brakuje kompleksowego, opatrzonego adnotacjami zestawu danych i ustandaryzowanych modeli wykrywania emocji Hinglish. Nieregularna gramatyka i mieszany z kodem charakter tekstów w mediach społecznościowych utrudniają dokładną klasyfikację emocji.
 

Przyszłe prace będą koncentrować się na rozszerzeniu kategorii emocji i opracowaniu większych, wielojęzycznych zestawów danych mieszanych z kodem.
[39]2866szczęście, smutek, złość, zaskoczenie i smutekMaszyna wektorów nośnychHinglish (hindi+angielski)RęcznieBrak zestawów danych mieszanych z adnotacjami w kodzie. Wyrażanie emocji w tekście mieszanym z kodem różni się w zależności od języka i skryptów, co sprawia, że adnotacje i klasyfikacja są złożone.
 

Przyszłe prace mogą poszerzyć korpus o większą różnorodność emocjonalną, zintegrować tagowanie części mowy i zbadać wielojęzyczne treści mieszane z kodem.
[40]13738---Tłumaczenie maszynowe Google TranslatorHinglish powiedział:RęcznieIstniejące systemy tłumaczenia maszynowego nie są dokładne w przypadku mieszanych z kodem danych z mediów społecznościowych ze względu na brak dużych, specyficznych dla danej dziedziny równoległych korpusów. Duże różnice w pisowni, nieformalna struktura i niejednoznaczność w identyfikacji języka komplikują tłumaczenie zromanizowanego tekstu hindi-angielskiego.
 
Korpus może wspierać rozwój systemów tłumaczenia mieszanego z kodem i być rozszerzony na inne języki o niskich zasobach i zadania NLP, takie jak rozpoznawanie jednostek nazwanych
[41]11527pozytywne, bardzo pozytywne i negatywne, bardzo negatywneKlasyfikacja oparta na kNN, reprezentacja BOWFrancuscy politycyRęcznieOgraniczona dostępność wysokiej jakości zestawów danych z adnotacjami do wyszukiwania opinii politycznych w językach innych niż angielski. Zrównoważenie redukcji szumów adnotacji z przechowywaniem informacji i radzenie sobie z nierównomiernym rozkładem etykiet w dużych zestawach danych tweetów to kluczowe trudności.
 

Przyszłe prace mogą udoskonalić metody aktywnego uczenia się, aby lepiej zachować krytyczne treści przy jednoczesnym zminimalizowaniu szumu związanego z adnotacjami w wielojęzycznym dyskursie politycznym.
[42]764,416---Klastrowanie Kmeans, SVMAngielskiCzęściowo nadzorowanyEtykietowanie w czasie rzeczywistym i aktualizowanie modelu w analizie tonacji jest ograniczone przez zmienność strumienia danych, koszt etykietowania i skalowalność systemu.Przyszłe prace będą badać wieloklasową klasyfikację tonacji, integrować dodatkowe strategie etykietowania i rozszerzać kontrolę nad początkowym generowaniem modelu

Tabela 1: Dostępne badania wraz z odpowiednimi metodami znakowania. Tabela zawiera pełny przegląd porównawczy istniejących badań, odnosząc się do adnotacji emocjonalnych i ustanawiając krajobraz metodologiczny oraz konceptualizując wkład niniejszej pracy w istniejącą literaturę.

Opis problemu
Najczęściej badane emocje w adnotacjach są pod silnym wpływem podstawowych modeli psychologicznych, takich jak Ekmana i Plutchika, koncentrujących się przede wszystkim na podstawowych kategoriach, takich jak gniew, strach, szczęście, smutek, zaskoczeniei tak dalej. Stąd w niniejszej pracy badawczej zamierzamy pracować nad dobrze ugruntowanymi konotacjami emocji. Wyzwanie polega na opracowaniu dynamicznej struktury obliczeniowej F, zdolnej do dokładnego opisywania instancji tekstu Hinglish (ti ) z korpusu T skoncentrowanego na wojnach i konfliktach za pomocą etykiet emocji (ei) z predefiniowanego zestawu E = {e1, e2, ..., e8}. Ramy te muszą syntetyzować zasady z konstrukcjonistycznej teorii emocji, teorii zdarzeń afektywnych (AET), teorii emocji dyskretnych i teorii oceny poznawczej, aby modelować wieloaspektowy krajobraz emocjonalny dyskursu związanego z konfliktem. Każda instancja tekstu ti w T jest złożona językowo, łącząc hindi (w alfabecie łacińskim), angielski, emotikony i symbole, co wymaga wielowarstwowego podejścia do uchwycenia zniuansowanych wyrażeń emocjonalnych.

Model obliczeniowy emocji związanych z wojną (jako studium przypadku) może obejmować podejście wieloaspektowe, począwszy od reguł leksykalnych, które odnoszą się do niuansów opartych na Hinglish. Tokenizacja, oznaczona jako T, obejmuje pisma łacińskie (hindi pisane alfabetem łacińskim), wraz z emotikonami i interpunkcją, stanowiące podstawę przetwarzania języka. Słowniki emocji, reprezentowane jako D, mapują słowa w różnych językach na określone emocje, takie jak gniew, radość i inne, w których każde emotion_i ma words_j w language_k. Dekompozycja podsłów, S, rozbija terminy złożone na ich podsłowa składowe, umożliwiając głębsze zrozumienie złożonych wyrażeń. Następnie techniki uczenia maszynowego, M, wykorzystują osadzanie E, takie jak Word2Vec/fastText, do przekształcania tokenów w reprezentacje wektorowe, vector_v, ułatwiając analizę numeryczną. Klasyfikatory zespołowe, C, takie jak Random Forest, przewidują następnie etykiety emocji, emotion_label_p, na podstawie tych zestawów wektorów. Aby iteracyjnie ulepszać model uczenia się adnotacji, stosuje się mechanizm aktywnego uczenia się, AL. Informacja zwrotna od ekspertów, F, udoskonala niejednoznaczne przypadki, ambiguous_sample_q, przypisując refined_label_r, wprowadzając kluczowe poprawki. Priorytetyzacja próbek, P, koncentruje się na próbkach o niskim poziomie ufności, low_confidence_sample_s, przypisując je annotation_priority_t, optymalizując w ten sposób proces adnotacji.

Integrując te komponenty i teorie, ramy te mają na celu dynamiczne przetwarzanie tekstu Hinglish, łączenie niuansów językowych i kulturowych oraz adaptacyjne udoskonalanie adnotacji emocjonalnych, oferując skalowalne rozwiązanie do analizy wymiarów afektywnych w dyskursie konfliktowym.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

W tej sekcji wyjaśniono również, w jaki sposób skonstruowano multimodalny model dla adnotacji 8 emocji. Sekcja rozpoczyna się od omówienia właściwości zbioru danych, po których następują kolejne procedury. W celu lepszego zrozumienia procedury badawczej należy zapoznać się z Rysunkiem 1.

figure-protocol-1
Rysunek 1: Systematyczne ramy adnotacji emocji. Rysunek przedstawia efektywny proces adnotacji emocji w tekście w języku hinglish, który łączy uczenie maszynowe, aktywne uczenie oraz dynamiczne reguły leksykonu poprzez wkład ekspertów; błędnie sklasyfikowane przykłady są sukcesywnie poprawiane w celu zwiększenia dokładności i obniżenia kosztów adnotacji. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

Przygotowanie zbioru danych
Gromadzenie danych rozpoczyna się od zidentyfikowania kompleksowej listy słów kluczowych i hashtagów związanych z konfliktami wojennymi oraz towarzyszącymi im emocjami. W celu opracowania odpowiednich i istniejących list wykorzystano takie źródła, jak literatura akademicka, artykuły prasowe oraz trendy w mediach społecznościowych.

Zgodnie z Rysunkiem 1, po zebraniu tweetów i wstępnym przetworzeniu danych, eksperci uczestniczą w ręcznym etykietowaniu oraz tworzeniu reguł leksykalnych, które muszą zostać uwzględnione w celu usprawnienia procesu adnotacji. Wykorzystując te słowa kluczowe (conflict, war, crisis, gussa itp.), zebrano wstępny zestaw 10 040 tweetów, który posłużył jako podstawa do ręcznego etykietowania, gdzie każdy tweet został opatrzony adnotacją jednej z ośmiu predefiniowanych emocji (gniew, strach, szczęście, smutek, frustracja, współczucie, mieszane oraz inne istotne dla domeny wojny i konfliktów). Proces ręcznego etykietowania został przeprowadzony przez zespół ekspertów biegłych w języku hindi i angielskim, co zapewniło dokładne uchwycenie niuansów języka angielskiego.

Poniżej opisano przykładowy przebieg przetwarzania.

Tokenizacja i przetwarzanie wstępne:
Tweet wejściowy: "Mujhe Bhayanak lag raha hai figure-protocol-2"
Wynik tokenizacji: ["Mujhe", "Bhayanak", "lag", "raha", "hai", "figure-protocol-3"]
Obsługa pisma łacińskiego: Słowa w języku hindi ("Mujhe", "Bhayanak") zostają zachowane w zapisie łacińskim.
Wykrywanie emoji/symboli: "" zostaje wyizolowany jako token symboliczny.

Mapowanie słownika emocji (D):
Mapowanie tokenów na emocje w E przy użyciu dwujęzycznych (hindi/angielskich) leksykonów emocji: „Bhayanak” (hindi dla „horrible”) → Strach; „lag raha hai” (fraza kontekstowa sugerująca trwającą emocję) → Strach; „figure-protocol-4” → Gniew

Dekompozycja podsłów (S):
Rozkład złożonych terminów w celu przeprowadzenia głębszej analizy: "Bhayanak" → ["Bhay" (strach), "anak" (przyrostek)], aby wyjaśnić jego semantyczny rdzeń związany ze strachem.

Generowanie osadzeń (E):
Generowanie osadzeń tokenów przy użyciu Word2Vec/fastText: Osadzenia dla ["Mujhe", "Bhayanak", "lag", "raha", "hai", "figure-protocol-5"] → wektory v1, v2, v3, v4, v5, v6.
Reguła agregacji: Obliczanie średniej z osadzeń tokenów w celu stworzenia globalnego wektora semantycznego:
V_avg = (v1 + v2 + v3 + v4 + v5 + v6) / 6

Ekstrakcja cech oparta na regułach:
Ekstrahowanie cech pomocniczych do konkatenacji. Liczba znaczników emocji: Strach: 2 wystąpienia ("Bhayanak", "lag raha hai"); Gniew: 1 wystąpienie ("figure-protocol-6").
Flaga przełączania kodu (Code-Switch): Flaga binarna = 1 (mieszane tokeny w języku hindi i angielskim: "Mujhe" [hindi], "lag", "raha", "hai" [pochodne z hindi]).

Fuzja cech:
Połącz zagregowane zanurzenia (embeddings) oraz cechy oparte na regułach w jeden zunifikowany wektor wejściowy: Globalny Wektor Semantyczny=V_avg (uśrednione zanurzenia), Liczba Emocji=[Fear: 2, Anger: 1, Others: 0], Flaga Przełączania Kodów=1
Reguła konkatenacji Końcowy Wektor Wejściowy = V_avg figure-protocol-7 [Fear: 2, Anger: 1, Others: 0] figure-protocol-8 [1]
Algorytm uczenia maszynowego przetwarza ten końcowy wektor, po czym rozpoczyna się iteracyjny proces ulepszania adnotacji. W następnej sekcji omówimy skuteczność metody uczenia aktywnego (Active learning) przyjętej w tym celu.

Następnie zbiór danych rozszerzono do 19 00 tweetów. Zbiór ten został opracowany przy użyciu kombinacji technik automatycznych i półautomatycznych, wykorzystując wnioski wyciągnięte z początkowej ręcznej adnotacji. Rozszerzony zbiór danych został dodatkowo dopracowany w ramach iteracyjnego procesu uczenia; obejmował on selektywną identyfikację i priorytetyzację niejednoznacznych danych/tweetów w celu przeprowadzenia adnotacji eksperckiej oraz uzyskania opinii od ekspertów z danej dziedziny, aby poprawić dokładność, spójność i efektywność adnotacji. W trakcie procesu gromadzenia danych szczególną uwagę zwrócono na zachowanie równowagi między różnymi emocjami, zapewniając, że zbiór danych był reprezentatywny dla różnorodnych sentymentów wyrażanych w odniesieniu do wojny i konfliktów. Powstały zbiór danych stanowi wartościowy zasób do analizy tekstów w języku Hinglish. W celu lepszego zrozumienia można odwołać się do Rysunku 2.

figure-protocol-9
Rycina 2: Procedura gromadzenia zbioru danych. Rycina przedstawia proces tworzenia zbioru danych, od identyfikacji słów kluczowych (seed words), poprzez etykietowanie ręczne i uczenie aktywne, aż do końcowego adnotowanego zbioru danych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Końcowe przygotowanie zbioru danych przeprowadzono po zakończeniu procesu iteracyjnego ulepszania z wykorzystaniem aktywnego uczenia. Aktywne uczenie zostało zastosowane w ramach hybrydowego modelu obejmującego reguły leksykalne, uczenie maszynowe oraz iteracyjne dane od ekspertów w celu adnotacji emocji w wypowiedziach w języku Hinglish. Kroki przebiegały następująco:

Proces rozpoczyna się od zbioru danych etykietowanego ręcznie. Wykorzystano klasyfikator Random Forest do identyfikacji niejednoznacznych tweetów, co do których model uczenia maszynowego nie miał pewności. Próbki te przekazano ekspertom do kategoryzacji. Model był wielokrotnie aktualizowany przy użyciu niedawno adnotowanych danych, co stopniowo zwiększało dokładność i redukowało liczbę błędnych klasyfikacji. Następnie sfinalizowano zbiór danych i zweryfikowano adnotacje w celu zapewnienia poprawności. Przygotowano zbiór danych do analizy, dbając o jego odpowiednią dokumentację i formatowanie, aby umożliwić jego wykorzystanie w dalszych etapach procesu. Istotne jest jednak zbadanie wzorców emocji zawartych w wypowiedziach, aby przyszłe kroki wdrożeniowe stały się bardziej przejrzyste. W związku z tym w kolejnym kroku przeprowadzona zostanie analiza skupień, aby zidentyfikować dominujące emocje w zbiorze danych. Pozwoli to również na określenie emocji będących przedmiotem badania. 

Wybór klastrów emocji
Tabela 2 przedstawia grupy emocji i ich odpowiedniki w języku Hinglish, wraz z uzasadnieniem wyboru poszczególnych emocji. Z każdej grupy emocji wybrano emocję dominującą do dalszej analizy. Emocje dominujące zostały wybrane na podstawie analizy skupień.

Grupa emocjiOdpowiednik w języku hinglishUzasadnienie wyboru
Strach (obejmuje lęk i panikę)Lęk, strach, niepokój, obawa, napięcie, zmartwienie, stres, troska, wątpliwość, smutek, niecierpliwość, zdenerwowanieStrach jest powszechną emocją w czasie wojny i konfliktów, gdy jednostki stają w obliczu zagrożeń dla swojego bezpieczeństwa i dobrostanu. Strach ten może manifestować się na różne sposoby, takie jak lęk, napady paniki i nadmierna czujność.
Gniew (obejmuje irytację, wrogość, frustrację i poczucie zranienia)Gussa, raag, Prakop, Raudra, Chidhaan, Shatruta, Krodh, Gussa dilana, apata, Atyachar, Khushfehmi, hairani, Bhayanak, Chakker KathinaaiGniew jest kolejną powszechną emocją w czasie wojny i konfliktów, często wynikającą z poczucia niesprawiedliwości, zdrady lub straty. Gniew ten może napędzać agresję i przemoc, przyczyniając się do destrukcyjnego charakteru tych konfliktów.
Smutek (obejmuje żałobę, rozpacz i beznadziejność)Smutek, żal, żałoba, wzruszenie, cierpienie, przygnębienie, zdumienie, rozczarowanie, żałoba, cierpienie, wyrzeczenie, obawa, melancholia, wzruszenie, cierpienie, przygnębienie, pokora, wzruszenie, złamane serce, choroba, rozczarowanie, zagłada, nienawiść, rozczarowanie, niemożliwość, porażkaSmutek jest naturalną reakcją na stratę i żałobę, które niestety są częstymi doświadczeniami w czasie wojen i konfliktów. Żołnierze mogą odczuwać smutek z powodu straty towarzyszy broni, cywile mogą opłakiwać zabitych lub przesiedlonych bliskich, a całe społeczności mogą żałować po utracie domów i dotychczasowego stylu życia. Uczucie rozpaczy i beznadziei może również wynikać z przedłużającego się charakteru konfliktu oraz z pozoru nieskończonego cyklu przemocy.
Wstyd i poczucie winyWstyd, zażenowanie, wstyd, skromność, poniżenie, żal, grzech, żal, skrucha, skromność, niepokój, oddanie się, poczucie wstydu, łzy, skrucha, sumienie, wina, grzech, uznanie się za winnego, potępienie, wadaWstyd i poczucie winy to złożone emocje, które mogą wynikać z poczucia osobistego lub zbiorowego wyrządzenia krzywdy, nieadekwatności lub upokorzenia. W sytuacjach wojny i konfliktów jednostki mogą odczuwać wstyd lub poczucie winy z powodu własnych działań, niezdolności do zapobieżenia wyrządzeniu krzywdy innym lub z faktu przeżycia, podczas gdy inni zginęli.
WstrętGhin, nafrat, Asahayak, Pratikool, Ghrina, Vairagya, Dvesha, Nakaratmak, Vibhavsu, Vairagya, Vairagya, NirashaWstręt jest uczuciem odrazy lub niechęci wobec czegoś, co jest postrzegane jako niesmaczne lub obraźliwe. W czasie wojny i konfliktów osoby mogą odczuwać wstręt w reakcji na akty okrucieństwa, przemocy i barbarzyństwa.
Empatia i współczucieEmpatia, współczucie, wyrozumiałość, filantropia, wrażliwość, wsparcie, uważność, życzliwość, troska, ciepło, czułość, litość, miłosierdzie, empatia, współpraca, dobroć, zrozumienie, miłość, litość, łagodność, altruizmEmpatia i współczucie są kluczowe dla rozumienia i współodczuwania emocji innych osób. W warunkach wojny i konfliktów empatia może być potężnym narzędziem budowania więzi z osobami, które przeszły podobne doświadczenia, sprzyjając współczuciu i promując pojednanie. Współczucie może motywować jednostki do pomagania potrzebującym oraz przyczyniać się do działań na rzecz leczenia i odbudowy.
Nadzieja i wdzięcznośćUmeed, aasha, Chah, Ichha, Sapna, Unnati, Ashvasan, Khushi, Utsaah, Ashirwad, Samvedansheelata, Vishwas, Bharosa, Shukraguzaar, eshaananand, Shukrana, Aabhaar, Namrata, Samaanya, Naman, Aasherewad, Badhai, Dhanyavaad, Abhivadn, Manobhav, BhaktiNadzieja to uczucie optymizmu i oczekiwanie, że wydarzy się coś dobrego pomimo napotkanych wyzwań i trudności. Wdzięczność to uczucie podziękowania i uznania dla dobrych rzeczy w życiu człowieka. W czasie wojny i konfliktów nadzieja może być źródłem siły i motywacji, umożliwiając jednostkom wytrwałość i dążenie do lepszej przyszłości. Wdzięczność może pomóc ludziom skupić się na pozytywnych aspektach ich życia, wspierać odporność psychiczną oraz pielęgnować poczucie spokoju w obliczu chaosu.
Odporność psychicznaJheelaanek, himmat, Sahasi, Sahas, Dhairya, Majbooti, Samvedansheel, Samarthya, Majbuti, LachariOdporność psychiczna to zdolność do adaptacji i radzenia sobie w trudnych lub wymagających sytuacjach. W warunkach wojny i konfliktów odporność psychiczna jest niezbędna, aby jednostki i społeczności mogły przetrwać i wytrwać w obliczu przeciwności.

Tabela 2: Uzasadnienie wyboru emocji. Tabela przyporządkowuje grupy emocji do ich odpowiedników w języku hinglish i wyjaśnia ich znaczenie w kontekście wojny i konfliktów.

Należy jednak zauważyć, że wybór tych emocji nie opiera się wyłącznie na analizie skupień, lecz jest również ugruntowany w teoriach emocji, w tym w teorii poznawczej oceny (CAT), teorii dyskretnych emocji (DET) oraz teorii procesowej (POT) emocji43.

Szczegóły korpusu
Zestaw danych składa się z tweetów specyficznych dla danej domeny (wojny, konflikty i kryzysy) oraz dodatkowych zestawów tweetów zawierających mieszankę wpisów w języku hindi i angielskim. Rycina 3 przedstawia zrzut ekranu publicznie dostępnych zestawów tweetów przetwarzanych na potrzeby niniejszej pracy badawczej. Główny zestaw danych jest publicznie dostępny pod adresem https://data.mendeley.com/datasets/y63frd6pmf/7.

figure-protocol-10
Rycina 3: Szczegóły korpusu. Tutaj wyjaśniono dostępność zbioru danych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Adnotacja etykiet emocji
Wstępny korpus 10 040 tweetów w języku hinglish dotyczących wojny i konfliktów został ręcznie adnotowany ośmioma etykietami emocji przez ekspertów bilingwalnych. Aby rozwiązać problem złożoności lingwistycznej tekstu mieszanego (code-mixed), opracowano ramowy system oparty na regułach leksykalnych, składający się z kilku komponentów. System ten obejmuje słowniki specyficzne dla emocji, które przypisują terminy w języku hindi i angielskim do konkretnych emocji, na przykład fear_words = {Fear, Dread, Bhayanak, figure-protocol-11, Terror, figure-protocol-12} oraz anger_words = {gussa, rage, figure-protocol-13, irritation, figure-protocol-14}. Reguły ekwiwalencji międzyjęzykowej łączyły poszczególne terminy (np. jeśli (Ae == Ah): anger = gussa | figure-protocol-15). Wykorzystano reguły leksykalne, takie jak słowniki emocji, tokenizacja dla języków mieszanych oraz dekompozycja podwyrazowa. W celu adnotacji emocji reguły te służą do wstępnego przetwarzania tekstu i ekstrakcji cech, które następnie są łączone z embeddingami uczenia maszynowego45.

Do tokenizacji, W ramach struktury zastosowano niestandardowe reguły przełączania języków, interpunkcji, emoji oraz tokenizacji podsłów. Tekst w języku hindi (pismo dewanagari) był tokenizowany na poziomie znaków, natomiast w przypadku języka angielskiego (pismo łacińskie) wykorzystano znaki odstępu. Przykład: Czuję frustrację. → [Mujhe, frustration, hai]. Znaki specjalne, takie jak hashtagi (#) i wzmianki (@), zostały wyizolowane jako poszczególne tokeny (np. #ZbrodnieWojenne → [#, WarCrimes]), podczas gdy znaki interpunkcyjne, takie jak przecinki (,) i wykrzykniki (!), zostały rozdzielone na oddzielne tokeny (np., figure-protocol-16 → figure-protocol-17, !]).

Emoji traktowano również jako odrębne tokeny i przyporządkowano je do emocji (np. figure-protocol-18 → gniew, figure-protocol-19→ smutek). Tokenizacja podsłów została wykonana w piśmie Dewanagari, w którym wyrazy złożone zostały podzielone przy użyciu wzorców wyrażeń regularnych dla reguł Sandhi (np. figure-protocol-20] [królestwo + świat]) oraz przedrostki/przyrostki pism rzymskich zostały poddane segmentacji (np. nieprawdopodobne → [un, believable]). W celu rozszerzenia specyficznego dla danej dziedziny, tokeny zastąpiono etykietami emocji, jeśli dopasowano je w słownikach. Na przykład: Bhayanak → strach, Dahad" → strach, gussa → gniew. Tweet Czuję przerażenie. → Tokeny [Mujhe, fear, lag, raha, hai].

Po wektoryzacji przetworzone tokeny (słowa, podsłowa, emoji) zostały przekształcone w 30-wymiarowe osadzenia (embeddings) przy użyciu Word2Vec/fastText. Reprezentacje numeryczne w wektorach kolumnowych tokenów tworzą macierz wektorów odpowiadających poszczególnym tokenom. Każdy wiersz odpowiada wektorowi osadzenia przypisanemu do tokenu w tekście, reprezentując jego kolejność. Kolumny w wierszu oznaczają wymiary w przestrzeni osadzeń. Wektory zawierają liczby rzeczywiste obliczone za pomocą Word2Vec i FastText. Tokeny z wektorami zerowymi, przedstawione przez wiersze z samymi zerami, mogą oznaczać spacje lub znaki specjalne pozbawione istotnych informacji w tej reprezentacji. Celem osadzeń jest uchwycenie kontekstowych relacji między słowami w celu poprawy adnotacji. Wektory niezerowe wskazują na znaczące reprezentacje słów lub symboli. Wartości w tych wektorach kodują różne cechy semantyczne i syntaktyczne. Wektory zerowe zazwyczaj reprezentują dopełnienia (padding), spacje lub nierozpoznane tokeny. Zmienność wartości odzwierciedla bogactwo cech przechwyconych przez model osadzeń. Różne wymiary wektora reprezentują odmienne aspekty znaczenia, kontekstu i użycia słowa. Rysunek 4 pokazuje sposób reprezentacji wektorów, a z Rysunku 5 można wywnioskować skutki zastosowania procesu wektoryzacji.

figure-protocol-21
Rysunek 4: Niestandardowa tokenizacja. Rysunek przedstawia sposób reprezentacji wektorów w przestrzeni osadzeń oraz ilustruje proces konwersji każdego tokena na format liczbowy Aby wyświetlić powiększoną wersję tego rysunku, kliknij tutaj.

figure-protocol-22
Rysunek 5: Proces wektoryzacji tokenów i jego znaczenie. Rysunek przedstawia znaczenie tych procesów i komponentów oraz podkreśla, w jaki sposób osadzenia (embeddings) przechwytują semantykę emocji w celu dokładnej klasyfikacji emocjonalnej. Aby wyświetlić powiększoną wersję tego rysunku, kliknij tutaj.

Zgodnie z przebiegiem badań, proces rozpoczyna się od analizy tekstu wejściowego, rozszerzania tokenów przy użyciu słowników opartych na regułach, a następnie podziału tych tokenów na podsłowa. Podejście to umożliwia zrozumienie zawartości emocjonalnej oraz kontekstu kulturowego tekstu; poniżej przedstawiono pseudologikę przeprowadzonych badań.

Inicjuj słowniki emocji (np. fear_words = {"Fear", "Dread", "Bhayanak", ...}): Ustaw Ae = Ah
SubwordRules(token, script): Jeśli Devanagari → podziel za pomocą regex (związki/Sandhi), Jeśli Roman → podziel prefiksy/sufiksy za pomocą regex, Zwróć podsłowa
DomainSpecificExpansion(token): Jeśli token znajduje się w słownikach emocjonalnych/lingwistycznych → zwróć emocję
W przeciwnym razie → zwróć token
ProcessTweet(text): Zdefiniuj regex dla pisma Devanagari, rzymskiego i pozostałych; Wyekstrahuj tokeny za pomocą regex; Zastosuj DomainSpecificExpansion i SubwordRules do tokenów; Zwróć przetworzone podsłowa
Wektoryzuj tokeny do numerycznych osadzeń (embeddings)
Zastosuj uczenie aktywne (Active Learning) z informacją zwrotną od człowieka

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Wyniki niniejszego badania sugerują, że zintegrowanie reguł leksykalnych z uczeniem maszynowym oraz technikami uczenia aktywnego stanowi skuteczny sposób zwiększenia efektywności i dokładności adnotacji emocji w tekstach w języku hinglish o mieszanym kodzie. Dzięki iteracyjnemu udoskonalaniu i sugestiom ekspertów, zaproponowana struktura pozwoliła na znaczne zmniejszenie nakładów pracy ręcznej, przy jednoczesnym zachowaniu wysokiej wydajności w macierzach ewaluacyjnych. Wyniki wskazują na...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Zbiór danych do niniejszego badania został opracowany przy użyciu kombinacji ręcznej adnotacji i aktywnego uczenia (active learning). Początkowo 10 040 tweetów w języku Hinglish dotyczących wojny i konfliktów zostało ręcznie oznakowano ośmioma zdefiniowanymi emocjami. Następnie zbiór danych rozszerzono do 19 00 tweetów, stosując podejście półautomatyczne. Aktywne uczenie umożliwiło selektywną interwencję ekspercką, co zredukowało nakład pracy ręcznej o 40% przy zachowaniu wysokiej dokładności adnotacji na poziomie 81% z ...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy deklarują brak konfliktu interesów.

Podziękowania

Badania te nie otrzymały żadnego zewnętrznego finansowania.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
fastText (szybki tekstSztuczna inteligencja FacebookaN/AReprezentacja i klasyfikacja słów
Współpraca z GoogleWyszukiwarka GoogleN/AOparte na chmurze środowisko Jupyter Notebook
Procesor graficzny/TPU Google ColabWyszukiwarka GoogleN/AAkceleracja sprzętowa oparta na chmurze
Intel Core i5/i7 lub AMD Ryzen 5/7Intel / AMDN/AProcesor do wykonywania lokalnego (jeśli jest wymagany)
biblioteka matplotlibOprogramowanie typu open source (oprogramowanie typu open source)N/ABiblioteka wizualizacji danych
NLTK (Biblioteka NLTK)Oprogramowanie typu open source (oprogramowanie typu open source)N/AZestaw narzędzi języka naturalnego do przetwarzania tekstu
NumPyOprogramowanie typu open source (oprogramowanie typu open source)N/ABiblioteka obliczeń numerycznych
NVIDIA GTX 1650 lub lepsza (opcjonalnie)Technologia NVIDIAN/AProcesor graficzny do zadań głębokiego uczenia
PandyOprogramowanie typu open source (oprogramowanie typu open source)N/ABiblioteka manipulacji danymi
Język Python Fundacja oprogramowania PythonN/AJęzyk programowania dla ML i NLP
Pochodnia PyTorchMeta Sztuczna inteligencjaN/AStruktura głębokiego uczenia
Pamięć RAM (minimum 8 GB, zalecane 16 GB)RozmaityN/AWymagania dotyczące pamięci dla zadań uczenia maszynowego
Scikit-naucz sięOprogramowanie typu open source (oprogramowanie typu open source)N/ABiblioteka uczenia maszynowego
Urodzony na morzuOprogramowanie typu open source (oprogramowanie typu open source)N/AWizualizacja danych statystycznych
SpaCySztuczna inteligencja eksplozjiN/ABiblioteka NLP o sile przemysłowej
Pamięć SSD (minimum 256 GB, zalecane 512 GB)RozmaityN/AMagazyn do przetwarzania zestawu danych
Technologia TensorFlowWyszukiwarka GoogleN/AStruktura głębokiego uczenia

Bibliografia

  1. Herce, R. Non-locality of the phenomenon of consciousness according to Roger Penrose. Dialogo. 3 (2), 127-134 (2016).
  2. Wolfram, S. The future of computation. Math J. 10 (2), 329-362 (2006).
  3. Kusal, S., et al. A systematic review of applications of natural language processing and future challenges with special emphasis in text-based emotion detection. Artif Intell Rev. 56 (12), 15129-15215 (2023).
  4. Recent advancements and challenges in multimodal sentiment analysis: a survey. Dong, Z. X., Liu, H. 2023 Int Conf Machine Learning Cybernetics (ICMLC), , IEEE. 464-469 (2023).
  5. Gandhi, A., et al. Multimodal sentiment analysis: a systematic review of history, datasets, multimodal fusion methods, applications, challenges and future directions. Inf Fusion. 91, 424-444 (2023).
  6. Chand, V. The rise and rise of Hinglish in India. Conversation. , https://theconversation.com/the-rise-and-rise-of-hinglish-in-india-53476 (2016).
  7. Hernández-de-Menéndez, M., et al. Active learning in engineering education: a review of fundamentals, best practices and experiences. Int J Interact Des Manuf. 13, 909-922 (2019).
  8. Liu, X., et al. Developing multi-labelled corpus of Twitter short texts: a semi-automatic method. Systems. 11 (8), 390(2023).
  9. Alahmary, R., Al-Dossari, H. A semiautomatic annotation approach for sentiment analysis. J Inf Sci. 49 (2), 398-410 (2023).
  10. Garg, N., Sharma, K. Annotated corpus creation for sentiment analysis in code-mixed Hindi-English (Hinglish) social network data. Indian J Sci Technol. 13 (40), 4216-4224 (2020).
  11. Jamatia, A., et al. Deep learning based sentiment analysis in a code-mixed English-Hindi and English-Bengali social media corpus. Int J Artif Intell Tools. 29 (5), 2050014(2020).
  12. Nainabasti, B. Role of students' participation on learning physics in active learning classes. ProQuest ETD Collection for FIU. , AAI10743750(2016).
  13. Goudjil, M., et al. A novel active learning method using SVM for text classification. Int J Autom Comput. 15, 290-298 (2018).
  14. Huang, S. J., Jin, R., Zhou, Z. H. Active learning by querying informative and representative examples. Adv Neural Inf Process Syst. 23, 1-9 (2010).
  15. Zhang, Z., Strubell, E., Hovy, E. A survey of active learning for natural language processing. arXiv. , (2022).
  16. Baghel, R. A survey on code-mixed sentiment analysis based on Hinglish dataset. Int Conf Comput Commun Cyber-Secur. 664, (2022).
  17. Tong, S., Koller, D. Support vector machine active learning with applications to text classification. J Mach Learn Res. 2 (Nov), 45-66 (2001).
  18. Subramanian, M., et al. A survey on hate speech detection and sentiment analysis using machine learning and deep learning models. Alex Eng J. 80, 110-121 (2023).
  19. Liu, Z., et al. An emotion-based personalized music recommendation framework for emotion improvement. Inf Process Manag. 60 (3), 103256(2023).
  20. Ren, F., Liu, Z., Kang, X. An efficient framework for constructing speech emotion corpus based on integrated active learning strategies. IEEE Trans Affect Comput. 13 (4), 1929-1940 (2022).
  21. Azzi, S. A., Zribi, C. B. O. Comparing deep learning models for multi-label classification of Arabic abusive texts in social media. Proc Int Conf Software Tech, , 374-381 (2022).
  22. Min, X. Y., et al. Multi-label active learning through serial-parallel neural networks. Knowl Based Syst. 251, 109226(2022).
  23. Gosselin, L., Sabourin, L. Language athletes: dual-language code-switchers exhibit inhibitory control advantages. Front Psychol. 14, 1150159(2023).
  24. Acheampong, F. A., Wenyu, C., Nunoo-Mensah, H. Text-based emotion detection: advances, challenges, and opportunities. Eng Rep. 2 (7), e12189(2020).
  25. Tracy, J. L., Randles, D. Four models of basic emotions: a review of Ekman and Cordaro, Izard, Levenson, and Panksepp and Watt. Emotion Rev. 3 (4), 397-405 (2011).
  26. Xiao, X., et al. A cognitive emotion model enhanced sequential method for social emotion cause identification. Inf Process Manag. 60 (3), 103305(2023).
  27. Park, E. H., Storey, V. C. Emotion ontology studies: a framework for expressing feelings digitally and its application to sentiment analysis. ACM Comput Surv. 55 (9), 1-38 (2023).
  28. Batra, H., Nelson, L. DCADS: data-driven computer aided diagnostic system using machine learning techniques for polycystic ovary syndrome. Int J Performability Eng. 19 (3), 193(2023).
  29. Sakib, N., et al. Towards automated recipe genre classification using semi-supervised learning. PLoS One. 20 (1), e0317697(2025).
  30. Fu, L., et al. A touch, vision, and language dataset for multimodal alignment. arXiv. , (2024).
  31. Modeling public mood and emotion: Twitter sentiment and socio-economic phenomena. Bollen, J., Mao, H., Pepe, A. Proc Int AAAI Conf Web Soc Media, 5 (1), https://ojs.aaai.org/index.php/ICWSM/article/view/14171 (2011).
  32. EmpaTweet: annotating and detecting emotions on Twitter. Roberts, K., et al. Proc Eighth Int Conf Language Resource Eval, 12 (12), 3806-3813 (2012).
  33. Mohammad, S. #Emotional tweets. First Joint Conf on Lexical Comput Semantics. , 246-255 (2012).
  34. Li, W., Xu, H. Text-based emotion classification using emotion cause extraction. Expert Syst Appl. 41 (4), 1742-1749 (2014).
  35. Verma, P., Kaur, A., Khurana, M., Damaševičius, R. Multimodal Hinglish tweet dataset for deep pragmatic analysis. Data. 9 (2), 38(2024).
  36. Hasan, M., Agu, E., Rundensteiner, E. Using hashtags as labels for supervised learning of emotions in Twitter messages. ACM SIGKDD Workshop Health Info. 34 (74), 1-8 (2014).
  37. Scherer, K. R., Wallbott, H. G. Evidence for universality and cultural variation of differential emotion response patterning. J Pers Soc Psychol. 66 (2), 310(1994).
  38. Sasidhar, T. T., Premjith, B., Soman, K. P. Emotion detection in Hinglish (Hindi+ English) code-mixed social media text. Procedia Comput Sci. 171, 1346-1352 (2020).
  39. Corpus creation and emotion prediction for Hindi-English code-mixed social media text. Vijay, D., et al. Proc. 2018 Conf. North Am Chapter Assoc Comput Linguistics: Student Research Workshop, , 128-135 (2018).
  40. Srivastava, V., Singh, M. Phinc: a parallel Hinglish social media code-mixed corpus for machine translation. arXiv. , (2004).
  41. Cossu, J. V., Molina-Villegas, A., Tello-Signoret, M. Active learning in annotating micro-blogs dealing with e-reputation. J Interdiscip Methodol Issues Sci. 3, (2017).
  42. Kranjc, J., et al. Active learning for sentiment analysis on data streams: methodology and workflow implementation in the ClowdFlows platform. Inf Process Manag. 51 (2), 187-203 (2015).
  43. Smith, C. A., Kirby, L. D. Consequences require antecedents: toward a process model of emotion elicitation. Feeling and Thinking: The Role of Affect in Social Cognition. , 83-106 (2000).
  44. Jan, T. G., Khurana, S. S., Kumar, M. Semi-supervised labeling: a proposed methodology for labeling the Twitter datasets. Multimed Tools Appl. 81 (6), 7669-7683 (2022).
  45. Cahyana, N. H., et al. Semi-supervised text annotation for hate speech detection using k-nearest neighbors and term frequency-inverse document frequency. Int J Adv Comput Sci Appl. 13 (10), 147-151 (2022).
  46. Saifullah, S., et al. Automated text annotation using a semi-supervised approach with meta vectorizer and machine learning algorithms for hate speech detection. Appl Sci. 14 (3), 1078(2024).
  47. Advani, L., Lu, C., Maharjan, S. C1 at SemEval-2020 Task 9: SentiMix: sentiment analysis for code-mixed social media text using feature engineering. arXiv. , (2008).
  48. Alarcão, S. M., et al. Annotate smarter, not harder: using active learning to reduce emotional annotation effort. IEEE Trans Affect Comput. 15 (3), 1213-1227 (2023).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

j zyk mieszanyaktywne uczeniedwuj zyczny s ownik emocjitokenizacja pods ownateoria oceny poznawczejteoria emocji dyskretnych
Film wkrótce dostępny