Artigo de investigação

Aprendizado de máquina e anotação de emoção econômica baseada em regras lexicais de enunciados em hinglish

DOI:

10.3791/68437

19 de agosto de 2025

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo combina a estratégia baseada em regras com aprendizado de máquina e assistência especializada para anotar o texto em hinglish e inglês. Os dados são testados em 19.000 tweets com 81% de precisão e é muito mais barato do que fazê-lo manualmente. Pode ser útil para rastrear emoções durante uma crise.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A anotação de emoções em linguagens mistas de código, como o hinglish (hindi-inglês), apresenta desafios únicos devido à complexidade linguística e às restrições de recursos. Este estudo apresenta uma estrutura híbrida de aprendizado ativo que combina regras lexicais, aprendizado de máquina e feedback iterativo de especialistas para obter anotação de emoções econômica e de alta precisão. Fundamentado em teorias psicológicas da emoção, incluindo a Teoria das Emoções Discretas e a Teoria da Avaliação Cognitiva, a estrutura emprega dicionários de emoções bilíngues (por exemplo, mapeando gussa e raiva para raiva), tokenização de subpalavras para termos compostos (por exemplo, divisão em figure-abstract-1) e aprendizado ativo para priorizar figure-abstract-2 amostras ambíguas. Avaliado em um conjunto de dados de 19.000 tweets Hinglish relacionados a guerras e conflitos, a estrutura alcançou 81% de precisão (pontuação F: 0,76) enquanto reduzia os custos operacionais em 40% em comparação com a anotação manual. As regras lexicais resolveram 89% das ambiguidades de troca de código e os refinamentos iterativos permitiram ganhos incrementais de precisão de 72% a 81%. A eficiência do sistema decorre da limitação do esforço humano a 73% do conjunto de dados, com pré-processamento automatizado de emojis, hashtags e gírias. Este estudo é baseado na hipótese de que a integração de métodos baseados em regras lexicais com aprendizado ativo e aprendizado de máquina pode aumentar a precisão da anotação de emoções no texto em hinglish, ao mesmo tempo em que reduz a rotulagem manual e o esforço geral de anotação.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Quando dois ou mais idiomas são misturados em uma única linha ou fala, isso é chamado de linguagem mista de código. É comum em diálogos casuais como o hinglish. Existem várias maneiras pelas quais as emoções humanas podem ser compreendidas, e modelar computacionalmente uma série de declarações emocionais é anotá-las pelas pessoas que proferiram essas frases. Pode ser entendido em termos de níveis biológicos, fisiológicos, psicológicos e assim por diante. De acordo com cientistas como Roger Penrose, muitos fenômenos em nosso mundo são não computacionais, e cientistas como Wolfram consideram que tudo (todos os fenômenos) podem ser modelados computacionalmente1. Penrose acredita que a consciência envolve processos (talvez relacionados à mecânica quântica dentro do cérebro) que vão além do que qualquer procedimento algorítmico passo a passo pode alcançar. Ele frequentemente cita os teoremas da incompletude de Gödel para apoiar a ideia de que a visão matemática humana, por exemplo, transcende os sistemas formais2. Se a consciência não é computacional, então as emoções, como um aspecto fundamental da experiência consciente, também podem ter elementos não computacionais. Stephen Wolfram, conhecido pelo Mathematica e seu trabalho sobre autômatos celulares, propõe o "Princípio da Equivalência Computacional". Isso sugere que mesmo sistemas muito complexos, incluindo potencialmente o próprio universo e fenômenos dentro dele (como emoções), podem ser descritos e modelados por regras computacionais, mesmo que essas regras sejam muito simples, gerando um comportamento complexo. Mas, na prática, isso não é possível, e precisamos de alguém que seja referido como um especialista ou simplesmente um anotador que possa fazer análise de emoções3.

Nesta pesquisa, propagamos a ideia de construção de modelos computacionais. Mas esse modelo será quase computacional. Nossa pesquisa neste contexto visa ser computacional na forma, mas pode não capturar todos os aspectos perfeitamente, talvez deixando espaço para complexidades que são difíceis ou impossíveis de calcular totalmente. As emoções são difíceis de modelar computacionalmente porque dependem de experiências subjetivas, contexto cultural e expressões diferenciadas que não podem ser totalmente capturadas por meio de algoritmos fixos.

Portanto, para modelar emoções humanas usando abordagens computacionais baseadas em variáveis, é necessário anotar enunciados emocionais humanos. Esta anotação deve ser realizada por um especialista ou anotador especializado em análise de emoções¹. Compreender as complexidades das emoções humanas não é uma tarefa fácil, principalmente quando se lida com idiomas mistos. Além disso, problemas relacionados à escala significam que confiar apenas na anotação manual por humanos não é uma opção viável. Pesquisas recentes indicam uma necessidade consistente de uma abordagem human-in-the-loop ao construir sistemas para tarefas tão complexas. Consequentemente, uma abordagem semiautomática, que envolve automatizar as partes mais diretas, reservando tarefas que exigem nuances humanas para anotadores, parece mais apropriada para o desenvolvimento de sistemas de linguagem natural neste domínio.

Um anotador humano, é claro, estará fazendo o trabalho manualmente e, na era da computação, isso não é o que se espera dos cientistas contemporâneos. Se o anotador (manual, semiautomático ou totalmente automático) for capaz de adivinhar de forma inteligente o tipo de emoção incorporada nos enunciados, enunciados que consistem em vários tipos de emoções expressas como símbolos, com coloquialismo ou código misturado e usando várias modalidades, então a tarefa é difícil e fácil ao mesmo tempo. A complexidade da anotação de emoção em enunciados em hinglish depende da natureza da expressão. Quando as emoções são transmitidas claramente usando palavras ou emojis familiares, a anotação é relativamente direta. No entanto, a tarefa se torna desafiadora quando os enunciados envolvem várias emoções, mistura de códigos ou expressões simbólicas ambíguas. Portanto, a anotação pode ser fácil e difícil, dependendo de quão diretamente a emoção é expressa.

As abordagens contemporâneas na identificação de emoções e sentimentos lidam com esses desafios, incluindo a natureza subjetiva das emoções, a ambigüidade nas expressões humanas, a complexidade de linguagens mistas de código como o hinglish e a natureza demorada e inconsistente da anotação manual. associado à construção de modelos computacionais e ao gerenciamento de tarefas de anotação tediosas. Pesquisas recentes indicam que os pesquisadores estão empregando uma gama diversificada de métodos para atingir esse objetivo, incluindo aprendizado de máquina, aprendizado profundo e várias abordagens híbridas. Pesquisas recentes mostram que, para superar esses problemas, os pesquisadores estão empregando uma variedade de técnicas, como aprendizado de máquina, aprendizado profundo e modelos híbridos.

Pesquisas recentes mostram que os pesquisadores estão empregando todos os tipos de abordagens, incluindo aprendizado de máquina, aprendizado profundo3 e abordagens híbridas. O termo análise de sentimento refere-se a um procedimento usado quando se acredita que a polaridade das emoções é um marcador para entender a emoção crua dos seres humanos 3,4. O desenvolvimento dessa tecnologia ajudou a reconhecer humor, sentimentos, fala, emoções faciais e pistas não verbais, e já fez incursões em aplicativos que permitem tradução em tempo real2. Uma abordagem multimodal pode ser usada para traduzir o hinglish para o inglês e pode ser útil no futuro para tornar o cinema indiano mais acessível a sociedades remotas 5,6. Por exemplo, na Índia, o inglês costuma ser a segunda língua. Pesquisas neste contexto mostram que isso melhorou a qualidade do ensino de inglês, analisando a fala indiana (linguagem de código misto) quanto à expressividade, ou grau de sentimento e emoção, de cada palavra.

Nesse contexto de pesquisa, o uso da linguagem de código misto em conjunto com a tradução demonstrou melhorar a qualidade do ensino de inglês. Isso é feito por meio da análise da fala indiana (linguagem de código misto) para determinar a expressividade, ou valência emocional, de cada palavra. Por meio da aplicação do aprendizado profundo para treinar computadores na interpretação da fala, esta pesquisa já melhorou a precisão da análise computadorizada da fala e facilitou uma maior compreensão da comunicação 4,5. De acordo com os resultados do censo de 2001, o hinglish, uma língua que é uma mistura de hindi e inglês, é atualmente usado por cerca de 120 milhões de pessoas na Índia6.

A partir do cenário contemporâneo de algoritmos de aprendizagem, fica claro que a aprendizagem ativa emergiu como uma ferramenta poderosa para reduzir significativamente o esforço humano na anotação de grandes conjuntos de dados, particularmente no domínio da identificação e reconhecimento de emoções. Essa abordagem iterativa, que anota seletivamente anotações impactantes (com métricas apropriadas), não apenas aumenta a precisão da anotação, mas também melhora a eficiência5. Estudos anteriores demonstraram sua eficácia em alcançar reduções substanciais na carga de trabalho de anotação manual, mantendo ou mesmo melhorando o desempenho com conjuntos de dados de treinamento menores e propondo um método baseado em análise de cluster para seleção de instâncias informativas 7,8. No contexto específico do reconhecimento de emoções Hinglish, os pesquisadores fizeram contribuições valiosas por meio de modelos de aprendizado profundo e um conjunto de dados anotado com vários rótulos 9,10,11. Estudos anteriores 12,13 introduziram aprendizado ativo e métodos semi-supervisionados para minimizar a dependência de dados rotulados por humanos, aumentando ainda mais a eficiência e reduzindo os custos de anotação. Além disso, o aprendizado ativo foi demonstrado em muitos projetos para aumentar o desempenho da classificação, particularmente na classificação de emoções multi-rótulo14.

A eficácia do aprendizado ativo na melhoria do desempenho do classificador foi reconhecida em vários aplicativos de aprendizado de máquina. Estudos15,16 destacaram seu papel crucial na melhoria do desempenho, concentrando-se em aplicações educacionais. Da mesma forma, um estudo inicial introduziu um novo algoritmo para aprendizado ativo com máquinas de vetores de suporte, reduzindo significativamente a necessidade de instâncias rotuladas17. Outro trabalho também explorou sua aplicação em tarefas envolvendo instâncias estruturadas, como classificação de texto18. O impacto do aprendizado ativo nas tarefas de reconhecimento de emoções vai além dos ganhos de eficiência, principalmente na minimização da dependência de dados rotulados por humanos. Um estudo introduziu uma estrutura multitarefa para classificação e regressão de emoções, superando o desempenho de métodos de tarefa única10.

Além disso, os pesquisadores19 fizeram avanços significativos no reconhecimento de emoções de fala e texto usando aprendizado ativo, enquanto demonstravam20 sua eficácia na classificação personalizada de emoções musicais. No entanto, o processo de categorização e rotulagem de emoções apresenta um desafio significativo, como destacado21,22, particularmente em contextos de análise de sentimentos. Observa que o uso do rótulo pode influenciar significativamente a categorização das emoções, principalmente para categorias aprendidas posteriormente23. Para enfrentar esses desafios, vários algoritmos, incluindo métodos baseados em palavras-chave e baseados em aprendizado, foram desenvolvidos, alcançando taxas de precisão notáveis24. A pesquisa sobre emoções com base em enunciados e textos escritos tem sido explorada em vários modelos, e as abordagens implementaram um modelo dimensional usando bancos de dados normativos para detecção eficaz de emoções25. Em outro estudo26, um modelo de emoção cognitiva aprimorou um método sequencial usado para identificação da causa da emoção social. O autor forneceu uma interpretação linguística computacional do modelo de emoção OCC, enquanto um estudo semelhante27propôs um sistema utilizando ontologias para representar relações de dependência de palavras e emoções. Os autores de um estudodiscutiramos sinais que se correlacionam com o processamento emocional de palavras, destacando a adaptação do cérebro em expressar emoções na linguagem escrita. A anotação de várias matrizes de emoções brutas, incluindo a dos dados de vários modelos, é um desafio. No entanto, investigar as emoções relacionadas à guerra e ao conflito fornece uma janela científica e sistemática para a psique humana em circunstâncias extremas, permitindo-nos entender melhor como indivíduos e comunidades lidam com traumas, perdas e incertezas5. Outro estudo descobriu que a técnica de anotação melhorou efetivamente a classificação de gênero, com o recurso do título desempenhando um papel crucial no processo29. Um estudo criou um conjunto de dados de toque de visão 44K com especialista e GPT-4V para treinar um codificador tátil e um modelo TVL para geraçãode texto 30. Outro estudo explorou a mineração de opinião e tendências em tweets políticos, com foco no processo de aprendizagem ativa para anotar automaticamente tweets em francês sobre políticos41. Outro estudo apresentou o CloudFlows, uma plataforma de fluxo de trabalho científico baseada em nuvem projetada para análise central adaptativa dinâmica em fluxos de dados. Ele permite o aprendizado ativo para melhorar a classificação de sentimentos, permitindo que o algoritmo se adapte às mudanças nos dados em tempo real42.

Há uma tensão clara entre a complexidade da emoção humana e o desejo de análise automatizada da emoção. Existe uma tensão inerente entre a complexidade da emoção humana e o objetivo da análise automatizada da emoção. A maior parte do trabalho contemporâneo reconhece as limitações da anotação manual e enfatiza a necessidade de métodos computacionais sofisticados para enfrentar os desafios de compreender as emoções em diversas formas de comunicação. Esse cenário ideal é amplamente impraticável, ou seja, obter anotações das pessoas que escreveram ou falaram as frases43. O cenário ideal para obter dados, especificamente obter anotações diretamente dos indivíduos que escreveram ou falaram as frases, é amplamente impraticável. Essa impraticabilidade decorre da impossibilidade de reunir e processar tais anotações personalizadas em larga escala. Portanto, os esforços atuais devem contar com anotadores especializados ou algoritmos automatizados de detecção de emoções para analisar e rotular as emoções expressas no texto. Neste trabalho de pesquisa, tentamos superar alguns aspectos desses desafios de domínio. Os principais contributos nesta área problemática são apresentados a seguir44.

Portanto, precisamos contar com especialistas ou anotadores e algoritmos de detecção de emoções para analisar e rotular as emoções expressas no texto. É impossível reunir e processar essas anotações personalizadas em grande escala. Assim, neste trabalho de pesquisa, procurou-se superar alguns aspectos desse domínio do conhecimento. A seguir estão as principais contribuições nesta área problemática.

A estrutura funciona em conjunto com métodos baseados em regras, como marcação de emoções, detecção de combinação de códigos e interpretação de emojis, com técnicas de aprendizado de máquina, como Random Forest e incorporação de palavras, melhorando a precisão das anotações e reduzindo o esforço manual. O Aprendizado Iterativo do Classificador emprega aprendizado ativo, bem como aprendizado de transferência para priorizar amostras de recursos ambíguos, reduzindo a necessidade de trabalho árduo. Essa abordagem reduziu os custos operacionais em 40% em comparação com a rotulagem manual rígida.

Para lidar com as nuances do Hinglish em um nível granular, foi desenvolvido um método personalizado de tokenização sensível ao contexto. Essa abordagem processa texto misto de código, levando em conta a troca de idioma, pontuação, emojis e segmentação de subpalavras, permitindo uma anotação de emoção mais precisa em texto misto hindi e inglês. Em um nível granular, desenvolvemos tokenização personalizada sensível ao contexto para texto em Hinglish. A estrutura aborda as complexidades do texto misto de código, incorporando dicionários de emoções bilíngues, tokenização de subpalavras e tokenização personalizada sensível ao contexto. As regras lexicais resolveram 89% das ambiguidades de troca de código.

Nosso trabalho é fundamentado em teorias psicológicas estabelecidas da emoção, como a Teoria das Emoções Discretas e a Teoria da Avaliação Cognitiva. A pesquisa demonstra a escalabilidade da abordagem para resposta a crises e monitoramento de mídia social, fornecendo um plano para aplicativos multilíngues de PNL com poucos recursos.

A Tabela 1 explica os estudos disponíveis para o mesmo domínio do problema. A partir do levantamento bibliográfico e do resumo tabulado, pode-se inferir que a maioria dos estudos não pode escapar de fazer algum trabalho inicial de anotação usando métodos manuais. Poucos pesquisadores estão seguindo abordagens semiautomáticas41. No entanto, a diferença real no desempenho vem do uso de um modelo de aprendizado eficaz que pode automatizar o processo de anotação. O conteúdo emocional dos tweets deve corresponder às teorias que explicam os caminhos das emoções humanas e a organização dos sentimentos. A próxima seção define o problema com base nas limitações das abordagens existentes e nos resultados empíricos dos artigos.

EstudarDatasetEmoçãoMétodosDomínioProcesso de rotulagemLacunasEscopo futuro
[31]9.000.000 de Tweetstensão, depressão, raiva, vigor, fadiga,Perfil de confusão dos estados de humorInglêsSem rotulagemO estudo ignora diferenças emocionais sutis como surpresa, alegria ou medo, sugerindo que a rotulagem de emoções pode melhorar a interpretabilidade e a granularidade das tendências de sentimento, particularmente em relação a eventos socioeconômicos.Ele poderia investigar como capturar e examinar melhor uma variedade de expressões emocionais em dados de mídia social, utilizando métodos automatizados de categorização e taxonomias emocionais bem estabelecidas.
[32]7000 Tweetsraiva, nojo, medo, alegria, amor, tristeza,Máquina de vetores de suporteInglêsManualA generalização do conjunto de dados é limitada devido à sua especificidade do tópico e à falta de representatividade do uso geral do Twitter.  Devido à interpretação subjetiva e ao contexto mínimo, que é mostrado em uma modesta concordância entre anotadores, é um desafio anotar emoções em tweets breves e casuais.Trabalhos futuros se concentrarão no desenvolvimento de modelos aprimorados de detecção de emoções, incorporando distinções entre estilos linguísticos específicos de tópicos e emoções, permitindo uma classificação mais precisa em diversos contextos de tweets.
[33]21.000 Tweetraiva, nojo, medo, alegria, tristeza, surpresaMáquina de vetores de suporte------Usando hashtagOs corpora rotulados de emoções existentes são limitados em tamanho e domínio, sem conjuntos de dados grandes e diversificados para microblogs. Os tweets são curtos, barulhentos e limitados ao contexto, dificultando a detecção e anotação precisas de emoções.Em trabalhos futuros, o estudo pode incluir a expansão do léxico emocional com sinônimos e hashtags adicionais para melhorar a cobertura e a precisão da detecção.
[34]16485 Tweetsraiva, nojo, medo, alegria, tristeza, surpresaRegressão de vetor de suporteChinêsManualOs métodos tradicionais de classificação de emoções geralmente ignoram a causa subjacente das emoções, limitando a qualidade do recurso.
Extrair com precisão as causas emocionais de postagens curtas e informais de microblog requer sistemas robustos baseados em regras e conhecimento de domínio.
 
Uma exploração mais aprofundada da análise da causa da emoção pode aprimorar os modelos de detecção de emoções e abrir novas direções na compreensão da emoção textual.
[35]10.040 TweetMedo, esperança, alegria, raiva, surpresa, tristeza, nojoLDA, concordância entre avaliadoresHinglishManualHá uma falta de conjuntos de dados estruturados e disponíveis publicamente para Hinglish, especialmente aqueles que capturam nuances pragmáticas e emocionais em conteúdo relacionado a crises. O hinglish é uma linguagem não padrão, com código misto, e as variações regionais complicam a análise e a anotação precisas de sentimentos.
 

Para expandir conjuntos de dados multimodais, integre análises pragmáticas profundas com modelos de aprendizado de máquina e aborde a escalabilidade para rastreamento de emoções em tempo real no discurso de conflito.
[36]134.000 tweetsativo, inativo feliz, infelizMáquina de vetores de suporte e vizinhos mais próximos KHinglishUsando hashtagsA rotulagem manual de emoções de tweets é trabalhosa e inconsistente, limitando os esforços de classificação de emoções em larga escala
As anotações de crowdsourcing carecem de confiabilidade, especialmente na identificação dos níveis de excitação emocional, destacando a subjetividade na interpretação das emoções.
 
Concentre-se em refinar a rotulagem baseada em hashtag e expandir os modelos de detecção de emoções para melhorar a precisão e a generalização em diversos contextos emocionais.
[37]3.000 estudantes, psicólogos e não psicólogos de 37 paísesalegria, medo, raiva, tristeza, nojo, vergonha e culpa.-------ManualExploração limitada de como os fatores culturais influenciam a regulação e expressão de emoções específicas em diversas sociedades. Equilibrar evidências de padrões emocionais universais com variações culturalmente específicas na elicitação e interpretação de emoções permanece complexo.
 
Novos estudos devem investigar a interação entre universalidade biológica e contexto cultural na formação da experiência emocional e da comunicação
[38]12000Felicidade, tristeza e raivaConcordância entre avaliadoresHindi+InglêsManualA pesquisa atual carece de um conjunto de dados abrangente e anotado e modelos padronizados para detecção de emoções Hinglish. A gramática irregular e a natureza mista de códigos dos textos de mídia social dificultam a classificação precisa das emoções.
 

O trabalho futuro se concentrará na expansão das categorias de emoções e no desenvolvimento de conjuntos de dados maiores e multilíngues com codificação mista.
[39]2866felicidade, tristeza, raiva, surpresa e tristezaMáquina de vetores de suporteHinglish (Hindi+Inglês)ManualFalta de conjuntos de dados mistos de código anotado por emoção.  A expressão de emoção em texto misto de código varia entre idiomas e scripts, tornando a anotação e a classificação complexas.
 

Trabalhos futuros podem expandir o corpus para incluir mais diversidade emocional, integrar a marcação de parte do discurso e explorar conteúdo misto de código multilíngue.
[40]13738---Tradução automática Google TranslatorHinglishManualOs sistemas de tradução automática existentes carecem de precisão em dados de mídia social mistos devido à ausência de grandes corpora paralelos específicos de domínio. A alta variação ortográfica, a estrutura informal e a ambiguidade na identificação do idioma complicam a tradução do texto romanizado hindi-inglês.
 
O corpus pode suportar o desenvolvimento de sistemas de tradução mista de código e ser estendido a outras linguagens de poucos recursos e tarefas de PNL, como reconhecimento de entidade nomeada
[41]11527positivo, muito positivo e negativo, muito negativoClassificação baseada em kNN, representação BOWPolíticos francesesManualDisponibilidade limitada de conjuntos de dados anotados de alta qualidade para mineração de opinião política em idiomas diferentes do inglês. Equilibrar a redução de ruído de anotação com retenção de informações e lidar com a distribuição desigual de rótulos em conjuntos de dados de tweets em grande escala são as principais dificuldades.
 

Trabalhos futuros podem refinar métodos de aprendizagem ativa para preservar melhor o conteúdo crítico, minimizando o ruído de anotação no discurso político multilíngue.
[42]764,416---Clustering de Kmeans, SVMInglêsSemi supervisionadoA rotulagem em tempo real e a atualização do modelo na análise de sentimento são limitadas pela variabilidade do fluxo de dados, custo de rotulagem e escalabilidade do sistema.Trabalhos futuros explorarão a classificação de sentimento multiclasse, integrarão estratégias de rotulagem adicionais e expandirão o controle sobre a geração inicial do modelo

Tabela 1: Estudos disponíveis com métodos de rotulagem correspondentes. A tabela fornece uma visão comparativa completa dos estudos existentes, abordando a anotação da emoção e estabelecendo o cenário metodológico e conceituando a contribuição do presente trabalho na literatura existente.

Declaração do problema
As emoções mais frequentemente estudadas na anotação são fortemente influenciadas por modelos psicológicos fundamentais como os de Ekman e Plutchik, concentrando-se principalmente em categorias centrais como raiva, medo, felicidade, tristeza, surpresa e assim por diante44 . Assim, neste trabalho de pesquisa, pretendemos trabalhar conotações bem estabelecidas de emoções. O desafio é desenvolver uma estrutura computacional dinâmica, F, capaz de anotar com precisão instâncias de texto em hinglish (ti ) de um corpus T focado em guerras e conflitos com rótulos de emoção (ei) a partir de um conjunto predefinido E = {e1, e2, ..., e8}. Essa estrutura deve sintetizar princípios da Teoria Construcionista da Emoção, Teoria dos Eventos Afetivos (AET), Teoria das Emoções Discretas e Teoria da Avaliação Cognitiva para modelar a paisagem emocional multifacetada do discurso relacionado ao conflito. Cada instância de texto ti em T é linguisticamente complexa, misturando hindi (em escrita romana), inglês, emojis e símbolos, necessitando de uma abordagem de várias camadas para capturar expressões emocionais diferenciadas.

O modelo computacional de emoções relacionadas à guerra (como um estudo de caso) pode envolver uma abordagem multifacetada, começando com regras lexicais que abordam nuances baseadas em Hinglish. A tokenização, denotada como T, engloba scripts romanos (hindi escrito em script romano), juntamente com emojis e pontuação, formando a base do processamento da linguagem. dicionários de emoções, representados como D, mapeiam palavras entre idiomas para emoções específicas, como raiva, alegria e outras, onde cada emotion_i associou words_j em language_k. A decomposição de subpalavras, S, decompõe os termos compostos em suas subpalavras constituintes, permitindo uma compreensão mais profunda de expressões complexas. Posteriormente, as técnicas de aprendizado de máquina, M, utilizam embeddings, E, como Word2Vec/fastText, para transformar tokens em representações vetoriais, vector_v, facilitando a análise numérica. Os classificadores de conjunto, C, como Random Forest, preveem rótulos de emoção, emotion_label_p, a partir desses conjuntos de vetores. Para melhorar iterativamente o modelo de aprendizado de anotação, um mecanismo de aprendizado ativo, AL, é empregado. O feedback de especialistas, F, refina casos ambíguos ambiguous_sample_q, atribuindo refined_label_r, fornecendo correções cruciais. A priorização de amostras, P, concentra-se em amostras de baixa confiança, low_confidence_sample_s, atribuindo-as annotation_priority_t, otimizando assim o processo de anotação.

Ao integrar esses componentes e teorias, essa estrutura visa processar dinamicamente o texto em hinglish, unir nuances linguísticas e culturais e refinar de forma adaptativa as anotações emocionais, oferecendo uma solução escalável para analisar as dimensões afetivas no discurso de conflito.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta seção também explica como a estrutura multimodal para anotação de 8 emoções foi construída. A seção começa com uma discussão sobre as propriedades do conjunto de dados, seguida pelos procedimentos subsequentes. Para uma melhor compreensão do procedimento de pesquisa, consulte a Figura 1.

figure-protocol-1
Figura 1: Estrutura sistemática de anotação de emoções. A figura explica a emoção efetiva, a anotação de texto hinglish que combina aprendizado de máquina, aprendizado ativo e regras de léxico dinâmico por meio de informações de especialistas, exemplos classificados incorretamente são progressivamente aprimorados para aumentar a precisão e reduzir o custo da anotação. Clique aqui para ver uma versão maior desta figura.

Preparação do conjunto de dados
A coleta de dados começa com a identificação de uma lista abrangente de palavras-chave e hashtags relacionadas a guerras, conflitos e emoções associadas. Recursos como literatura acadêmica, artigos de notícias e tendências de mídia social foram usados para compilar listas relevantes e existentes.

De acordo com a Figura 1, após a coleta de tweets e o pré-processamento dos dados, especialistas humanos estão envolvidos na rotulagem manual e na criação de regras lexicais que precisam ser incorporadas para melhorar o processo de anotação. Usando essas palavras-chave (conflito, guerra, crise, gussa, etc.), um conjunto de dados inicial de 10.040 tweets foi coletado e serviu como base para a rotulagem manual, onde cada tweet foi anotado com oito emoções predefinidas (raiva, medo, felicidade, tristeza, frustração, compaixão, misturado, outros relevantes para o domínio da guerra e do conflito. O processo de rotulagem manual foi conduzido por uma equipe de especialistas proficientes em hindi e inglês, garantindo que as nuances do inglês sejam capturadas com precisão.

Um exemplo de processamento é descrito abaixo.

Tokenização e pré-processamento:
Tweet de entrada: "Mujhe Bhayanak lag raha hai figure-protocol-2"
Saída tokenizada: ["Mujhe", "Bhayanak", "lag", "raha", "hai", "figure-protocol-3"]
Manipulação da escrita romana: As palavras hindi ("Mujhe", "Bhayanak") são mantidas na escrita romana.
Detecção de emoji/símbolo: "" é isolado como um token simbólico.

Mapeamento do Dicionário de Emoções (D):
Mapeie tokens para emoções em E usando léxicos emocionais bilíngues (hindi/inglês): "Bhayanak" (hindi para "horrível") → Medo; "lag raha hai" (frase contextual que implica emoção contínua) → Medo; "figure-protocol-4" → Raiva

Decomposição de subpalavras (S):
Decomponha termos complexos para uma análise mais profunda: "Bhayanak" → ["Bhay" (medo), "anak" (sufixo)] para esclarecer sua raiz semântica no medo.

Geração de incorporação (E):
Gere incorporações de token usando Word2Vec/fastText: Incorporações para ["Mujhe", "Bhayanak", "lag", "raha", "hai", "figure-protocol-5"] → vetores v1, v2, v3, v4, v5, v6.
Regra de agregação: Média de inserções de token para criar um vetor semântico global:
V_avg = (v1 + v2 + v3 + v4 + v5 + v6) / 6

Extração de recursos baseada em regras:
Extraia recursos auxiliares para concatenação. Contagem de tags de emoção: Medo: 2 instâncias ("Bhayanak", "lag raha hai"); Raiva: 1 instância ("figure-protocol-6").
Sinalizador de troca de código: sinalizador binário = 1 (tokens mistos em hindi e inglês: "Mujhe" [hindi], "lag", "raha", "hai" [derivado do hindi]).

Fusão de recursos:
Combine incorporações agregadas e recursos baseados em regras em um vetor de entrada unificado: Vetor semântico global=V_avg(incorporações médias),Contagens de emoções=[Medo: 2, Raiva: 1, Outros: 0], Sinalizador de troca de código=1
Vetor de entrada final da regra de concatenação = V_avg figure-protocol-7 [Medo: 2, Raiva: 1, Outros: 0] figure-protocol-8 [1]
O algoritmo de aprendizado de máquina processa esse vetor final e o processo iterativo de melhoria da anotação começa. Na próxima seção, discutimos o desempenho do método de aprendizagem ativa adotado para esse fim.

Depois disso, o conjunto de dados foi expandido para 19.000 tweets. Esse conjunto de dados foi selecionado usando uma combinação de técnicas automatizadas e semiautomatizadas, aproveitando o insight obtido com a anotação manual inicial. O conjunto de dados expandido foi refinado a partir de um processo de aprendizado iterativo, que envolveu identificar e priorizar seletivamente dados/tweets ambíguos para anotação de especialistas e feedback de especialistas de domínio para melhorar a precisão, consistência e eficiência da anotação. Ao longo do processo de coleta de dados, foi dada atenção especial à manutenção do equilíbrio entre as diferentes emoções, garantindo que o conjunto de dados fosse representativo dos diversos sentimentos expressos sobre guerra e conflito. O conjunto de dados resultante é um recurso valioso para analisar o texto em hinglish. Para melhor compreensão, a Figura 2 pode ser consultada.

figure-protocol-9
Figura 2: Procedimento de coleta do conjunto de dados. A figura descreve o desenvolvimento do conjunto de dados, desde a identificação da palavra-semente até a rotulagem manual, seguida de aprendizado ativo, até o conjunto de dados final anotado. Clique aqui para ver uma versão maior desta figura.

A preparação final do conjunto de dados é feita após a conclusão do processo de refinamento iterativo com a ajuda do aprendizado ativo. O aprendizado ativo foi usado em uma estrutura híbrida que incluía regras lexicais, aprendizado de máquina e entrada iterativa de especialistas para anotar as emoções dos enunciados em Hinglish. As etapas foram as seguintes:

O processo começa com um conjunto de dados rotulado manualmente. Usando um classificador Random Forest, que foi empregado para identificar tweets ambíguos sobre os quais o modelo de aprendizado de máquina não tinha certeza. Envie essas amostras ambíguas para categorização para especialistas humanos. O modelo foi atualizado repetidamente usando os dados recentemente anotados, o que melhorou gradualmente a precisão e reduziu os erros de classificação. Finalize o conjunto de dados e revise as anotações para garantir a precisão. Prepare o conjunto de dados para análise, garantindo que ele esteja devidamente documentado e formatado para uso futuro para implementação em casos downstream. No entanto, é importante investigar os padrões de emoções embutidos nos enunciados para que as etapas futuras se tornem mais claras em termos de implementação. Portanto, na próxima etapa, a análise de cluster será realizada para encontrar emoções dominantes embutidas no conjunto de dados. Isso também ajuda a identificar as emoções que estamos pesquisando.

Seleção de clusters de emoções
A Tabela 2 mostra os grupos de emoções e seus equivalentes em Hinglish, juntamente com o motivo da seleção das respectivas emoções. De cada grupo de emoções, uma emoção dominante foi selecionada para processamento posterior. Essas emoções dominantes são selecionadas a partir da análise de cluster.

Grupo de EmoçõesEquivalente em hinglishJustificação da Selecção
Medo (inclui ansiedade e pânico)Dar, khauf, Asahaj, Bekabu, Angadai, Chinta, tensão, Fikr, Ashanka, Udaasi, Bechaini, GhabrahatO medo é uma emoção comum em guerras e conflitos, pois os indivíduos enfrentam ameaças à sua segurança e bem-estar. Esse medo pode se manifestar de várias maneiras, como ansiedade, ataques de pânico e hipervigilância.
Raiva (inclui irritação, hostilidade, frustração e mágoa)Gussa, raag, Prakop, Raudra, Chidhaan, Shatruta, Krodh, Gussa dilana, apata, Atyachar, Khushfehmi, hairani, Bhayanak, Chakker KathinaaiA raiva é outra emoção predominante na guerra e no conflito, muitas vezes decorrente de sentimentos de injustiça, traição ou perda. Essa raiva pode alimentar a agressão e a violência, contribuindo para a natureza destrutiva desses conflitos.
Tristeza (inclui tristeza, desespero e desesperança)Udaasi, gham, Shok, Bhavuk, Dukhi, Udas, Vismay, Nirasha, Shok, Dukhi, Vairagya, Aashank, Vishada, Bhavuk, Dukhi, Udas, Vinamrata, Bhavuk, Hridaytoda, Beumaar, nirasha, Vinaash, Bair, Nirasha, Asambhav, HaarA tristeza é uma resposta natural à perda e ao luto, que infelizmente são experiências comuns em guerras e conflitos. Os soldados podem sentir tristeza pela perda de camaradas, os civis podem lamentar os entes queridos mortos ou deslocados e comunidades inteiras podem lamentar a perda de suas casas e modo de vida. Sentimentos de desespero e desesperança também podem surgir devido à natureza prolongada do conflito e ao ciclo aparentemente interminável de violência.
Vergonha e culpaSharm, lajjabari, Sharm, Laaj, Zillat, Afsos, Gunah, Afsos, Pashchatap, Laaj, Bechaini, Aatmasamarpan, Sharmindagi, Ashru, Pashchatap, Antaratma, Kasoor, gunaah, Khud ko doshi maana, Ninda, DoshaVergonha e culpa são emoções complexas que podem surgir de sentimentos de transgressão pessoal ou coletiva, inadequação ou humilhação. Na guerra e no conflito, os indivíduos podem sentir vergonha ou culpa por suas ações, sua incapacidade de evitar danos aos outros ou sua sobrevivência enquanto outros morreram.
NojoGhin, nafrat, Asahayak, Pratikool, Ghrina, Vairagya, Dvesha, Nakaratmak, Vibhavsu, Vairagya, Vairagya, NirashaNojo é um sentimento de repulsa ou aversão a algo percebido como desagradável ou ofensivo. Na guerra e no conflito, os indivíduos podem sentir repulsa em resposta a atos de crueldade, violência e barbárie.
Empatia e compaixãoSahaaanubhuti, hamderdari, Samajhdari, Daan Sahabhooti, Sensibilidade, Apoio, Consideração, Bondade, Carinho, Calor, Ternura, Daya, raham, Sahaaanubhuti, Sahyog, Dayalu, Samajh, Pyar, Daya, Narami, ParopkariEmpatia e compaixão são vitais para entender e compartilhar os sentimentos dos outros. Em guerras e conflitos, a empatia pode ser uma ferramenta poderosa para se conectar com outras pessoas que sofreram experiências semelhantes, promovendo a compaixão e promovendo a reconciliação. A compaixão pode motivar as pessoas a ajudar os necessitados e contribuir para os esforços de cura e reconstrução.
Esperança e GratidãoUmeed, aasha, Chah, Ichha, Sapna, Unnati, Ashvasan, Khushi, Utsaah, Ashirwad, Samvedansheelata, Vishwas, Bharosa, Shukraguzaar, eshaananand, Shukrana, Aabhaar, Namrata, Samaanya, Naman, Aasherewad, Badhai, Dhanyavaad, Abhivadn, Manobhav, BhaktiA esperança é um sentimento de otimismo e expectativa de que algo de bom aconteça, apesar dos desafios e dificuldades enfrentados. Gratidão é um sentimento de gratidão e apreço pelas coisas boas da vida de alguém. Na guerra e no conflito, a esperança pode ser uma fonte de força e motivação, permitindo que os indivíduos perseverem e trabalhem por um futuro melhor. A gratidão pode ajudar as pessoas a se concentrarem nos aspectos positivos de suas vidas, promover a resiliência e cultivar uma sensação de paz em meio à turbulência.
ResiliênciaJheelaanek, himmat, Sahasi, Sahas, Dhairya, Majbooti, Samvedansheel, Samarthya, Majbuti, LachariResiliência é a capacidade de se adaptar e lidar com situações difíceis ou desafiadoras. Na guerra e no conflito, a resiliência é essencial para que indivíduos e comunidades sobrevivam e perseverem diante da adversidade.

Tabela 2: Justificativa para a seleção da emoção. A tabela mapeia grupos emocionais para seus equivalentes em hinglish e explica sua relevância em contextos de guerra e conflito.

No entanto, deve-se notar que a seleção dessas emoções não se baseia apenas na análise de cluster, mas também nas teorias das emoções, incluindo a Teoria da Avaliação Cognitiva (CAT), a Teoria das Emoções Discretas (DET) e a Teoria Orientada a Processos (POT) da Emoção43.

Detalhes do corpus
O conjunto de dados consiste em conjuntos de dados de tweets específicos de domínio (guerras, conflitos e crises) e adicionais que contêm uma mistura de tweets em hindi e inglês. A Figura 3 é um instantâneo dos conjuntos de dados de tweets disponíveis publicamente sendo processados para este trabalho de pesquisa. O conjunto de dados primário está disponível publicamente em https://data.mendeley.com/datasets/y63frd6pmf/7.

figure-protocol-10
Figura 3: Detalhes do corpus. A disponibilidade do conjunto de dados é explicada aqui. Clique aqui para ver uma versão maior desta figura.

Anotação de rótulos de emoção
Um corpus inicial de 10.040 tweets em hinglish relacionados à guerra e ao conflito foi anotado manualmente com oito rótulos de emoção por especialistas bilíngues. Para abordar a complexidade linguística do texto misto de código, foi desenvolvida uma estrutura baseada em regras lexicais, incorporando vários componentes. A estrutura inclui dicionários específicos de emoções que mapeiam termos em hindi/inglês para emoções, como fear_words = {Medo, Pavor, Bhayanak, figure-protocol-11, Terror, figure-protocol-12} e anger_words = {gussa, raiva, figure-protocol-13, irritação, figure-protocol-14}. As regras de equivalência multilíngue ligavam os termos (por exemplo, se (Ae == Ah): raiva = gussa | figure-protocol-15). Regras lexicais, como dicionários de emoções, tokenização para idiomas mistos e decomposição de subpalavras são usadas. Para anotar emoções, essas regras pré-processam o texto e extraem recursos, que são combinados com incorporações de aprendizado de máquina45.

Para tokenização, a estrutura utilizou regras personalizadas para troca de idioma, pontuação, emojis e tokenização de subpalavras. O texto em hindi (Devanagari) foi tokenizado no nível do caractere, enquanto o inglês (romano) usou espaços em branco. Exemplo: Mujhe frustração hai → [Mujhe, frustração, hai]. Caracteres especiais como hashtags (#) e menções (@) foram isolados como tokens individuais (por exemplo, #WarCrimes → [#, WarCrimes]), enquanto sinais de pontuação como vírgulas (,) e pontos de exclamação (!) foram divididos em tokens separados (por exemplo, figure-protocol-16figure-protocol-17, !]).

Os emojis também foram tratados como tokens independentes e mapeados para emoções (por exemplo, figure-protocol-18 → raiva figure-protocol-19→ tristeza). Tokenização de subpalavras feita com script Devanagari em que palavras compostas foram divididas usando padrões regex para regras Sandhi (por exemplo, figure-protocol-20] [reino + mundo]) e prefixos / sufixos de scripts romanos foram segmentados (por exemplo, inacreditável → [un, crível]). Para expansão específica do domínio, os tokens foram substituídos por rótulos de emoção se correspondidos em dicionários. Por exemplo: Bhayanak → medo, Dahad" → medo, gussa → raiva. Tweet Mujhe Bhayanak lag raha hai → Tokens [Mujhe, medo, lag, raha, hai].

Após a vetorização, os tokens processados (palavras, subpalavras, emojis) foram convertidos em incorporações de 300 dimensões usando Word2Vec/fastText. As representações numéricas em vetores de coluna de tokens, uma matriz de vetores correspondentes a tokens. Cada linha corresponde a um vetor de incorporação associado a um token no texto, representando a ordem do token. As colunas em uma linha significam dimensões no espaço de incorporação. Os vetores contêm números reais calculados usando Word2Vec e FastText. Tokens com vetores zero, representados por linhas com todos os valores zero, podem denotar espaços ou caracteres especiais sem informações significativas nesta representação. As incorporações visam capturar relacionamentos contextuais de palavras para melhor anotação. Vetores diferentes de zero indicam representações significativas de palavras ou símbolos. Os valores nesses vetores codificam várias características semânticas e sintáticas. Os vetores zero normalmente representam preenchimento, espaço ou tokens não reconhecidos. A variabilidade nos valores reflete a riqueza de recursos capturados pelo modelo de incorporação. Diferentes dimensões vetoriais capturam diversos aspectos do significado, contexto e uso de uma palavra. A Figura 4 mostra como os vetores são representados e, a partir da Figura 5, as implicações do uso do processo de vetorização podem ser compreendidas.

figure-protocol-21
Figura 4: Tokenização personalizada. A figura mostra como os vetores são representados no espaço de incorporação e mostra como cada token é transferido para um formato numérico Clique aqui para ver uma versão maior desta figura.

figure-protocol-22
Figura 5: Processo de vetorização de tokens e suas implicações. A figura ilustra a implicação desses processos, componentes e destaca como essas incorporações capturam a semântica das emoções para uma classificação emocional precisa. Clique aqui para ver uma versão maior desta figura.

De acordo com o fluxo de pesquisa, o processo começa com a análise do texto de entrada, expandindo os tokens usando os dicionários baseados em regras e, em seguida, dividindo esses tokens em subpalavras. Essa abordagem fornece uma compreensão do conteúdo emocional e do contexto cultural do texto, e a pseudológica para a pesquisa é dada abaixo.

Inicialize dicionários de emoções (por exemplo, fear_words = {"Medo", "Pavor", "Bhayanak", ...}): Defina Ae = Ah
SubwordRules(token, script): Se Devanagari → dividido usando regex (composto/Sandhi), Se Roman → dividir prefixos/sufixos usando regex, Retorna subpalavras
DomainSpecificExpansion(token): Se o token em dicionários emocionais/linguísticos → retornam emoção
Caso contrário, → token de retorno
ProcessTweet(text): Define regex para Devanagari, Roman, outros; Extraia tokens usando regex; Aplique DomainSpecificExpansion e SubwordRules a tokens; Retornar subpalavras processadas
Vetorizar tokens em incorporações numéricas
Aplique a Aprendizagem Ativa com feedback humano

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A descoberta desta pesquisa sugere que a integração das regras lexicais com técnicas de aprendizado de máquina e aprendizado ativo oferece um caminho viável para aumentar a eficiência e a precisão da anotação de emoções em texto hinglish misto de código. Por meio de refinamento iterativo e sugestão de especialistas, a estrutura proposta foi capaz de alcançar reduções notáveis no esforço manual, mantendo o alto desempenho em todas as matrizes de evolução. Os resultados indicam potencial pa...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O conjunto de dados para este estudo foi selecionado usando uma combinação de anotação manual e aprendizado ativo. Inicialmente, 10.040 tweets em hinglish relacionados a guerra e conflito foram rotulados manualmente com oito emoções predefinidas. O conjunto de dados foi então expandido para 19.000 tweets usando uma abordagem semiautomatizada. O aprendizado ativo permitiu a intervenção seletiva de especialistas, reduzindo o esforço manual em 40%, mantendo uma alta precisão de anotação de 81% com um escore F de 0,76. Regra...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram não haver conflito de interesses.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta pesquisa não recebeu financiamento externo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
texto rápidoIA do FacebookN/ARepresentação e classificação de palavras
Google ColabPesquise no GoogleN/AAmbiente Jupyter Notebook baseado em nuvem
Google Colab GPU/TPUPesquise no GoogleN/AAceleração de hardware baseada em nuvem
Intel Core i5/i7 ou AMD Ryzen 5/7Intel / AMDN/AProcessador para execução local (se necessário)
MatplotlibCódigo abertoN/ABiblioteca de visualização de dados
NLTKCódigo abertoN/AKit de ferramentas de linguagem natural para processamento de texto
NumPyCódigo abertoN/ABiblioteca de computação numérica
NVIDIA GTX 1650 ou superior (opcional)NVIDIAN/AGPU para tarefas de aprendizado profundo
PandasCódigo abertoN/ABiblioteca de manipulação de dados
Python Fundação de Software PythonN/ALinguagem de programação para ML e PNL
PyTorchMeta IAN/AEstrutura de aprendizado profundo
RAM (mínimo de 8 GB, recomendado 16 GB)VárioN/ARequisito de memória para tarefas de ML
Scikit-aprenderCódigo abertoN/ABiblioteca de aprendizado de máquina
Nascido no marCódigo abertoN/AVisualização de dados estatísticos
SpaCyIA de explosãoN/ABiblioteca de NLP de força industrial
Armazenamento SSD (mínimo de 256 GB, 512 GB recomendado)VárioN/AArmazenamento para processamento de conjunto de dados
TensorFlowPesquise no GoogleN/AEstrutura de aprendizado profundo

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Herce, R. Non-locality of the phenomenon of consciousness according to Roger Penrose. Dialogo. 3 (2), 127-134 (2016).
  2. Wolfram, S. The future of computation. Math J. 10 (2), 329-362 (2006).
  3. Kusal, S., et al. A systematic review of applications of natural language processing and future challenges with special emphasis in text-based emotion detection. Artif Intell Rev. 56 (12), 15129-15215 (2023).
  4. Recent advancements and challenges in multimodal sentiment analysis: a survey. Dong, Z. X., Liu, H. 2023 Int Conf Machine Learning Cybernetics (ICMLC), , IEEE. 464-469 (2023).
  5. Gandhi, A., et al. Multimodal sentiment analysis: a systematic review of history, datasets, multimodal fusion methods, applications, challenges and future directions. Inf Fusion. 91, 424-444 (2023).
  6. Chand, V. The rise and rise of Hinglish in India. Conversation. , https://theconversation.com/the-rise-and-rise-of-hinglish-in-india-53476 (2016).
  7. Hernández-de-Menéndez, M., et al. Active learning in engineering education: a review of fundamentals, best practices and experiences. Int J Interact Des Manuf. 13, 909-922 (2019).
  8. Liu, X., et al. Developing multi-labelled corpus of Twitter short texts: a semi-automatic method. Systems. 11 (8), 390(2023).
  9. Alahmary, R., Al-Dossari, H. A semiautomatic annotation approach for sentiment analysis. J Inf Sci. 49 (2), 398-410 (2023).
  10. Garg, N., Sharma, K. Annotated corpus creation for sentiment analysis in code-mixed Hindi-English (Hinglish) social network data. Indian J Sci Technol. 13 (40), 4216-4224 (2020).
  11. Jamatia, A., et al. Deep learning based sentiment analysis in a code-mixed English-Hindi and English-Bengali social media corpus. Int J Artif Intell Tools. 29 (5), 2050014(2020).
  12. Nainabasti, B. Role of students' participation on learning physics in active learning classes. ProQuest ETD Collection for FIU. , AAI10743750(2016).
  13. Goudjil, M., et al. A novel active learning method using SVM for text classification. Int J Autom Comput. 15, 290-298 (2018).
  14. Huang, S. J., Jin, R., Zhou, Z. H. Active learning by querying informative and representative examples. Adv Neural Inf Process Syst. 23, 1-9 (2010).
  15. Zhang, Z., Strubell, E., Hovy, E. A survey of active learning for natural language processing. arXiv. , (2022).
  16. Baghel, R. A survey on code-mixed sentiment analysis based on Hinglish dataset. Int Conf Comput Commun Cyber-Secur. 664, (2022).
  17. Tong, S., Koller, D. Support vector machine active learning with applications to text classification. J Mach Learn Res. 2 (Nov), 45-66 (2001).
  18. Subramanian, M., et al. A survey on hate speech detection and sentiment analysis using machine learning and deep learning models. Alex Eng J. 80, 110-121 (2023).
  19. Liu, Z., et al. An emotion-based personalized music recommendation framework for emotion improvement. Inf Process Manag. 60 (3), 103256(2023).
  20. Ren, F., Liu, Z., Kang, X. An efficient framework for constructing speech emotion corpus based on integrated active learning strategies. IEEE Trans Affect Comput. 13 (4), 1929-1940 (2022).
  21. Azzi, S. A., Zribi, C. B. O. Comparing deep learning models for multi-label classification of Arabic abusive texts in social media. Proc Int Conf Software Tech, , 374-381 (2022).
  22. Min, X. Y., et al. Multi-label active learning through serial-parallel neural networks. Knowl Based Syst. 251, 109226(2022).
  23. Gosselin, L., Sabourin, L. Language athletes: dual-language code-switchers exhibit inhibitory control advantages. Front Psychol. 14, 1150159(2023).
  24. Acheampong, F. A., Wenyu, C., Nunoo-Mensah, H. Text-based emotion detection: advances, challenges, and opportunities. Eng Rep. 2 (7), e12189(2020).
  25. Tracy, J. L., Randles, D. Four models of basic emotions: a review of Ekman and Cordaro, Izard, Levenson, and Panksepp and Watt. Emotion Rev. 3 (4), 397-405 (2011).
  26. Xiao, X., et al. A cognitive emotion model enhanced sequential method for social emotion cause identification. Inf Process Manag. 60 (3), 103305(2023).
  27. Park, E. H., Storey, V. C. Emotion ontology studies: a framework for expressing feelings digitally and its application to sentiment analysis. ACM Comput Surv. 55 (9), 1-38 (2023).
  28. Batra, H., Nelson, L. DCADS: data-driven computer aided diagnostic system using machine learning techniques for polycystic ovary syndrome. Int J Performability Eng. 19 (3), 193(2023).
  29. Sakib, N., et al. Towards automated recipe genre classification using semi-supervised learning. PLoS One. 20 (1), e0317697(2025).
  30. Fu, L., et al. A touch, vision, and language dataset for multimodal alignment. arXiv. , (2024).
  31. Modeling public mood and emotion: Twitter sentiment and socio-economic phenomena. Bollen, J., Mao, H., Pepe, A. Proc Int AAAI Conf Web Soc Media, 5 (1), https://ojs.aaai.org/index.php/ICWSM/article/view/14171 (2011).
  32. EmpaTweet: annotating and detecting emotions on Twitter. Roberts, K., et al. Proc Eighth Int Conf Language Resource Eval, 12 (12), 3806-3813 (2012).
  33. Mohammad, S. #Emotional tweets. First Joint Conf on Lexical Comput Semantics. , 246-255 (2012).
  34. Li, W., Xu, H. Text-based emotion classification using emotion cause extraction. Expert Syst Appl. 41 (4), 1742-1749 (2014).
  35. Verma, P., Kaur, A., Khurana, M., Damaševičius, R. Multimodal Hinglish tweet dataset for deep pragmatic analysis. Data. 9 (2), 38(2024).
  36. Hasan, M., Agu, E., Rundensteiner, E. Using hashtags as labels for supervised learning of emotions in Twitter messages. ACM SIGKDD Workshop Health Info. 34 (74), 1-8 (2014).
  37. Scherer, K. R., Wallbott, H. G. Evidence for universality and cultural variation of differential emotion response patterning. J Pers Soc Psychol. 66 (2), 310(1994).
  38. Sasidhar, T. T., Premjith, B., Soman, K. P. Emotion detection in Hinglish (Hindi+ English) code-mixed social media text. Procedia Comput Sci. 171, 1346-1352 (2020).
  39. Corpus creation and emotion prediction for Hindi-English code-mixed social media text. Vijay, D., et al. Proc. 2018 Conf. North Am Chapter Assoc Comput Linguistics: Student Research Workshop, , 128-135 (2018).
  40. Srivastava, V., Singh, M. Phinc: a parallel Hinglish social media code-mixed corpus for machine translation. arXiv. , (2004).
  41. Cossu, J. V., Molina-Villegas, A., Tello-Signoret, M. Active learning in annotating micro-blogs dealing with e-reputation. J Interdiscip Methodol Issues Sci. 3, (2017).
  42. Kranjc, J., et al. Active learning for sentiment analysis on data streams: methodology and workflow implementation in the ClowdFlows platform. Inf Process Manag. 51 (2), 187-203 (2015).
  43. Smith, C. A., Kirby, L. D. Consequences require antecedents: toward a process model of emotion elicitation. Feeling and Thinking: The Role of Affect in Social Cognition. , 83-106 (2000).
  44. Jan, T. G., Khurana, S. S., Kumar, M. Semi-supervised labeling: a proposed methodology for labeling the Twitter datasets. Multimed Tools Appl. 81 (6), 7669-7683 (2022).
  45. Cahyana, N. H., et al. Semi-supervised text annotation for hate speech detection using k-nearest neighbors and term frequency-inverse document frequency. Int J Adv Comput Sci Appl. 13 (10), 147-151 (2022).
  46. Saifullah, S., et al. Automated text annotation using a semi-supervised approach with meta vectorizer and machine learning algorithms for hate speech detection. Appl Sci. 14 (3), 1078(2024).
  47. Advani, L., Lu, C., Maharjan, S. C1 at SemEval-2020 Task 9: SentiMix: sentiment analysis for code-mixed social media text using feature engineering. arXiv. , (2008).
  48. Alarcão, S. M., et al. Annotate smarter, not harder: using active learning to reduce emotional annotation effort. IEEE Trans Affect Comput. 15 (3), 1213-1227 (2023).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Linguagem com Mistura de C digosAprendizagem AtivaDicion rio de Emo es Bil ngueTokeniza o de SubpalavrasTeoria da Avalia o CognitivaTeoria das Emo es Discretas
Vídeo em breve

Artigos relacionados