Исследовательская статья

Идентификация языков с низким уровнем ресурсов английского языка и предложений с кодом Кокборока

DOI:

10.3791/69130

2 января 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Цель данного протокола — правильно идентифицировать языки на уровне слов в тексте с кодовым смешанным английским и Kokborok с помощью неконтролируемой модели, объединяющей символьные n-граммы и частотные словари.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Существует растущая потребность в модели автоматического обнаружения языка на уровне слов из-за растущего использования многоязычного текста. Для выявления предложений с кодовым переключением и смешанным кодом на языке Кокборок и английском на уровне слов мы предлагаем модель без надзора. Было опубликовано множество исследований по тексту с кодовым смешиванием, в том числе для нескольких индийских языков. Однако, насколько нам известно, наша работа представляет собой новаторское усилие, поскольку мы первыми определили языки для пар языков с низким уровнем ресурсов — английский-кокборок. Мы применили метод, объединяющий данные из частотного словаря с данными модели символов n-грамм. Техника Витерби сочетает модель символа n-граммы Маркова с частотным лексиконом для помощи в точной идентификации языка на уровне слова. Предлагаемый метод показал хорошие результаты, с точностью на уровне слов 93,15%, что лучше, чем модель BiLSTM-CRF с 88,5% и базовая база на основе правил 85,3%. Это демонстрирует эффективность сочетания лексикона и статистической методологии для работы языков с низкими ресурсами без зависимости от огромных аннотированных наборов данных.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В эту цифровую эпоху стремительный рост многоязычной коммуникации на платформах социальных сетей становится центральным элементом глобальной коммуникации. Необходимость точного определения языков в текстовом содержании имеет первостепенное значение. После наблюдений мы обнаружили, что многие индийские языки, такие как хинди, бенгальский и телугу, уже исследованы в области идентификации языков, а другие индийские языки с низким уровнем ресурсов, такие как манипури, бодо и ассамский, частично изучены в исследованиях идентификации языков. Тем не менее, существует значительная исследовательская пробел в разработке моделей для Кокборок — малоресурсного языка, который отличается как лингвистически, так и структурно.

В отличие от манипурских, ассамских и бодо-языков с низкими ресурсами, кокборок отличается высоким уровнем орфографических различий и пишется на римском или бенгальском алфавите, часто взаимозаменяемо в общении. Это создаёт много неоднозначности в границах токенов, транслитерации и выделении признаков на уровне персонажей, что создаёт серьёзные трудности и редко рассматривалось в литературе. Кроме того, кокборок — агглютинативный язык, и его морфология включает богатые префиксы и суффиксы (например, -o, -do, -no) и фонемные тона, что усложняет применение существующих моделей идентификации языков с смешанными кодами, разработанных в отношении индоарийских языков.

Эти проблемы усугубляются социальными сетями. Носители кокборок часто склонны смешивать английские слова в текст не только для смешивания кода и переключения кодов, но и для компенсации недостающих лексических элементов в предложении Кокборока. Это приводит к нестандартным орфографиям и контекстно-ориентированному использованию слов, что является отступлением для правиловых или чисто лексических систем.

В данном исследовании эти пробелы устраняются за счёт предложения неконтролируемой модели, сочетающей частотные словари и вероятности n-граммов символов с концепцией декодирования Витерби. Метод особенно сосредоточен на орфографической, морфологической и контекстуальной сложности пары английский-кокборок, поэтому это одна из первых вычислительных попыток систематически обработать и обнаружить языковые барьеры на уровне слов в этом языке с ограниченными ресурсами.

ПРЕДЫСТОРИЯ КОКБОРОКА
Слова «Кок», обозначающее язык, и «Борок», подразумевающее человека, объединяются в составное слово «Кок-борок», обозначающее человека. Термин «Кок-борок» относится к языку, на котором говорят народ борок в Трипуре, а также жители соседних стран Бангладеш и Мьянмы, а также жители Мизорама, Манипура и Ассама. Язык кокборок, на котором в основном говорят в Трипуре, написан как на римском, так и на бенгальском алфавитах. Латинский алфавит предпочитается большинству носителей кокборока. На самом деле сино-тибетская лингвистическая подгруппа, известная как тибето-бирманский, является местом происхождения языка кокборок. Язык кокборок и бодо тонко похожи. 36 разновидностей языка кокборок имеют тонкие сходства как с бодо, так и с качари.

Колома была известна как оригинальное письмо Кокборока. Единственное государство в Индии, Трипура, находилось под контролем 184 человек до того, как оно было объединено в Индийский союз 15 октября 1949 года. Письмо Колома, найдённое в книге Раджаратнакар , использовалось для записи исторических повествовования. Позже, в XIV веке, два брахмана по имени Сукресвар и Ванешвар перевели язык на санскрит, а затем снова на бенгальскую письменность. Существуют гомофония основа, фонемный тон, морфология глаголов, порядок слов и суффиксы, производные от глаголов в языке кокборок.

Со временем Кокборок встречал такие языки, как английский, арабский, бенгальский, персидский и другие. В языке кокборок встречаются различные виды сложных агглютинативных структур. Люди, говорящие на Кокборок как на родном языке в Трипуре, не могут легко получить информацию, поскольку язык ещё не имеет широко распространённого письма, но над этим ведутся работа.

В Трипуре говорят на нескольких диалектах кокборока. В Трипуре говорят на различных диалектах, включая трипура/трипури, деббарму, реанг, джаматию, учаи, ноатию, лусай, куки, чаймал, халам, сантал, лепча, чакма, хасия, оранг, мог и гаро. Согласно отчёту переписи 2011 года, в Индии насчитывается 1 011 294 носителя на кокборок и более 400 000 человек в Бангладеш, соседней стране.

ОБЗОР ЛИТЕРАТУРЫ
Авторы описывают своё текущее исследование автоматической идентификации языка, используя новый набор данных из публикаций в Facebook с смешанными кодами на хинди, бенгали и английском. Они экспериментируют с различными методами, такими как словарные подходы и контролируемая классификация, для идентификации языка на уровне слова, подчёркивая важность учёта контекстуальных подсказок для точной идентификации языка в подобных условиях.

В статье представлен набор данных аннотированных твитов с целью выявления языка ненависти на платформах социальных сетей, используя сочетание кода на хинди и английском языках, использующее лексиконные, символические и словесныеметоды: 1. В статье представлен ошибочно-устойчивый метод категоризации текста на основе N-грамм. Во-первых, система используется для вычисления профилей с использованием данных обучающего набора, таких как образцы материалов или фраз групп новостей, отражающих различные категории. После этого система создаёт профиль для конкретного документа, который нужно классифицировать. Наконец, алгоритм вычисляет меру расстояния между профилем каждой категории и профилем документа. Категория, профиль которой ближе всего к профилю документа, выбираетсясистемой 2.

Для создания векторов признаков сравнивались несколько техник вложения слов, включая Continuous Bag of Words и Skip-Gram models. Adaboost, Random Forest, K-Nearest Neighbors, Naive-Bayes Gauss, Support Vector Machine и Logistic Regression показали хорошие результаты кросс-валидации3. Краткое изложение предыдущих подходов приведено в Таблице 1.

Используя лексиконные классификаторы, исследование превосходит существующие классификаторы по трём языковым парам, оценённым в исследовании: испанско-английский, голландско-английский и немецко-турецкий с использованием наборов данных в социальныхсетях 4. Подход исследования показывает повышенную устойчивость модели с точки зрения сходимости и согласованности результатов тестов, превосходя текущие методы анализа настроений в текстах с кодовым смешением на 3,31 процентаточности 5.

В своей фундаментальной работе статистическая идентификация языка Даннинга была впервые представлена Лабораторией вычислительных исследований Университета штата Нью-Мексико в Техническомотчёте 6. В этой статье анализируются различные типы контролируемого обучения с использованием модели Хидден Маркова, метода классификатора случайного леса, условного случайного поля и наивного классификатора Байеса на основе языковой пары англо-телугу кодовых смешанныхданных 7. Статья сосредоточена на индийских языках, включая английский, бодо и ассамский, а также обсуждается новый подход к распознаванию языков в коде-смешанном материале социальных сетей. Исследователи используют двунаправленную долговременную кратковременную память в модели глубокогообучения 8.

В этой работе они использовали значительный набор данных, относящийся к гуджаратскому языку, где гуджаратский язык смешан с английским и хинди. Они использовали различные классификаторы машинного обучения. Среди них классификатор опорного вектора показал лучшую точность — 92 процентаточности 9.

Лингвистическая основа используется на отдельной стадии классификации для различия между кодовым переключением и заимствованием голландско-английских твитов. Используя LID на основе правил, Support Vector Machines и классификаторы дерева решений, они узнают, что DTC (micro F1 = .95) и система LID на основе правил (micro F1 = .95) показывают лучшие10.

Производительность их модели оценивалась с использованием набора данных TRAC-1 по обнаружению агрессивности с кодовым коммутацией, набора данных Hinglish Offensive Tweet и набора 11 по классификации юмора. Для улучшения усвоения лексической информации взрослого языка через чтение был предложен вероятностный подход в качестве L2 методологии для создания текста с кодовымсмешиванием 12. Включается словарный модуль, который используется для проведения тестов различных контролируемых классификаторов с целью управления кодовым смешиваниемна уровне слов 13.

Они использовали различные метрики для анализа паттернов коммутации кода и обнаружили, что для моделей нейронных сетей на испанско-английском и хинди-английском показаны хуже моделей условных случайных полей (CRF) с разницей в 2,5 и 3,5 процентных пункта соответственно, 14.

Используя двуязычный лексикон и английский текст в качестве входных данных, метод строит факторный граф поверх лексических упоминаний, чтобы получить текст с переключением кода, оптимизирующий заданный параметр «обучаемости». В этой статье они стремятся лучше понять концепции инструментария CanVEC на основе языковых пар данных, переключаемых на хинди-английский. Они успешно достигли результата Формулы-1 с точностью 87,99процента (15,16).

Авторы сначала исследуют смешивание кода между гуджарати ианглийским 17, применяя трёхступенчатый конвейер для идентификации языка каждого токена, нормализации орфографии и обратно транслитерации сегментов в их родные письма. Затем они переключаются на корпус18 на хинди-английском, где вводят новые алгоритмы определения настроений, специально настроенные на билингвальные структуры предложений. Для поддержки контролируемых экспериментов они генерируют синтетический код-микс текста, обучая модели пропуска грамм на монолингвальных данных и смешиваявыходные данные 19.

Далее обрабатывается налет20 в социальных сетях на конкани-английском языке с помощью метода идентификации на уровне слов, основанного на правилах, обеспечивая надёжную производительность без ручной аннотации обучающихданных 21. Расширяя охват, одно исследование использует большой транслитерированный корпус английского, хинди, бенгальского и ассамского языков с платформ вроде Facebook22 для оценки различных методов тегирования на уровне слов. Основываясь на этом, другойфреймворк 23 динамически переключается между языками, чтобы с высокой точностью обнаруживать встроенные или заимствованные фразы. В сельскохозяйственной сфере комментарии на пенджабско-английском классифицируются по нескольким моделям — среди них классификатор n-грамм обеспечивает наилучшуюточность 24. Для сингальско-английского CMST сравниваются ансамблевые учащиеся (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression), при этом Random Forest занимает первое место25, а встраивания на уровне символов в сочетании с SVM дают сильные результаты на парах тамильско-английский и малаялам-английский26. Наконец, проектCrúbadán 27 представлен как масштабная инициатива по созданию недостаточно ресурсируемых языковых корпусов с помощью сканирования интернета, закладывая основу для будущих исследований по смешиванию кода.

Набор данныхКлючевые результатыТочность/F1-Score/Точность/Принцип/Воспоминание
Хинди-бенгальско-английский набор данных, взятых из публикаций в FacebookВыделены проблемы с идентификацией языка в социальных сетях на уровне слов Текст89.30%
Новостные статьи, документыЭффективно выполняется с использованием N-грамм для идентификации языка0.99%
Индийские наборы данных с смешанными кодамиДемонстрация хорошей точности в языковой идентификации на уровне словаНе сообщалось (NR)
Наборы данных на основе ВикипедииНадежное обнаружение кодовых коммутаторов на уровне токенаНе сообщалось (NR)
Твиты на хинди-английскомРезультаты улучшены в классификации настроений между хинди и английским код-смешанными языками0.78%
Многоязычные корпусаУстановленная базовая рамка идентификации языка78.00%
Code_mixed англо-телугу данныеCRF достиг наилучших результатов89.30%
Английский и бодо-кодовый текстДостигнута высокая точность слов92.00%
Код-смешанные гуджаратско-хинди письменные программыТочность языковой идентификации на уровне предложений составляет ≈92%.92.00%
Нидерландско-английские твитыDTC и модели на основе правил достигли F1 ≈0,9595.00%
Наборы данных с кодовым коммутированиемКонкурентоспособность между моделямиНе сообщалось (NR)
Синтетический код-смешанный текстУлучшенное лексическое обучениеНе сообщалось (NR)
Английский и каннада Кодовый текстЭффективный автоматический LIDНе сообщалось (NR)
TRAC-1, наборы данных ХинглишаCRF превзошла результаты в моделях нейронных сетей91.00%
Многоязычные онлайн-данныеТочная идентификация Lnague на уровне слова88.00%
Социальные сети на хинди-английском языкеВысокая точность в языковой идентификации хинди-английского языка0.93%
Английский и гуджаратский код — смешанныйЭффективная билингвальная обработка
Коды социальных медиа — смешанные наборы данныхУлучшенное обнаружение настроений0.90%
Синтетические данные, смешанные с кодомСильные вложенные представленияНе сообщалось (NR)
Текст социальных сетей на конкани и английском языке с кодовым смешанным текстомНадёжная производительность без аннотации0.89%
Набор данных Code-Mixed от TwitterУлучшенное обнаружение переключателей90.20%
Ассамский–бенгальский–хинди–английскийТочная многоязычная идентификация языка91.00%
Социальные сети Код-смешанный текстСчёт F1 ≈0,950.95%
Англо-пенджабские кодовые смешанные данныеN-граммовая модель показала наилучшие результаты0.88%
Сингальско-английские кодовые смешанные данныеRF достигла наилучшей точности0.92%
Комментарии в Facebook с кодом-смешаннымиУлучшенный LID на уровне слова0.93%
Корпус КрубаданПозволил исследовать языковые исследования с ограниченными ресурсамиНе сообщалось (NR)
Наборы данных с кодом и смешаннымХорошая производительность, показаная в словесной идентификации языка0.94%

Таблица 1: Краткое изложение литературы на смешанном языке.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Текст на английском и Kokborok был собран вручную из местных разговоров и публичных публикаций в социальных сетях. Не было собрано никакой личной или конфиденциальной информации. Все процедуры соответствовали институциональным этическим нормам.

3. Проектирование и внедрение

3.1 Алгоритм
3.1.1 Для каждого жетона в предложении (S):
a. С помощью частотного словаря рассчитывается лексическая вероятность Plexi .
b. На основе N-граммовой модели рассчитывается символическийсимволический символ вероятности P
c. взвешенная интерполяция обоих:
Pкомбинировано = λлекси Plexi + λchar P char
3.1.2. Комбинация вероятностей P,объединённая для каждого токена, была сохранена как вероятность излучения.
3.1.3. Применим алгоритм Витерби:
a. Заданные начальные с начальными языковыми вероятностями.
b. Для каждого жетона:
i. Вычислить переходP Count (продолжение на одном языке).
ипереключатель P (вероятность переключения языка).
ii. Выберите языковой путь и максимизируйте вероятность последовательности.
3.1.4. Вывести максимальную последовательность языка вероятностей L с наибольшей общей вероятностью.

3.2 Вычислительная среда
Реализация всех экспериментов проводилась с использованием Python 3.10 на платформе Google Colab. Система использовала набор базовых Python-пакетов, таких как NumPy, Pandas и Matplotlib, для обработки и визуализации данных, а также scikit-learn (v1.3) для статистических прогнозов и анализов. Интеграция с частотным словарем, моделирование n-грамм символов и декодирование Витерби были реализованы с помощью собственных скриптов на Python. Модель была обучена и протестирована на наборе из 10 000 предложений, с распределением 70/30 для обучения и тестирования.

3.3 Идентификация языка
После токенизации предложения модуль идентификации языка решает, находится ли каждый токен на Кокбороке или английском. Полная архитектура системы показана на рисунке 1. Это назначение языка затем используется для определения подходящих транскрипционных модулей. Объединяя данные из модели символов n-грамм и частотного словаря, определяется язык токена.

Из-за значительных орфографических различий между двумя вышеописанными языками классификатор, использующий только информацию из самого токена без контекстных признаков, уже показывает хорошие результаты. Однако после первоначального присвоения применяется другой классификатор с использованием алгоритма Витерби. Второй классификатор снижает неправильную классификацию межязычных омографов и отдаёт предпочтение группам слов, принадлежащим одному языку.

figure-protocol-1
Рисунок 1: Шаблоны на уровне слов и штрафные языковые переключатели с использованием алгоритмического ритма Витерби. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка. 

figure-protocol-2
Рисунок 2: Метод идентификации языков с помощью смешанных предложений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Мы собрали данные из корпуса Крубадана27 для словаря и модели иероглифов. В этом корпусе присутствуют многочисленные языки, включая многие языки меньшинств, такие как Кокборок.

Поскольку набор данных в корпусе Crúbadán недостаточен для нашей цели, мы протестировали новый набор данных Kokborok Bible. По сравнению с другими языками, доступных источников сравнительно мало. Соответственно, данные для смешанных предложений этой статьи были собраны из кокборок-говорящих WhatsApp-групп, таких как Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (EU), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, студенты Национального технологического института Borok, Information Yarung и Трипура Учой Youth Association (TUYA).

Всего с августа 2021 по декабрь 2023 года из этих WhatsApp-групп было собрано 10 000 смешанных предложений на кокборок и английском языках. Источники и распределение доменов набора данных приведены в Таблице 2.

НазваниеОбщее количество слов
Библейские слова Кокборока718883
Английский и кокборок — смешанные предложения68789

Таблица 2: Общее количество слов Кокборок.

ЯзыкОбщее количество жетонов
Кокборок (trp)711509
Английский (англ.)1767141

Таблица 3: Модель символа 2 грамма.

Сл. НетИспользуемые предложения Total Code-Mix
110,768

Таблица 4: Общее количество тренированных смешанных предложений.

Модель иероглифов и словарь были взяты из корпуса Crúbadán27. Эта коллекция, доступная для широкого круга языков, включая многочисленные языки меньшинств, создаётся автоматически путем поиска материалов на целевом языке в интернете. Корпус Кокборока в частности довольно мал, потому что подход изначально был создан именно для Кокборока.

Хотя корпус Kokborok и English также доступен, его намеренно не использовали из-за нехватки наборов данных, особенно в плане смешивания кода и переворота кода. В корпусе Кокборок также есть несколько английских терминов; некоторые из этих слов (включая no, do и o) встречаются чаще, чем в английском корпусе.

Словарь и языковая модель выполняют задачу маркировки отдельных слов. Наша задача сопоставима с задачей Кинга и др.28.

Лексическая (lex), символ (ch) и вероятности метки слова используются для создания линейной интерполяции между частотами лексических (ch) и лексических (lex) компонентов. Совокупная (гребня) вероятность, полученная из этого, показана в уравнении (1) ниже; подробные параметры интерполяции приведены в таблице 3. Стратегия интерполяции показана на рисунке 2.

Pкомбинированное = λлекси · Plexi + λchar · Pchar (1)

где 0 ≤ λlexi, λchar ≤ 1; и λlexi + λchar = 1. Слова без лексической основы имеют чрезвычайно низкую, но ненулёвую лексическую вероятность. Предположительно, если слово отсутствует в обоих лексиконных языках, для реализации используется модель символов вместо лексической вероятности, даже если λlexi = 1.

Наш метод разработки модели характера основан на n-граммовой цепи Маркова Даннинга (1994). Это достигается путём подсчёта n-граммов в начале и конце токенов соответственно, чтобы оценить начальную и переходную вероятности.

Ниже приведено сравнение производительности обученных моделей весом 2 и 4 грамма.

figure-protocol-3   (2)

figure-protocol-4·

figure-protocol-5 (3)

Начальные и переходные слова вероятности можно умножить, чтобы получить вероятность слова с использованием языковой модели (4).

P(〈w1w2w3〉) = Pinitial(〈w1w2) · Pпереход (c3|〈w1w2) · Pпереход(〉|w1w2w3) (4)

Язык Кокборок очень богат префиксами и суффиксами и является морфологически агглютинативным языком, где к базовым словам добавляются суффиксы, такие как «о», «до» и «нет». 2-грамм помогает эффективно фиксировать локальные морфологические переходы на границах аффиксов, тогда как 4-грамм может захватить те слова Кокборока, которые имеют более длительные орфографические зависимости, встречающиеся в корневых и сложных словах, таких как Phailaidido, Thanlainai и Mwchangkha.

Это относится к большому корпусу, что увеличивает вероятность возникновения нескольких проблем с разреженностью данных. Кроме того, комбинация символов может встречаться не во всех случаях, что может привести к нулю. Для решения подобных задач используется лямбда-сглаживание, присваивая каждому n-грамму, содержащему невидимые символы, небольшое значение с ненулевой вероятностью. Значение лямбды установлено на уровне 0,001.

figure-protocol-6  (5)

где N = обозначает количество различных наблюдений в n-граммах.

figure-protocol-7   (6)

где D= — число обнаруженных различий в n-граммах. Предполагается, что вероятность ненаблюдаемого n-грамма одинакова.

figure-protocol-8   (7)

где C указывает размер символа.

Начальные значения Pcount, λlexi и λchar были эмпирически заданы с помощью частотного анализа корпусов Kokborok и English. Во-первых, мы инициализировали λlexi до 0,5 и взвесили как лексические, так и символьные вероятности, таким образом делая оба одинаково вносящими вклад в первый запуск. Такой уровень инициализации позволил нам определить сравнительную роль лексикона и модели символов n-грамм между наборами данных.

Параметр перехода Pcount (продолжающийся на том же языке) был установлен на 0.6, исходя из отношения монолингвальных последовательностей к точкам переключения в ручной помеченной базе данных. Эти значения служили хорошей отправной точкой для сходимости во время настройки. Затем были проведены уточнения всех параметров с помощью серии повторных испытаний для максимизации коэффициента корреляции Мэттьюса (MCC), который подробно описан в разделе «Результаты».

Контекстуальная идентификация
Контекстная модель использует вероятности, уже инициализированные (Pcount и Pswitch) на этапе независимой идентификации, и уточняет их с помощью декодирования последовательностей Витерби, чтобы уменьшить несоответствия переходов и оптимально обнаружить переключение языка.

Аналитический результат языковой модели зависит от контекста и в основном получается путём объединения текущего токена с последующим токеном и использования как предыдущих, так и текущих токенов. Поскольку существует вероятность, что два слова с одинаковым значением частоты будут иметь схожие значения и вызывать неправильную классификацию, для поиска терминов сходства, присутствующих в обоих языках, был использован контекстно-зависимый подход.

Некоторые слова, такие как «no», «do», «o», «are», «da (day)», «go», «sa (say)», «rose», «ring» и многие другие, схожи в обоих языках. В результате бывает довольно сложно определить правильный язык, когда возникает такая неоднозначность, и иногда языки классифицируются неправильно.

Для решения этих проблем идентификации языка мы представили набор языковых моделей с использованием дискриминативной Скрытой марковой модели и контролируемого машинного обучения. Предполагается, что вероятность перехода для обоих языков совпадает. Для Pcount на том же языке основным параметром является непрерывная вероятность, который необходимо объявить. С помощью этого мы можем рассчитать вероятность смены языка.

Переключатель P = 1 − Pcount (8)

Контекстная классификация по пути Витерби показана на рисунке 3. Цель алгоритма Витерби — определить, какой из языков последовательностей токенов является лучшим по данным Pcount и Pswitch.

Алгоритм Витерби применяется к контекстной классификации. Pcount и Pswitch используются для обозначения рёбер, а узлы маркируются относительной вероятностью, приданной первым классификатором.

Из-за более высокой вероятности использования языка Кокборок, пунктирный путь выбирался бы, если бы использовался только первый классификатор и не было доступной контекстной информации.

Влияние контекстной корректировки визуализировано на рисунке 4. Это показывает, что при отсутствии контекстуальной информации второе, третье и пятое слова фразы «Next week o phaisidi do» ошибочно идентифицируются как английские (en) (пунктирный путь). Хотя вероятности для английского немного выше, относительные значения близки.

Два смена языка будут наказаны, и вероятность последовательности будет ниже оптимального пути алгоритма Витерби, если учитывать вероятности переходов. Таким образом, только слова, которые значительно чаще происходят из другого языка — а не обычные термины, встречающиеся в обоих, могут вызывать изменения языка в коротких последовательностях.

Коэффициент корреляции Мэттьюса был выбран в качестве оценочной метрики, поскольку по сравнению с другими метриками, такими как точность, воспоминание и точность, он значительно более подходит для задач бинарной классификации, учитывая истинные положительные и истинные отрицательные результаты, а также ложноположительные и ложноотрицательные результаты.

figure-protocol-9   (9)

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В таблице 4 мы показали результаты MCC и настройки параметров для Ptrp, которые рассчитывали начальное смещение в пользу начальных последовательностей с помощью слов Кокборока и рассчитывали Pcount, то есть вероятность продолжения работы на том же языке.

...
λ_lexPcount = 0,66Pcount = 0.70Pcount = 0,74Pcount = 0,79

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Хотя предлагаемая модель демонстрирует точность 93,15 % на уровне слов, тщательный анализ ошибок выявляет несколько повторяющихся закономерностей, подчёркивающих сложности идентификации смешанного языка между английским и Кокбороком.

Использование заимствованных слов и неоднозначных слов
Значительная часть ошибок связана с использованием заимствованных английских слов, которые стали распространёнными в кокборок. Слова в...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликта интересов, которые можно было бы заявлять.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мы хотели бы поблагодарить местных носителей языка, группы WhatsApp, организации, студенческие союзы и Библейское общество Индии за помощь в получении необработанных наборов предложений с кодом. Мы также благодарны кафедре компьютерных наук и инженерии Национального технологического института Аруначал-Прадеш и Университету Lovely Professional за предоставленную платформу для анализа и тестирования нашего набора данных.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Raspberry Pi 4Фонд Raspberry PiRPI4-MODBP-4GBИспользуется для обработки языков с низкими ресурсами
MicroSD-карта 64 ГБSanDiskSDSQUAR-064G-GN6MAДля хранения ОС и наборов данных
Блок питания 5V/3AОфициальный Raspberry PiSC0218Для питания платы Pi
USB-микрофонБояBY-M1Для аудиоввода в сбор данных на языке
Монитор (HDMI)LG22MK600MВыходной дисплей во время испытаний
Клавишные и Мышиная комбинацияLogitechMK270Управление интерфейсом
WiFi-донгл (если Pi 3)TP-LinkTL-WN725NБеспроводная передача данных (если нет встроенного Wi-Fi)
Python IDE (Thonny)Открытый исходный код-IDE для программирования
Набор данных LexiconИзготовление на заказ-Пара Кокборок-англоязычный язык
N-граммовый набор данныхИзготовление на заказАнгло-Кокборок языковая пара
Код-микс и код-коммутаторИзготовление на заказ10 000 предложенийСобрано из текстов в социальных сетях, Grouops в Whatsapp, НПО, БИБЛИИ и других

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

n
Видео скоро будет доступно

Похожие статьи