Цель данного протокола — правильно идентифицировать языки на уровне слов в тексте с кодовым смешанным английским и Kokborok с помощью неконтролируемой модели, объединяющей символьные n-граммы и частотные словари.
Исследовательская статья
Цель данного протокола — правильно идентифицировать языки на уровне слов в тексте с кодовым смешанным английским и Kokborok с помощью неконтролируемой модели, объединяющей символьные n-граммы и частотные словари.
Существует растущая потребность в модели автоматического обнаружения языка на уровне слов из-за растущего использования многоязычного текста. Для выявления предложений с кодовым переключением и смешанным кодом на языке Кокборок и английском на уровне слов мы предлагаем модель без надзора. Было опубликовано множество исследований по тексту с кодовым смешиванием, в том числе для нескольких индийских языков. Однако, насколько нам известно, наша работа представляет собой новаторское усилие, поскольку мы первыми определили языки для пар языков с низким уровнем ресурсов — английский-кокборок. Мы применили метод, объединяющий данные из частотного словаря с данными модели символов n-грамм. Техника Витерби сочетает модель символа n-граммы Маркова с частотным лексиконом для помощи в точной идентификации языка на уровне слова. Предлагаемый метод показал хорошие результаты, с точностью на уровне слов 93,15%, что лучше, чем модель BiLSTM-CRF с 88,5% и базовая база на основе правил 85,3%. Это демонстрирует эффективность сочетания лексикона и статистической методологии для работы языков с низкими ресурсами без зависимости от огромных аннотированных наборов данных.
В эту цифровую эпоху стремительный рост многоязычной коммуникации на платформах социальных сетей становится центральным элементом глобальной коммуникации. Необходимость точного определения языков в текстовом содержании имеет первостепенное значение. После наблюдений мы обнаружили, что многие индийские языки, такие как хинди, бенгальский и телугу, уже исследованы в области идентификации языков, а другие индийские языки с низким уровнем ресурсов, такие как манипури, бодо и ассамский, частично изучены в исследованиях идентификации языков. Тем не менее, существует значительная исследовательская пробел в разработке моделей для Кокборок — малоресурсного языка, который отличается как лингвистически, так и структурно.
В отличие от манипурских, ассамских и бодо-языков с низкими ресурсами, кокборок отличается высоким уровнем орфографических различий и пишется на римском или бенгальском алфавите, часто взаимозаменяемо в общении. Это создаёт много неоднозначности в границах токенов, транслитерации и выделении признаков на уровне персонажей, что создаёт серьёзные трудности и редко рассматривалось в литературе. Кроме того, кокборок — агглютинативный язык, и его морфология включает богатые префиксы и суффиксы (например, -o, -do, -no) и фонемные тона, что усложняет применение существующих моделей идентификации языков с смешанными кодами, разработанных в отношении индоарийских языков.
Эти проблемы усугубляются социальными сетями. Носители кокборок часто склонны смешивать английские слова в текст не только для смешивания кода и переключения кодов, но и для компенсации недостающих лексических элементов в предложении Кокборока. Это приводит к нестандартным орфографиям и контекстно-ориентированному использованию слов, что является отступлением для правиловых или чисто лексических систем.
В данном исследовании эти пробелы устраняются за счёт предложения неконтролируемой модели, сочетающей частотные словари и вероятности n-граммов символов с концепцией декодирования Витерби. Метод особенно сосредоточен на орфографической, морфологической и контекстуальной сложности пары английский-кокборок, поэтому это одна из первых вычислительных попыток систематически обработать и обнаружить языковые барьеры на уровне слов в этом языке с ограниченными ресурсами.
ПРЕДЫСТОРИЯ КОКБОРОКА
Слова «Кок», обозначающее язык, и «Борок», подразумевающее человека, объединяются в составное слово «Кок-борок», обозначающее человека. Термин «Кок-борок» относится к языку, на котором говорят народ борок в Трипуре, а также жители соседних стран Бангладеш и Мьянмы, а также жители Мизорама, Манипура и Ассама. Язык кокборок, на котором в основном говорят в Трипуре, написан как на римском, так и на бенгальском алфавитах. Латинский алфавит предпочитается большинству носителей кокборока. На самом деле сино-тибетская лингвистическая подгруппа, известная как тибето-бирманский, является местом происхождения языка кокборок. Язык кокборок и бодо тонко похожи. 36 разновидностей языка кокборок имеют тонкие сходства как с бодо, так и с качари.
Колома была известна как оригинальное письмо Кокборока. Единственное государство в Индии, Трипура, находилось под контролем 184 человек до того, как оно было объединено в Индийский союз 15 октября 1949 года. Письмо Колома, найдённое в книге Раджаратнакар , использовалось для записи исторических повествовования. Позже, в XIV веке, два брахмана по имени Сукресвар и Ванешвар перевели язык на санскрит, а затем снова на бенгальскую письменность. Существуют гомофония основа, фонемный тон, морфология глаголов, порядок слов и суффиксы, производные от глаголов в языке кокборок.
Со временем Кокборок встречал такие языки, как английский, арабский, бенгальский, персидский и другие. В языке кокборок встречаются различные виды сложных агглютинативных структур. Люди, говорящие на Кокборок как на родном языке в Трипуре, не могут легко получить информацию, поскольку язык ещё не имеет широко распространённого письма, но над этим ведутся работа.
В Трипуре говорят на нескольких диалектах кокборока. В Трипуре говорят на различных диалектах, включая трипура/трипури, деббарму, реанг, джаматию, учаи, ноатию, лусай, куки, чаймал, халам, сантал, лепча, чакма, хасия, оранг, мог и гаро. Согласно отчёту переписи 2011 года, в Индии насчитывается 1 011 294 носителя на кокборок и более 400 000 человек в Бангладеш, соседней стране.
ОБЗОР ЛИТЕРАТУРЫ
Авторы описывают своё текущее исследование автоматической идентификации языка, используя новый набор данных из публикаций в Facebook с смешанными кодами на хинди, бенгали и английском. Они экспериментируют с различными методами, такими как словарные подходы и контролируемая классификация, для идентификации языка на уровне слова, подчёркивая важность учёта контекстуальных подсказок для точной идентификации языка в подобных условиях.
В статье представлен набор данных аннотированных твитов с целью выявления языка ненависти на платформах социальных сетей, используя сочетание кода на хинди и английском языках, использующее лексиконные, символические и словесныеметоды: 1. В статье представлен ошибочно-устойчивый метод категоризации текста на основе N-грамм. Во-первых, система используется для вычисления профилей с использованием данных обучающего набора, таких как образцы материалов или фраз групп новостей, отражающих различные категории. После этого система создаёт профиль для конкретного документа, который нужно классифицировать. Наконец, алгоритм вычисляет меру расстояния между профилем каждой категории и профилем документа. Категория, профиль которой ближе всего к профилю документа, выбираетсясистемой 2.
Для создания векторов признаков сравнивались несколько техник вложения слов, включая Continuous Bag of Words и Skip-Gram models. Adaboost, Random Forest, K-Nearest Neighbors, Naive-Bayes Gauss, Support Vector Machine и Logistic Regression показали хорошие результаты кросс-валидации3. Краткое изложение предыдущих подходов приведено в Таблице 1.
Используя лексиконные классификаторы, исследование превосходит существующие классификаторы по трём языковым парам, оценённым в исследовании: испанско-английский, голландско-английский и немецко-турецкий с использованием наборов данных в социальныхсетях 4. Подход исследования показывает повышенную устойчивость модели с точки зрения сходимости и согласованности результатов тестов, превосходя текущие методы анализа настроений в текстах с кодовым смешением на 3,31 процентаточности 5.
В своей фундаментальной работе статистическая идентификация языка Даннинга была впервые представлена Лабораторией вычислительных исследований Университета штата Нью-Мексико в Техническомотчёте 6. В этой статье анализируются различные типы контролируемого обучения с использованием модели Хидден Маркова, метода классификатора случайного леса, условного случайного поля и наивного классификатора Байеса на основе языковой пары англо-телугу кодовых смешанныхданных 7. Статья сосредоточена на индийских языках, включая английский, бодо и ассамский, а также обсуждается новый подход к распознаванию языков в коде-смешанном материале социальных сетей. Исследователи используют двунаправленную долговременную кратковременную память в модели глубокогообучения 8.
В этой работе они использовали значительный набор данных, относящийся к гуджаратскому языку, где гуджаратский язык смешан с английским и хинди. Они использовали различные классификаторы машинного обучения. Среди них классификатор опорного вектора показал лучшую точность — 92 процентаточности 9.
Лингвистическая основа используется на отдельной стадии классификации для различия между кодовым переключением и заимствованием голландско-английских твитов. Используя LID на основе правил, Support Vector Machines и классификаторы дерева решений, они узнают, что DTC (micro F1 = .95) и система LID на основе правил (micro F1 = .95) показывают лучшие10.
Производительность их модели оценивалась с использованием набора данных TRAC-1 по обнаружению агрессивности с кодовым коммутацией, набора данных Hinglish Offensive Tweet и набора 11 по классификации юмора. Для улучшения усвоения лексической информации взрослого языка через чтение был предложен вероятностный подход в качестве L2 методологии для создания текста с кодовымсмешиванием 12. Включается словарный модуль, который используется для проведения тестов различных контролируемых классификаторов с целью управления кодовым смешиваниемна уровне слов 13.
Они использовали различные метрики для анализа паттернов коммутации кода и обнаружили, что для моделей нейронных сетей на испанско-английском и хинди-английском показаны хуже моделей условных случайных полей (CRF) с разницей в 2,5 и 3,5 процентных пункта соответственно, 14.
Используя двуязычный лексикон и английский текст в качестве входных данных, метод строит факторный граф поверх лексических упоминаний, чтобы получить текст с переключением кода, оптимизирующий заданный параметр «обучаемости». В этой статье они стремятся лучше понять концепции инструментария CanVEC на основе языковых пар данных, переключаемых на хинди-английский. Они успешно достигли результата Формулы-1 с точностью 87,99процента (15,16).
Авторы сначала исследуют смешивание кода между гуджарати ианглийским 17, применяя трёхступенчатый конвейер для идентификации языка каждого токена, нормализации орфографии и обратно транслитерации сегментов в их родные письма. Затем они переключаются на корпус18 на хинди-английском, где вводят новые алгоритмы определения настроений, специально настроенные на билингвальные структуры предложений. Для поддержки контролируемых экспериментов они генерируют синтетический код-микс текста, обучая модели пропуска грамм на монолингвальных данных и смешиваявыходные данные 19.
Далее обрабатывается налет20 в социальных сетях на конкани-английском языке с помощью метода идентификации на уровне слов, основанного на правилах, обеспечивая надёжную производительность без ручной аннотации обучающихданных 21. Расширяя охват, одно исследование использует большой транслитерированный корпус английского, хинди, бенгальского и ассамского языков с платформ вроде Facebook22 для оценки различных методов тегирования на уровне слов. Основываясь на этом, другойфреймворк 23 динамически переключается между языками, чтобы с высокой точностью обнаруживать встроенные или заимствованные фразы. В сельскохозяйственной сфере комментарии на пенджабско-английском классифицируются по нескольким моделям — среди них классификатор n-грамм обеспечивает наилучшуюточность 24. Для сингальско-английского CMST сравниваются ансамблевые учащиеся (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression), при этом Random Forest занимает первое место25, а встраивания на уровне символов в сочетании с SVM дают сильные результаты на парах тамильско-английский и малаялам-английский26. Наконец, проектCrúbadán 27 представлен как масштабная инициатива по созданию недостаточно ресурсируемых языковых корпусов с помощью сканирования интернета, закладывая основу для будущих исследований по смешиванию кода.
| Набор данных | Ключевые результаты | Точность/F1-Score/Точность/Принцип/Воспоминание |
| Хинди-бенгальско-английский набор данных, взятых из публикаций в Facebook | Выделены проблемы с идентификацией языка в социальных сетях на уровне слов Текст | 89.30% |
| Новостные статьи, документы | Эффективно выполняется с использованием N-грамм для идентификации языка | 0.99% |
| Индийские наборы данных с смешанными кодами | Демонстрация хорошей точности в языковой идентификации на уровне слова | Не сообщалось (NR) |
| Наборы данных на основе Википедии | Надежное обнаружение кодовых коммутаторов на уровне токена | Не сообщалось (NR) |
| Твиты на хинди-английском | Результаты улучшены в классификации настроений между хинди и английским код-смешанными языками | 0.78% |
| Многоязычные корпуса | Установленная базовая рамка идентификации языка | 78.00% |
| Code_mixed англо-телугу данные | CRF достиг наилучших результатов | 89.30% |
| Английский и бодо-кодовый текст | Достигнута высокая точность слов | 92.00% |
| Код-смешанные гуджаратско-хинди письменные программы | Точность языковой идентификации на уровне предложений составляет ≈92%. | 92.00% |
| Нидерландско-английские твиты | DTC и модели на основе правил достигли F1 ≈0,95 | 95.00% |
| Наборы данных с кодовым коммутированием | Конкурентоспособность между моделями | Не сообщалось (NR) |
| Синтетический код-смешанный текст | Улучшенное лексическое обучение | Не сообщалось (NR) |
| Английский и каннада Кодовый текст | Эффективный автоматический LID | Не сообщалось (NR) |
| TRAC-1, наборы данных Хинглиша | CRF превзошла результаты в моделях нейронных сетей | 91.00% |
| Многоязычные онлайн-данные | Точная идентификация Lnague на уровне слова | 88.00% |
| Социальные сети на хинди-английском языке | Высокая точность в языковой идентификации хинди-английского языка | 0.93% |
| Английский и гуджаратский код — смешанный | Эффективная билингвальная обработка | |
| Коды социальных медиа — смешанные наборы данных | Улучшенное обнаружение настроений | 0.90% |
| Синтетические данные, смешанные с кодом | Сильные вложенные представления | Не сообщалось (NR) |
| Текст социальных сетей на конкани и английском языке с кодовым смешанным текстом | Надёжная производительность без аннотации | 0.89% |
| Набор данных Code-Mixed от Twitter | Улучшенное обнаружение переключателей | 90.20% |
| Ассамский–бенгальский–хинди–английский | Точная многоязычная идентификация языка | 91.00% |
| Социальные сети Код-смешанный текст | Счёт F1 ≈0,95 | 0.95% |
| Англо-пенджабские кодовые смешанные данные | N-граммовая модель показала наилучшие результаты | 0.88% |
| Сингальско-английские кодовые смешанные данные | RF достигла наилучшей точности | 0.92% |
| Комментарии в Facebook с кодом-смешанными | Улучшенный LID на уровне слова | 0.93% |
| Корпус Крубадан | Позволил исследовать языковые исследования с ограниченными ресурсами | Не сообщалось (NR) |
| Наборы данных с кодом и смешанным | Хорошая производительность, показаная в словесной идентификации языка | 0.94% |
Таблица 1: Краткое изложение литературы на смешанном языке.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Текст на английском и Kokborok был собран вручную из местных разговоров и публичных публикаций в социальных сетях. Не было собрано никакой личной или конфиденциальной информации. Все процедуры соответствовали институциональным этическим нормам.
3. Проектирование и внедрение
3.1 Алгоритм
3.1.1 Для каждого жетона в предложении (S):
a. С помощью частотного словаря рассчитывается лексическая вероятность Plexi .
b. На основе N-граммовой модели рассчитывается символическийсимволический символ вероятности P
c. взвешенная интерполяция обоих:
Pкомбинировано = λлекси Plexi + λchar P char
3.1.2. Комбинация вероятностей P,объединённая для каждого токена, была сохранена как вероятность излучения.
3.1.3. Применим алгоритм Витерби:
a. Заданные начальные с начальными языковыми вероятностями.
b. Для каждого жетона:
i. Вычислить переходP Count (продолжение на одном языке).
ипереключатель P (вероятность переключения языка).
ii. Выберите языковой путь и максимизируйте вероятность последовательности.
3.1.4. Вывести максимальную последовательность языка вероятностей L с наибольшей общей вероятностью.
3.2 Вычислительная среда
Реализация всех экспериментов проводилась с использованием Python 3.10 на платформе Google Colab. Система использовала набор базовых Python-пакетов, таких как NumPy, Pandas и Matplotlib, для обработки и визуализации данных, а также scikit-learn (v1.3) для статистических прогнозов и анализов. Интеграция с частотным словарем, моделирование n-грамм символов и декодирование Витерби были реализованы с помощью собственных скриптов на Python. Модель была обучена и протестирована на наборе из 10 000 предложений, с распределением 70/30 для обучения и тестирования.
3.3 Идентификация языка
После токенизации предложения модуль идентификации языка решает, находится ли каждый токен на Кокбороке или английском. Полная архитектура системы показана на рисунке 1. Это назначение языка затем используется для определения подходящих транскрипционных модулей. Объединяя данные из модели символов n-грамм и частотного словаря, определяется язык токена.
Из-за значительных орфографических различий между двумя вышеописанными языками классификатор, использующий только информацию из самого токена без контекстных признаков, уже показывает хорошие результаты. Однако после первоначального присвоения применяется другой классификатор с использованием алгоритма Витерби. Второй классификатор снижает неправильную классификацию межязычных омографов и отдаёт предпочтение группам слов, принадлежащим одному языку.

Рисунок 1: Шаблоны на уровне слов и штрафные языковые переключатели с использованием алгоритмического ритма Витерби. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 2: Метод идентификации языков с помощью смешанных предложений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.
Мы собрали данные из корпуса Крубадана27 для словаря и модели иероглифов. В этом корпусе присутствуют многочисленные языки, включая многие языки меньшинств, такие как Кокборок.
Поскольку набор данных в корпусе Crúbadán недостаточен для нашей цели, мы протестировали новый набор данных Kokborok Bible. По сравнению с другими языками, доступных источников сравнительно мало. Соответственно, данные для смешанных предложений этой статьи были собраны из кокборок-говорящих WhatsApp-групп, таких как Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (EU), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, студенты Национального технологического института Borok, Information Yarung и Трипура Учой Youth Association (TUYA).
Всего с августа 2021 по декабрь 2023 года из этих WhatsApp-групп было собрано 10 000 смешанных предложений на кокборок и английском языках. Источники и распределение доменов набора данных приведены в Таблице 2.
| Название | Общее количество слов |
| Библейские слова Кокборока | 718883 |
| Английский и кокборок — смешанные предложения | 68789 |
Таблица 2: Общее количество слов Кокборок.
| Язык | Общее количество жетонов |
| Кокборок (trp) | 711509 |
| Английский (англ.) | 1767141 |
Таблица 3: Модель символа 2 грамма.
| Сл. Нет | Используемые предложения Total Code-Mix |
| 1 | 10,768 |
Таблица 4: Общее количество тренированных смешанных предложений.
Модель иероглифов и словарь были взяты из корпуса Crúbadán27. Эта коллекция, доступная для широкого круга языков, включая многочисленные языки меньшинств, создаётся автоматически путем поиска материалов на целевом языке в интернете. Корпус Кокборока в частности довольно мал, потому что подход изначально был создан именно для Кокборока.
Хотя корпус Kokborok и English также доступен, его намеренно не использовали из-за нехватки наборов данных, особенно в плане смешивания кода и переворота кода. В корпусе Кокборок также есть несколько английских терминов; некоторые из этих слов (включая no, do и o) встречаются чаще, чем в английском корпусе.
Словарь и языковая модель выполняют задачу маркировки отдельных слов. Наша задача сопоставима с задачей Кинга и др.28.
Лексическая (lex), символ (ch) и вероятности метки слова используются для создания линейной интерполяции между частотами лексических (ch) и лексических (lex) компонентов. Совокупная (гребня) вероятность, полученная из этого, показана в уравнении (1) ниже; подробные параметры интерполяции приведены в таблице 3. Стратегия интерполяции показана на рисунке 2.
Pкомбинированное = λлекси · Plexi + λchar · Pchar (1)
где 0 ≤ λlexi, λchar ≤ 1; и λlexi + λchar = 1. Слова без лексической основы имеют чрезвычайно низкую, но ненулёвую лексическую вероятность. Предположительно, если слово отсутствует в обоих лексиконных языках, для реализации используется модель символов вместо лексической вероятности, даже если λlexi = 1.
Наш метод разработки модели характера основан на n-граммовой цепи Маркова Даннинга (1994). Это достигается путём подсчёта n-граммов в начале и конце токенов соответственно, чтобы оценить начальную и переходную вероятности.
Ниже приведено сравнение производительности обученных моделей весом 2 и 4 грамма.
(2)
·
(3)
Начальные и переходные слова вероятности можно умножить, чтобы получить вероятность слова с использованием языковой модели (4).
P(〈w1w2w3〉) = Pinitial(〈w1w2) · Pпереход (c3|〈w1w2) · Pпереход(〉|w1w2w3) (4)
Язык Кокборок очень богат префиксами и суффиксами и является морфологически агглютинативным языком, где к базовым словам добавляются суффиксы, такие как «о», «до» и «нет». 2-грамм помогает эффективно фиксировать локальные морфологические переходы на границах аффиксов, тогда как 4-грамм может захватить те слова Кокборока, которые имеют более длительные орфографические зависимости, встречающиеся в корневых и сложных словах, таких как Phailaidido, Thanlainai и Mwchangkha.
Это относится к большому корпусу, что увеличивает вероятность возникновения нескольких проблем с разреженностью данных. Кроме того, комбинация символов может встречаться не во всех случаях, что может привести к нулю. Для решения подобных задач используется лямбда-сглаживание, присваивая каждому n-грамму, содержащему невидимые символы, небольшое значение с ненулевой вероятностью. Значение лямбды установлено на уровне 0,001.
(5)
где N = обозначает количество различных наблюдений в n-граммах.
(6)
где D= — число обнаруженных различий в n-граммах. Предполагается, что вероятность ненаблюдаемого n-грамма одинакова.
(7)
где C указывает размер символа.
Начальные значения Pcount, λlexi и λchar были эмпирически заданы с помощью частотного анализа корпусов Kokborok и English. Во-первых, мы инициализировали λlexi до 0,5 и взвесили как лексические, так и символьные вероятности, таким образом делая оба одинаково вносящими вклад в первый запуск. Такой уровень инициализации позволил нам определить сравнительную роль лексикона и модели символов n-грамм между наборами данных.
Параметр перехода Pcount (продолжающийся на том же языке) был установлен на 0.6, исходя из отношения монолингвальных последовательностей к точкам переключения в ручной помеченной базе данных. Эти значения служили хорошей отправной точкой для сходимости во время настройки. Затем были проведены уточнения всех параметров с помощью серии повторных испытаний для максимизации коэффициента корреляции Мэттьюса (MCC), который подробно описан в разделе «Результаты».
Контекстуальная идентификация
Контекстная модель использует вероятности, уже инициализированные (Pcount и Pswitch) на этапе независимой идентификации, и уточняет их с помощью декодирования последовательностей Витерби, чтобы уменьшить несоответствия переходов и оптимально обнаружить переключение языка.
Аналитический результат языковой модели зависит от контекста и в основном получается путём объединения текущего токена с последующим токеном и использования как предыдущих, так и текущих токенов. Поскольку существует вероятность, что два слова с одинаковым значением частоты будут иметь схожие значения и вызывать неправильную классификацию, для поиска терминов сходства, присутствующих в обоих языках, был использован контекстно-зависимый подход.
Некоторые слова, такие как «no», «do», «o», «are», «da (day)», «go», «sa (say)», «rose», «ring» и многие другие, схожи в обоих языках. В результате бывает довольно сложно определить правильный язык, когда возникает такая неоднозначность, и иногда языки классифицируются неправильно.
Для решения этих проблем идентификации языка мы представили набор языковых моделей с использованием дискриминативной Скрытой марковой модели и контролируемого машинного обучения. Предполагается, что вероятность перехода для обоих языков совпадает. Для Pcount на том же языке основным параметром является непрерывная вероятность, который необходимо объявить. С помощью этого мы можем рассчитать вероятность смены языка.
Переключатель P = 1 − Pcount (8)
Контекстная классификация по пути Витерби показана на рисунке 3. Цель алгоритма Витерби — определить, какой из языков последовательностей токенов является лучшим по данным Pcount и Pswitch.
Алгоритм Витерби применяется к контекстной классификации. Pcount и Pswitch используются для обозначения рёбер, а узлы маркируются относительной вероятностью, приданной первым классификатором.
Из-за более высокой вероятности использования языка Кокборок, пунктирный путь выбирался бы, если бы использовался только первый классификатор и не было доступной контекстной информации.
Влияние контекстной корректировки визуализировано на рисунке 4. Это показывает, что при отсутствии контекстуальной информации второе, третье и пятое слова фразы «Next week o phaisidi do» ошибочно идентифицируются как английские (en) (пунктирный путь). Хотя вероятности для английского немного выше, относительные значения близки.
Два смена языка будут наказаны, и вероятность последовательности будет ниже оптимального пути алгоритма Витерби, если учитывать вероятности переходов. Таким образом, только слова, которые значительно чаще происходят из другого языка — а не обычные термины, встречающиеся в обоих, могут вызывать изменения языка в коротких последовательностях.
Коэффициент корреляции Мэттьюса был выбран в качестве оценочной метрики, поскольку по сравнению с другими метриками, такими как точность, воспоминание и точность, он значительно более подходит для задач бинарной классификации, учитывая истинные положительные и истинные отрицательные результаты, а также ложноположительные и ложноотрицательные результаты.
(9)
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
В таблице 4 мы показали результаты MCC и настройки параметров для Ptrp, которые рассчитывали начальное смещение в пользу начальных последовательностей с помощью слов Кокборока и рассчитывали Pcount, то есть вероятность продолжения работы на том же языке.
...| λ_lex | Pcount = 0,66 | Pcount = 0.70 | Pcount = 0,74 | Pcount = 0,79 |
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Хотя предлагаемая модель демонстрирует точность 93,15 % на уровне слов, тщательный анализ ошибок выявляет несколько повторяющихся закономерностей, подчёркивающих сложности идентификации смешанного языка между английским и Кокбороком.
Использование заимствованных слов и неоднозначных слов
Значительная часть ошибок связана с использованием заимствованных английских слов, которые стали распространёнными в кокборок. Слова в...
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
У авторов нет конфликта интересов, которые можно было бы заявлять.
Мы хотели бы поблагодарить местных носителей языка, группы WhatsApp, организации, студенческие союзы и Библейское общество Индии за помощь в получении необработанных наборов предложений с кодом. Мы также благодарны кафедре компьютерных наук и инженерии Национального технологического института Аруначал-Прадеш и Университету Lovely Professional за предоставленную платформу для анализа и тестирования нашего набора данных.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
| Имя | Компания | Каталожный номер | Комментарии |
|---|---|---|---|
| Raspberry Pi 4 | Фонд Raspberry Pi | RPI4-MODBP-4GB | Используется для обработки языков с низкими ресурсами |
| MicroSD-карта 64 ГБ | SanDisk | SDSQUAR-064G-GN6MA | Для хранения ОС и наборов данных |
| Блок питания 5V/3A | Официальный Raspberry Pi | SC0218 | Для питания платы Pi |
| USB-микрофон | Боя | BY-M1 | Для аудиоввода в сбор данных на языке |
| Монитор (HDMI) | LG | 22MK600M | Выходной дисплей во время испытаний |
| Клавишные и Мышиная комбинация | Logitech | MK270 | Управление интерфейсом |
| WiFi-донгл (если Pi 3) | TP-Link | TL-WN725N | Беспроводная передача данных (если нет встроенного Wi-Fi) |
| Python IDE (Thonny) | Открытый исходный код | - | IDE для программирования |
| Набор данных Lexicon | Изготовление на заказ | - | Пара Кокборок-англоязычный язык |
| N-граммовый набор данных | Изготовление на заказ | Англо-Кокборок языковая пара | |
| Код-микс и код-коммутатор | Изготовление на заказ | 10 000 предложений | Собрано из текстов в социальных сетях, Grouops в Whatsapp, НПО, БИБЛИИ и других |
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE
Запросить разрешение