本实验方案的目的是利用结合字符n元语法和频率词典的无监督模型,准确识别英语- Kokborok 混合文本中的词级语言归属。
研究文章
本实验方案的目的是利用结合字符n元语法和频率词典的无监督模型,准确识别英语- Kokborok 混合文本中的词级语言归属。
由于多语言文本的使用日益增多,对词级语言自动检测模型的需求也在不断增长。为了在词级别上识别科克伯罗克语和英语的语码转换与语码混合句子,我们提出了一种无监督模型。已有大量关于语码混合文本的研究发表,涵盖多种印度语言。然而,据我们所知,本研究是一项开创性工作,首次针对资源匮乏的英语-科克伯罗克语语言对实现语言识别。我们采用了一种将频率词典数据与字符n元模型数据相结合的方法。该方法利用维特比算法,将字符n元马尔可夫模型与频率词典相结合,以辅助实现精确的词级语言识别。所提出的方法表现良好,词级准确率达到93.15%,优于88.5%的BiLSTM-CRF模型和85.3%的基于规则的基线模型。这表明,结合词典与统计方法在不依赖大规模标注数据集的情况下,有效应对低资源语言问题具有显著优势。
在数字时代,社交媒体平台上语码混合和语码转换的多语言交流迅速增长,已成为全球交流的核心。准确识别文本内容中语言的需求至关重要。经过观察,我们发现印地语、孟加拉语和泰卢固语等多种印度语言在语言识别方面已有研究,而曼尼普尔语、博多语和阿萨姆语等其他印度低资源语言也在语言识别研究中得到了部分探讨。然而,对于科克伯罗克语这一在语言学和结构上均具独特性的低资源语言,相关模型的开发仍存在显著的研究空白。
与曼尼普尔语、阿萨姆语和博多语等低资源语言不同,科克伯罗克语具有较高的正字法变体,通常在罗马字母或孟加拉字母之间交替使用,通信中常互换书写。这在词元边界、音译以及字符级别的特征提取方面造成了大量歧义,带来了独特的挑战,而现有文献中极少考虑这一问题。此外,科克伯罗克语是一种黏着语,其形态学包含丰富的前缀和后缀(例如 -o、-do、-no)以及音位性声调,使得针对印欧语系语言开发的现有语码混合语言识别模型难以有效应用于该语言。
社交媒体进一步加剧了这些问题。科克伯罗克语使用者常常在文本中混用英语词汇,这不仅是为了语码混合和语码转换,也是为了弥补科克伯罗克语句子中缺失的词汇项。这导致了非标准的正字法以及词语的语境相关用法,从而对基于规则或纯词汇的系统构成了障碍。
本研究通过提出一种无监督模型,结合频率词典、字符n元概率与维特比解码框架,解决了上述问题。该方法特别关注英语- Kokborok 语言对在正字法、形态学和上下文方面的复杂性,因此是首次针对这一低资源语言中词级语言界限进行系统性处理与检测的计算尝试之一。
KOKBOROK 语言背景
“"Kok"”意为语言,“"Borok"”意为人类,这两个词组合成复合词“"Kok-borok"”,表示人类的语言。术语“"Kok-borok"”指特里普拉邦的博罗克(Borok)人所说的语言,也包括孟加拉国和缅甸邻近地区以及米佐拉姆邦、曼尼普尔邦和阿萨姆邦居民所使用的语言。主要在特里普拉邦使用的 Kokborok 语言,可用罗马字母和孟加拉字母书写。大多数 Kokborok 语言使用者更倾向于使用罗马字母而非孟加拉字母。实际上,Kokborok 语言起源于汉藏语系中的藏缅语族。Kokborok 语言与博多(Bodo)语言有细微的相似之处。Kokborok 语言的 36 种方言在一定程度上与博多语和卡查里(Kachari)语存在细微相似性。
科洛马曾是科克伯罗克语的原始文字。在1949年10月15日并入印度联邦之前,印度唯一的特里普拉邦由184人统治。所发现的科洛马文字位于 Rajratnakar 书籍是用于记录历史叙事的载体。后来,在十四世纪,两位名为Sukreswar和Vaneswar的婆罗门将该语言翻译成梵文,随后又译为孟加拉文。 Kokborok语言中存在词干同音、音位声调、动词形态、语序以及由动词产生的动词派生后缀。
随着时间的推移, Kokborok 接触到了英语、阿拉伯语、孟加拉语、波斯语等语言。Kokborok 语言中存在多种复杂的黏着结构。在特里普拉以 Kokborok 为母语的人们由于该语言尚未采用广泛接受的文字系统,难以便捷地获取信息,但目前这一问题正在得到解决。
在特里普拉邦,有多种 Kokborok 方言被使用。在特里普拉邦,人们使用多种方言,包括特里普拉/特里普里(Tripura/Tripuri)、德巴尔马(Debbarma)、雷昂(Reang)、贾马提亚(Jamatia)、乌柴(Uchai)、诺提亚(Noatia)、卢赛(Lusai)、库基(Kukis)、柴马尔(Chaimal)、哈拉姆(Halam)、桑塔尔(Santal)、雷布查(Lepcha)、查克马(Chakma)、卡西亚(Khasia)、奥朗(Orang)、莫格(Mog)和加罗(Garos)。根据2011年人口普查报告,印度有1,011,294名 Kokborok 使用者,邻国孟加拉国则有超过400,000名使用者。
文献综述
作者介绍了他们利用包含印地语、孟加拉语和英语混用的 Facebook 帖子新数据集,开展自动语言识别的持续研究。他们尝试了多种技术,如基于词典的方法和有监督分类法,用于实现词级语言识别,并强调在此类环境中考虑上下文线索对于准确语言识别的重要性。
本文提出了一种标注推文数据集,旨在通过基于词典、字符级和词级技术识别使用印地语-英语语码混合的社交媒体平台上的仇恨言论1。文章介绍了一种基于N元语法的容错文本分类方法。首先,系统利用训练集数据(例如新闻组文本样本或短语)计算出反映各类别的特征谱型。随后,系统为待分类的具体文档生成其对应的特征谱型。最后,算法计算文档谱型与各个类别谱型之间的距离度量。系统将选择与文档谱型最接近的类别作为其分类结果2。
为了生成特征向量,比较了多种词嵌入技术,包括连续词袋模型和Skip-Gram模型。AdaBoost、随机森林、K近邻、高斯朴素贝叶斯、支持向量机和逻辑回归均取得了良好的交叉验证得分3。先前方法的汇总见表1。
利用基于词典的分类器,该研究在三个语言组合上的表现优于现有分类器:使用社交媒体数据集评估的西班牙语-英语、荷兰语-英语以及德语-土耳其语4。该研究的方法在模型收敛性和测试性能一致性方面表现出更强的鲁棒性,在语码混合文本的情感分析任务中,准确率比当前技术高出3.31个百分点5。
在他们的开创性工作中,Dunning 的语言统计识别方法首次由新墨西哥州立大学计算研究实验室在技术报告6中提出。该论文基于英-泰卢固语混合语料,分析了多种类型的有监督学习方法,包括隐马尔可夫模型、随机森林分类器方法、条件随机场以及朴素贝叶斯分类器7。该研究聚焦于印度语言,包括英语、博多语和阿萨姆语,探讨了一种识别社交媒体中语码混合内容语言的新方法。研究人员在深度学习模型中使用了双向长短期记忆网络(Bidirectional Long Short-Term Memory)8。
本文使用了一个规模较大的古吉拉特语数据集,其中古吉拉特语混合了英语和印地语。他们采用了多种机器学习分类器,其中支持向量分类器取得了最佳准确率,达到92%9。
在独立的分类阶段,采用语言学框架来区分荷兰语-英语推文中的语码转换与词语借用。通过基于规则的语言识别(LID)、支持向量机和决策树分类器,研究发现决策树分类器(DTC,micro F1 = .95)和基于规则的LID系统(micro F1 = .95)表现最佳10。
使用代码转换攻击性检测数据集 TRAC-1、印地英混合攻击性推文数据集以及幽默分类数据集对他们的模型性能进行了评估11。为了通过阅读提高成人词汇习得的保持率,提出了一种基于概率的方法,作为生成词级混码文本的第二语言教学法12。通过引入词典模块,并用于在多种有监督分类器上进行测试,以控制词级代码混合13。
他们采用了多种指标来分析语码转换模式,发现对于西班牙语-英语和印地语-英语两种语言对,神经网络模型的表现均逊于条件随机场(CRF)模型,分别低了2.5和3.5个百分点14。
该方法以双语词典和英文文本作为输入,构建一个覆盖词汇提及的因子图,以生成优化特定"可学习性"参数的语码转换文本。本文旨在通过印地语-英语语码转换数据的语言对,深入理解CanVEC工具箱的相关概念。研究成功实现了87.99%的F1分数准确率15,16。
作者首先研究了古吉拉特语和英语之间的语码混合17,采用三阶段流程来识别每个词元的语言、规范化正字法,并将语段回译为其原始文字。随后,他们将重点转向印地语-英语语料库18,在此引入了专门针对双语句子结构优化的新颖情感检测算法。为了支持受控实验,他们通过在单语数据上训练skip-gram模型并融合其输出,生成合成的语码混合文本19。
接下来,通过基于规则的词级识别方法处理了一个孔卡尼语-英语社交媒体数据集20 ,在无需任何人工标注训练数据的情况下实现了稳健的性能21。在扩展研究范围方面,一项研究利用来自 Facebook 等平台的大规模转写语料库(包含英语、印地语、孟加拉语和阿萨姆语)22 ,评估了多种词级标注技术。在此基础上,另一种框架23 能够动态切换语言,以高精度检测嵌入式或借用短语。在农业领域,使用多个模型对旁遮普语-英语评论进行分类,其中 n-gram 分类器取得了最佳准确率24。对于僧伽罗语-英语混合语句(CMST),比较了多种集成学习方法(随机森林、支持向量机、朴素贝叶斯、决策树、逻辑回归),结果显示随机森林表现最优25;而基于字符级嵌入与支持向量机结合的方法在泰米尔语-英语和马拉雅拉姆语-英语语对上也取得了良好效果26。最后,Crúbadán 项目27 被介绍为一项大规模构建低资源语言语料库的努力,通过网络爬取数据,为未来的语码混合研究奠定了基础。
| 数据集 | 主要结果 | 准确率/F1分数/准确率/精确率/召回率 |
| 来自 Facebook 帖子的印地语–孟加拉语–英语数据集 | 强调了词级语言识别的挑战 社交媒体文本 | 89.30% |
| 新闻文章、文档 | 使用N-gram进行语言识别的有效方法 | 0.99% |
| 印度语码混杂数据集 | 展示了在词级别语言识别中的高准确率 | 未报告(NR) |
| 基于维基百科的数据集 | 鲁棒的词元级语码转换检测 | 未报告(NR) |
| 印地语–英语推文 | 印地语和英语混合语的 sentiment 分类性能得到提升 | 0.78% |
| 多语言语料库 | 建立基础的语言识别框架 | 78.00% |
| 英-泰卢固语混合 数据 | CRF 实现了最佳性能 | 89.30% |
| 英语—博多语混合文本 | 实现了较高的词级别准确率 | 92.00% |
| 混合语码古吉拉特语–印地语 脚本 | 句子级别的语言识别准确率是 ≈92% | 92.00% |
| 荷兰语–英语推文 | DTC 和基于规则的模型达到了 F1 ≈0.95 | 95.00% |
| 语码转换数据集 | 各模型间的竞争性表现 | 未报告(NR) |
| 合成的语码混合文本 | 改进的词汇学习 | 未报告(NR) |
| 英语—卡纳达语混用文本 | 有效的自动语言识别 | 未报告(NR) |
| TRAC-1,印地语-英语混合数据集 | CRF 在神经网络模型中表现更优 | 91.00% |
| 多语言在线数据 | 准确的词级语言识别 | 88.00% |
| 印地语–英语社交媒体 | 印地语-英语语言识别的高准确率 | 0.93% |
| 英语—古吉拉特语混用 | 有效的双语处理 | |
| 社交媒体代码混合数据集 | 情感检测的改进 | 0.90% |
| 混合代码合成 数据 | 强嵌入表示 | 未报告(NR) |
| 孔卡尼语–英语混用社交媒体文本 | 无需标注的稳健性能 | 0.89% |
| 来自 Twitter 的语码混合数据集 | 提升对语码转换的检测能力 | 90.20% |
| 阿萨姆语–孟加拉语–印地语–英语 | 准确的多语言语言识别 | 91.00% |
| 社交媒体中的语码混合文本 | F1分数 ≈0.95 | 0.95% |
| 英语—旁遮普语混用数据 | N-gram 模型表现最佳 | 0.88% |
| 僧伽罗语–英语混合语码数据 | RF 实现了最高的准确率 | 0.92% |
| Facebook 语码混杂评论 | 改进的词级语言识别 | 0.93% |
| Crúbadán 语料库 | 促进低资源语言研究 | 未报告(NR) |
| 语码混合数据集 | 在词级语言识别中表现出良好的性能 | 0.94% |
表1: 语码混合语言文献综述。
访问受限。请登录或开始试用以查看此内容。
英语和 Kokborok 语的语码混合及语码转换文本是通过从本地对话以及社交媒体平台公开发布的帖子中手动收集而得。未收集任何个人身份信息或敏感信息。所有程序均遵循机构的伦理准则。
3. 设计与实现
3.1 算法
3.1.1 对于句子(S)中的每个词元:
a. 利用频率词典,计算词汇概率 Plexi。
b. 基于 N-gram 模型,计算基于字符的概率 Pchar。
c. 对两者进行加权插值:
Pcombined = λlexi Plexi + λchar Pchar
3.1.2. 每个词元的概率组合 Pcombined 已作为发射概率存储。
3.1.3. 应用维特比算法:
a. 给定初始的起始语言概率。
b. 对于每个词元:
i. 计算转移概率 Pcount(同语言延续)
和 Pswitch(语言切换的可能性)。
ii. 选择语言路径并最大化序列概率。
3.1.4. 输出具有最高整体概率的最大概率语言序列 L。
3.2 计算环境
所有实验均在 Google Colab 平台上使用 Python 3.10 实现。系统采用了一系列基础的 Python 软件包,如 NumPy、Pandas 和 Matplotlib,用于数据处理与可视化,以及 scikit-learn(v1.3)进行统计预测与分析。频率词典整合、字符 n-gram 建模和维特比解码均通过自定义的 Python 脚本实现。该模型在一个包含 10,000 个句子的数据集上进行训练与测试,训练集与测试集按 70/30 划分。
3.3 语言识别
句子完成分词后,语言识别模块将判断每个词元属于 Kokborok 语还是英语。完整的系统架构如图1所示。该语言标注结果随后用于确定适用的转录模块。词元的语言通过融合字符n元模型和词频词典的数据来判定。
由于上述两种语言在正字法上存在显著差异,仅使用词元自身信息而无需任何上下文特征的分类器 already 表现良好。然而,在初次赋值之后,会应用基于维特比算法的另一个分类器。该第二分类器可减少跨语言同形异义词的误分类,并倾向于将属于同一语言的词组进行归类。

图 1: 基于维特比算法的词级语言识别模式及语言切换惩罚机制。 请点击此处查看此图的放大版本。

图 2:语码混合句子的语言识别方法。 请点击此处查看此图的放大版本。
我们从 Crúbadán 语料库27中收集了词典和字符模型所需的数据。该语料库包含多种语言,其中包括许多少数民族语言,如 Kokborok。
由于Crúbadán语料库中的数据集不足以满足我们的需求,我们测试了一个新的 Kokborok 语圣经数据集。与其他语言相比,可用资源相对较少。因此,本文所用混合句子的数据来自使用 Kokborok 语的 WhatsApp 群组,包括 Platinum Jubilee、Population Group、Restoration International Group、Khumulwng、Depachara Baptist Society、United Tiprasa Forum (UTF)、Depachara Youth Fellowship、Krishna Nagar (EU)、Uchoi Christian Fellowship (UCF)、Tipra Kwsrang Bodol、Tribal Engineering Society、National Institute of Technology Students Borok、Information Yarung 和 Tripura Uchoi Youth Association (TUYA)。
2021年8月至2023年12月期间,从这些WhatsApp群组中收集了共计10,000条科克博罗克语与英语的语码混合句子。该数据集的来源及领域分布见表2。
| 名称 | 总词数 |
| Kokborok 圣经词汇 | 718883 |
| 英语与 Kokborok 混合语句 | 68789 |
表 2: Kokborok 语总词数。
| 语言 | 总词元数 |
| Kokborok (trp) | 711509 |
| English (en) | 1767141 |
表 3:字符二元模型。
| 序号 | 使用的总代码混合句子数 |
| 1 | 10,768 |
表 4:训练的总混合句子数。
字符模型和词典取自 Crúbadán 语料库27。该语料库涵盖多种语言,包括众多少数语言,通过在互联网上搜索目标语言的材料自动构建而成。其中, Kokborok 语料库的规模相对较小,因为该方法最初是为 Kokborok 语开发的。
尽管现有的 Kokborok 与英语语料库也可获取,但由于缺乏数据集,特别是在语码混合和语码转换方面的数据集,因此有意未予使用。Kokborok 语料库中也包含若干英语词汇;其中一些词(包括 no、do 和 o)的使用频率甚至高于英语语料库中的使用频率。
词典和语言模型执行对单个词语进行独立标注的任务。我们的任务与 King 等人28的研究类似。
词典(lex)、字符(ch)和词标签概率被用于在词典(ch)和词典(lex)组分的频率之间创建线性插值。由此得到的组合(comb)概率如下面的公式(1)所示;详细的插值参数见表3。插值策略如图2所示。
Pcombined = λlexi ·Plexi + λchar ·Pchar (1)
其中 0 ≤ λlexi, λchar ≤ 1;且 λlexi + λchar = 1。对于无词典依据的词,其词典似然性极低但非零。理论上,若某词在两种词典语言中均不存在,则即使 λlexi = 1,也将使用字符模型而非词典概率进行判定。
我们构建字符模型的方法基于 Dunning 的字符 n-gram 马尔可夫链(1994 年)。该方法通过分别统计词元开头和结尾处的 n-gram 频次,以估计初始概率和转移概率。
下文展示了训练后的2-gram与4-gram模型的性能比较。
(2)
·
(3)
可以将概率的初始词和转移词相乘,以利用语言模型(4)计算出一个词的似然性。
P(〈w1w2w3〉) = Pinitial(〈w1w2) · Ptransition (c3|〈w1w2) · Ptransition(〉|w1w2w3) (4)
科克伯罗克语具有丰富的前缀和后缀,是一种形态上的黏着语,其中“o”、“do”和“no”等后缀会附加在词根上。2-gram 能有效捕捉词缀边界处的局部形态转换,而 4-gram 则能够捕捉那些在词根和复合词(如 Phailaidido、Thanlainai 和 Mwchangkha)中具有较长正字法依赖关系的科克伯罗克语词汇。
这适用于大规模语料库,从而增加了多种数据稀疏性问题出现的可能性。此外,字符组合在某些情况下可能不会出现,这可能导致概率降为零。为解决此类问题,采用 lambda 平滑方法,为包含未登录字符的每个 n 元组赋予一个具有非零概率的小值。lambda 的取值设定为 0.001。
(5)
其中 N 表示 n-元组中不同观测值的数量。
(6)
其中 D= 表示在 n-gram 中检测到的差异数量。假设未观测到的 n-gram 的概率相同。
(7)
其中 C 表示字符大小。
Pcount、λlexi 和 λchar 的初始值通过科克博罗克语和英语语料库的频率分析经验确定。首先,我们将 λlexi 初始化为 0.5,并对基于词典和基于字符的概率进行加权,从而使两者在首次运行中贡献相等。这种初始化水平使我们能够识别词典与字符 n-gram 模型在不同数据集之间的相对作用。
转移参数 Pcount(保持同一语言)根据手动标注数据集中单语序列与语码转换点的比例设定为 0.6。这些值在调优过程中为收敛提供了良好的起点。随后,通过一系列重复试验对所有参数进行优化,以最大化马修斯相关系数(MCC),具体细节见结果部分。
上下文识别
上下文模型利用在独立识别阶段已初始化的概率(Pcount 和 Pswitch),并通过维特比序列解码对其进行优化,从而减少状态转移的不一致性,并最优地检测语言切换。
该语言模型的分析输出依赖于上下文,主要通过将当前词元与后续词元相结合,并利用前一个及当前词元共同获得。由于频率值相同的两个词可能存在相似含义并导致误分类,因此采用依赖上下文的方法来识别两种语言中共同存在的相似词汇。
某些词在两种语言中是相似的,例如“no”、“do”、“o”、“are”、“da (day)”、“go”、“sa (say)”、“rose”、“ring”以及许多其他词汇。因此,当出现此类歧义时,准确识别语言可能会非常困难,有时会导致语言被错误分类。
为了解决这些语言识别问题,我们提出了一组基于判别性隐马尔可夫模型和有监督机器学习的语言模型。假设两种语言之间的转移概率相同。对于同一种语言的 Pcount,持续概率是需要设定的主要参数。通过该参数,我们可以计算语言切换的可能性。
Pswitch = 1 − Pcount (8)
使用维特比路径进行上下文分类如图3所示。维特比算法的目标是根据Pcount和Pswitch确定哪个词元序列的语言最优。
Viterbi 算法应用于上下文分类。Pcount 和 Pswitch 用于标记边,节点则由第一个分类器分配的相对似然性进行标记。
由于使用 Kokborok 语言的可能性更高,如果仅使用第一个分类器且无上下文信息可用,则会选择虚线路径。
基于上下文的调整效果如图4所示。该图展示了在缺乏上下文信息的情况下,短语"Next week o phaisidi do"中的第二、第三和第五个词将被错误地识别为英语(en)(虚线路径)。尽管英语的概率略高,但相对数值非常接近。
若同时考虑转移概率,则两次语言转换将受到惩罚,且该序列的概率将低于维特比算法的最优路径。因此,只有那些极有可能源自另一种语言的词——而非在两种语言中均常见的词汇——才能在短序列中触发语言转换。
选择 Matthews 相关系数作为评估指标,是因为与其他指标(如精确率、召回率和准确率)相比,它在二分类任务中更为合适,因为它同时考虑了真正例、真反例、假正例和假反例。
(9)
访问受限。请登录或开始试用以查看此内容。
在表4中,我们展示了针对Ptrp的MCC评分和参数调优结果,该参数用于计算以 Kokborok 词汇作为起始序列的初始偏向性,并计算了Pcount,即在同一语言中继续生成的概率。
| λ_lex | Pcount = 0.66 | Pcount = 0.70 | Pcount = 0.74 | Pcount = 0.79 | Pcount = 0.82 | Pcount = 0.86 | Pcount = 0.90 | Pcount = 0.92 | Pcount = 0.94 |
| 0 | 0.719 | 0.732 |
访问受限。请登录或开始试用以查看此内容。
尽管所提出的模型在词级别上表现出93.15%的准确率,但对错误的深入分析揭示了若干反复出现的模式,突显了英语- Kokborok 混合语种识别所面临的挑战。
使用外来词和含义模糊的词
大量错误源于使用了借自英语的词汇,这些词在 Kokborok 语言中已变得常见。诸如 no、do、o、go、ring、rose 和 are 等词在两种语言中频繁出现,并可作为同义词互换使用。
由于拼写模式相似且上下文频率较高,这些词有时会被系统错误分类。例如, Kokborok语的前缀do(命令式标记)可能与英语助动词do混淆,而前缀no(否定词)可能与英语限定词no混淆。
形态复杂性
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
我们感谢当地母语使用者、WhatsApp 群组、各类组织、学生联合会以及印度圣经公会,协助我们获取了语码混杂句子的原始数据集。同时,我们也感谢阿鲁纳恰尔邦国家理工学院计算机科学与工程系以及洛夫利职业大学为我们提供了平台,用于对数据集进行分析与测试。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 树莓派 4 | 树莓派基金会 | RPI4-MODBP-4GB | 用于低资源语言处理 |
| MicroSD 卡 64GB | SanDisk | SDSQUAR-064G-GN6MA | 用于操作系统和数据集存储 |
| 电源 5V/3A | 官方树莓派 | SC0218 | 为 Pi 主板供电 |
| USB麦克风 | 波亚 | BY-M1 | 用于语言数据采集中的音频输入 |
| 显示器(HDMI) | LG | 22MK600M | 测试期间的输出显示 |
| 键盘 &和小鼠组合 | 罗技 | MK270 | 界面控制 |
| WiFi 无线网卡(若使用 Pi 3) | TP-Link | TL-WN725N | 无线数据传输(若无内置WiFi) |
| Python 集成开发环境(Thonny) | 开源 | - | 编程用集成开发环境 |
| 词汇数据集 | 定制构建 | - | 科克伯罗克语-英语语言对 |
| N-gram 数据集 | 定制构建 | 英语-科克伯罗克语语种组合 | |
| 混合语码与语码转换 | 定制构建 | 10,000 个句子 | 从社交媒体文本、WhatsApp 群组、非政府组织、圣经等收集 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可