ThaiTrees:多领域泰语句法依存树库与处理流水线
针对泰语缺乏用于定量句法研究的大规模自动解析语料库的问题,研究团队推出了 ThaiTrees。该语料库规模达 3.42 亿词元(tokens),涵盖新闻、维基百科、口语转录及社交媒体等多个领域。此外,研究人员在通用依存(Universal Dependencies)框架下构建了一套可复现的泰语文本清洗、预处理和句法解析流水线,为泰语的定量句法分析和语言学研究提供了有力的数据支撑。
推荐理由推出了包含 3.42 亿词元的多领域泰语依存句法语料库及解析流水线,填补了泰语大规模计算句法资源的空白。
原标题:ThaiTrees: Thai Syntactic Dependency Trees Across Domains
阅读 arXiv 自然语言处理 原文 ↗