COILD:针对印度多语言机器翻译的高质量平行语料库与评测基准
针对印度语言机器翻译受限于缺乏高质量本土语料与基准的问题,研究人员推出了以印度语言为中心的平行语料库 COILD。该资源包含超过116万对经人工翻译和验证的句对,覆盖印欧、达罗毗荼及藏缅等语系的20种印度语言对。与传统依赖英语轴心的语料库不同,COILD 更好地保留了印度语言的多样性、文化特性与领域特征,为低资源语言翻译提供了重要的数据与评估支持。
针对印度语言机器翻译受限于缺乏高质量本土语料与基准的问题,研究人员推出了以印度语言为中心的平行语料库 COILD。该资源包含超过116万对经人工翻译和验证的句对,覆盖印欧、达罗毗荼及藏缅等语系的20种印度语言对。与传统依赖英语轴心的语料库不同,COILD 更好地保留了印度语言的多样性、文化特性与领域特征,为低资源语言翻译提供了重要的数据与评估支持。
针对蛋白质修饰中序列空间庞大且湿实验验证成本高的问题,研究人员推出了名为 PFArena 的评测基准。尽管蛋白质语言模型(PLM)、大语言模型(LLM)及智能体在蛋白质修饰领域展现出潜力,但其在实际实验决策场景中的相对表现尚不明确。PFArena 包含四个受控任务接口,覆盖单突变体生成与多突变体排序,通过提供不同梯度的突变适应度数据,系统性评估各类模型在蛋白质设计与修饰任务中的决策能力。
现有的全双工语音对话模型评测多采用固定窗口规则,机械地通过停顿或打断重叠来判定轮换成败。研究人员指出,响应时机的合理性取决于说话人的潜在意图。为此,该研究提出了评测基准 TACT,包含来自 5 个双人对话语料库的 9,728 个片段(共 73.2 小时),整合了对话历史、说话人记忆画像以及针对 6 类意图的标注,旨在提供更符合人类自然交互习惯的意图条件化轮换评估。
针对阿拉伯语等低资源语言标注数据稀缺的问题,AraGenre 2026 评测任务提出了一种基于定义指导的层级阿拉伯语文体分类基准。该任务要求系统为文本分配宽泛的交际文体以及细粒度的具体文体标签。其公开的训练与开发集主要包含有限的合成与受控样本,而最终测试基准则涵盖了包含现代标准阿拉伯语、古典阿拉伯语及多种方言的真实噪声文本,旨在评估模型利用自然语言定义进行文本分类的泛化能力。