研究人员发布面向意第绪语的 MameLoshnLM
这款开源 8B 模型引入了意第绪语语料库和基准,用于低资源语言评估。
为什么重要
这一发布凸显了嘈杂的网络级多语言数据在低资源语言上可能表现不佳。它为意第绪语语言技术研究提供了更有针对性的模型、语料库和评估套件。
核心要点
- 1.首个专为意第绪语打造的开源 8B 模型。
- 2.Oytser 结合了网络原生和文学类意第绪语来源。
- 3.Kashes 测试翻译、分析、抽取和理解能力。
研究人员推出了 MameLoshnLM,这是一款专为意第绪语打造的开源 8B 参数语言模型,基于 Llama 3.1 8B 继续预训练而成。该研究还发布了 Oytser,一个高质量的意第绪语预训练语料库,以及 Kashes,一个涵盖翻译、语言学分析、信息抽取和语言理解的多任务基准。论文称,MameLoshnLM 在该基准上优于同等规模的开源基线模型,并且相比通用多语言模型,能更好地捕捉意第绪语的词汇和形态模式。
⚡ 今天就能用
在依赖通用多语言基准之前,先用 Kashes 评估具备意第绪语能力的模型。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。