研究人员将 Nemotron 检索栈适配至希腊语 RAG
该工作加入希腊语检索训练、重排序、阅读器调优,并推出面向专业领域的 HERA 基准。
为什么重要
这项研究凸显了现代希腊语多语言检索系统中的短板,并表明针对语言和领域进行适配可以显著提升 RAG 流水线的效果。它也再次说明,在某些专业领域检索场景中,简单的词法基线依然具备竞争力。
核心要点
- 1.HERA 对现代希腊语在专业领域的检索能力进行基准测试。
- 2.BM25 击败了多种现成的多语言稠密检索器。
- 3.微调将 Nemotron 1B 的 nDCG@10 提升至 0.835。
研究人员展示了对 NVIDIA Nemotron 检索栈面向现代希腊语的端到端适配,涵盖语料挖掘、合成监督、检索训练、重排序器适配、阅读器微调,以及名为 HERA 的新基准。在专业希腊语语料中,BM25 的表现超过了多种现成的多语言稠密检索模型。在 65,773 组希腊语检索配对上微调后,Nemotron 1B 嵌入模型的 nDCG@10 从 0.362 提升至 0.835;对 Nemotron 30B-A3B 阅读器进行 LoRA 调优后,经评估的答案正确率从 29.4% 提升至 66.9%。
⚡ 今天就能用
在为专业希腊语 RAG 部署稠密检索之前,应先以 BM25 做基准;若收益足以抵消复杂度,再微调嵌入模型和重排序器。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.CLTeaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist DomainsAug 6, 12:00 PM↗
- arXiv cs.AITeaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist DomainsAug 6, 12:00 PM↗
- HF Daily PapersTeaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist DomainsAug 5, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。
更多 研究
研究
研究人员发布 LittleLearner,用于受控研究 LLM
这款 5B 参数模型基于 88B token、面向五年级及以下水平的课程语料训练而成。
r/LocalLLaMA+1 家媒体·6h ago
研究
研究人员聚焦 VLM 空间推理短板
多篇新论文为视觉语言系统的空间智能提出记忆机制、RL 方法和基准测试。
arXiv cs.AI+1 家媒体·1d ago
研究
Google 发布面向编程和智能体的 Gemini 3.7 Flash
这款新的 Flash 模型已登陆 Gemini API、Google AI Studio、Android Studio 和企业工具。
Hacker News+13 家媒体·1d ago