AAI News Hub
研究Thu, August 6, 2026·Aug 62 家媒体交叉佐证

研究人员将 Nemotron 检索栈适配至希腊语 RAG

该工作加入希腊语检索训练、重排序、阅读器调优,并推出面向专业领域的 HERA 基准。

为什么重要

这项研究凸显了现代希腊语多语言检索系统中的短板,并表明针对语言和领域进行适配可以显著提升 RAG 流水线的效果。它也再次说明,在某些专业领域检索场景中,简单的词法基线依然具备竞争力。

核心要点

  • 1.HERA 对现代希腊语在专业领域的检索能力进行基准测试。
  • 2.BM25 击败了多种现成的多语言稠密检索器。
  • 3.微调将 Nemotron 1B 的 nDCG@10 提升至 0.835。

研究人员展示了对 NVIDIA Nemotron 检索栈面向现代希腊语的端到端适配,涵盖语料挖掘、合成监督、检索训练、重排序器适配、阅读器微调,以及名为 HERA 的新基准。在专业希腊语语料中,BM25 的表现超过了多种现成的多语言稠密检索模型。在 65,773 组希腊语检索配对上微调后,Nemotron 1B 嵌入模型的 nDCG@10 从 0.362 提升至 0.835;对 Nemotron 30B-A3B 阅读器进行 LoRA 调优后,经评估的答案正确率从 29.4% 提升至 66.9%。

今天就能用

在为专业希腊语 RAG 部署稠密检索之前,应先以 BM25 做基准;若收益足以抵消复杂度,再微调嵌入模型和重排序器。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究