Forscher passen Nemotron-Retrieval-Stack für griechisches RAG an
Die Arbeit ergänzt griechisches Retrieval-Training, Reranking, Reader-Tuning und den HERA-Benchmark für Spezialdomänen.
Warum es wichtig ist
Die Studie macht eine Lücke in mehrsprachigen Retrieval-Systemen für Neugriechisch sichtbar und zeigt, dass sprach- und domänenspezifische Anpassungen RAG-Pipelines deutlich verbessern können. Sie unterstreicht zudem, dass einfache lexikalische Baselines in manchen Retrieval-Szenarien für Spezialdomänen weiterhin konkurrenzfähig bleiben.
Die Kernpunkte
- 1.HERA benchmarked Neugriechisch-Retrieval über Spezialdomänen hinweg.
- 2.BM25 schlug mehrere sofort nutzbare mehrsprachige Dense Retriever.
- 3.Fine-Tuning hob Nemotron 1B nDCG@10 auf 0,835.
Forscher haben eine End-to-End-Anpassung von NVIDIAs Nemotron-Retrieval-Stack für Neugriechisch vorgestellt. Sie umfasst Corpus Mining, synthetische Supervision, Retrieval-Training, Reranker-Anpassung, Reader-Fine-Tuning und einen neuen Benchmark namens HERA. In spezialisierten griechischen Korpora schnitt BM25 besser ab als mehrere sofort nutzbare mehrsprachige Dense-Retrieval-Modelle. Nach dem Fine-Tuning mit 65.773 griechischen Retrieval-Paaren verbesserte ein Nemotron 1B Embedder den nDCG@10-Wert von 0,362 auf 0,835; das LoRA-Tuning eines Nemotron 30B-A3B Readers erhöhte die bewertete Antwortkorrektheit von 29,4 % auf 66,9 %.
⚡ Heute ausprobieren
BM25 sollte vor dem Einsatz von Dense Retrieval für spezialisiertes griechisches RAG als Benchmark dienen; anschließend können Embeddings und Reranker feinabgestimmt werden, sofern die Zugewinne die zusätzliche Komplexität rechtfertigen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.CLTeaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist DomainsAug 6, 12:00 PM↗
- arXiv cs.AITeaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist DomainsAug 6, 12:00 PM↗
- HF Daily PapersTeaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist DomainsAug 5, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
MiLMMT-Team veröffentlicht referenzfreie Übersetzungsmodelle
MiLMMT-46-v1.0 nutzt GRPO und Checkpoint-Interpolation, um offene mehrsprachige Übersetzung zu verbessern.
Neue Papers zielen auf VLM-Reasoning für lange Dokumente
InSight-doc, DocAtlas und DocMemo schlagen agentische Ansätze vor, um Belege in komplexen Dokumenten zu finden.
Google testet AMIE für medizinische Videokonsultationen in Echtzeit
Das auf Gemini basierende Forschungssystem wurde in simulierten Telemedizin-Konsultationen evaluiert.