연구진, 이디시어용 MameLoshnLM 공개
오픈소스 8B 모델이 저자원 언어 평가를 위한 이디시어 말뭉치와 벤치마크를 추가했다.
왜 중요한가
이번 공개는 노이즈가 많은 웹 규모 다국어 데이터가 저자원 언어에서는 기대에 못 미칠 수 있음을 보여준다. 이디시어 언어 기술을 연구하는 이들에게 더 특화된 모델, 말뭉치, 평가 도구 모음을 제공한다.
핵심 포인트
- 1.이디시어에 특화해 구축된 최초의 오픈소스 8B 모델이다.
- 2.Oytser는 웹 기반 이디시어 자료와 문학 자료를 결합했다.
- 3.Kashes는 번역, 분석, 추출, 이해 능력을 테스트한다.
연구진은 Llama 3.1 8B에서 지속 사전학습을 진행해 이디시어에 특화해 구축한 오픈소스 80억 매개변수 언어 모델 MameLoshnLM을 공개했다. 이번 연구는 고품질 이디시어 사전학습 말뭉치 Oytser와 번역, 언어 분석, 정보 추출, 언어 이해를 포괄하는 다중 과제 벤치마크 Kashes도 함께 제시했다. 논문에 따르면 MameLoshnLM은 벤치마크 전반에서 비슷한 규모의 오픈 베이스라인을 앞섰고, 범용 다국어 모델보다 이디시어의 어휘 및 형태론적 패턴을 더 잘 포착했다.
⚡ 오늘 바로 활용
범용 다국어 벤치마크에 의존하기 전에 Kashes로 이디시어 지원 모델을 평가해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구
DistilVDR, 시각 문서 검색을 압축하다
5억2400만 매개변수 규모의 검색 모델이 80억 매개변수 비전-언어 교사 모델로부터 양방향 증류를 활용한다.
arXiv cs.CL+1 outlet·1d ago
연구
연구진, Power Law Graph Attention 제안
PLGA는 scaled dot-product attention을 일반화하며, 정확한 불변성 조건에서 추론 붕괴가 발생한다고 보고했다.
arXiv cs.LG+1 outlet·1d ago
연구
장문 문서 VLM 추론을 겨냥한 새 논문들
InSight-doc, DocAtlas, DocMemo가 복잡한 문서 전반에서 근거를 찾아내는 에이전트형 접근법을 제안했다.
arXiv cs.LG+1 outlet·1d ago