Wnuan論文、エンタープライズQA向けの段階的ポストトレーニングを検証
32BルートはWnuanBenchで許容回答率を引き上げた一方、一般ベンチマークのスコアは低下した。
なぜ重要か
この結果は、段階的ポストトレーニングがドメインQA性能を大幅に高め得る一方で、一般能力には測定可能なトレードオフが生じることを示している。そのため、エンタープライズタスクでの向上と、より広範な性能低下の双方を評価することが、導入判断の中核となる。
要点
- 1.Wnuanは、段階的ポストトレーニングにより専有エンタープライズ質問応答を対象とする。
- 2.32BルートはRL後に91.51%の許容回答率に到達した。
- 3.同ルート全体で、一般ベンチマーク平均は5.17ポイント低下した。
新たなarXiv論文は、専有知識を対象とするエンタープライズ質問応答のための3段階パイプライン「Wnuan」を提示している。この手法は、文書からタスク指向の教師データを構築し、一般データのリプレイを伴う教師ありファインチューニングを適用したうえで、残存エラーに対して強化学習を用いる。707問からなるWnuanBenchでは、主要な32Bルートの許容回答率が適応前の52.76%から、SFT後に80.06%、RL後に91.51%へ改善した一方、一般ベンチマーク平均は5.17ポイント低下した。
⚡ 今日から使える
導入前に、エンタープライズQA向けの適応をドメインベンチマークと一般的な指示追従テストの双方で監査すること。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
MiLMMTチーム、参照訳不要の翻訳モデルを公開
MiLMMT-46-v1.0はGRPOとチェックポイント補間により、オープンな多言語翻訳を改善する。
arXiv cs.CL+1 outlet·16h ago
研究
DistilVDR、視覚文書検索を圧縮
5億2400万パラメータの検索器は、80億パラメータの視覚言語教師モデルから双方向蒸留を行う。
arXiv cs.CL+1 outlet·16h ago
研究
研究者ら、Power Law Graph Attentionを提案
PLGAはscaled dot-product attentionを一般化し、厳密な不変性の下で推論が崩壊すると報告している。
arXiv cs.LG+1 outlet·16h ago