Wnuan 通过分阶段后训练提升企业问答表现
这篇 arXiv 论文显示,可接受答案率有所提高,但通用能力出现了可量化的代价。
为什么重要
这项工作为企业 AI 团队提供了一套具体的适配方案,并用基准证据证明其能提升专有领域问答表现。它也量化了其中的取舍:领域答案质量提升,可能伴随通用能力下降,尤其是在指令遵循方面。
核心要点
- 1.Wnuan 结合了文档监督、带回放的 SFT,以及针对剩余错误的 RL。
- 2.这条 32B 路线在 WnuanBench 上达到 91.51% 的可接受答案率。
- 3.整条路线的通用基准平均分下降了 5.17 个百分点。
研究人员推出了 Wnuan,这是一套面向专有企业知识问答的三阶段流程。该方法先从文档中构建面向任务的监督数据,再使用带通用数据回放的监督微调,并通过强化学习处理剩余错误。在包含 707 个问题的 WnuanBench 上,主要的 32B 路线将可接受答案率从适配前的 52.76% 提升到 SFT 后的 80.06%,再提升到 RL 后的 91.51%;与此同时,通用基准平均分下降了 5.17 个百分点。
⚡ 今天就能用
在适配企业问答模型之前,应同时衡量领域答案质量和通用指令遵循能力的退化情况。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。