#post-training
8 briefs tagged #post-training.
Research
SA-MRPO targets under-optimized rewards in RL post-training
The method reweights multi-reward policy optimization based on objective saturation.
arXiv cs.AI+1 outlet·1d ago
Research
Researchers release LittleLearner sandbox for studying LMs
A 5B-parameter model and 88B-token Grade 5-limited corpus test how training scope bounds capabilities.
r/LocalLLaMA+1 outlet·3d ago
Research
Papers test post-training for multilingual AI systems
New arXiv studies examine tool use, translation and low-resource language support.
arXiv cs.CL+1 outlet·Aug 12
Research
AdvFD targets Fréchet hacking in visual generation
The paper proposes an adversarial Fréchet loss for generator post-training.
HF Daily Papers·Aug 11
Research
Researchers target reasoning gaps in model post-training
New arXiv papers propose denser supervision for language and multimodal reasoning models.
arXiv cs.AI+1 outlet·Aug 5
Research
Researchers target weak spots in on-policy distillation
New arXiv papers propose OPD variants for multimodal, agent and generator training.
arXiv cs.LG+1 outlet·Aug 5
Research
New papers test self-distillation for LLM reinforcement learning
Studies propose ICE and OCSD while warning that privileged-information teachers can fail on harder tasks.
arXiv cs.AI+1 outlet·Aug 4
Research
Wnuan paper tests staged post-training for enterprise QA
A 32B route lifted acceptable-answer rate on WnuanBench while reducing general-benchmark scores.
arXiv cs.AI+1 outlet·Aug 4