Lexicographic Multi-Objective On-Policy Distillation
arXiv:2610.02359v1 Announce Type: new Abstract: Reinforcement learning from verifiable rewards (RLVR) usually optimizes answer correctness, yet useful language-model behavior also requires high-quality reasoning and concise responses. Existing multi-reward post-training methods typically scalarize…
Read the full story at arXiv cs.LG ↗
Timeline · 1 report
- 2026-10-05 04:00 · arXiv cs.LG
Lexicographic Multi-Objective On-Policy Distillation