ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration
This story is from 2026-09-02. It is preserved in the archive; the latest stories are on the live feed.
arXiv:2609.00061v1 Announce Type: new Abstract: Reward post-training of diffusion generators inevitably concentrates probability mass on a few reward-favored modes, a mode collapse that erases within-prompt diversity. Existing methods for mitigating collapse rely on external signals or interfaces,…
Read the full story at arXiv cs.LG ↗
Timeline · 1 report
- 2026-09-02 04:00 · arXiv cs.LG
ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration