"Score Centering Stabilizes Off-policy Reinforcement Learning", Marek & Ryabinin 202 {Together.ai} (LLM RL is extremely sensitive to numeric issues)
Coverage of ""Score Centering Stabilizes Off-policy Reinforcement Learning", Marek & Ryabinin 202 {Together.ai} (LLM RL is extremely sensitive to numeric issues)" from 1 source, with a live timeline of who reported what and when.
Read the full story at r/reinforcementlearning ↗
Timeline · 1 report
- 2026-09-20 17:52 · r/reinforcementlearning
"Score Centering Stabilizes Off-policy Reinforcement Learning", Marek & Ryabinin 202 {Together.ai} (LLM RL is extremely sensitive to numeric issues)