Discussion about this post

User's avatar
Hao Hoang's avatar

📚 Related Papers:

- SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training. Available at: https://arxiv.org/abs/2510.08141

- ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models. https://arxiv.org/abs/2509.21826

- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. Available at: https://arxiv.org/abs/2501.12948

- Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards. Available at: https://arxiv.org/abs/2506.20520

No posts

Ready for more?