New #J2C Certification:
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
Yuxiao Qu, Amrith Setlur, Virginia Smith, Ruslan Salakhutdinov, Aviral Kumar

New #J2C Certification:
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
Yuxiao Qu, Amrith Setlur, Virginia Smith, Ruslan Salakhutdinov, Aviral Kumar
New #TMLR-Paper-with-Video:
Divide and Conquer: Selective Value Learning and Policy Optimization for Offline Safe Reinforcement ...
Jiahui Zhu, Lei Ying, Honghao Wei
Reinforcement Learning for Symbolic Equation Solving
Kevin O'Keeffe
Action editor: Wei Huang
New #TMLR-Paper-with-Video:
Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individua...
Radman Rakhshandehroo, Daniel Coombs
Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Lear...
Benjamin Poole, Andrew Quinn, Li Yang, Minwoo Lee
Action editor: Michele Caprio
Offline Meta-Reinforcement Learning in Piecewise Stationary Environments
Mohammadreza Nakhaeinezhad, Aidan Scannell, Joni Pajarinen
Action editor: Dennis Soemers
New #TMLR-Paper-with-Video:
Provably Efficient Reward Transfer in Reinforcement Learning with Discrete Markov Decision Processes
Kevin Jatin Vora, Yu Zhang
New #TMLR-Paper-with-Video:
A Multi-Fidelity Control Variate Approach for Policy Gradient Estimation
Xinjie Liu, Cyrus Neary, Kushagra Gupta et al.
A Hierarchical Geometric Observation Interface for Spatial Planning in Reinforcement Learning
Andres R. Zapata Rodriguez, Hongpeng Cao, Raphael Trumpp, Marco Caccamo
Action editor: William Redman
Cross-Domain Offline Policy Adaptation via Selective Transition Correction
Mengbei Yan, Jiafei Lyu, Shengjie Sun et al.
Action editor: Wilka Carvalho
"Does this CNOT spark joy? Teaching an RL agent to tidy quantum circuits ✨" by João Galego
#amazon-braket #reinforcement-learning
A new JAX-based benchmark, PowerZooJax, offers GPU-resident reinforcement learning evaluation for five constrained power system tasks, spanning generation through data center microgrids. It rewrites core power operations as…
#cybersecurity #AI #reinforcement #power
https://arxiv.org/abs/2609.36052
ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning
Wenwu Fan, Zhijie Xia, Qihong Lin, Zhuo Zheng, Sihao Wang, QiangChen, Liangsheng Zhu
Action editor: Shangtong Zhang
World Model Anomaly Detection with a Latent Linear Prior
Zarif Ikram, Harry Zhao, Ling Pan, Alex Lamb, Dianbo Liu
Action editor: Li Li
Enhance the Safety in Reinforcement Learning by ADRC Lagrangian Methods
Mingxu Zhang, Huicheng Zhang, Jiaming Ji, Yaodong Yang, Ying Sun
Action editor: Steffen Udluft
Influencing Humans to Conform to Preference Models for RLHF
Stephane Hatgis-Kessell, W. Bradley Knox, Serena Booth, Peter Stone
Action editor: Zheng Wen
Analysis of Natural Actor-Critic with Randomized Low- Discrepancy Sampling
Ajin George Joseph, shikher chhawchharia
Action editor: Murat Erdogdu
Dynamic Reward Incentives for Emergent Cooperation under Changing Rewards
Philipp Altmann, Maximilian Zorn, Sven Koenig, Thomy Phan
Action editor: Youngchul Sung
New #Survey Certification:
Review of Reinforcement Learning for Large Language Models: Formulations, Algorithms, and Opportu...
Ziniu Li, Pengyuan Wang, Tian Xu, Tian Ding, Ruoyu Sun, Yang Yu