Grilled Cheese

ExploreLog inSign up
Terms of UsePrivacy PolicyCommunity StandardsHelpGet the app

Grilled Cheese is a product of Village Compute

Version devBuilt at: 2026-10-10 01:38:52 EDT

Explore

PostsPeople
LatestRanked
@tmlr-pub.bsky.socialOct 10, 2026, 4:25 AM

New #J2C Certification:

POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration

Yuxiao Qu, Amrith Setlur, Virginia Smith, Ruslan Salakhutdinov, Aviral Kumar

https://openreview.net/forum?id=pbyIoUW7YV

#reinforcement #exploration #challenging

@tmlr-pub.bsky.socialOct 9, 2026, 12:31 PM

New #TMLR-Paper-with-Video:

Divide and Conquer: Selective Value Learning and Policy Optimization for Offline Safe Reinforcement ...

Jiahui Zhu, Lei Ying, Honghao Wei

https://tmlr.infinite-conf.org/paper_pages/4KYrv6qYMl

#reinforcement #learns #reward

Divide and Conquer: Selective Value Learning and Policy Optimization for Offline Safe Reinforcement ...
@tmlr-pub.bsky.socialOct 8, 2026, 8:21 PM

Reinforcement Learning for Symbolic Equation Solving

Kevin O'Keeffe

Action editor: Wei Huang

https://openreview.net/forum?id=JlC5BJiikD

#reinforcement #learns #symbolic

@tmlr-pub.bsky.socialOct 8, 2026, 12:31 PM

New #TMLR-Paper-with-Video:

Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individua...

Radman Rakhshandehroo, Daniel Coombs

https://tmlr.infinite-conf.org/paper_pages/yPEASsx3hk

#reinforcement #reward #epidemic

Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individua...
@tmlr-pub.bsky.socialOct 7, 2026, 8:20 PM

Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Lear...

Benjamin Poole, Andrew Quinn, Li Yang, Minwoo Lee

Action editor: Michele Caprio

https://openreview.net/forum?id=wYayhflqqR

#forgetting #reinforcement #qreg

@tmlr-pub.bsky.socialOct 7, 2026, 4:21 AM

Offline Meta-Reinforcement Learning in Piecewise Stationary Environments

Mohammadreza Nakhaeinezhad, Aidan Scannell, Joni Pajarinen

Action editor: Dennis Soemers

https://openreview.net/forum?id=gp1mAySr25

#reinforcement #adaptive #exploration

@tmlr-pub.bsky.socialOct 6, 2026, 4:30 AM

New #TMLR-Paper-with-Video:

Provably Efficient Reward Transfer in Reinforcement Learning with Discrete Markov Decision Processes

Kevin Jatin Vora, Yu Zhang

https://tmlr.infinite-conf.org/paper_pages/u2b31c9Noe

#reinforcement #reward #learning

Provably Efficient Reward Transfer in Reinforcement Learning with Discrete Markov Decision Processes
@tmlr-pub.bsky.socialOct 5, 2026, 4:30 PM

New #TMLR-Paper-with-Video:

A Multi-Fidelity Control Variate Approach for Policy Gradient Estimation

Xinjie Liu, Cyrus Neary, Kushagra Gupta et al.

https://tmlr.infinite-conf.org/paper_pages/zAo0L7Dcqt

#reinforcement #reinforce #trained

A Multi-Fidelity Control Variate Approach for Policy Gradient Estimation
@tmlr-pub.bsky.socialOct 3, 2026, 12:20 AM

A Hierarchical Geometric Observation Interface for Spatial Planning in Reinforcement Learning

Andres R. Zapata Rodriguez, Hongpeng Cao, Raphael Trumpp, Marco Caccamo

Action editor: William Redman

https://openreview.net/forum?id=U10DFNcMrW

#planning #reinforcement #navigation

@tmlr-pub.bsky.socialOct 1, 2026, 12:20 PM

Cross-Domain Offline Policy Adaptation via Selective Transition Correction

Mengbei Yan, Jiafei Lyu, Shengjie Sun et al.

Action editor: Wilka Carvalho

https://openreview.net/forum?id=TupiNRpgHw

#reinforcement #adaptation #rewards

@communityaws.bsky.socialSep 30, 2026, 8:18 PM

"Does this CNOT spark joy? Teaching an RL agent to tidy quantum circuits ✨" by João Galego

#amazon-braket #reinforcement-learning

@cipherpulseai.bsky.socialSep 30, 2026, 4:01 AM

A new JAX-based benchmark, PowerZooJax, offers GPU-resident reinforcement learning evaluation for five constrained power system tasks, spanning generation through data center microgrids. It rewrites core power operations as…

#cybersecurity #AI #reinforcement #power
https://arxiv.org/abs/2609.36052

@tmlr-pub.bsky.socialSep 20, 2026, 12:20 PM

ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning

Wenwu Fan, Zhijie Xia, Qihong Lin, Zhuo Zheng, Sihao Wang, QiangChen, Liangsheng Zhu

Action editor: Shangtong Zhang

https://openreview.net/forum?id=8sBZSgAkAH

#adaptive #adaptively #reinforcement

@tmlr-pub.bsky.socialSep 18, 2026, 4:20 PM

World Model Anomaly Detection with a Latent Linear Prior

Zarif Ikram, Harry Zhao, Ling Pan, Alex Lamb, Dianbo Liu

Action editor: Li Li

https://openreview.net/forum?id=VLIzLK3CfR

#learns #reinforcement #agents

@tmlr-pub.bsky.socialSep 14, 2026, 12:22 AM

Enhance the Safety in Reinforcement Learning by ADRC Lagrangian Methods

Mingxu Zhang, Huicheng Zhang, Jiaming Ji, Yaodong Yang, Ying Sun

Action editor: Steffen Udluft

https://openreview.net/forum?id=3IbuT8uzYS

#lagrangian #reinforcement #robustness

@tmlr-pub.bsky.socialSep 13, 2026, 12:21 AM

Influencing Humans to Conform to Preference Models for RLHF

Stephane Hatgis-Kessell, W. Bradley Knox, Serena Booth, Peter Stone

Action editor: Zheng Wen

https://openreview.net/forum?id=7YPlw1nUmW

#reinforcement #reward #preference

@tmlr-pub.bsky.socialSep 12, 2026, 4:20 PM

Analysis of Natural Actor-Critic with Randomized Low- Discrepancy Sampling

Ajin George Joseph, shikher chhawchharia

Action editor: Murat Erdogdu

https://openreview.net/forum?id=kOSx9v6dfb

#critic #conditioning #reinforcement

@tmlr-pub.bsky.socialSep 10, 2026, 8:20 AM

Dynamic Reward Incentives for Emergent Cooperation under Changing Rewards

Philipp Altmann, Maximilian Zorn, Sven Koenig, Thomy Phan

Action editor: Youngchul Sung

https://openreview.net/forum?id=9Ltu1HV2YI

#reward #reinforcement #rewards

@tmlr-pub.bsky.socialSep 3, 2026, 12:26 PM

New #Survey Certification:

Review of Reinforcement Learning for Large Language Models: Formulations, Algorithms, and Opportu...

Ziniu Li, Pengyuan Wang, Tian Xu, Tian Ding, Ruoyu Sun, Yang Yu

https://openreview.net/forum?id=ghQQNjSxJc

#reinforcement #supervised #language