New paper RL-ARC proposes a calibration-aware training framework for large reasoning models that uses reasoning confidence to regularize answer confidence, aiming to fix overconfidence caused by RLVR. arXiv:2610.11352.
#AIResearch #LLMs #Calibration
https://arxiv.org/abs/2610.11352
