人大汤昕宇:可验证奖励的强化学习中样本极性的探索
合集 · ACL 2026 (12)
-
北大张文涛:面向大模型的 Data-centric AI 基础设施
35:08
-
北师大钟方威:基于欲求对齐的高效具身通信与主动交互
20:56
-
清华陈泽华:全局语义、精确时间、人声可懂的高可控文生音频系统ControlAudio
12:14
-
UCLA周自横:用 LLM Agent 模拟研究人类为何进化出道德
14:01
-
人大汤昕宇:可验证奖励的强化学习中样本极性的探索
15:13
-
MBZUAI高朗:个性化场景下AI文本检测器的效果反转现象
19:28
-
中科院李阳:面向细粒度AI生成文本检测的“创作者-编辑者”双重建模
16:22
-
西湖大学张驰 | 自主进化智能体:从固定工作流到动态架构的演进
39:51
-
圆桌对话:Agent又有了新范式?
56:58
-
北理工田炎智:基于Agent-as-a-Judge的非字面翻译评测
12:37
-
清华花佳诚:结构化文本表征引导多模态大模型空间推理
14:09
-
北理工杨振:大模型视角旋转理解可解释性研究
13:43
Description
大型推理模型通常通过可验证奖励的强化学习(RLVR)提升推理能力。本文系统研究了正负样本极性对RLVR训练动态与行为的影响,发现正样本强化已有正确推理模式,负样本促进新推理路径的探索。我们进一步探索了在样本级别和token级别调整正负样本优势值的效果,并据此提出A3PO方法,在token级别自适应且非对称地为不同极性样本精准分配优势信号。