人大汤昕宇:可验证奖励的强化学习中样本极性的探索

合集 · ACL 2026 (12)

  1. 35:08
    北大张文涛:面向大模型的 Data-centric AI 基础设施
  2. 20:56
    北师大钟方威:基于欲求对齐的高效具身通信与主动交互
  3. 12:14
    清华陈泽华:全局语义、精确时间、人声可懂的高可控文生音频系统ControlAudio
  4. 14:01
    UCLA周自横:用 LLM Agent 模拟研究人类为何进化出道德
  5. 15:13
    人大汤昕宇:可验证奖励的强化学习中样本极性的探索
  6. 19:28
    MBZUAI高朗:个性化场景下AI文本检测器的效果反转现象
  7. 16:22
    中科院李阳:面向细粒度AI生成文本检测的“创作者-编辑者”双重建模
  8. 39:51
    西湖大学张驰 | 自主进化智能体:从固定工作流到动态架构的演进
  9. 56:58
    圆桌对话:Agent又有了新范式?
  10. 12:37
    北理工田炎智:基于Agent-as-a-Judge的非字面翻译评测
  11. 14:09
    清华花佳诚:结构化文本表征引导多模态大模型空间推理
  12. 13:43
    北理工杨振:大模型视角旋转理解可解释性研究
Description
大型推理模型通常通过可验证奖励的强化学习(RLVR)提升推理能力。本文系统研究了正负样本极性对RLVR训练动态与行为的影响,发现正样本强化已有正确推理模式,负样本促进新推理路径的探索。我们进一步探索了在样本级别和token级别调整正负样本优势值的效果,并据此提出A3PO方法,在token级别自适应且非对称地为不同极性样本精准分配优势信号。