北理工田炎智:基于Agent-as-a-Judge的非字面翻译评测

合集 · ACL 2026 (12)

  1. 35:08
    北大张文涛:面向大模型的 Data-centric AI 基础设施
  2. 20:56
    北师大钟方威:基于欲求对齐的高效具身通信与主动交互
  3. 12:14
    清华陈泽华:全局语义、精确时间、人声可懂的高可控文生音频系统ControlAudio
  4. 14:01
    UCLA周自横:用 LLM Agent 模拟研究人类为何进化出道德
  5. 15:13
    人大汤昕宇:可验证奖励的强化学习中样本极性的探索
  6. 19:28
    MBZUAI高朗:个性化场景下AI文本检测器的效果反转现象
  7. 16:22
    中科院李阳:面向细粒度AI生成文本检测的“创作者-编辑者”双重建模
  8. 39:51
    西湖大学张驰 | 自主进化智能体:从固定工作流到动态架构的演进
  9. 56:58
    圆桌对话:Agent又有了新范式?
  10. 12:37
    北理工田炎智:基于Agent-as-a-Judge的非字面翻译评测
  11. 14:09
    清华花佳诚:结构化文本表征引导多模态大模型空间推理
  12. 13:43
    北理工杨振:大模型视角旋转理解可解释性研究
Description
本工作针对传统机器翻译指标(如BLEU)以及LLM-as-a-Judge难以准确评估非直译领域机器翻译质量的问题,构建了首个针对非直译领域翻译质量评估的Meta-evaluation数据集MENT,并提出了支持调用搜索工具的Agent-as-a-Judge评估框架RATE。该框架通过一个执行自我反思循环的核心智能体,根据待评估翻译特点选择性地调用3个子智能体:搜索智能体、评估智能体和比较智能体。实验结果表示,RATE在翻译质量评估中有更高的准确性。