从 Benchmark 分数到真实生产力,Agent 还要过哪一关?

Description
我们邀请了AI局内人——复旦大学 NLP 实验室博士生、蚂蚁奖学金得主奚志恒老师,分享他对大模型智能体、强化学习和可扩展监督等研究方向的思考与判断。

ChatGPT 爆发时,很多人看到的是更强的对话模型。
但在奚志恒看来,模型不应该只停留在对话框里,而应该进入真实环境,与人、与世界交互,并真正产生价值。

当前行业仍在通过模型规模、数据和强化学习 scaling,尽可能抬高智能上限。但 Agent 的下一步,不只是继续刷新 Benchmark 分数,还要研究多智能体组织、可扩展监督,以及如何让人类持续参与模型进化。

当下,他最关注的问题是如何让智能体可靠、可监督地持续进化,同时提高人的效率、放大人的潜力,并扩展人的能力边界。他相信,未来是一个 AI-native 的世界,但技术的发展必须是 human-centric。