Token 用量被推爆后,扩散语言模型为何开始进入产品?

Description
我们邀请了 AI 局内人——清华大学自动化系博士倪赞林老师(师从黄高老师),分享他对扩散语言模型、推理成本与模型演化方向的观察。

今年,Agent、强化学习和数据合成把 Token 用量推到了新高。
推理成本不再只是商业问题,也开始变成能力问题。智能越便宜,模型就越有能力承担更多探索,能力上限也可能随之提高。

在倪赞林看来,扩散语言模型是降低解码成本的激进路线之一。
传统 GPT 往往一个 token、一个 token 地生成,每一步都要重新读取模型权重;并行生成则是在一次读取后,同时推理多个 token,这就是“快”的来源。

但快不是没有代价。目前的扩散语言模型习惯先填有把握的词,容易绕开关键的推理分叉点,反而限制了推理潜力;而在高并发场景下,并行生成的效率优势也未必明显。