Wan-Streamer:让 AI 像真人一样边听、边看、边回应

Description
告别机械感与高延迟!Wan-Streamer——面向实时双工交互的端到端全模态理解与生成模型,将“听、看、说、演”统一进单个 Transformer,模型能够持续倾听和回应,并实时生成同步的语音、视频与自由行为。

✨ 三大核心突破:
⚡️ 极致低延迟:端到端响应仅需 550ms(200ms模型延迟 + 350ms网络延迟),对话如丝般顺滑。
🎬 画质大跃升:输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,微表情场景细节清晰可见。
🧩 全模态端到端:原生支持文本、音频、视频的实时理解与同步生成,无需外部模块拼装,架构更纯粹。

项目主页:https://wan-streamer.com/ 
论文:
v0.1: https://arxiv.org/abs/2606.25041 
v0.2: https://arxiv.org/abs/2607.04443 
v0.3: https://arxiv.org/abs/2607.15038