研究解读 · 进化解读
Wan Streamer:边听边看边说话的实时 AI
模型侧响应约 200ms、总延迟约 550ms;v0.1 仅 192p,演示为预录非实时体验。
速览
- Wan Streamer v0.1 是一个原生流式、端到端的交互式基础模型,在同一个 Transformer 里同时把语言、音频、视频当作输入和输出来建模,靠 block-causal attention(块状因果注意力)协调,边来边算地流式生成。
- 模型自己算一段回应大约 200ms,加上 350ms 的双向网络延迟,总交互延迟约 550ms;25fps 下,最短的流式处理单元只有 160ms。
- 官方称它是唯一能用单个端到端 Transformer 输出同步音视频、且总延迟压在 1 秒内的模型;现有系统要么只出语音(GPT-4o Realtime、豆包、Gemini Live),要么靠 ASR+LLM+TTS+动画 一串模块拼接。
- 当前 v0.1 分辨率只有 192p,定位是端到端设计的概念验证;放出来的角色演示都是未经剪辑的预录模型输出,不是在线实时体验。
- 对比图里的延迟数字混了不同测量口径:上方一组是端到端交互闭环,下方一组只算渲染阶段(不含外部 LLM/ASR/TTS),官方提示要按注释打折看。
⚑
这是 Wan Streamer 官方发布页(厂商通稿)。文中的延迟、能力对比、「唯一」等定位措辞都出自官方,部分对比数字混合了不同测量边界,相关处已随文说明。
1这是什么
一个模型跑通实时音视频对话
通义万相(Wan)团队最近发布了 Wan Streamer v0.1,一个实时音视频交互模型。能实时对话的 AI 现在不少,但能一边看你的脸、一边听你说话、一边开口回应、自己还自带一张会动的脸的,几乎没有。Wan Streamer 把这件事压进了一个模型里。
它在同一个 Transformer 里同时处理语言、音频、视频的输入和输出,做到亚秒级的全双工音视频对话:模型自己算出一段回应大约只要 200 毫秒,加上网络往返后总延迟约 550 毫秒。
⚡
为什么值得看:现在能实时对话的系统分两类,一类响应快但只出声音、没有可见的脸(GPT-4o Realtime、豆包、Gemini Live),另一类有脸但靠外部 ASR、语言模型、TTS、动画一串模块拼出来。官方称 Wan Streamer 是唯一用单个端到端 Transformer 同时吐出同步音视频、且总延迟压在 1 秒内的模型。
~200 ms
模型侧响应延迟(官方报告)
~550 ms
总交互延迟=200ms 模型侧+350ms 网络
160 ms
25fps 下最短的流式处理单元
192p
v0.1 分辨率,端到端设计的概念验证
总延迟 550ms 拆开看
模型本身只占 200ms,剩下 350ms 是网络往返。也就是说,纯模型的反应速度比读出来的总延迟更快。
2先看效果
四段角色演示 + 实时录屏
下面四段演示都出自同一个模型,只是换了人物、声音和场景。先看效果,再讲原理。
看之前先说清楚:这些都是未经剪辑的预录模型输出,不是在线实时体验;当前 v0.1 分辨率只有 192p,用来验证端到端设计是否跑得通。官方称后续扩到更高分辨率较容易,但那是计划,不是 v0.1 已实现的。
中文 · 暖色室内视频通话。聊刮胡子、在家办公、想看一部特效不错的新动作片。清晰自然男声。来源:Wan Streamer 官方 demo
中文 · 明亮白色室内。聊 CP、娱乐圈八卦、周星驰《功夫》,最后模仿经典笑容。轻松愉快女声。来源:Wan Streamer 官方 demo
英文 · 车内近景。女生说自己很累,感谢对方耐心陪伴。疲惫真诚女声。来源:Wan Streamer 官方 demo
英文 · 浅色室内近景。聊无意识刷手机、自动化习惯、关掉通知。自然女声。来源:Wan Streamer 官方 demo