豆包重磅升级:搭载 SeedRealtime 音视频全双工大模型,AI 终于实现「边看、边听、边说」实时对话
8 月 5 日字节 Seed 团队正式发布SeedRealtime 原生音视频全双工大模型,并同步在豆包 App 全量上线,是行业首个大规模落地的端到端音视频全双工 AI 交互方案。
普通用户把豆包更新到最新版,点击对话框「打电话」入口,就能开启带实时画面的 AI 视频通话,体验全新多模态交互能力。
先讲人话:什么是「全双工」?之前 AI 差在哪
半双工(旧版 AI / 传统方案):类似对讲机,必须等你说完、安静下来,AI 才会开始回复;底层是 ASR 语音识别、视觉模型、TTS 语音合成多个模块串联流水线,层层叠加延迟,还容易被背景杂音误触发抢话、长时间不回应。
SeedRealtime 全双工(新版豆包):和真人打电话逻辑一致 ——AI 同时看画面、听声音、实时思考,你说话时它也能同步判断、中途插话、适时停顿,不用等你说完完整句子再应答,感知、理解、回答同步完成,没有分段等待损耗。
二、这次升级三大核心能力,结合真实场景讲清楚
1. 音视频联合理解:看图听音,看懂模糊指代、分清多人对话
传统 AI 只能单独看画面 / 单独听语音,SeedRealtime 把视频、音频、时序画面统一建模,画面信息直接参与语义判断,解决大量日常沟通痛点:
消除歧义:你指着桌上杯子说 “这个怎么调”,AI 自动锁定画面物体,不会分不清指代;遇到同音词,靠画面场景自动区分;
多人区分:多人聚餐视频通话,能对应每个人的长相、声音,记住各自需求,汇总统一方案;
实景翻译:对着外文菜单、外文路牌实时翻译,同步讲解背景知识(比如鱼香肉丝不含鱼);
时序记忆:画面切换后,依然留存之前看到的大屏、文字信息,随时调取回答。
实拍例子:四人聚餐依次介绍自己,AI 记住每个人外貌和声音,后续聊天精准对应每个人的旅行偏好,综合规划出行方案;在餐馆对着外文菜单,实时翻译菜品并讲解饮食文化。
2. 主动交互:不用你提问,看见变化自动提醒、纠错
旧 AI 只会被动等用户提问;新版豆包持续实时扫描画面,发现目标、错误会主动开口协作:
目标定点提醒:逛博物馆提前交代 “看到错金银铜虎噬鹿屏座提醒我”,镜头扫到文物立刻主动讲解工艺;
实时纠错实操:冲咖啡直接倒整粒咖啡豆,AI 立刻指出需要先研磨;萃取油脂不对,主动建议缩短萃取时间;
文档辅助:翻看论文时,提前标记训练参数章节,翻到页面主动叫停并解读数值。
3. 流畅自然对话节奏,嘈杂环境不跑偏、不误触发
官方评测:相比传统级联模型,对话卡顿、抢话、迟滞、杂音误触发问题直接减少 50%,两大亮点:
自主判断接话时机:不用外置静音检测模块,模型结合画面、人声综合判断,该倾听不打断、该补充自然插话;
强抗干扰过滤:机场、家里有人闲聊、电视噪音等背景杂音,能区分「你的提问」和「无关旁人对话」,不会被闲聊带偏。
实拍例子:机场大屏看完航班,同伴闲聊别的事 AI 无回应;你主动问航班信息,它调取之前画面数据答复;家长辅导孩子学习,旁边大人打电话,AI 只跟着孩子画面纠音,不受干扰。
三、和传统 AI 视频功能的本质区别
表格
维度 旧多模块级联 AI 豆包 SeedRealtime 新版
底层架构 语音、视觉、文字分模块串联处理 音视频时序统一端到端单模型
交互模式 一问一答,必须等用户说完 全双工同步,边听边看边回应
指代理解 只能靠文字描述,容易混淆 画面实时辅助,精准识别物体 / 手势
触发逻辑 靠静音判断,杂音极易误回复 多模态综合判断,抗干扰强
交互形态 纯被动问答 主动观察、主动提醒纠错
四、普通人怎么体验(操作步骤)
应用商店更新豆包 App 至最新版本;
打开任意对话窗口,点击输入框上方「打电话」按钮;
选择视频通话,授予相机、麦克风权限,直接开启实时全双工音视频交互。
五、行业意义与后续规划
落地里程碑:市面上同类实时多模态模型大多停留在实验室,SeedRealtime 率先面向上亿普通用户开放,把实时音视频全双工技术民用化;
产业方向:打破 “AI 只能文字单向问答” 局限,走向和真人一样自然的临场协作交互;
官方后续迭代目标:进一步压缩延迟、强化复杂多人场景、打通线上工具调用,未来 AI 看完画面可直接帮用户订票、查资料、完成完整事务。