字节跳动推出SeedRealtime大模型:音视频全双工交互,开启智能交互新体验

   发布时间:2026-08-05 18:55 作者:任飞扬

字节跳动旗下豆包App近日迎来重大更新,正式上线原生音视频全双工大模型SeedRealtime。这款基于统一架构研发的交互模型,突破了传统音视频交互的形态限制,通过原生融合音频、视频与文本信息,实现了"边看、边听、边说"的实时交互体验。用户只需将应用升级至最新版本,通过"打电话"功能进入视频通话界面即可开启全新交互模式。

传统音视频交互长期面临技术瓶颈:级联系统依赖语音识别、视觉理解、语音合成等多个模块串联,导致延迟累积和信息损耗;端到端方案虽提升流畅度,但多数仍需外置语音检测模块,本质上仍是半双工交互。SeedRealtime的创新在于将声音、画面、时序与表达统一整合到单个模型中,在连续信息流中同步完成感知、理解、决策与表达,彻底改变了"先听后看再答"的交互逻辑。

该模型的核心能力体现在三个方面:首先是多模态联合理解能力,通过深度融合场景声音、画面及时序信息,可精准解析视觉指代关系。例如当用户询问"这个怎么弄"时,模型能综合手势、视线、历史操作等上下文,准确判断"这个"的具体指向。其次是主动交互能力,模型具备环境感知与工具调用能力,能在检测到关键目标出现时主动提醒,将交互从被动响应升级为主动协作。第三是流畅的节奏控制,通过实时感知对话状态,模型能在恰当时机自然接话、停顿,同时具备抗干扰能力,可区分背景噪声与有效对话。

实际应用场景中,SeedRealtime展现出强大的环境适应力。在多人聚会场景中,模型能持续追踪发言者身份;旅游场景中可实时翻译菜单并转述服务人员介绍;博物馆导览时能自动识别文物并主动讲解;操作设备时可根据画面变化实时纠错;阅读文献时能监测翻页进度并在指定章节自动提示。面对复杂环境,模型能精准判断回应时机,在机场等嘈杂场所可区分用户对话与背景闲聊,在儿童学习场景中则能过滤电话铃声等干扰。

端到端人工评测数据显示,相比传统级联系统,SeedRealtime将对话节奏问题减少约50%。模型对说话时机的把握更自然,有效减少了"抢话""延迟回应"或"误触发"等卡顿现象,单次对话的完整流畅度显著提升。目前该技术已在豆包App实现规模化落地,标志着音视频全双工交互技术进入实用阶段。

 
 
更多>同类内容
全站最新
热门内容
本栏最新