当前位置:主页 > 热点 > 正文

字节推出SeedRealtime音全双工大模型,已在豆包App全量上线

发布时间:2026-08-06 已有: 位 网友关注

  与此前业界主流的级联系统不同,后者依赖自动语音识别、

  模型原生支持声音、画面与时序信息的深度融合,能够结合场景消解同音词歧义,也能准确理解

  模型具备持续的环境感知与主动表达能力,能在察觉画面状态变化时主动提醒,并能调用工具融入表达。官方演示中,模型可在博物馆持续观察镜头画面、识别指定文物后主动提醒,也可在用户操作咖啡机时根据画面变化实时纠错。

  模型能够实时感知用户的对话状态,在适当时机自然接话、停顿与回应;同时具备抗干扰能力,能分辨旁人闲聊与背景噪声,避免误触发。在机场等嘈杂场景中,模型能够区分用户与旁人的对话。

  字节披露的端到端人工评测数据显示,相比传统级联系统,SeedRealtime将音对话中的节奏问题减少约一半。“话未说完被抢断、话音已落却回应迟缓,或是被背景杂音与闲聊误触发”等卡壳现象均有明显下降。同时,单次对话能够完整、顺畅交流的概率也有明显提升。

  从行业基本面来看,SeedRealtime的推出符合今年基础模型的演进趋势。自今年上半年以来,头部企业的竞争焦点已明显从单纯追求参数规模,转向多模态实时交互的商业化落地。

  豆包App是字节跳动在C端市场的核心AI产品。此次在端内快速全量上线全双工大模型,其业务逻辑在于通过降低交互门槛,进一步争夺用户规模与应用内的停留时长。

  不过,音全双工技术的常态化运营仍面临直接的工程与商业挑战。连续多模态信息流的实时处理,对云端算力和网络带宽的消耗呈指数级增长。

  在C端海量并发请求的场景下,如何将模型的推理成本控制在商业可接受的范围内,是包括字节跳动在内所有AI研发企业必须跨越的门槛。

  另一方面,市场对通话类AI的真实需求黏性仍需打个问号。主动提醒、实时交互等功能,在特定场景下是否会造成用户的体验冗余甚至打扰,目前尚无定论。

  SeedRealtime能否在新鲜感褪去后,沉淀出具有高频、刚需属性的核心应用场景,多模态应用生态能否就此闭环,还需要后续真实的留存数据来验证。

温馨提示:所有理财类资讯内容仅供参考,不作为投资依据。