字节跳动 Seed 发布原生音视频全双工模型 SeedRealtime
深潮 TechFlow 消息,8 月 10 日,字节跳动 Seed 团队发布 SeedRealtime,一款原生音视频全双工大模型,已上线豆包 App。该模型将音频、视频和文本统一在端到端架构中,并行处理感知、理解、决策与表达,并将轮次切换内化到模型内部,取代外部语音活动检测器。字节内部人工评估显示,其节奏问题相比级联架构减半,但未发布技术报告、参数规模、开源权重或 API。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯