字节跳动发布Doubao-Seed-2.0-lite:首款全模态理解模型
5月7日,据字节跳动旗下火山引擎官方消息,Doubao-Seed-2.0-lite今日迎来新版本升级,成为豆包大模型家族首款全模态理解模型。该模型支持视频、图像、音频、文本的原生统一理解,同时在Agent、Coding与GUI能力方面同步获得提升。在同等算力成本下,它被视为企业大规模、批量化部署全模态推理任务的更具性价比选择。目前,全新版本已在火山方舟上线。
新版本在视觉理解能力上大幅提升。在物理(HiPhO)、医疗(MedXpertQA)等高阶学科推理方面,表现大幅超越2月发布的Doubao-Seed-2.0-pro。在细粒度感知(BabyVision、WorldVQA)与具身理解(ERQA)等关键领域达到行业领先水平,更适合企业在高价值场景中规模化部署。
融入语音理解后,新版本可同时处理多种输入模态,并完成跨模态联合推理,能够直接应对需要“音画结合”才能判断的复杂业务需求。在视频理解场景中,模型可联合分析画面与音频信息,精准辨析视听一致性,并支持根据自然语言指令在视频中精准定位特定事件发生的时间点。此外,它还能跨越多个时间段提取关键线索,持续追踪人物与事件发展,并基于画面进行多步逻辑推理。
音频方面,模型支持19个语种的精准语音转写,以及中英文与其他14个语种之间的互译。它还能深度捕捉语音中的情绪变化、环境背景声与音乐细节,输出更接近人类认知的语义信息。根据公开评测集,Doubao-Seed-2.0-lite在语音识别、翻译等多项音频理解基准上优于Gemini-3.1-Pro。
模型对多轮、多步、多约束指令的遵循度显著提升,增强了任务反思推理与多Agent协同调度能力,使Agent在长程任务中能够自我拆解、自我校验。Doubao-Seed-2.0-lite深度适配OpenClaw、Hermes Agent等框架,强化深度搜索与Skill动态调用,可边执行边沉淀经验。在Coding能力方面,模型全面覆盖前端页面、3D场景与游戏开发,交付产物在视觉美观度与工程完整度上进一步提升,能够胜任从原型到上线的前后端深度开发。
基于升级的GUI能力,Doubao-Seed-2.0-lite将“看懂界面”与“动手操作”打通为闭环。它既能精准识别按钮、菜单、表单、弹窗等界面元素及其状态,也能稳定完成点击、输入、右键、滚动、拖拽等操作。从读懂一张网页到跨应用、跨窗口连续执行一整套业务流程,让Agent真正具备“端到端把活干完”的交付力。
全模态理解结合持续增强的Agent、Coding和GUI能力,正在帮助各领域企业解锁更多商业化应用场景。在电竞领域,模型可联合分析比赛画面与语音指挥,围绕准星、身法、道具、经济等多维信息进行切片点评,并能跨越整场比赛多个回合追踪选手表现,赛后生成高光与失误图谱及时间轴复盘。依托Agent Harness框架,模型可连续执行跨越25小时的长程任务,整套交互界面也由模型直接生成,排版整洁,达到可上线水准。
在在线教育场景中,用户可在ArkClaw中调用模型,定时查看课堂教学录像,识别师生状态、口语发音与情绪变化,自动生成课堂表现报告并发送给家长。在海外电商运营中,基于模型的GUI能力,可自主搜索多语言的口红爆款视频,下载并拆解要素,生成多语言推广视频并自动发布,执行过程不断进化Skills。
此外,Doubao-Seed-2.0-mini全新版也已同步上线,同样支持全模态理解,相比上一版本思考长度大幅缩短,Tokens效率更高。