腾讯混元联合多所高校发布OpenSearch-VL:开源多模态搜索智能体训练方案

2026-05-07 17:14:52   |   探索者   |   1590

5月7日,腾讯混元携手加州大学洛杉矶分校、香港中文大学等学术机构,联合发布OpenSearch-VL开源多模态训练方案。该方案通过强化学习技术,打造具备前沿能力的深度搜索智能体。

多模态搜索智能体是指能够同时处理图像、文本等多种模态输入,并主动调用搜索引擎、图像处理工具等外部工具,进行多步骤推理、证据验证与知识检索的智能体,旨在解决知识密集型的复杂视觉问答问题。

据介绍,该研究的相关报告已于昨日(5月6日)在arXiv平台发表。OpenSearch-VL方案致力于训练前沿的多模态深度搜索智能体。研究团队构建了高质量的数据管道,通过维基百科路径采样与模糊实体重写来减少检索捷径,并产出了SearchVL-SFT-36k等数据集。

研究团队指出,当前阻碍前沿多模态搜索智能体进化的最大瓶颈在于高质量训练数据的匮乏。现有顶尖系统多由商业公司主导,其数据来源、过滤标准与工具使用轨迹均属私有,这阻碍了先进能力的复现与系统性研究。OpenSearch-VL提供了从数据、工具到训练算法的完整开源方案。

在数据管道构建方面,OpenSearch-VL利用维基百科的超链接图谱执行多跳实体路径采样,将中间实体重写为模糊描述,并将锚点实体锚定至源图像。这一设计有效抑制了单步检索捷径,鼓励智能体学习多跳搜索与推理行为。该管道产出的SearchVL-SFT-36k数据集用于监督微调,平均每个轨迹包含6.3次工具调用。同时,研究团队随机选取10%的数据应用模糊、下采样等降质处理,配对增强工具,以诱导“边思考边处理图像”的行为。

在工具环境方面,OpenSearch-VL超越了仅检索的智能体,统一集成了文本搜索、图像搜索、OCR、裁剪、锐化、超分辨率与透视校正等功能。这使得智能体在查询外部知识之前,能够先处理模糊、低分辨率或倾斜的视觉输入,实现主动感知与知识获取的结合。

实验结果显示,OpenSearch-VL-30B-A3B模型将基线平均得分从47.8提升至61.6,在VDR、MMSearch等基准测试上取得了显著增益。消融实验也验证了各组件的贡献:移除源锚点锚定、模糊重写或分阶段过滤后,平均得分下降了8.2至11.5点。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

腾讯混元联合多所高校发布OpenSearch-VL:开源多模态搜索智能体训练方案

2026-05-07 17:14:52 浏览量: 1590 作者: 探索者

5月7日,腾讯混元携手加州大学洛杉矶分校、香港中文大学等学术机构,联合发布OpenSearch-VL开源多模态训练方案。该方案通过强化学习技术,打造具备前沿能力的深度搜索智能体。

多模态搜索智能体是指能够同时处理图像、文本等多种模态输入,并主动调用搜索引擎、图像处理工具等外部工具,进行多步骤推理、证据验证与知识检索的智能体,旨在解决知识密集型的复杂视觉问答问题。

据介绍,该研究的相关报告已于昨日(5月6日)在arXiv平台发表。OpenSearch-VL方案致力于训练前沿的多模态深度搜索智能体。研究团队构建了高质量的数据管道,通过维基百科路径采样与模糊实体重写来减少检索捷径,并产出了SearchVL-SFT-36k等数据集。

研究团队指出,当前阻碍前沿多模态搜索智能体进化的最大瓶颈在于高质量训练数据的匮乏。现有顶尖系统多由商业公司主导,其数据来源、过滤标准与工具使用轨迹均属私有,这阻碍了先进能力的复现与系统性研究。OpenSearch-VL提供了从数据、工具到训练算法的完整开源方案。

在数据管道构建方面,OpenSearch-VL利用维基百科的超链接图谱执行多跳实体路径采样,将中间实体重写为模糊描述,并将锚点实体锚定至源图像。这一设计有效抑制了单步检索捷径,鼓励智能体学习多跳搜索与推理行为。该管道产出的SearchVL-SFT-36k数据集用于监督微调,平均每个轨迹包含6.3次工具调用。同时,研究团队随机选取10%的数据应用模糊、下采样等降质处理,配对增强工具,以诱导“边思考边处理图像”的行为。

在工具环境方面,OpenSearch-VL超越了仅检索的智能体,统一集成了文本搜索、图像搜索、OCR、裁剪、锐化、超分辨率与透视校正等功能。这使得智能体在查询外部知识之前,能够先处理模糊、低分辨率或倾斜的视觉输入,实现主动感知与知识获取的结合。

实验结果显示,OpenSearch-VL-30B-A3B模型将基线平均得分从47.8提升至61.6,在VDR、MMSearch等基准测试上取得了显著增益。消融实验也验证了各组件的贡献:移除源锚点锚定、模糊重写或分阶段过滤后,平均得分下降了8.2至11.5点。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号