小鹏发布TuringViT高效视觉编码器:十分之一数据实现更优性能,全面支撑智驾与机器人

2026-07-22 16:39:56   |   微观猎人   |   4371

7月22日,小鹏被报道正式发布TuringViT高效视觉编码器,面向VLM/VLA时代对视觉编码器的架构设计、数据范式与训练流程进行了系统性重构。该技术将全面支撑智能驾驶、智能座舱及IRON人形机器人三大业务场景。

当前行业普遍采用的“复用开源通用ViT”方案,在高分辨率、多视角、连续视频帧等真实场景下面临算力成本与数据效率的双重瓶颈。TuringViT从架构、数据、训练三个维度同步突破:

架构层面,TuringViT以Turing线性注意力(TLA) 作为核心计算单元,将计算复杂度从二次方降至近线性。实测显示,在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍。系统提供TuringViT-18L(主打高效部署)和TuringViT-24L(更强表征能力)两个规格。

数据层面,TuringViT打造了VISTA-Curation多模态数据治理流水线,通过精细化筛选提升单样本监督价值,而非简单地堆砌数据规模。最终仅用0.85B图文对(约为SigLIP2-L训练数据规模的10%),便在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越使用10B数据训练的主流基线。

训练层面,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练阶段即适配下游VLM/VLA的输入特性,告别“固定分辨率预训练+事后适配”的传统模式。

作为小鹏物理AI技术体系的关键组件,TuringViT在具体业务中已有明确落点:

- 智能驾驶:作为第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率道路场景输入。

- 智能座舱:支撑视觉特征与语言模型的高效对齐,支持不同画幅和比例的视觉输入。

- IRON人形机器人:充当“视觉视网膜”角色,为物体识别、空间关系理解、动态环境追踪等提供基础感知能力。

TuringViT的发布使小鹏的物理AI底层技术能力进一步完善——从智能驾驶、座舱交互到具身智能,物理AI各场景的“感知入口”正在走向统一的技术底座。据官方透露,TuringViT的架构设计与训练流程不依赖特定硬件平台,旨在为行业提供可复现、低成本的SOTA级视觉Transformer训练路径。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

小鹏发布TuringViT高效视觉编码器:十分之一数据实现更优性能,全面支撑智驾与机器人

2026-07-22 16:39:56 浏览量: 4371 作者: 微观猎人

7月22日,小鹏被报道正式发布TuringViT高效视觉编码器,面向VLM/VLA时代对视觉编码器的架构设计、数据范式与训练流程进行了系统性重构。该技术将全面支撑智能驾驶、智能座舱及IRON人形机器人三大业务场景。

当前行业普遍采用的“复用开源通用ViT”方案,在高分辨率、多视角、连续视频帧等真实场景下面临算力成本与数据效率的双重瓶颈。TuringViT从架构、数据、训练三个维度同步突破:

架构层面,TuringViT以Turing线性注意力(TLA) 作为核心计算单元,将计算复杂度从二次方降至近线性。实测显示,在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍。系统提供TuringViT-18L(主打高效部署)和TuringViT-24L(更强表征能力)两个规格。

数据层面,TuringViT打造了VISTA-Curation多模态数据治理流水线,通过精细化筛选提升单样本监督价值,而非简单地堆砌数据规模。最终仅用0.85B图文对(约为SigLIP2-L训练数据规模的10%),便在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越使用10B数据训练的主流基线。

训练层面,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练阶段即适配下游VLM/VLA的输入特性,告别“固定分辨率预训练+事后适配”的传统模式。

作为小鹏物理AI技术体系的关键组件,TuringViT在具体业务中已有明确落点:

- 智能驾驶:作为第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率道路场景输入。

- 智能座舱:支撑视觉特征与语言模型的高效对齐,支持不同画幅和比例的视觉输入。

- IRON人形机器人:充当“视觉视网膜”角色,为物体识别、空间关系理解、动态环境追踪等提供基础感知能力。

TuringViT的发布使小鹏的物理AI底层技术能力进一步完善——从智能驾驶、座舱交互到具身智能,物理AI各场景的“感知入口”正在走向统一的技术底座。据官方透露,TuringViT的架构设计与训练流程不依赖特定硬件平台,旨在为行业提供可复现、低成本的SOTA级视觉Transformer训练路径。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号