小鹏发布TuringViT高效视觉编码器:十分之一数据实现更优性能,全面支撑智驾与机器人
7月22日,小鹏被报道正式发布TuringViT高效视觉编码器,面向VLM/VLA时代对视觉编码器的架构设计、数据范式与训练流程进行了系统性重构。该技术将全面支撑智能驾驶、智能座舱及IRON人形机器人三大业务场景。
当前行业普遍采用的“复用开源通用ViT”方案,在高分辨率、多视角、连续视频帧等真实场景下面临算力成本与数据效率的双重瓶颈。TuringViT从架构、数据、训练三个维度同步突破:
架构层面,TuringViT以Turing线性注意力(TLA) 作为核心计算单元,将计算复杂度从二次方降至近线性。实测显示,在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍。系统提供TuringViT-18L(主打高效部署)和TuringViT-24L(更强表征能力)两个规格。
数据层面,TuringViT打造了VISTA-Curation多模态数据治理流水线,通过精细化筛选提升单样本监督价值,而非简单地堆砌数据规模。最终仅用0.85B图文对(约为SigLIP2-L训练数据规模的10%),便在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越使用10B数据训练的主流基线。
训练层面,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练阶段即适配下游VLM/VLA的输入特性,告别“固定分辨率预训练+事后适配”的传统模式。
作为小鹏物理AI技术体系的关键组件,TuringViT在具体业务中已有明确落点:
- 智能驾驶:作为第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率道路场景输入。
- 智能座舱:支撑视觉特征与语言模型的高效对齐,支持不同画幅和比例的视觉输入。
- IRON人形机器人:充当“视觉视网膜”角色,为物体识别、空间关系理解、动态环境追踪等提供基础感知能力。
TuringViT的发布使小鹏的物理AI底层技术能力进一步完善——从智能驾驶、座舱交互到具身智能,物理AI各场景的“感知入口”正在走向统一的技术底座。据官方透露,TuringViT的架构设计与训练流程不依赖特定硬件平台,旨在为行业提供可复现、低成本的SOTA级视觉Transformer训练路径。