小鹏发布TuringViT视觉编码器,面向VLM/VLA时代,覆盖智驾、座舱与机器人全场景。该方案采用线性注意力与原生动态分辨率,仅用0.85B图文对训练,在多项基准上平均准确率83.6%,超越10B数据模型,推动先进视觉大模型行业普惠。
小鹏汽车的动作,向来是行业里值得留意的风向标。今年上半年,这家公司密集发布了一系列物理AI技术报告,内容涵盖多视角生成式世界模型X-World、世界模型推理加速引擎X-Cache、预测式世界模型X-Foresight,以及X-Mind技术框架。而就在最近,他们又亮出了一张新牌——TuringViT,一个面向VLM/VLA时代的高效视觉编码器。这套方案,从架构设计、数据范式到训练流程,几乎是对视觉编码器的一次系统性重构。

长期稳定更新的攒劲资源: >>>点此立即查看<<<
视觉编码器,是物理AI的“感知入口”——这个说法并不夸张。所有场景理解、状态判断、动作决策,第一步都得从高质量的视觉特征提取开始。但随着VLM和VLA技术加速落地到真实场景,高分辨率图像、多视角输入、连续视频帧这些需求,已经成了常态。行业对视觉编码器的要求,正在发生本质性的变化。
眼下主流的技术路线,普遍面临三重瓶颈:算力成本高、数据效率低、场景适配难。许多团队还在沿用“复用开源通用ViT”的老路子,但这套方案,在智能驾驶、具身机器人这类真实场景中,已经越来越跟不上节奏。性能、延迟、定制化——这些需求,通用模型很难同时满足。正是冲着这些痛点,小鹏推出了TuringViT,一套完整的系统性解决方案。

从架构、数据到训练,TuringViT三条线同步推进,搭建起一个“线性注意力主导+高质量数据治理+原生动态分辨率”的技术体系。效果、效率、落地性,三者同步提升。数据效率是其中的亮点:TuringViT只用了0.85B图文对,差不多是主流模型训练数据规模的十分之一,结果在ImageNet-1K等六项零样本分类基准上,平均准确率达到了83.6%,直接超越了那些用10B数据训练出来的开源基线。在COCO、Flickr30K的图文检索任务上,同样实现了“十分之一数据,效果更优”的突破。
这套编码器的发布,让小鹏全栈自研的物理AI底层技术能力,变得更加完整。它的价值不只局限于智能辅助驾驶,而是会辐射到更多物理AI的业务场景。
在智能驾驶领域,TuringViT是第二代VLA系统的核心视觉编码器。它的近线性延迟特性,让高分辨率视觉感知能在车端算力约束下稳定运行。窄路通行、无导航辅助驾驶、复杂路口处理、长尾交通参与者识别——这些功能,体验上会有明显提升。端侧大模型的性能潜力,也能被进一步释放,让驾驶决策既“看得清”,又“反应快”。
智能座舱和驾泊一体化场景同样受益。TuringViT的VLM原生特性,让视觉特征与语言模型的对齐更高效,识别精度更高,还能适应不同画幅和比例的视觉输入。未来车辆与用户交互的丰富座舱功能,多了不少想象空间。
在小鹏IRON人形机器人的技术体系中,TuringViT扮演着“视觉视网膜”的角色。它为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。统一的基座架构,让智能驾驶场景积累的海量视觉经验,能够快速迁移到机器人场景,跨场景研发成本因此大幅降低。
TuringViT的价值,不止于小鹏内部业务的落地。它也为行业提供了一条可复现、低成本训练SOTA级视觉Transformer的技术路径。换句话说,先进视觉大模型,正在从“头部团队专属”走向“行业普惠”。
小鹏集团表示,未来将持续扩大高质量图文视频数据规模,深化时序建模与具身视觉方向的技术探索,推动视觉基座与VLM/VLA系统的更深度融合。让先进AI技术,真正渗透到每一次出行、每一个交互场景——用科技突破,定义智能出行与具身智能的新高度。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述