7月21日,小鹏汽车发布TuringViT高效视觉编码器,通过三项创新:Turing线性注意力机制降低计算复杂度、VISTA-Curation数据治理方法用10%数据实现更优零样本泛化、原生动态分辨率训练策略,赋能智能驾驶、智能座舱及人形机器人,加速视觉大模型规模化落地。
7月21日,小鹏汽车正式发布TuringViT高效视觉编码器。该技术从根本上重新思考视觉语言模型与视觉语言动作模型时代下,视觉编码器的设计方式、数据组织方法以及训练范式的落地路径。TuringViT致力于深度赋能智能驾驶、智能座舱和IRON人形机器人三大核心业务,并为行业提供一条可复现、低门槛且达到SOTA水准的视觉Transformer训练路径。
TuringViT的强劲表现源自三项关键创新。第一,原创的Turing线性注意力机制将计算复杂度从指数级压缩至近似线性水平。在1536超高分辨率输入条件下,推理效率显著超越当前主流基准模型。第二,VISTA-Curation数据治理方法仅需使用10%的训练数据,即可实现更优的零样本泛化能力,效率极为突出。第三,原生动态分辨率训练策略从预训练初始阶段就匹配下游任务的实际分辨率需求,彻底摆脱传统“预训练-微调”路线中后置适配的难题。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
作为小鹏物理AI全栈技术闭环中的核心视觉基座,TuringViT不仅增强了车载端对高分辨率视觉信息的理解与处理能力,更在深层次上为具身智能系统构建了通用、鲁棒、可扩展的视觉感知基础。这将加速先进视觉大模型在真实产业场景中的规模化落地与普惠应用。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述