


凤凰网科技讯 7月21日,小鹏集团正式发布TuringViT高效视觉编码器,面向VLM/VLA时代系统性重构了视觉编码器的架构设计、数据范式与训练流程。该编码器将全面支撑小鹏智能驾驶、智能座舱及IRON人形机器人三大业务场景。
TuringViT的核心技术创新包括三个方面:
Turing线性注意力架构:采用“5层线性注意力+1层标准多头注意力”的混合Turing Block架构,将计算复杂度从二次方降至近线性。实测显示,在1536×1536分辨率下,TuringViT-18L推理吞吐量达到Seed1.5-ViT的3.04倍,为高分辨率感知、多摄像头输入的端侧部署扫清了算力障碍。
VISTA-Curation数据治理:通过三步精细化筛选(质量过滤、多样化字幕生成与交叉验证、综合评分排序),仅用0.85B图文对(约SigLIP2-L训练数据的10%),便在ImageNet-1K等零样本分类基准上取得83.6%平均准确率,超越使用10B数据训练的主流开源基线。
原生动态分辨率训练:采用四阶段渐进式训练范式(视觉初始化→范围受限动态分辨率→原生分辨率精调→图文视频混合训练),从预训练阶段就适配下游VLM/VLA的输入特性,无需事后适配。
小鹏表示,TuringViT的价值在于为行业提供了一条可复现、低成本训练SOTA级视觉Transformer的技术路径,推动先进视觉大模型从“头部团队专属”走向“行业普惠”。相关论文及代码已同步公开。