7月21日,小鹏集团推出了TuringViT高效视觉编码器,旨在为VLM/VLA时代提供系统性重构的视觉编码器架构设计、数据范式与训练流程。TuringViT将支持智能驾驶、智能座舱和IRON人形机器人三大业务场景,并提供一条可复现、低成本训练SOTA级视觉Transformer的技术路径,推动先进视觉大模型的普及。
TuringViT在架构、数据、训练三个维度实现突破,构建了“线性注意力主导+高质量数据治理+原生动态分辨率”的技术体系,提升了效果、效率与落地性。该编码器包含两个规格版本:TuringViT-18L和TuringViT-24L,分别主打动态分辨率下的高效部署和提升表征能力。实测数据显示,TuringViT在高分辨率下的效率优势显著,推理吞吐量在1536×1536分辨率下达到Seed1.5-ViT的3.04倍。
TuringViT采用VISTA-Curation多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升。在图文数据和视频数据的处理上,该流水线通过精细化筛选和全流程治理,生成具备变换感知能力的视频标注,让模型学习更鲁棒的视觉表征。最终,TuringViT仅用0.85B图文对,便在多项零样本分类基准上取得83.6%的平均准确率,实现了“十分之一数据,更优效果”的突破。



来源:一电快讯
返回第一电动网首页 >
以上内容由AI创作,如有问题请联系admin#d1ev.com(#替换成@)沟通,AI创作内容并不代表第一电动网(www.d1ev.com)立场。
文中图片源自互联网或AI创作,如有侵权请联系邮件删除。