小鹏集团发布TuringViT高效视觉编码器
2026-07-26 【 字体:大 中 小 】
7 月 21 日消息,小鹏集团今日发布 TuringViT 高效视觉编码器,面向 VLM / VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。
小鹏集团表示,TuringViT 将全面支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景,同时为行业提供了一条可复现、低成本训练 SOTA 级(State-of-the-Art,最新技术水平)视觉 Transformer 的技术路径,推动先进视觉大模型从“头部团队专属”走向“行业普惠”。
据介绍,TuringViT 从架构、数据、训练三个维度同步突破,打造了“线性注意力主导 + 高质量数据治理 + 原生动态分辨率”的完整技术体系,实现了效果、效率与落地性的三重提升。
TuringViT 共推出两个规格版本:
TuringViT-18L包含 3 组 Turing Block(共 15 层 TLA+3 层 MHA),主打动态分辨率下的高效部署;
TuringViT-24L包含 4 组 Turing Block(共 20 层 TLA+4 层 MHA),在保持线性计算主导的前提下进一步提升表征能力。
实测数据显示,随着输入分辨率提升,TuringViT 的延迟增长曲线远平缓于标准 softmax ViT,高分辨率下的效率优势愈发显著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。
不同于行业“堆数据规模”的粗放路线,TuringViT 打造了 VISTA-Curation 多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升,从“用更多数据”转向“用更优质的监督”。
针对图文数据,流水线通过三步精细化筛选实现质量升级:
第一步过滤低分辨率、模糊、低纹理的低质量图片;
第二步通过多模型、多提示词生成多样化候选字幕,并交叉验证视觉一致性;
第三步在统一对比池中通过相对图文对齐度、文本信息量、歧义度综合打分,筛选出视觉贴合度高、语义信息密度高的优质标注,淘汰模糊、泛化、弱对齐的样本。
针对视频数据,流水线同样进行全流程治理:先将长视频切分为连续短片段并均匀采样代表帧;再通过语义一致性与运动一致性双重过滤,保留语义连贯、变化信息有效的片段;最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面中学习更鲁棒的视觉表征。
最终,TuringViT 仅用 0.85B 图文对(约为 SigLIP2-L 训练数据规模的 10%),便在 ImageNet-1K 等六项零样本分类基准上取得 83.6% 的平均准确率,超越使用 10B 数据训练的主流开源基线;在 COCO、Flickr30K 图文检索任务上同样优势显著,真正实现了“十分之一数据,更优效果”的突破。
TuringViT 还采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就适配下游 VLM / VLA 的输入特性,告别“固定分辨率预训练 + 事后适配”的传统模式。
在智能驾驶领域,TuringViT 是第二代 VLA 模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉 token。
面向智能座舱与驾泊一体化场景,TuringViT 的 VLM 原生特性让视觉特征与语言模型实现更高效的对齐,可以提供更高的识别精度、不同画幅和比例的视觉输入,以支撑更多未来的车辆与用户交互的丰富座舱功能。
在小鹏 IRON 人形机器人的技术体系中,TuringViT 充当着“视觉视网膜”的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。
(来源:我爱公关)
TuringViT 共推出两个规格版本:
TuringViT-18L包含 3 组 Turing Block(共 15 层 TLA+3 层 MHA),主打动态分辨率下的高效部署;
TuringViT-24L包含 4 组 Turing Block(共 20 层 TLA+4 层 MHA),在保持线性计算主导的前提下进一步提升表征能力。
实测数据显示,随着输入分辨率提升,TuringViT 的延迟增长曲线远平缓于标准 softmax ViT,高分辨率下的效率优势愈发显著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。
不同于行业“堆数据规模”的粗放路线,TuringViT 打造了 VISTA-Curation 多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升,从“用更多数据”转向“用更优质的监督”。
针对图文数据,流水线通过三步精细化筛选实现质量升级:
第一步过滤低分辨率、模糊、低纹理的低质量图片;
第二步通过多模型、多提示词生成多样化候选字幕,并交叉验证视觉一致性;
第三步在统一对比池中通过相对图文对齐度、文本信息量、歧义度综合打分,筛选出视觉贴合度高、语义信息密度高的优质标注,淘汰模糊、泛化、弱对齐的样本。
针对视频数据,流水线同样进行全流程治理:先将长视频切分为连续短片段并均匀采样代表帧;再通过语义一致性与运动一致性双重过滤,保留语义连贯、变化信息有效的片段;最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面中学习更鲁棒的视觉表征。
最终,TuringViT 仅用 0.85B 图文对(约为 SigLIP2-L 训练数据规模的 10%),便在 ImageNet-1K 等六项零样本分类基准上取得 83.6% 的平均准确率,超越使用 10B 数据训练的主流开源基线;在 COCO、Flickr30K 图文检索任务上同样优势显著,真正实现了“十分之一数据,更优效果”的突破。
TuringViT 还采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就适配下游 VLM / VLA 的输入特性,告别“固定分辨率预训练 + 事后适配”的传统模式。
在智能驾驶领域,TuringViT 是第二代 VLA 模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉 token。
面向智能座舱与驾泊一体化场景,TuringViT 的 VLM 原生特性让视觉特征与语言模型实现更高效的对齐,可以提供更高的识别精度、不同画幅和比例的视觉输入,以支撑更多未来的车辆与用户交互的丰富座舱功能。
在小鹏 IRON 人形机器人的技术体系中,TuringViT 充当着“视觉视网膜”的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。
(来源:我爱公关)
The End
猜你喜欢
辛选正式推出线上超市
2026-03-23
鸿蒙5图库这些“隐藏”小功能 让找图、编辑、收藏全都变简单了
2025-08-24
DeepSeek喊着不赚钱,为何资本却疯狂追捧?
2026-05-29
试试鸿蒙版《搜觅 QuickSearch》,实现全网跨应用一键搜索
2026-05-22
重磅|宁波昂霖智能装备有限公司荣膺“宁波智造五小虎”称号
2026-05-25
“非洲手机之王”传音控股递表港交所
2025-12-03
适乐肤校园行再启航:以“修护”之名,与年轻一代一起“重建屏障”
2025-11-08
小米澎程两款增程SUV亮相
2026-08-01
法院辟谣“LV起诉国家知识产权局败诉”传言,案件仍在审理中
2026-08-23
七夕“好戏”在抖音:全域内容激活新中式,撬动“东方美学”新增量
2025-09-03
最新文章
相关推荐
南北丰田迎来整合节点,品牌格局重塑在即
9月14日晚间,广汽集团发布重大资产重组公告,公司筹划以发行股份方式收购一汽股份...
传承致远 设计新生|HALO光环家居以匠心赋能人居美学新篇章
金秋九月,黄浦江畔迎来全球家居行业的年度盛事。第三十一届中国国际家具展览会(Fu...
凡士林改名字了
在美妆博主 Min Day Lee 的一段病毒式传播的视频在 Instagram...
Le Creuset酷彩101周年庆典于上海Le Bec Bund盛大启幕
2026年9月1011日,法国高端厨具品牌Le Creuset酷彩101周年庆典...
荣耀“魔法画报”事件当事人澄清:事件与荣耀无关
9月10日晚,济南张先生在社交媒体发文反映,母亲突发心梗,因荣耀手机“魔法画报”...
华为与阿联酋航空续签合作备忘录,深化品牌营销与数字服务合作
9月14日,华为与阿联酋航空在ATM展会期间签署合作备忘录(MOU),进一步深化...
长安汽车发布严正声明回击网络不实言论
9月11日上午,长安汽车不实信息举报中心通过官方微信公众号发布严正声明。据了解,...
胖东来基层员工平均月薪9886元
快科技3月30日消息,据报道,胖东来创始人于东来在2025中国超市周上公开透露,...
硬蹭《狂飙》热度卖酒,侵权企业被判赔偿 500 万
近日,最高人民法院发布不正当竞争典型案例,“狂飙酒” 不正当竞争案入选。该案明确...
刘翔宣布”已买断“:获49.4万买断费
9月10日,奥运冠军刘翔公开官宣个人体制身份处置结果。此次事件源于近期体育系统编...