Label Studio 深度解析:VLA 模型为何忽视语言指令及低成本修复方案

ADK Label Studio官方 / ADK编译 2026-07-23 5 分钟 157 次浏览
速览导读 / Summary

Label Studio 团队发布深度技术文章,揭示 VLA(视觉 - 语言 - 动作)模型在机器人领域普遍存在的“语言遗忘”现象。文章指出,现有数据集存在严重的模态不平衡,导致模型将语言视为冗余信息。团队提出无需收集新轨迹即可通过“指令增强”和“细粒度标注”修复此问题,实测成功率可从 0% 提升至 90%。

单任务成功率提升 0% -> 90% 通过指令增强技术实现
性能增益 +27% 通过反事实标注实现
性能下降幅度 22%-52% 指令同义改写导致的鲁棒性损失
数据需求 零新增轨迹 修复方案无需额外数据采集

Key Insights / 核心看点

  • 1 揭示了 VLA 模型普遍存在的‘语言遗忘’现象,根源在于训练数据中语言指令的模板化和模态失衡。
  • 2 提出了无需收集新轨迹即可修复语言失效的方案,通过指令增强和细粒度标注显著提升模型鲁棒性。
  • 3 实证数据显示,针对同一轨迹进行多样化指令标注,可将单任务成功率从 0% 提升至 90%。
  • 4 解决了‘监督别名’问题,通过标注执行细节(如接触区域、接近方向)增强模型对关键动作的区分能力。
  • 5 指出当前 SOTA 模型在指令扰动下性能下降 22%-52%,暴露了从演示到产品之间的巨大鸿沟。

VLA 模型为何忽视语言指令?Label Studio 揭秘数据根源与低成本修复方案

在机器人领域,Vision-Language-Action (VLA) 模型被视为实现通用物理智能的关键。然而,Label Studio 团队近期发布的一项深度研究揭示了一个令人不安的现实:许多最先进的 VLA 模型在部署后,其语言模块实际上并未发挥任何作用。

核心问题:模态失衡与信息坍缩

研究团队通过审计当前机器人学习语料库发现,模态失衡 (Modality Imbalance) 是导致语言失效的根本原因。

  • 视觉与动作流的丰富性:训练数据中的视觉流包含不同的光照、物体位置和遮挡;动作流则是独特的连续电机命令序列。
  • 语言流的贫乏:相比之下,语言指令往往由模板生成,如 pick up the {object},缺乏结构多样性。

这种不平衡导致信息坍缩 (Information Collapse)。当指令可以从图像中直接推断时(例如:看到杯子在水槽旁,指令必然是“把杯子放进水槽”),模型为了优化,会丢弃语言输入,转而依赖视觉捷径。这被称为语言遗忘 (Language Forgetting)

此外,监督别名 (Supervision Aliasing) 也是一个关键问题。现有数据集通常只标注粗粒度的目标(如“拿起杯子”),而忽略了执行细节(如“用哪只手”、“从哪个角度接近”)。这种模糊的标签导致模型无法在关键执行层面进行区分。

实测数据:灾难性的鲁棒性缺失

当模型离开训练分布进入真实世界时,问题暴露无遗:

  • 指令扰动测试:在 LIBERO-PRO 基准测试中,即使将指令替换为同义句或无意义词汇,模型的成功率依然保持在 90% 以上,完全无视指令变化。
  • 性能下降:控制性研究指出,对指令进行同义改写会导致性能下降 22% 至 52%
  • 记忆化策略:由于无法理解语言,模型退化为死记硬背视觉布局与动作序列的对应关系,一旦环境微调即失效。

解决方案:无需新数据的低成本修复

Label Studio 团队强调,修复此问题不需要收集任何新的轨迹数据,仅需对现有数据进行标注增强:

  1. 指令增强 (Instruction Augmentation):对同一轨迹重新标注为多种不同的、具有区分度的语言指令。LangGap 基准测试证实,此方法可将单任务成功率从 0% 提升至 90%
  2. 反事实标注 (Counterfactual Relabeling):为轨迹添加其实际未执行但满足条件的指令,强迫模型关注指令与动作的细微差别。CAST 项目因此获得了 +27 个百分点 的性能提升。
  3. 细粒度标注 (Fine-grained Annotation):针对 FineVLA 提出的监督别名问题,标注具体的执行细节(主动臂、接近方向、接触区域)。

总结

VLA 模型的“语言失效”并非架构缺陷,而是数据构建方式导致的系统性偏差。通过引入多样化的语言指令和细粒度的执行描述,开发者可以以极低的成本显著增强机器人的指令遵循能力,使其从“视觉捷径”转向真正的“语义理解”。

The dataset's own construction makes language redundant, so a well-optimized model discards it.

Label Studio Research Team

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
模型发布 2026-09-08

Ajelix 自研 GPU 基础设施并推出企业级 Agentic 平台,解决数据主权与生产落地难题

Agentic AI 平台 Ajelix 宣布投资自建 GPU 计算基础设施,并正式发布面向企业的 Ajelix Enterprise Platform。此举旨在解决企业级 AI 落地中数据不可控、审计困难及中断风险等痛点。新平台提供从智能体编排、RAG 知识库到严格治理的全栈能力,支持私有化部署,助力企业将 AI 从实验阶段平稳过渡到生产运营。

Ajelix官方 / ADK编译 4 分钟
AI 工具 2026-09-08

Pixmax 详解 SD2.5 视频生成成本:分辨率与参考视频对定价的影响

Pixmax 平台针对 SD2.5 (Seedance 2.5) 模型发布了详细的计费指南,揭示了影响视频生成成本的关键变量。文章通过具体充值活动案例,计算出在优惠条件下每积分约 0.0267 元的实际成本。核心发现包括:分辨率直接影响单价(480P 低至 0.51 元/秒),且使用参考视频时计费时长为“参考 + 生成”之和。该指南为批量创作者提供了精确的预算规划依据。

Pixmax官方 / ADK编译 3 分钟
技术解读 2026-09-08

Accio Work 发布 F1 电视转播技术深度解析:8K 流媒体与超低延迟架构揭秘

Accio Work 深度编译 F1 TV 如何永久改变体育转播的历程,聚焦于日本市场策略、8K 流媒体技术革新及超低延迟架构。文章揭示了现代体育直播对带宽、编码及 CDN 的极致要求,包括 45% 的带宽消耗增长和亚 200ms 延迟标准。同时探讨了数字观众如何驱动 23 亿美元的周边销售,为开发者与架构师提供了从传统广播向数字化、智能化转型的宝贵案例与技术指标参考。

Accio Work官方 / ADK编译 3 分钟