人形机器人的手臂抖动从哪来:改掉注意力机制,显存降七成
编译自 MDPI Sensors 2026, 26(1), 165 · 开放获取 CC BY 4.0
让机器人完成一次抓取不难,难的是让它把一整套多步操作从头做到尾。人形机器人在长时间任务里最容易被看出来的毛病,是手臂在动作衔接处出现细碎的抖动。这种抖动看起来像控制环路没调好,实际上很多案例的根源不在控制器,而在训练数据的采集粒度与模型处理时序的方式上。
一篇发表在《Sensors》上的论文把这件事拆成两半来处理:数据侧只采集关键步骤的姿态,模型侧换掉多头自注意力里的权重生成方式,并重新设计观测与动作序列之间的对齐关系。三个改动叠加之后,任务成功率上去了,显存占用降了七成,单批次训练时间缩短了大约一个数量级。
抖动的源头不在控制器
模仿学习的标准做法是记录从起点到终点的完整轨迹,让模型学会每一步该输出什么动作。问题在于长时多步任务里,一步行为克隆的预测误差会在序列上累积,小的偏差被逐步放大,这就是常说的复合误差。与此同时,完整轨迹里夹着大量与任务无关的中间动作,这些噪声与冗余会让模型在推理时给出不连贯的关节控制指令,手臂的抖动就来自这里。
另一层原因在模型本身。视觉语言动作模型处理的是图像、语言指令和动作序列构成的长序列,自注意力机制的计算复杂度随序列长度增长,显存占用和训练耗时都被推高。论文还指出一个容易被忽略的细节:机器人每执行完一个动作,如果下一帧观测突然加入新的环境信息,运动也会变得不稳定。
只采集关键步骤的姿态
论文提出的数据采集策略,核心是把连续的轨迹压缩成若干个关键点。所谓关键步骤,指的是机械爪在路径调整转折点上的姿态,以及最终抓取时的姿态。采集时只记录这些关键动作,中间的过程不让模型去推理,而是让机械臂自己走到下一个关键位置。
观测的更新频率也跟着改了。系统采用每两个关键步骤更新一次观测的策略,也就是一帧观测数据用来指导两个连续关键步骤的动作生成。观测来源是一台单深度相机,输出 640 × 480 的 RGBD 图像,深度图经过归一化预处理,与彩色像素完全对齐。这样做的结果是数据量下降,而模型需要拟合的目标变得更干净。
训练阶段的第二个改动是跨模态对齐。论文收集的观测帧数与动作序列数之间满足 n = 2m + 1 的关系,模型不只预测与当前观测严格对应的那一个动作,而是同时对齐后续所有剩余的动作序列,第一个观测对应整段动作,第二个观测对应去掉前两步之后的剩余序列。为了让张量维度保持一致,长度不足的部分用任务完成后的待机动作填充,避免模型对非物理的预测结果产生拟合。
图1 记忆门控滤波注意力的数据流(依据原文第 2.1 节绘制)
给查询矩阵加一道门控
模型侧的核心改动叫记忆门控滤波注意力。它在每个注意力头内部插入一步滤波操作:先让查询矩阵与一个可学习参数矩阵点乘,再用 sigmoid 函数激活,得到一个门控滤波矩阵,然后让行累积矩阵与这个门控矩阵做逐元素相乘,也就是哈达玛积,完成滤波,最后把滤波结果与原始查询矩阵拼接起来,送进线性层融合,得到该头的输出。所有头的输出再拼接成最终结果。
这个设计的关键在于用一次元素级乘积替代了额外的注意力矩阵运算。门控矩阵由查询自身生成,不需要再去连乘注意力权重,计算量和显存占用同步下降。论文没有把它做成一个额外的模块堆在模型外面,而是嵌进注意力头内部,所以它对模型结构的改动很小,理论上可以移植到其他基于 Transformer 的策略里。
显存与训练时间的账单
实验用的是一台双臂人形机器人,单臂 7 个自由度,双臂合计 14 个自由度。训练与推理在单张 8 GB 的 NVIDIA RTX 4060 上完成,软件环境是 PyTorch 2.1.0。迭代次数 10000 次,优化器为 AdamW,预训练大语言模型的学习率为 1×10-4、主模型为 1×10-3,特征维度 1024,主模型使用 L1 损失,批大小分别为 512 与 1024。模型参数量最终为 500 MB,预训练模型为 122 MB。
对比对象是 RDT、OpenVLA 和 Aloha 三个方案,评测涉及 7 个典型双臂精细操作任务,每个任务测试 25 次。结果层面最硬的两个数字是显存与时间:显存占用降低 72%,单批次训练时间从 1.35 秒 降到 0.129 秒。论文把后面这个变化称为接近一个数量级的加速。动作质量方面,由于模型只在关键动作点上做推理,中间过程由系统自主执行,其他方案在关键点之间出现的明显抖动被抑制住了,任务成功率也有提升。
论文给出的局限同样值得记下来。部分采集数据因为伦理限制未公开,这意味着这套方法的数据集很难被完整复现。抖动问题在遥操作采集环节本身就埋下了偏差,模型层面的抑制只是后置修补。验证只在 8 GB 显存、500 MB 模型规模的条件下完成,更大规模部署的表现还需要更多数据。对做具身智能工程的人来说,这篇论文最实用的部分可能不是那个门控结构,而是数据采集粒度的思路:把中间步骤交给机器人自己走,让模型只负责真正需要判断的地方。
图2 显存与训练时间的下降幅度及训练配置(依据原文摘要与第 4 节绘制)
|
内容来源:MDPI Sensors 2026, 26(1), 165 原文标题:Cross-Modality Alignment Perception and Multi-Head Self-Attention Mechanism for Vision-Language-Action of Humanoid Robot 作者:Bin Ren, Diwei Shi 原文链接:https://doi.org/10.3390/s26010165 许可协议:CC BY 4.0(https://creativecommons.org/licenses/by/4.0/) 配图说明:图1、图2 为本文依据原文献数据自行绘制。 改动声明:本文在其基础上进行了中文编译与删节,未改变技术结论与原始数据。 |





