海量财经 | 从零开始预训练,蚂蚁灵波发布具身原生世界动作模型LingBot-VA 2.0
2026-07-11 11:55 海报新闻
然而内容创作和机器人控制有着不同的出发点,内容创作更在意画质和创意,机器人控制则更在意执行效率和预测的合理性。上述这些不同导致数字世界的视频模型和物理世界的视频动作模型在设计之初就有各自的能力侧重点,强行“微调”把前者适配成后者会带来知识遗忘、泛化性下降等副作用。
蚂蚁集团工作人员表示,LingBot-VA 2.0选择直面问题,探索一条更艰难的路——基于自回归架构从头开始预训练,通过四大核心设计构建原生基模。
首先,模型引入语义视觉-动作分词器(Tokenizer)作为全新的视觉编码器,在视觉压缩过程中加入了语义与动作信息的对齐,使模型在后续的训练中更容易把“理解指令”转化为“完成动作”,有助于指令跟随与提升动作精度。其次,模型采用严格的因果预训练范式,让模型从训练一开始就使用自回归架构,确保视觉预测和动作生成完全遵循单向时间顺序。第三,引入MoE 架构,在不牺牲推理效率的前提下有效扩大了模型容量,在性能和效率之间取得平衡。最后,通过增强的异步推理机制实现实时闭环控制,在机器人执行动作的同时预测未来状态,并利用最新真实观测不断校正下一步决策。基于这些设计,在行业普遍面临的具身世界模型执行效率低这一问题上,LingBot-VA 2.0给出了单卡150Hz实时推理效率的答卷。




