这是为 AI 阅读之用. AE: action expert. MoT: 每层把两路 transformer 的 token 的 Q/K/V 投影后拼接,在同一个 self-attention 中计算,在不冻结大型预训练 transformer 的情况下缓解灾难性遗忘的问题(相比 cascaded). UMI: 人类使用手持夹爪收集的机器人训练数据,存在 visual gap,无 joint 数据等问题。