How to?

Basic Robot Papers for Beginners

Sep 22, 2026
2609
3 Minutes
427 Words
  • 基础
    • CLIP | 21.1 通过直接匹配图-文编码来训练
    • DINO | 21.4 以 EMA & 全局视图的教师与局部视图学生进行自蒸馏
    • BLIP | 22.1 在 CLIP 基础上添加 decoder 看图生文本
    • SigLIP | 23.3 将 CLIP 的 softmax 损失改为 sigmoid 二分类损失提升训练效率
    • LLaVA | 23.4 将 CLIP 投影到 LLM 空间并进行问答训练
    • QwenVL | 23.8 将 CLIP 通过 256 learnable-queries cross-attn 变换到 LLM 空间
  • VLA
    • OpenVLA | 24.6 用 VLM 的 next-token-prediction 输出离散动作
    • pi0 | 24.10 推出 MoT & FM & zero-padding 大规模预训练范式
    • pi05 | 25.4 预训练扩充 CE/互联网,离散动作预训练,subtask 作为辅助损失和 CoT
    • SmolVLA | 25.6 裁剪 MoT 并交错使用 CA 和 SA 以让模型更轻量化
    • pi06 | 25.11 稀疏 RL 训练进度估计器给数据打 0/1 advantage 作为 VLA condition
  • WM
    • EnerVerse | 25.11 稀疏自回归扩散训练 Unet-VM,中间层 latent 作为 AE cross-attn kv
    • DreamDojo | 26.2 LAPA 式提取 WM Ego 预训练所需的 latent action condition 并用于动作择优
    • Ctrl-World (for IL) | 26.3 WM simulator rollout + 人工选择后训练数据
    • PlaNet ?
    • Sora
    • V-JEPA
    • Wan
  • WM for RL
    • Dreamer to Control
    • Dreamer V3
    • World-Env
  • Cascaded WAM
  • Joint WAM
    • 扩散
      • Motus | 25.12 VM/VLM/AE 三专家 MoT
      • Lingbot-va | 26.1 自回归交错去噪 video chunk/action chunk
      • Cosmos | 26.1 单一 Cosmos 直接去噪 proprio/action/img/value token,不用投影直接广播
      • DreamZero | 26.2 单一 WAN 去噪 img/action token,带 action decoder
      • DiT4DiT | 26.3 非 MoT & 带 diffusion shift & action_to_video_only 的实践
      • FastWAM | 26.3 video gen 仅作为辅助任务
      • MotuBrain
    • Query-based (ACT-like)
      • VLA-JEPA | 26.2 query latent action 并在 JEPA 空间监督从而 leverage human video
  • VLA Framework
    • FLuxVLA
    • RLinf
    • StarVLA
Article title:Basic Robot Papers for Beginners
Article author:Julyfun
Release time:Sep 22, 2026
Copyright 2026
Sitemap