DDPM → DDIM / CFG → VAE·LDM → DiT → Flow Matching → Video DiT。
面向具身智能(Embodied AI)方向的中文学习记录:论文精读、源码精读、以及认知科学/理论背景。 聚焦 VLA(视觉-语言-动作)模型、世界模型、控制策略等方向,每篇都有架构拆解 / 核心公式 / 与工程实践的连接。
主线严格按截图:先补视频生成地基,再学无动作视频里的 Latent Action,随后分清 Cascaded 与 Joint WAM,最后进入实时化、多模态与评测。JEPA 和 Real-to-Sim / 4DGS 作为两条侧翼并入。
DDPM → DDIM / CFG → VAE·LDM → DiT → Flow Matching → Video DiT。
从无动作标签的人类视频中发现可控变化,把互联网视频变成预训练信号。
Cascaded:先预测未来再取动作;Joint:同一模型联合生成未来状态与动作。
低延迟 rollout、cache / distill、力触觉扩展,以及视觉—物理—动作三层评估。
从 VLA/SFT 基座出发,依次理解离线 RL、轻量在线真机微调、生成式动作头的原生策略梯度,以及 residual 数据闭环与世界模型想象训练。截图中的可疑简称已单独核验,不生成假论文页面。
RT-2 / OpenVLA / π₀ 建立动作表示;IQL、AWAC、HIL-SERL 建立反馈学习直觉。
冻结或保护 VLA 先验,用 residual、critic 与人类介入做分钟级闭环修正。
让 RL 目标匹配 action chunk、diffusion chain 与 flow path,而非照搬普通高斯 actor。
RL 既可以生成部署分布内的恢复数据,也可以在世界模型中批量想象策略后果。
norm_stats.json 做粘合。逐层展开每个 transform 的"做什么/为什么/代码在哪",
以及 LIBERO / ALOHA / DROID 三种数据集的适配差异对照。
这是一个个人学习笔记仓库,记录具身智能(Embodied AI)方向的学习过程——不限于论文精读, 也包含源码精读、工程实践、认知科学背景等。 每篇笔记包含:核心贡献/设计、架构拆解、关键公式或代码、以及与研究/工程实践的联系。 使用中文写作,英文专业术语保留对照,方便查阅原文。
如有错误或建议,欢迎通过 GitHub Issues 指出。