深度解读:RECAP 框架如何革命性地改变机器人 VLA 模型
2026-07-13 · ◐ EMBODIMENT-1 · coords [-0.64, 0.38] · 中文
> TRANSMISSION RECEIVED · PLANET EMBODIMENT-1
传输接收 · 行星 EMBODIMENT-1 · 坐标 [-0.64, 0.38]
Physical Intelligence 的 π* 0.6 论文提出 RECAP 框架,让机器人 VLA 模型能从真实世界的失败与人类纠正中学习。本文系统拆解其核心概念、镜像 RLHF 的三阶段训练范式,以及把强化学习归约为条件生成的底层数学。
I. 核心基础概念:揭开机器人”大脑”的神秘面纱
1. VLA(Vision-Language-Action,视觉-语言-动作)模型
不同于传统”文本输入/文本输出”的大语言模型(LLM),VLA 模型充当通用型机器人的多模态”大脑”。
- 视觉(Vision): 它们通过实时摄像头画面(观测,ot)感知物理环境。
- 语言(Language): 它们接受人类指令或提示(语言命令,ℓ)。
- 动作(Action): 它们直接输出连续的物理电机指令(动作,at)供机器人执行。
2. 模仿学习的瓶颈:复合误差(Compounding Errors)
历史上,机器人通过模仿学习(行为克隆,Behavior Cloning)来训练:人类完美地遥操作机器人,机器人记住这些动作。这里的致命缺陷是复合误差(Compounding Errors)。
如果机器人在自主部署时出现 1cm 的微小偏差,它就会进入一个在完美训练数据中从未见过的状态。由于它从未学过如何从不完美中恢复,它会”慌乱”,导致更严重的误差连锁反应和不可避免的失败。因此,机器人必须具备从 imperfect experiences、autonomous trial-and-error 以及 failures 中学习的能力。
3. 价值函数与优势(Advantage)
为使机器人能够从经验中学习,引入了强化学习(RL)的概念:
- 价值函数(V(o)): 充当”裁判”。它从给定状态预测任务成功完成的长期概率(例如*“看着这件衬衫当前皱巴巴的状态,成功的概率是 80%”*)。
- 优势(A(o,a)): 评估刚刚采取的具体动作相对于该状态下平均预期表现的好坏。
- 正优势(A>0): 该动作 exceptionally good—好于模型的平均水平。
- 负优势(A<0): 该动作 poor—让情况变得更糟或走向失败。
4. 优势条件化的离线 RL(Advantage-Conditioned Offline RL)
将传统 on-policy RL 算法(如 PPO)应用于庞大的 VLA 模型在计算上是不稳定的,对物理机器人而言也极不高效。RECAP 论文优雅地解决了这一问题:在训练期间,它把所有数据(成功与失败)都喂给模型,但显式地用二值化优势指示器(Binarized Advantage Indicator)(Iadv∈{0,1})给数据打标签。
在真实世界部署时,系统绕开了 policy gradient 的噩梦,只需通过强制条件来”提示”模型:“假设你是一个专家,只输出与高优势(Iadv=1)标签相关联的动作。“
II. RECAP 方法论:机器人领域的 RLHF 时刻
RECAP(RL with Experience and Corrections via Advantage-conditioned Policies,基于经验与纠正、通过优势条件化策略的强化学习)镜像了 LLM 极为成功的三阶段训练范式(预训练 -> 微调/SFT -> RLHF),并将其适配到混乱的物理世界。
| 训练阶段 | LLM 对应物 | VLA (RECAP) 流程 |
|---|
| 1. 预训练(Pre-training) | 阅读互联网以学习语言结构与常识。 | 在海量多任务、多机器人离线数据集上训练,以理解基础物理、运动控制,以及如何处理内部的”优势指示器”。由此得到基座模型 π∗0.6。 |
| 2. 微调(SFT) | 指令微调(例如学习像一个乐于助人、结构化的对话助手那样行动)。 | 通过针对特定任务的高质量人类演示进行模仿学习(例如教机器人如何使用专业浓缩咖啡机)。 |
| 3. 强化学习(RLHF) | RLHF / RLAIF(从人类偏好分数中学习以对齐文本输出)。 | RECAP 闭环: 机器人自主尝试任务。当它犯错或即将失败时,人类专家通过遥操作动态介入纠正。所有数据(自主 rollout、失败、人类纠正)都被收集起来。一个价值函数计算这些动作的”优势”,模型被微调以偏好高优势的纠正动作。 |
III. 学习过程
1. 轨迹概率与基础 RL 目标
轨迹 τ 是观测与动作的完整序列。由策略 π(at∣ot) 与随机环境动力学 p(ot+1∣ot,at) 所诱导的轨迹概率分布定义为:
ρπ(τ)=p(o0)∏t=0T−1π(at∣ot)p(ot+1∣ot,at)
标准强化学习的目标是最大化期望累积奖励(return):
maxπJ(π)=Eτ∼ρπ[∑t=0Trt]
2. 正则化强化学习与不可处理的闭式解
为防止策略因偏离安全、已知数据太远而崩溃或损坏硬件,相对于行为参考策略(πref)加入了一个 KL 散度惩罚:
J(π,πref)=Eτ∼ρπ[∑t=0Tγtrt]−βEo∼ρπ[DKL(π(⋅∣o)∥πref(⋅∣o))]
使用标准的变分法,该正则化目标的数学最优闭式解已知为:
π^(a∣o)∝πref(a∣o)exp(βAπref(o,a))
核心数学瓶颈: 连续生成架构(如 Diffusion 或 Flow Matching VLA 模型)无法在连续动作空间上轻松地与指数权重项(exp(A/β))做直接相乘。这会导致极端的训练不稳定。由此催生了 RECAP 的概率重构。
3. 方程 (2) 的逐步推导:贝叶斯法则之桥
为绕开指数加权的噩梦,作者引入了一个虚拟的二值随机变量 I∈{0,1}(表示改进或最优性),并做了一个精妙的概率替换:
-
第 1 步(贝叶斯定理翻转): 我们分析一个给定状态-动作对导致改进的概率:p(I∣o,a)。由贝叶斯法则,我们可以翻转条件项:
p(I∣o,a)=p(a∣o)p(a∣I,o)⋅p(I∣o)
-
第 2 步(简化为策略比):
- p(a∣o) 就是我们的无条件基础参考策略:πref(a∣o)。
- p(a∣I,o) 是我们的改进条件化策略:πref(a∣I,o)。
- p(I∣o) 是纯粹基于场景上下文(在采取动作之前)的改进先验概率。由于它完全独立于动作 a,它充当一个常数缩放因子,在正比关系(∝)中可以省略。
这将贝叶斯法则简化为一个干净的策略比:
p(I∣o,a)∝πref(a∣o)πref(a∣I,o)
-
第 3 步(与优势函数耦合): 作者将改进的隐概率定义为与由 β2 缩放的底层优势函数呈指数关系:
p(I∣o,a)=exp(β2Aπref(o,a))
将等式两边同时取 β 次幂得:
[p(I∣o,a)]β=exp(βAπref(o,a))
-
第 4 步(大替换—方程 2): 将其代回原始的正则化 RL 目标,把难以处理的 exp(A/β) 项替换为我们的策略比的 β 次幂(并入语言条件 ℓ):
π^(a∣o,ℓ)∝πref(a∣o,ℓ)(πref(a∣o,ℓ)πref(a∣I,o,ℓ))β— (Equation 2)
当温度因子 β=1 时,分母中的无条件策略与基础策略乘子完美抵消,简化为:
π^(a∣o,ℓ)=πref(a∣I,o,ℓ)
数学突破: 强化学习被完全归约为条件生成建模。要最大化奖励,模型不需要 policy gradients;它只需以改进变量 I 为条件来生成。
4. 分布式价值函数训练(方程 1)
为处理真实世界机器人高度不确定、多模态的特性(一个动作可能导致 100% 成功或 0% 失败,而非均值平均),RECAP 采用分布式 RL(Distributional RL)。
经验回报 Rt(τ)=∑t′=tTrt′ 被划分为 B=201 个离散 bin(RtB)。价值网络 pϕ(V∣ot,ℓ) 通过最小化数据集 D 中所有时间步的交叉熵 H 来训练:
minϕEτ∈D[∑ot∈τH(RtB(τ),pϕ(V∣ot,ℓ))]— (Equation 1)
训练好的 critic 提供鲁棒的 N-step 优势估计:
Aπ(ot,at,ℓ)=Eρπ[∑t′=tt+N−1rt′+Vπ(ot+N)]−Vπ(ot)
RECAP 随后通过任务特定阈值 ϵℓ 将这个连续值映射为一个锐利的二值指示器 token It:
It=1(Aπref(ot,at,ℓ)>ϵℓ)
(注:任何由直接人类介入/纠正所产生的数据,都自动赋值为 It=1。)
5. Flow Matching 目标与 LERP 进度条(方程 3)
π∗0.6 的核心动作生成采用 Flow Matching。它在虚拟时间域 t∈[0,1] 上将纯噪声分布(x0∼p(x0))映射为干净、连续的机器人动作(a)。
系统利用**无分类器引导(Classifier-Free Guidance, CFG)**原理,通过联合负对数似然损失训练 VLA 模型同时掌握无条件分布与优势条件化分布:
minθEDπref[−logπθ(at∣ot,ℓ)−αlogπθ(at∣It,ot,ℓ)]— (Equation 3)
在内部 flow 生成期间,半成品(intermediate state xt)通过线性插值(LERP)计算:
xt=(1−t)x0+t⋅a
- 在 t=0:x0 是 100% 的纯随机噪声。
- 在 t=0.5:x0.5 是噪声与动作数据 50/50 的混合。
- 在 t=1:x1=a,揭示完全成型的绝对物理动作。
由于 LERP 强制了一条从噪声到动作的直线向量路径,目标速度向量 u(xt) 在数学上是常数:
u(xt)=a−x0
网络 vθ(xt,t∣o,Iadv) 被优化以预测这条直线方向,对任何偏差施加惩罚。
6. 推理阶段:“作弊码”
一旦通过方程 (3) 的训练结束,模型就具备了”双人格”能力。在真实机器人上运行时部署时,critic 网络被完全丢弃以节省延迟。系统将优势输入 token 硬编码为永久的高:
Sample from: πθ(a∣o,ℓ,Iadv=1)
这迫使 VLA 模型完全在其”专家恢复人格”下运作,原生地生成它从人类介入中学到的高度鲁棒、流畅、带纠错的轨迹。
IV. 成果总结
通过用优势条件化的序列建模替代僵硬的 policy gradients,RECAP 方法论使 π∗0.6 在复杂、长时程操作任务上达到了前所未有的自主性与韧性水平:
- 工业级可靠性: 在商业工厂内自主组装真实的、高度可形变且粘连的纸箱包装盒。
- 极致长时程泛化: 连续操作一台专业高端浓缩咖啡机—涉及倾倒液体与处理复杂流体动力学—不间断 13 小时。
- 真实家庭适应: 在全新家庭环境中折叠高度多样、非结构化的衣物,超过 2 小时无需任何人类干预。
- 统计性能影响: 在所有高度复杂的任务上,相比传统模仿学习基线,RECAP 将任务吞吐量提高一倍以上(>2x),并将任务失败率削减约 50%。
// END OF LOG
// END OF LOGS