◆ KEYNES SOFTWARE

深度解读:RECAP 框架如何革命性地改变机器人 VLA 模型

2026-07-13 · ◐ EMBODIMENT-1 · coords [-0.64, 0.38] · 中文
> TRANSMISSION RECEIVED · PLANET EMBODIMENT-1

传输接收 · 行星 EMBODIMENT-1 · 坐标 [-0.64, 0.38]

Physical Intelligence 的 π* 0.6 论文提出 RECAP 框架,让机器人 VLA 模型能从真实世界的失败与人类纠正中学习。本文系统拆解其核心概念、镜像 RLHF 的三阶段训练范式,以及把强化学习归约为条件生成的底层数学。


I. 核心基础概念:揭开机器人”大脑”的神秘面纱

1. VLA(Vision-Language-Action,视觉-语言-动作)模型

不同于传统”文本输入/文本输出”的大语言模型(LLM),VLA 模型充当通用型机器人的多模态”大脑”。

  • 视觉(Vision): 它们通过实时摄像头画面(观测,oto_t)感知物理环境。
  • 语言(Language): 它们接受人类指令或提示(语言命令,ℓ\ell)。
  • 动作(Action): 它们直接输出连续的物理电机指令(动作,ata_t)供机器人执行。

2. 模仿学习的瓶颈:复合误差(Compounding Errors)

历史上,机器人通过模仿学习(行为克隆,Behavior Cloning)来训练:人类完美地遥操作机器人,机器人记住这些动作。这里的致命缺陷是复合误差(Compounding Errors)。

如果机器人在自主部署时出现 1cm 的微小偏差,它就会进入一个在完美训练数据中从未见过的状态。由于它从未学过如何从不完美中恢复,它会”慌乱”,导致更严重的误差连锁反应和不可避免的失败。因此,机器人必须具备从 imperfect experiences、autonomous trial-and-error 以及 failures 中学习的能力。

3. 价值函数与优势(Advantage)

为使机器人能够从经验中学习,引入了强化学习(RL)的概念:

  • 价值函数(V(o)V(o)): 充当”裁判”。它从给定状态预测任务成功完成的长期概率(例如*“看着这件衬衫当前皱巴巴的状态,成功的概率是 80%”*)。
  • 优势(A(o,a)A(o, a)): 评估刚刚采取的具体动作相对于该状态下平均预期表现的好坏。
    • 正优势(A>0A > 0): 该动作 exceptionally good—好于模型的平均水平。
    • 负优势(A<0A < 0): 该动作 poor—让情况变得更糟或走向失败。

4. 优势条件化的离线 RL(Advantage-Conditioned Offline RL)

将传统 on-policy RL 算法(如 PPO)应用于庞大的 VLA 模型在计算上是不稳定的,对物理机器人而言也极不高效。RECAP 论文优雅地解决了这一问题:在训练期间,它把所有数据(成功与失败)都喂给模型,但显式地用二值化优势指示器(Binarized Advantage Indicator)(Iadv∈{0,1}I_{\text{adv}} \in \{0, 1\})给数据打标签。

在真实世界部署时,系统绕开了 policy gradient 的噩梦,只需通过强制条件来”提示”模型:“假设你是一个专家,只输出与高优势(Iadv=1I_{\text{adv}}=1)标签相关联的动作。“


II. RECAP 方法论:机器人领域的 RLHF 时刻

RECAP(RL with Experience and Corrections via Advantage-conditioned Policies,基于经验与纠正、通过优势条件化策略的强化学习)镜像了 LLM 极为成功的三阶段训练范式(预训练 -> 微调/SFT -> RLHF),并将其适配到混乱的物理世界。

训练阶段LLM 对应物VLA (RECAP) 流程
1. 预训练(Pre-training)阅读互联网以学习语言结构与常识。在海量多任务、多机器人离线数据集上训练,以理解基础物理、运动控制,以及如何处理内部的”优势指示器”。由此得到基座模型 π∗0.6\pi^* 0.6。
2. 微调(SFT)指令微调(例如学习像一个乐于助人、结构化的对话助手那样行动)。通过针对特定任务的高质量人类演示进行模仿学习(例如教机器人如何使用专业浓缩咖啡机)。
3. 强化学习(RLHF)RLHF / RLAIF(从人类偏好分数中学习以对齐文本输出)。RECAP 闭环: 机器人自主尝试任务。当它犯错或即将失败时,人类专家通过遥操作动态介入纠正。所有数据(自主 rollout、失败、人类纠正)都被收集起来。一个价值函数计算这些动作的”优势”,模型被微调以偏好高优势的纠正动作。

III. 学习过程

1. 轨迹概率与基础 RL 目标

轨迹 τ\tau 是观测与动作的完整序列。由策略 π(at∣ot)\pi(a_t \mid o_t) 与随机环境动力学 p(ot+1∣ot,at)p(o_{t+1} \mid o_t, a_t) 所诱导的轨迹概率分布定义为:

ρπ(τ)=p(o0)∏t=0T−1π(at∣ot)p(ot+1∣ot,at)\rho^\pi(\tau) = p(o_0) \prod_{t=0}^{T-1} \pi(a_t \mid o_t)p(o_{t+1} \mid o_t, a_t)

标准强化学习的目标是最大化期望累积奖励(return):

max⁡πJ(π)=Eτ∼ρπ[∑t=0Trt]\max_\pi J(\pi) = \mathbb{E}_{\tau \sim \rho^\pi} \left[ \sum_{t=0}^T r_t \right]

2. 正则化强化学习与不可处理的闭式解

为防止策略因偏离安全、已知数据太远而崩溃或损坏硬件,相对于行为参考策略(πref\pi_{\text{ref}})加入了一个 KL 散度惩罚:

J(π,πref)=Eτ∼ρπ[∑t=0Tγtrt]−βEo∼ρπ[DKL(π(⋅∣o)∥πref(⋅∣o))]J(\pi, \pi_{\text{ref}}) = \mathbb{E}_{\tau \sim \rho^\pi} \left[ \sum_{t=0}^T \gamma^t r_t \right] - \beta \mathbb{E}_{o \sim \rho^\pi} \left[ D_{\text{KL}}\big(\pi(\cdot \mid o) \parallel \pi_{\text{ref}}(\cdot \mid o)\big) \right]

使用标准的变分法,该正则化目标的数学最优闭式解已知为:

π^(a∣o)∝πref(a∣o)exp⁡(Aπref(o,a)β)\hat{\pi}(a \mid o) \propto \pi_{\text{ref}}(a \mid o) \exp\left(\frac{A^{\pi_{\text{ref}}}(o, a)}{\beta}\right)

核心数学瓶颈: 连续生成架构(如 Diffusion 或 Flow Matching VLA 模型)无法在连续动作空间上轻松地与指数权重项(exp⁡(A/β)\exp(A/\beta))做直接相乘。这会导致极端的训练不稳定。由此催生了 RECAP 的概率重构。

3. 方程 (2) 的逐步推导:贝叶斯法则之桥

为绕开指数加权的噩梦,作者引入了一个虚拟的二值随机变量 I∈{0,1}I \in \{0, 1\}(表示改进或最优性),并做了一个精妙的概率替换:

  • 第 1 步(贝叶斯定理翻转): 我们分析一个给定状态-动作对导致改进的概率:p(I∣o,a)p(I \mid o, a)。由贝叶斯法则,我们可以翻转条件项: p(I∣o,a)=p(a∣I,o)⋅p(I∣o)p(a∣o)p(I \mid o, a) = \frac{p(a \mid I, o) \cdot p(I \mid o)}{p(a \mid o)}

  • 第 2 步(简化为策略比):

    • p(a∣o)p(a \mid o) 就是我们的无条件基础参考策略:πref(a∣o)\pi_{\text{ref}}(a \mid o)。
    • p(a∣I,o)p(a \mid I, o) 是我们的改进条件化策略:πref(a∣I,o)\pi_{\text{ref}}(a \mid I, o)。
    • p(I∣o)p(I \mid o) 是纯粹基于场景上下文(在采取动作之前)的改进先验概率。由于它完全独立于动作 aa,它充当一个常数缩放因子,在正比关系(∝\propto)中可以省略。

    这将贝叶斯法则简化为一个干净的策略比: p(I∣o,a)∝πref(a∣I,o)πref(a∣o)p(I \mid o, a) \propto \frac{\pi_{\text{ref}}(a \mid I, o)}{\pi_{\text{ref}}(a \mid o)}

  • 第 3 步(与优势函数耦合): 作者将改进的隐概率定义为与由 β2\beta^2 缩放的底层优势函数呈指数关系: p(I∣o,a)=exp⁡(Aπref(o,a)β2)p(I \mid o, a) = \exp\left(\frac{A^{\pi_{\text{ref}}}(o, a)}{\beta^2}\right) 将等式两边同时取 β\beta 次幂得: [p(I∣o,a)]β=exp⁡(Aπref(o,a)β)[p(I \mid o, a)]^\beta = \exp\left(\frac{A^{\pi_{\text{ref}}}(o, a)}{\beta}\right)

  • 第 4 步(大替换—方程 2): 将其代回原始的正则化 RL 目标,把难以处理的 exp⁡(A/β)\exp(A/\beta) 项替换为我们的策略比的 β\beta 次幂(并入语言条件 ℓ\ell): π^(a∣o,ℓ)∝πref(a∣o,ℓ)(πref(a∣I,o,ℓ)πref(a∣o,ℓ))β— (Equation 2)\hat{\pi}(a \mid o, \ell) \propto \pi_{\text{ref}}(a \mid o, \ell) \left( \frac{\pi_{\text{ref}}(a \mid I, o, \ell)}{\pi_{\text{ref}}(a \mid o, \ell)} \right)^\beta \quad \text{--- (Equation 2)}

    当温度因子 β=1\beta = 1 时,分母中的无条件策略与基础策略乘子完美抵消,简化为: π^(a∣o,ℓ)=πref(a∣I,o,ℓ)\hat{\pi}(a \mid o, \ell) = \pi_{\text{ref}}(a \mid I, o, \ell)

    数学突破: 强化学习被完全归约为条件生成建模。要最大化奖励,模型不需要 policy gradients;它只需以改进变量 II 为条件来生成。

4. 分布式价值函数训练(方程 1)

为处理真实世界机器人高度不确定、多模态的特性(一个动作可能导致 100% 成功或 0% 失败,而非均值平均),RECAP 采用分布式 RL(Distributional RL)。

经验回报 Rt(τ)=∑t′=tTrt′R_t(\tau) = \sum_{t'=t}^T r_{t'} 被划分为 B=201B = 201 个离散 bin(RtBR_t^B)。价值网络 pϕ(V∣ot,ℓ)p_\phi(V \mid o_t, \ell) 通过最小化数据集 D\mathcal{D} 中所有时间步的交叉熵 HH 来训练:

min⁡ϕEτ∈D[∑ot∈τH(RtB(τ),pϕ(V∣ot,ℓ))]— (Equation 1)\min_\phi \mathbb{E}_{\tau \in \mathcal{D}} \left[ \sum_{\mathbf{o}_t \in \tau} H(R_t^B(\tau), p_\phi(V \mid \mathbf{o}_t, \ell)) \right] \quad \text{--- (Equation 1)}

训练好的 critic 提供鲁棒的 NN-step 优势估计:

Aπ(ot,at,ℓ)=Eρπ[∑t′=tt+N−1rt′+Vπ(ot+N)]−Vπ(ot)A^\pi(o_t, a_t, \ell) = \mathbb{E}_{\rho^\pi} \left[ \sum_{t'=t}^{t+N-1} r_{t'} + V^\pi(o_{t+N}) \right] - V^\pi(o_t)

RECAP 随后通过任务特定阈值 ϵℓ\epsilon_\ell 将这个连续值映射为一个锐利的二值指示器 token ItI_t:

It=1(Aπref(ot,at,ℓ)>ϵℓ)I_t = \mathbb{1}(A^{\pi_{\text{ref}}}(\mathbf{o}_t, \mathbf{a}_t, \ell) > \epsilon_\ell)

(注:任何由直接人类介入/纠正所产生的数据,都自动赋值为 It=1I_t = 1。)

5. Flow Matching 目标与 LERP 进度条(方程 3)

π∗0.6\pi^* 0.6 的核心动作生成采用 Flow Matching。它在虚拟时间域 t∈[0,1]t \in [0, 1] 上将纯噪声分布(x0∼p(x0)x_0 \sim p(x_0))映射为干净、连续的机器人动作(aa)。

系统利用**无分类器引导(Classifier-Free Guidance, CFG)**原理,通过联合负对数似然损失训练 VLA 模型同时掌握无条件分布与优势条件化分布:

min⁡θEDπref[−log⁡πθ(at∣ot,ℓ)−αlog⁡πθ(at∣It,ot,ℓ)]— (Equation 3)\min_\theta \mathbb{E}_{\mathcal{D}_{\pi_{\text{ref}}}} \left[ - \log \pi_\theta(\mathbf{a}_t \mid \mathbf{o}_t, \ell) - \alpha \log \pi_\theta(\mathbf{a}_t \mid I_t, \mathbf{o}_t, \ell) \right] \quad \text{--- (Equation 3)}

在内部 flow 生成期间,半成品(intermediate state xtx_t)通过线性插值(LERP)计算:

xt=(1−t)x0+t⋅ax_t = (1-t)x_0 + t \cdot a

  • 在 t=0t=0:x0x_0 是 100% 的纯随机噪声。
  • 在 t=0.5t=0.5:x0.5x_{0.5} 是噪声与动作数据 50/50 的混合。
  • 在 t=1t=1:x1=ax_1 = a,揭示完全成型的绝对物理动作。

由于 LERP 强制了一条从噪声到动作的直线向量路径,目标速度向量 u(xt)u(x_t) 在数学上是常数:

u(xt)=a−x0u(x_t) = a - x_0

网络 vθ(xt,t∣o,Iadv)v_\theta(x_t, t \mid o, I_{\text{adv}}) 被优化以预测这条直线方向,对任何偏差施加惩罚。

6. 推理阶段:“作弊码”

一旦通过方程 (3) 的训练结束,模型就具备了”双人格”能力。在真实机器人上运行时部署时,critic 网络被完全丢弃以节省延迟。系统将优势输入 token 硬编码为永久的高:

Sample from: πθ(a∣o,ℓ,Iadv=1)\text{Sample from: } \pi_\theta(a \mid o, \ell, I_{\text{adv}} = 1)

这迫使 VLA 模型完全在其”专家恢复人格”下运作,原生地生成它从人类介入中学到的高度鲁棒、流畅、带纠错的轨迹。


IV. 成果总结

通过用优势条件化的序列建模替代僵硬的 policy gradients,RECAP 方法论使 π∗0.6\pi^* 0.6 在复杂、长时程操作任务上达到了前所未有的自主性与韧性水平:

  • 工业级可靠性: 在商业工厂内自主组装真实的、高度可形变且粘连的纸箱包装盒。
  • 极致长时程泛化: 连续操作一台专业高端浓缩咖啡机—涉及倾倒液体与处理复杂流体动力学—不间断 13 小时。
  • 真实家庭适应: 在全新家庭环境中折叠高度多样、非结构化的衣物,超过 2 小时无需任何人类干预。
  • 统计性能影响: 在所有高度复杂的任务上,相比传统模仿学习基线,RECAP 将任务吞吐量提高一倍以上(>2x),并将任务失败率削减约 50%。

// END OF LOG

// END OF LOGS