Awesome LLM Research Collections
  • Home
  • Papers
    • Overview
    • Attention
    • LLMs
    • Multimodal LLMs
    • Embeddings
    • SFT
    • Training
    • Reinforcement Learning
    • Agents Application
    • Vision
    • Auto-Prompt
  • Notes
  • Blogs
  • English
  • 中文

强化学习

奖励建模、RLHF 类优化、推理强化学习、智能体强化学习和 VLA 策略学习。
English

研究分类

奖励建模、RLHF 类优化、推理强化学习、智能体强化学习和 VLA 策略学习。

58论文
121资源链接
2026.09最新月份
策略优化 OPD 奖励建模 视频生成强化学习 多模态强化学习 推理强化学习 智能体强化学习 视觉-语言-动作强化学习

13 篇论文

策略优化

2026.07 策略优化

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

该论文提出层贡献度指标,用于衡量单独训练每个 Transformer 层能够恢复多少全参数强化学习增益。跨多种模型、强化学习算法和任务的实验表明,强化学习增益稳定集中在少数中间层,且单层训练可以达到甚至超过全参数训练。

论文
2026.07 策略优化

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

该论文提出 Selective Importance Sampling (SIS),通过 token 级拒绝检验将接受的离策略 token 视为在策略样本,并对拒绝的 token 保留标准重要性采样修正。SIS 以可忽略的额外开销缩小 token 级与序列级梯度估计器之间的差距,在稠密和 MoE 模型上提升性能及离策略训练鲁棒性。

论文
2026.07 策略优化

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

该论文提出 SERPO,一种面向开放式生成的测试时强化学习框架,无需标注反馈、外部奖励模型或更强评测器,即可协同演化回答证据、查询特定的评分准则与策略参数。其概率化准则评分将判定 token 的似然转化为奖励,使策略及其自生成评测标准在闭环中持续改进。

论文 代码
2026.06 策略优化

Rethinking the Divergence Regularization in LLM RL

该论文提出 Divergence Regularized Policy Optimization (DRPO),以平滑的优势加权二次正则项替代 DPPO 的硬散度掩码,同时保留其信赖域几何结构。DRPO 通过有界连续梯度权重和越界后的纠正信号,提高 LLM 强化学习训练的稳定性与效率。

论文 代码
2026.05 策略优化

Constraint-Infused Policy Optimization: Principles and Practices for Harnessing Advanced LLM Reasoning

该论文将大语言模型强化学习表述为约束策略优化,通过不同约束选择统一现有算法,并揭示裁剪、KL 正则化与信赖域的作用。论文据此推导 Constraint-Infused Policy Optimization (CIPO),在多种任务和模型族上提升推理性能与训练稳定性。

论文 代码
2026.03 策略优化

BandPO: Bridging Trust Regions and Ratio Clipping via Probability-Aware Bounds for LLM Reinforcement Learning

BandPO 将由通用散度度量定义的信赖域投影为动态、概率感知的裁剪区间,为低概率且高优势的动作扩大更新空间。该方法以理论化的动态边界替代 PPO 式固定裁剪,在多种大语言模型强化学习设置中改善探索并稳定缓解熵坍缩。

论文 代码
2025.11 策略优化

Soft Adaptive Policy Optimization

该论文提出 Soft Adaptive Policy Optimization (SAPO),以温度控制的软门控替代大语言模型群组强化学习中的硬裁剪,连续衰减离策略 token 更新。其目标兼具序列一致性与 token 自适应性,在文本模型和 Qwen3-VL 模型上提升训练稳定性、样本效率与推理表现。

论文
2025.07 策略优化

Group Sequence Policy Optimization

该论文提出 GSPO,一种用于大语言模型的强化学习算法,以序列级似然比替代 token 级重要性比率,并在序列级执行裁剪、奖励与优化。GSPO 相比 GRPO 提升训练效率和性能,稳定 MoE 强化学习训练,并有助于简化 Qwen3 模型的大规模强化学习基础设施。

论文 项目
2025.03 策略优化

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

该论文提出 Decoupled Clip and Dynamic Sampling Policy Optimization (DAPO),一个用于激发大语言模型推理能力的开源大规模强化学习系统。论文开放训练配方、代码、数据集和模型权重,基于 Qwen2.5-32B 在 AIME 2024 上达到 50 分,提升大规模 LLM 强化学习的可复现性。

论文 项目 代码 Hugging Face
2024.05 策略优化

Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer

该论文将 RLHF 过度优化归因于偏好学习中的分布偏移与不确定性,并提出 Regularized Preference Optimization (RPO),将偏好优化目标与作为对抗正则项的 SFT 损失结合。RPO 具有有限样本理论保证,并在实验中相较 DPO 改善对齐效果、减少策略向非期望回答漂移。

论文 代码
2024.02 策略优化

KTO: Model Alignment as Prospect Theoretic Optimization

该论文将成功的大语言模型对齐损失归纳为带有 prospect theory 偏置的 human-aware losses,并提出 KTO,直接利用 desirable/undesirable 二元反馈优化生成效用。KTO 在 1B 到 30B 规模上达到或超过基于成对偏好的方法,也说明最佳对齐损失取决于具体场景中的归纳偏置。

论文
2023.05 策略优化

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

该论文提出 Direct Preference Optimization (DPO),重新参数化 RLHF 奖励模型,使最优策略能够通过简单的分类损失直接从偏好数据中学习。DPO 无需单独拟合奖励模型或执行在线强化学习,以更简单稳定的训练达到或超过基于 PPO 的 RLHF。

论文 代码
2017.07 策略优化

Proximal Policy Optimization Algorithms

该论文提出 Proximal Policy Optimization (PPO),一类在环境采样与代理目标上的多轮小批量优化之间交替进行的策略梯度方法。PPO 保留信赖域方法的关键优势,同时更易实现,并在样本效率、性能与运行时间之间取得良好平衡。

论文 项目 代码

9 篇论文

OPD

2026.08 OPD

Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement

该论文发现,教师监督中的噪声并非 on-policy distillation 性能提升的主要来源:仅对学生采样的低概率 token 施加固定负优势,即可达到相近效果。论文进一步提出无需教师和奖励的 On-Policy Self-Adaptation(OPSA),按 token 熵缩放负优势,以提升推理能力与泛化表现。

论文 项目 代码 Hugging Face
2026.06 OPD

PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation

该论文指出,基于采样 token 的 on-policy distillation 中,无界的 log-ratio 奖励会引发高方差梯度与训练不稳定。PowerOPD 使用由 Box-Cox 幂变换导出的有界、符号一致奖励族,在降低全词表 OPD 时间和显存开销的同时提升数学推理准确率。

论文
2026.05 OPD

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

该论文分析 on-policy self-distillation 在数学推理中效果不稳定的原因,指出基于特权上下文的教师信号会通过点式互信息过度强化答案已暗示的 token,同时压低驱动多步搜索的思考 token。论文提出 AntiSD,用带熵门控的反向自蒸馏散度替代默认下降方向,在 2 到 10 倍更少训练步数内达到 GRPO 水平,并将最终准确率最高提升 11.5 个百分点。

论文 代码
2026.05 OPD

Draft-OPD: Adapting Speculative Draft Models from LLMs via On-Policy Distillation

该论文提出 Draft-OPD,通过 on-policy distillation 复用 RL 训练轨迹,将 RL 后训练 LLM 的能力适配到 speculative draft model,避免为 draft model 进行昂贵的在线生成。论文证明 RL 训练与 OPD 式蒸馏之间的等价关系,并在保持任务性能的同时将 speculative decoding 速度最高提升 2.14 倍。

论文 项目 代码 Hugging Face
2026.05 OPD

OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification

该论文提出 OmniOPD,一种无 logits 的在策略蒸馏框架,以基于语义相似度评分的 Monte Carlo 分块 rollout 替代脆弱的 token 级 logit matching,从而支持黑盒教师。其 peak-entropy 调度器聚焦高不确定性推理分叉,并结合贝叶斯平滑与基础模型 KL 锚点稳定训练,在数学任务上相较标准 OPD 最高提升 28.64%。

论文
2026.04 OPD

Self-Distilled RLVR

该论文研究 RLVR 中的 on-policy self-distillation,指出仅依赖带特权信息的自教师信号会造成信息泄漏和长期训练不稳定。论文提出 RLSD,用自蒸馏估计 token 级更新幅度,同时保留 RLVR 的环境反馈作为可靠更新方向。

论文 Hugging Face
2026.02 OPD

Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation

该论文证明 on-policy distillation 是 dense KL-constrained RL 的一个特例,并提出带灵活参考模型和奖励缩放因子的 G-OPD。其 reward extrapolation 版本 ExOPD 相比标准 OPD 更强,并能在融合 RL 训练的领域专家时让学生模型超越教师边界。

论文 代码 Hugging Face
2026.01 OPD

Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models

该论文提出 On-Policy Self-Distillation (OPSD),让同一 LLM 在不同上下文下同时扮演教师和学生:教师可看到带特权的验证推理轨迹,学生只看到问题并从自身策略采样。通过在学生的 on-policy rollout 上匹配 token 级分布,OPSD 无需外部教师即可提供密集监督,并在数学推理上比 GRPO 和 off-policy 蒸馏更具 token 效率。

论文 项目 代码
2026.01 OPD

Self-Distillation Enables Continual Learning

该论文提出 Self-Distillation Fine-Tuning (SDFT),一种从专家示范中进行 on-policy self-distillation 的方法,通过让示范条件下的模型作为自身教师生成训练信号。该方法在学习新任务的同时显著减少灾难性遗忘,使单个模型无需显式奖励函数也能顺序积累技能与知识。

论文 项目 代码

7 篇论文

奖励建模

2026.06 奖励建模

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

该论文将可靠验证视为编码智能体面临的新瓶颈,并从可扩展性、忠实性和鲁棒性三个维度评估奖励信号。通过测试、规则、用户反馈和自动化智能体验证器,论文表明针对性的验证设计能够抑制奖励劫持,并指出验证机制必须与能力不断增强的生成器协同演化。

论文
2026.04 奖励建模

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

该论文重新审视 LLM 强化学习中的价值建模,指出单次预测式判别评论器受限于表达能力。论文提出 Generative Actor-Critic (GenAC),让评论器先推理再估计价值,并通过上下文条件适配当前策略,从而提升价值逼近、排序可靠性、分布外泛化和下游强化学习性能。

论文
2026.04 奖励建模

Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty

该论文提出 E-GRM,通过并行生成结果的收敛程度估计模型内部不确定性,仅在必要时触发思维链推理。框架还使用以回归-排序混合目标训练的轻量判别评分器,对推理路径提供细粒度奖励,在降低推理成本的同时提升答案准确率。

论文
2026.03 奖励建模

MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels

该论文提出 MemReward,一个基于图经验记忆的奖励预测框架,在有限标签下让 3B 和 1.5B 模型分别达到 Oracle 表现的 97.3% 和 96.6%。它还在域外任务上超过 Oracle。

论文 代码 Hugging Face
2026.03 奖励建模

Scaling Reward Modeling without Human Supervision

该论文研究无需人工标注的无监督奖励模型扩展,通过学习网页语料文档前缀与后缀之间的偏好来训练奖励模型。实验显示该方法在不同模型骨干上稳定提升 RewardBench,并改进 best-of-N 选择和策略优化。

论文
2026.01 奖励建模

Reward Modeling from Natural Language Human Feedback

该论文将偏好数据上的 RLVR 用于训练生成式奖励模型,指出二分类任务会让 GRM 倾向于猜对结果而非给出可靠批判。论文提出方法缓解这一问题。

论文
2025.10 奖励建模

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

这篇综述梳理过程奖励模型如何在步骤或轨迹层面评估并引导大语言模型推理,而不只判断最终答案。论文围绕过程数据生成、PRM 构建,以及 PRM 在测试时扩展和强化学习中的使用闭环,覆盖数学、代码、多模态推理、机器人和智能体等应用。

论文

1 篇论文

视频生成强化学习

2026.05 视频生成强化学习

KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration

KVPO 使用 ODE-native online GRPO 框架,将流式自回归视频生成器与人类偏好对齐。它用历史 KV 缓存的因果语义路由替代噪声探索,并基于 Trajectory Velocity Energy 优化速度场代理策略。

论文 项目 代码 Hugging Face

2 篇论文

多模态强化学习

2025.09 多模态强化学习

CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning

该论文提出 CapRL,首次将 RLVR 应用于开放式图像描述,通过检验无视觉语言模型能否仅依据生成描述回答图像问题来构造奖励。训练得到的 CapRL-3B 能生成信息更丰富且更多样的描述,其生成的描述数据还在 12 个基准上提升了大视觉语言模型的预训练效果。

论文 代码 Hugging Face
2025.05 多模态强化学习

Visual Planning: Let's Think Only with Images

该论文提出视觉规划范式,面向视觉优先的空间任务通过图像序列而非文本完成逐步规划。其 Visual Planning via Reinforcement Learning(VPRL)框架使用 GRPO 对大视觉模型进行后训练,并提升其在 FrozenLake、Maze 和 MiniBehavior 上的规划能力。

论文 代码

10 篇论文

推理强化学习

2026.07 推理强化学习

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

该论文通过结合裁剪重要性采样、训练与推理比率校正及混合精度控制的稳定训练管线,将基于可验证奖励的强化学习从基础模型扩展至万亿参数规模。所得模型在提升样本效率与推理质量的同时,自发形成结构化、自验证和自适应推理行为。

论文
2026.04 推理强化学习

All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

该论文提出 MUPO,一种强化学习方法,通过激励多解之间的发散思考来缓解 GRPO 训练 VLM 时的多样性坍塌。它让模型形成更深且更广的推理模式。

论文 项目 代码 Hugging Face
2026.04 推理强化学习

VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning

该论文提出 VL-Calibration,一种将大视觉语言模型的视觉置信度与推理置信度解耦的强化学习框架,用于缓解模型高置信度错误预测。它结合图像扰动下的视觉定位与 token 熵估计视觉确定性,并通过 token 级优势重加权提升校准效果和视觉推理准确率。

论文 代码
2026.03 推理强化学习

The Art of Efficient Reasoning: Data, Reward, and Optimization

该论文研究 LLM 的高效推理,通过 RL 激励短而准确的推理轨迹。论文总结了训练阶段、奖励设计和优化策略,并在 0.6B 到 30B 模型上分析泛化规律。

论文 项目
2026.03 推理强化学习

FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization

该论文提出 FIPO,一种强化学习算法,用于解决 LLM 推理瓶颈中的粗粒度信用分配问题。它针对 GRPO 式训练中结果奖励无法区分关键逻辑转折与普通 token 的问题进行改进。

论文
2026.02 推理强化学习

Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis

该论文提出 Agentic Proposing,一个使用专门智能体和 Multi-Granularity Policy Optimization 动态选择、组合模块化推理技能的框架。该框架用于合成高精度训练轨迹,从而增强大语言模型推理能力。

论文
2025.05 推理强化学习

The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models

该论文研究推理语言模型强化学习中的策略熵坍塌瓶颈,发现熵与下游性能之间存在经验关系,使性能上限可被预测。论文从动作概率与 logit 更新的协方差推导熵动态,并提出 Clip-Cov 和 KL-Cov 保持探索、提升下游表现。

论文
2025.05 推理强化学习

Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space

该论文提出 LatentSeek,一种测试时实例级适应框架,在不更新模型参数的情况下,利用策略梯度与自生成奖励迭代优化 LLM 的潜在表示。该方法在 GSM8K、MATH-500 和 AIME2024 上提升推理表现,并且通常只需少量迭代即可收敛。

论文 项目 代码
2025.01 推理强化学习

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

该论文展示纯强化学习无需人工标注推理轨迹即可直接激发 LLM 的高级推理行为。所提出框架诱导自我反思、验证和自适应策略使用,并在数学、代码和 STEM 推理任务上取得强提升。

论文 Hugging Face
2024.02 推理强化学习

DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

该论文提出 DeepSeekMath 7B,将精心设计的网页级数学数据筛选流程与 Group Relative Policy Optimization (GRPO) 相结合;GRPO 是 PPO 的一种变体。该方法在降低 PPO 显存占用的同时增强数学推理能力,无需外部工具或投票即可在竞赛级 MATH 基准上取得强劲表现。

论文 代码 Hugging Face

15 篇论文

智能体强化学习

2026.09 智能体强化学习

SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment

SafeEvolve 利用当前策略生成的智能体轨迹中的安全证据,让运行时安全提示、分层技能与策略共同演化。它将有界、可审计的 harness 更新与学习使用 harness 的 SFT、采用验证器分解奖励的 harness 增强 RL 相结合,在多步交互中改善安全性与任务效用的平衡。

论文 代码
2026.08 智能体强化学习

DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

该论文提出 DART-SD,一种拓扑感知的自蒸馏框架,将多轮工具执行表示为交互状态转移图(ISTG),保留由无序子目标产生的菱形替代路径。它在失败的学生轨迹中识别关键拓扑断点(CTB),仅对检索得到的恢复步骤施加监督,从而保护有效前缀并逐步提升工具使用能力。

论文
2026.08 智能体强化学习

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

ContextPilot 为长程智能体配备规划、长期记忆和软上下文卸载工具,使工作上下文保持紧凑。其上下文感知的局部 rollout 与动作级信用分配,将探索和策略更新聚焦于关键上下文编辑决策,从而提升长上下文问答和深度搜索性能。

论文 项目 代码 Hugging Face
2026.08 智能体强化学习

EnvHarness: Awakening Static Worlds for Agent Learning

EnvHarness 用可组合的插件组件封装静态智能体环境,在保留原有逻辑与验证器的同时重塑环境行为。其自动化 EnvRigger 从轨迹中诊断策略弱点并合成针对性环境,为强化学习提供更强的学习信号,并支持策略与环境持续协同演化。

论文 项目 代码
2026.07 智能体强化学习

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

该论文提出 Skill Self-Play,一个由提议器、求解器和动态技能控制器通过技能条件任务生成、能力边界探索及反馈驱动的技能库更新共同演化的强化学习框架。它兼顾技能特定验证的可靠性与开放式任务的多样性,在多种 LLM 骨干上提升工具使用和推理能力。

论文 代码
2026.07 智能体强化学习

OpenForgeRL: Train Harness-native Agents in Any Environment

OpenForgeRL 是一个开源框架,用于在部署时实际使用的有状态、多进程推理 harness 与环境中对智能体进行端到端强化学习。它通过轻量级记录代理将 harness 的模型调用转换为标准 RL 训练栈可用的数据,并用 Kubernetes 编排器隔离和扩展工具调用及多模态 GUI 环境中的 rollout。

论文 代码
2026.06 智能体强化学习

OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

该论文提出 OPID,从已完成的在策略轨迹中提取分层的回合级与步骤级技能,并将技能带来的概率变化转化为 token 级自蒸馏优势,与结果优势共同优化策略。其关键步骤优先路由提供稠密且匹配当前策略分布的后见监督,在具身、网页购物和搜索问答任务上提升智能体性能、样本效率与鲁棒性。

论文 代码
2026.06 智能体强化学习

Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

该论文提出面向长程智能体强化学习的 Group-Graph Policy Optimization (G2PO),将采样得到的交互轨迹转换为全局状态转移图,以降低状态价值估计方差。其群组聚合价值估计与边中心优势估计在稀疏、延迟奖励下实现细粒度信用分配,相比 GRPO 将成功率最高提升 22.2%。

论文 代码
2026.05 智能体强化学习

Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning

Spreadsheet-RL 是一个用于在真实 Microsoft Excel 环境中训练专用表格智能体的强化学习微调框架,面向提示式智能体难以处理的复杂多步工作流。它结合自动化起止表格数据构建、多轮 Spreadsheet Gym 沙盒工具环境,以及 Domain-Spreadsheet 基准,以提升真实表格自动化能力。

论文 项目 代码 Hugging Face
2026.02 智能体强化学习

Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration

该论文提出 Actor-Refiner 协作机制,解决搜索增强推理 RL 中的多尺度信用分配问题。它缓解稀疏轨迹级奖励难以区分高质量推理与偶然猜对的问题,并减少冗余或误导性搜索行为。

论文
2026.02 智能体强化学习

SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning

SkillRL 将原始智能体轨迹蒸馏为层次化 SkillBank,自适应检索通用与任务特定启发式知识,并让技能库在强化学习中与策略递归共同演化。该方法在降低 token 开销的同时,提升了智能体在具身、网页购物和搜索增强任务上的泛化能力与性能。

论文 代码 Hugging Face
2026.01 智能体强化学习

Arena-RL: Training LLMs as Game Players with Vision-Language Action Models

该论文提出 Arena-RL,一个通过视觉语言动作模型训练 LLM 驱动智能体玩视觉游戏的强化学习框架,重点从交互式游戏反馈中改进策略。实验表明,基于游戏轨迹的奖励优化能显著提升策略决策与跨游戏泛化。

论文
2025.07 智能体强化学习

Agentic Reinforced Policy Optimization

该论文提出 ARPO,一种面向多轮 LLM 智能体训练的智能体强化学习算法,用于平衡长程推理能力与逐步工具交互能力。它通过基于熵的自适应 rollout 采样和工具调用步骤上的优势归因,在计算推理、知识推理和深度搜索基准上优于轨迹级 RL 方法,并将工具调用预算约减半。

论文 代码 Hugging Face
2025.03 智能体强化学习

Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

该论文提出 Search-R1,一个让 LLM 在逐步推理中通过 RL 学会自主生成搜索查询并使用实时检索的框架。它提升了模型获取外部知识和最新信息的能力。

论文 代码
2025.01 智能体强化学习

Search-o1: Agentic Search-Enhanced Large Reasoning Models

该论文提出 Search-o1,一个用智能体式检索增强生成机制和 Reason-in-Documents 模块增强大推理模型的框架。它通过精炼检索文档来缓解长程推理中的知识不足。

论文 代码

1 篇论文

视觉-语言-动作强化学习

2025.11 视觉-语言-动作强化学习

SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models

该论文提出 SRPO,一个用于视觉语言动作模型的强化学习框架,用模型自身成功轨迹中的进展式奖励替代稀疏二元奖励。它利用潜在世界模型表征稳健衡量行为进展,并以更少 RL 步数在 LIBERO 上取得最优操作成功率。

论文
  • View source
  • Report an issue