Awesome LLM Research Collections
  • Home
  • Papers
    • Overview
    • Attention
    • LLMs
    • Multimodal LLMs
    • Embeddings
    • SFT
    • Training
    • Reinforcement Learning
    • Agents Application
    • Vision
    • Auto-Prompt
  • Notes
  • Blogs
  • English
  • 中文

笔记

研究笔记

围绕 LLM 研究与工程实践整理的双语论文解读和技术思考。

31笔记
8主题
2026-09-14最近创建
论文解读 技术思考

浏览

论文解读

创建 2026-09-12 · 更新 2026-09-12

DINO 系列:架构、训练原理与任务适配

沿 DINO、DINOv2、DINOv3 解释自蒸馏、局部表征、训练步骤与损失设计,并结合 DINOv2 + SimCLR 项目讨论图像检索和领域适配。

DINO Self-Supervised Learning Vision Transformer Knowledge Distillation Image Retrieval
VISION 论文解读
创建 2026-08-17 · 更新 2026-08-22

Self-Evolving Coding Agents:分类体系、反馈闭环与可信演化

基于演化对象、演化时机与软件证据三条主线,梳理自进化编码智能体如何更新框架、记忆、技能工具、模型与协作结构,并讨论可信演化所需的验证、版本化和回滚机制。

Self-Evolving Coding Agents Coding Agents Agent Self-Evolution Software Engineering Agent Memory Agent Skills
AGENTS 论文解读
创建 2026-08-10 · 更新 2026-08-11

SkillRL:如何将一次失败变成可复用的 Skill

以 ALFWorld 的 Skipping State Changes 为贯穿案例,拆解 SkillRL 如何从失败轨迹提炼候选技能、组织 SkillBank、训练技能使用策略,并区分论文证据、代码实现与生产准入建议。

SkillRL Agentic RL Reinforcement Learning Skill Learning Failure Learning Long-Horizon Agents
REINFORCEMENT-LEARNING 论文解读
创建 2026-08-03 · 更新 2026-08-22

Kimi Linear 与 KDA:从通道级遗忘到硬件高效的线性注意力

从递推公式、WY/UT 并行算法、3:1 KDA/MLA 混合结构与公开实现出发,复核 Kimi Linear 的效果、效率和边界。

Kimi Linear Kimi Delta Attention Linear Attention Delta Rule Long Context
ATTENTION 论文解读
创建 2026-08-01 · 更新 2026-08-22

Kimi K3:架构、训练与百万 Token Agentic RL 技术解读

用直白的方式解释 Kimi K3 的 KDA、Block AttnRes、LatentMoE、1M 上下文与九策略强化学习,并区分论文结论和外部实测。

Kimi K3 LLM Mixture of Experts Long Context Agentic RL
LLMS 论文解读
创建 2026-07-29 · 更新 2026-08-15

数据智能体:自治等级、研究现状与开放问题

基于 L0–L5 自治分级和数据生命周期视角,梳理数据智能体从响应式助手、程序执行器到受监督编排器的能力边界,并分析责任、治理与评测缺口。

Data Agents LLM Agents Data Management Autonomy Data Governance
AGENTS 论文解读
创建 2026-07-28 · 更新 2026-08-22

从 Qwen 到 Qwen3.6:七代模型的架构与训练演进

沿七代 Qwen 主线梳理注意力、MoE、数据、后训练、原生多模态与 Agent 环境的演进,并解释 Qwen3-Next 为何是架构桥梁而非独立一代。

Qwen LLM MoE Post-training Long Context
LLMS 论文解读
创建 2026-06-30 · 更新 2026-07-01

SAPO:用连续软门控替代策略比率的硬截断

从代理目标、梯度权重、非对称温度与 Qwen3-VL 实验出发,分析 SAPO 如何在 token 级保留有效梯度,并在小步更新条件下近似序列级软信任域。

SAPO Reinforcement Learning Policy Optimization GRPO GSPO Qwen3-VL
REINFORCEMENT-LEARNING 论文解读
创建 2026-06-18 · 更新 2026-06-19

Entropy Collapse:大模型 RL 训练中的策略熵消耗机制

从策略熵、SFT 与 RL 的优化差异、DAPO 的 Clip-Higher,以及协方差正则化角度理解大模型 RL 训练中的 Entropy Collapse。

Entropy Collapse Reinforcement Learning Post-training DAPO GRPO
REINFORCEMENT-LEARNING 论文解读
创建 2026-06-15 · 更新 2026-06-15

从 Qwen-VL 到 Qwen3-VL:四代模型的架构与训练演进

梳理 Qwen-VL 四代模型在视觉语言对齐、动态分辨率、时空位置编码、视频建模与深层视觉融合上的技术演进。

VLM Qwen Multimodal Large Language Model Position Encoding Video Understanding
MLLMS 论文解读
创建 2026-06-15 · 更新 2026-06-15

CapRL:用强化学习激发视觉语言模型的描述能力

CapRL 用 vision-free LLM 的 MCQ 答题准确率评价 caption,将主观的描述质量评分改造成可验证奖励,并据此训练图像描述模型。

CapRL Reinforcement Learning RLVR Vision-Language Model Image Captioning
REINFORCEMENT-LEARNING 论文解读

浏览

技术思考

创建 2026-09-14 · 更新 2026-09-14

万字长文带你读懂 RSI(自进化,Self-Evolving)

从进化对象、版本结构、更新者、更新时机和反馈维度整理 Recursive Self-Improvement(RSI)方法。

RSI Self-Evolving Agents Agent Harness Agent Memory Skill Evolution
AGENTS 技术思考
创建 2026-09-07 · 更新 2026-09-08

Query 识别与改写:训练、检索与 Agent 架构边界

梳理意图识别、澄清、行为驱动改写、蒸馏与检索评测,补充基于证据依赖的多跳训练数据构造,并讨论 Agent 状态管理与 AIGC recaption 的边界。

Query Rewriting Intent Recognition Retrieval Training Data Agent Architecture
AGENTS 技术思考
创建 2026-09-01 · 更新 2026-09-01

从策略滞后到优势坍缩:LLM 强化学习中的有效更新信号

从 rollout policy、PPO clip 与 GRPO 组内零优势出发,分析 LLM 强化学习中的无效更新,并给出数据、采样、监督和优化层面的处理顺序。

Reinforcement Learning PPO GRPO DAPO RLVR Advantage Estimation
REINFORCEMENT-LEARNING 技术思考
创建 2026-08-28 · 更新 2026-08-28

没有线上数据,如何为 Agent 构建冷启动评测集

从能力地图、人工金种子、受控变异、状态 Oracle、可重置环境和发布门禁出发,构建上线前可复核的 Agent 冷启动评测集。

Agent Evaluation Evaluation Dataset Benchmark Design Synthetic Data Agent Safety
AGENTS 技术思考
创建 2026-08-27 · 更新 2026-08-27

KL 散度:从数学推导到 LLM 强化学习

看懂 KL 散度的数学结构,并理解它在 PPO、DPO、GRPO、On Policy Distillation 中究竟控制了什么。

KL Divergence Reinforcement Learning RLHF PPO DPO GRPO On-Policy Distillation
REINFORCEMENT-LEARNING 技术思考
创建 2026-08-26 · 更新 2026-08-26

Agentic RL 的轨迹数据契约:从 Harness 到可训练样本

从模型调用、上下文重建到 rollout 分组与信用分配,说明 Agentic RL 如何保留可审计的 token 级训练数据。

Agentic RL Agent Harness Trajectory Data Policy Optimization Credit Assignment
REINFORCEMENT-LEARNING 技术思考
创建 2026-08-25 · 更新 2026-09-01

OPD 的局部信用分配与全局正确性边界:从『蒸馏强化学习』直觉出发

从一个『teacher-defined dense reward』的直觉出发,推导 OPD 的 reverse-KL 训练信号,分析错误前缀下的局部一致陷阱,并比较 KAT、BRTS、TrOPD 与 local support matching 的修正边界。

OPD Reinforcement Learning Distillation Credit Assignment Verifier
OPD 技术思考
创建 2026-08-21 · 更新 2026-08-22

递归自我改进:从产出物、Harness 到模型—脚手架共进化

用优化对象与闭环程度两个维度重审 2026 年递归自我改进进展,并给出一套可审计的证据准入标准。

recursive-self-improvement self-evolving-agents harness model-harness-coevolution
AGENTS 技术思考
创建 2026-08-21 · 更新 2026-08-24

RL 到底改变了什么:推理模式、蒸馏与可控后训练

以推理模式的存在、选择、迁移与控制为框架,重新审视 SFT、RLVR、蒸馏和二次 RL 的职责边界。

Reinforcement Learning SFT RLVR Distillation Reasoning
REINFORCEMENT-LEARNING 技术思考
创建 2026-08-19 · 更新 2026-08-28

如何科学评测 AI Agent:指标、环境、裁判与回归闭环

从结果与过程指标、环境与任务设计、LLM-as-a-Judge、失败归因和双层回归出发,构建可复现的 AI Agent 评测闭环。

Agent Evaluation Benchmark Design LLM-as-a-Judge Regression Testing Agent Safety
AGENTS 技术思考
创建 2026-08-12 · 更新 2026-08-22

从 Clio 到可执行 Skill:LLM + Embedding 分层聚类的工程复盘

从 Clio 的语义聚类子系统出发,复盘一个可执行 Agent Skill 的实现,并用 20 Newsgroups 实验分析 LLM 分层合并带来的指标收益、代价与隐私边界。

Clio Embedding Clustering Agent Skill Reproducibility
AGENTS 技术思考
创建 2026-08-10 · 更新 2026-08-22

Benchmark 背后的 Benchmark:Agent 评测中的裁判噪声与可信比较

从原文报告的 106 个任务与多裁判实验出发,分析 Agent 噪声、裁判方差、证据契约、连续评分、集成聚合和模型比较,并区分稳定性与正确性。

Agent Evaluation LLM-as-a-Judge Benchmark Statistical Reliability
AGENTS 技术思考
创建 2026-08-05 · 更新 2026-08-06

把 Agent 当作算法使用:Skill、CLI 与 Workflow 的工程化设计

从职责切分、按需披露、Gate 校验、状态持久化与 Workflow 编排出发,讨论如何约束 Agent 的执行随机性并提升多步任务的可恢复性。

Agent Skill Design CLI Workflow Engineering
AGENTS 技术思考
创建 2026-07-06 · 更新 2026-07-06

长轨迹、可学习价值与动态验证:Agentic RL 的训练约束正在变化

结合 GLM-5.2、Qwen、GenAC、OPID 与两项相关研究,分析长时域智能体如何重塑轨迹采样、信用分配、奖励验证和稠密监督。

Agentic RL Long-Horizon Agents Value Modeling Reward Hacking Verification
LLMS 技术思考
创建 2026-07-02 · 更新 2026-08-22

在 DPO 中保留一条 SFT 梯度:从相对偏好到 chosen likelihood 锚定

围绕 DPO Trainer with SFT Loss 的代码路径,分析 chosen-response SFT 如何改变 DPO 梯度、数据与显存边界,以及该假设应如何被实验推翻或保留。

DPO SFT Preference Optimization Post-training RLHF
TRAINING 技术思考
创建 2026-06-30 · 更新 2026-06-30

Agent 经验学习:从文本反思、程序技能到策略内化

梳理 LLM Agent 将任务轨迹沉淀为可检索经验、可执行技能和参数化能力的技术路线,并讨论技能库维护、评测方法与工程边界。

Agent Experience Learning Skill Learning Self-Evolving Agents
AGENTS 技术思考
创建 2026-06-30 · 更新 2026-07-02

从代码拆解 GRPO Loss:各组成项、负值与目标上升

沿着最小 GRPO 实现拆解 importance ratio、clipping、KL penalty 与聚合过程,解释负 loss、目标上升和近零实验现象。

GRPO Reinforcement Learning Post-training Policy Optimization
LLMS 技术思考
创建 2026-06-29 · 更新 2026-06-29

从 1D-RoPE 到 Qwen 的 MRoPE:旋转位置编码的频率分配

从一个 6 维向量出发,推导 1D-RoPE 的相对位置性质,并分析 Qwen2.5-VL 分块式 MRoPE 与 Qwen3-VL Interleaved-MRoPE 的差异。

VLM Qwen Multimodal Large Language Model Position Encoding
MLLMS 技术思考
创建 2026-06-16 · 更新 2026-06-16

PPO、DPO 与 GRPO:大模型对齐算法的目标函数与训练流程

从目标函数、优势估计和训练循环出发,对比 PPO、DPO 与 GRPO 在大模型对齐中的设计取舍与适用边界。

Post-training Reinforcement Learning PPO DPO GRPO
REINFORCEMENT-LEARNING 技术思考
创建 2026-05-28 · 更新 2026-08-25

OPD:后训练中的能力整合接口

从 Qwen3、GLM-5、MiMo-V2 与 DeepSeek-V4 的技术路径看 OPD 如何成为后训练中的能力整合接口。

OPD Reinforcement Learning Distillation
OPD 技术思考
  • View source
  • Report an issue