笔记
研究笔记
围绕 LLM 研究与工程实践整理的双语论文解读和技术思考。
浏览
论文解读
DINO 系列:架构、训练原理与任务适配
沿 DINO、DINOv2、DINOv3 解释自蒸馏、局部表征、训练步骤与损失设计,并结合 DINOv2 + SimCLR 项目讨论图像检索和领域适配。
Self-Evolving Coding Agents:分类体系、反馈闭环与可信演化
基于演化对象、演化时机与软件证据三条主线,梳理自进化编码智能体如何更新框架、记忆、技能工具、模型与协作结构,并讨论可信演化所需的验证、版本化和回滚机制。
SkillRL:如何将一次失败变成可复用的 Skill
以 ALFWorld 的 Skipping State Changes 为贯穿案例,拆解 SkillRL 如何从失败轨迹提炼候选技能、组织 SkillBank、训练技能使用策略,并区分论文证据、代码实现与生产准入建议。
Kimi Linear 与 KDA:从通道级遗忘到硬件高效的线性注意力
从递推公式、WY/UT 并行算法、3:1 KDA/MLA 混合结构与公开实现出发,复核 Kimi Linear 的效果、效率和边界。
Kimi K3:架构、训练与百万 Token Agentic RL 技术解读
用直白的方式解释 Kimi K3 的 KDA、Block AttnRes、LatentMoE、1M 上下文与九策略强化学习,并区分论文结论和外部实测。
数据智能体:自治等级、研究现状与开放问题
基于 L0–L5 自治分级和数据生命周期视角,梳理数据智能体从响应式助手、程序执行器到受监督编排器的能力边界,并分析责任、治理与评测缺口。
从 Qwen 到 Qwen3.6:七代模型的架构与训练演进
沿七代 Qwen 主线梳理注意力、MoE、数据、后训练、原生多模态与 Agent 环境的演进,并解释 Qwen3-Next 为何是架构桥梁而非独立一代。
SAPO:用连续软门控替代策略比率的硬截断
从代理目标、梯度权重、非对称温度与 Qwen3-VL 实验出发,分析 SAPO 如何在 token 级保留有效梯度,并在小步更新条件下近似序列级软信任域。
Entropy Collapse:大模型 RL 训练中的策略熵消耗机制
从策略熵、SFT 与 RL 的优化差异、DAPO 的 Clip-Higher,以及协方差正则化角度理解大模型 RL 训练中的 Entropy Collapse。
从 Qwen-VL 到 Qwen3-VL:四代模型的架构与训练演进
梳理 Qwen-VL 四代模型在视觉语言对齐、动态分辨率、时空位置编码、视频建模与深层视觉融合上的技术演进。
CapRL:用强化学习激发视觉语言模型的描述能力
CapRL 用 vision-free LLM 的 MCQ 答题准确率评价 caption,将主观的描述质量评分改造成可验证奖励,并据此训练图像描述模型。
浏览
技术思考
万字长文带你读懂 RSI(自进化,Self-Evolving)
从进化对象、版本结构、更新者、更新时机和反馈维度整理 Recursive Self-Improvement(RSI)方法。
Query 识别与改写:训练、检索与 Agent 架构边界
梳理意图识别、澄清、行为驱动改写、蒸馏与检索评测,补充基于证据依赖的多跳训练数据构造,并讨论 Agent 状态管理与 AIGC recaption 的边界。
从策略滞后到优势坍缩:LLM 强化学习中的有效更新信号
从 rollout policy、PPO clip 与 GRPO 组内零优势出发,分析 LLM 强化学习中的无效更新,并给出数据、采样、监督和优化层面的处理顺序。
没有线上数据,如何为 Agent 构建冷启动评测集
从能力地图、人工金种子、受控变异、状态 Oracle、可重置环境和发布门禁出发,构建上线前可复核的 Agent 冷启动评测集。
KL 散度:从数学推导到 LLM 强化学习
看懂 KL 散度的数学结构,并理解它在 PPO、DPO、GRPO、On Policy Distillation 中究竟控制了什么。
Agentic RL 的轨迹数据契约:从 Harness 到可训练样本
从模型调用、上下文重建到 rollout 分组与信用分配,说明 Agentic RL 如何保留可审计的 token 级训练数据。
OPD 的局部信用分配与全局正确性边界:从『蒸馏强化学习』直觉出发
从一个『teacher-defined dense reward』的直觉出发,推导 OPD 的 reverse-KL 训练信号,分析错误前缀下的局部一致陷阱,并比较 KAT、BRTS、TrOPD 与 local support matching 的修正边界。
递归自我改进:从产出物、Harness 到模型—脚手架共进化
用优化对象与闭环程度两个维度重审 2026 年递归自我改进进展,并给出一套可审计的证据准入标准。
RL 到底改变了什么:推理模式、蒸馏与可控后训练
以推理模式的存在、选择、迁移与控制为框架,重新审视 SFT、RLVR、蒸馏和二次 RL 的职责边界。
如何科学评测 AI Agent:指标、环境、裁判与回归闭环
从结果与过程指标、环境与任务设计、LLM-as-a-Judge、失败归因和双层回归出发,构建可复现的 AI Agent 评测闭环。
从 Clio 到可执行 Skill:LLM + Embedding 分层聚类的工程复盘
从 Clio 的语义聚类子系统出发,复盘一个可执行 Agent Skill 的实现,并用 20 Newsgroups 实验分析 LLM 分层合并带来的指标收益、代价与隐私边界。
Benchmark 背后的 Benchmark:Agent 评测中的裁判噪声与可信比较
从原文报告的 106 个任务与多裁判实验出发,分析 Agent 噪声、裁判方差、证据契约、连续评分、集成聚合和模型比较,并区分稳定性与正确性。
把 Agent 当作算法使用:Skill、CLI 与 Workflow 的工程化设计
从职责切分、按需披露、Gate 校验、状态持久化与 Workflow 编排出发,讨论如何约束 Agent 的执行随机性并提升多步任务的可恢复性。
长轨迹、可学习价值与动态验证:Agentic RL 的训练约束正在变化
结合 GLM-5.2、Qwen、GenAC、OPID 与两项相关研究,分析长时域智能体如何重塑轨迹采样、信用分配、奖励验证和稠密监督。
在 DPO 中保留一条 SFT 梯度:从相对偏好到 chosen likelihood 锚定
围绕 DPO Trainer with SFT Loss 的代码路径,分析 chosen-response SFT 如何改变 DPO 梯度、数据与显存边界,以及该假设应如何被实验推翻或保留。
Agent 经验学习:从文本反思、程序技能到策略内化
梳理 LLM Agent 将任务轨迹沉淀为可检索经验、可执行技能和参数化能力的技术路线,并讨论技能库维护、评测方法与工程边界。
从代码拆解 GRPO Loss:各组成项、负值与目标上升
沿着最小 GRPO 实现拆解 importance ratio、clipping、KL penalty 与聚合过程,解释负 loss、目标上升和近零实验现象。
从 1D-RoPE 到 Qwen 的 MRoPE:旋转位置编码的频率分配
从一个 6 维向量出发,推导 1D-RoPE 的相对位置性质,并分析 Qwen2.5-VL 分块式 MRoPE 与 Qwen3-VL Interleaved-MRoPE 的差异。
PPO、DPO 与 GRPO:大模型对齐算法的目标函数与训练流程
从目标函数、优势估计和训练循环出发,对比 PPO、DPO 与 GRPO 在大模型对齐中的设计取舍与适用边界。
OPD:后训练中的能力整合接口
从 Qwen3、GLM-5、MiMo-V2 与 DeepSeek-V4 的技术路径看 OPD 如何成为后训练中的能力整合接口。