Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
该论文提出面向 computer-use agents 的失败驱动推理时自改进循环,将失败轨迹转化为由 LLM 诊断生成的策略与代码补丁,而不是直接丢弃失败样本。在 OSWorld 上,该方法无需额外训练、仅增加适度推理开销,就将 OpenCUA-72B 的成功率从 42.3% 提升到 48.9%。
研究分类
智能体系统、工具调用、记忆、AI 研究工作流和可复用技能生态。
1 篇论文
3 篇论文
该论文实证研究检索策略、智能体 harness 设计与工具结果呈现方式在 agentic search 中如何相互影响。在基于 LongMemEval、Chronos 和厂商 CLI harness 的实验中,grep 往往优于向量检索,但整体性能仍强烈受 harness 与工具调用风格影响。
该论文提出 Direct Corpus Interaction(DCI)检索范式,让智能体使用 grep、文件读取和轻量脚本等通用终端工具直接搜索原始语料,而不是依赖固定的 top-k 检索器。DCI 无需嵌入模型、向量索引或检索 API,并在信息检索基准和端到端 agentic search 任务上显著优于稀疏、稠密及重排序基线。
该论文指出当前多模态工具调用推理在简单图像旋转和损坏下仍然脆弱,并提出 CodeVision,一种让模型通过生成代码调用任意图像操作的 code-as-tool 框架。它结合 SFT、RL 和密集过程奖励,提升多工具推理、执行效率和错误恢复。
1 篇论文
Tongyi DeepResearch 是一个面向长时程信息检索任务的智能体语言模型,总参数量为 30.5B、每个 token 激活 3.3B 参数,并通过智能体中期训练与后训练构建。其全自动数据合成管线和分阶段定制环境支持各训练阶段可扩展且稳定的交互。
2 篇论文
数据智能体利用 LLM 与工具自动化数据管理、准备和分析,但概念使用不一致,模糊了能力与责任边界。该教程提出 L0-L5 自治层级与生命周期驱动的综述框架,梳理现有系统,并勾勒迈向主动式和生成式数据智能体的研究路线图。
Clio 是一个隐私保护平台,利用 AI 助手从数百万次对话中提取、聚类并总结聚合模式,无需人工审阅原始数据。其评测及对一百万次 Claude.ai 对话的应用表明,大规模使用分析能够在保护用户隐私的同时揭示真实应用方式与新兴安全风险。
6 篇论文
该综述将智能体产物创作定义为一种有状态的构建过程:AI 系统实质性地创建或修改交付物,并根据中间观察结果调整后续工作。论文梳理了六类产物中的 230 个系统和 29 个基准,分析构建与评测挑战,并提出明确责任、针对性修复和变更后重新验证等原则。
AutoResearch 是一个两阶段多智能体系统,将科研想法生成与以证据为基础的执行相连接,并通过跨模型审查、实验分解和独立审计保障过程可靠性。它在跨模态检索、系统优化和基准驱动机器学习等场景中把候选想法转化为可量化进展,同时发现并纠正不可靠的实验结果。
Spark-to-Paper 将端到端科研论文生成实现为现有编程助手内的 13 个可组合技能,覆盖文献检索、实验规划与执行、证据引导的修订及可编辑图表生成。它结合确定性完整性检查、自我批评和对自我否定循环的有界恢复,使长程科研工作流程持续以实测证据为核心。
这篇综述从创造、写作、验证和传播等环节分析 AI 辅助科研,指出自动化在哪些地方可靠,以及自治系统在新颖性、实验和科学判断上仍会失败。它提供生命周期分类、基准套件、工具清单、设计原则和面向实践者的人类治理式 AI 研究工作流指南。
该论文提出 Crafter,一个面向多种图类型和输入条件的多智能体科学图生成 harness,并提出 CraftEditor 将栅格输出转换为可编辑 SVG。论文还构建带人工质量标注的 CraftBench 基准,并展示其相较独立生成器和 agentic baseline 的优势。
该论文提出 AIRA_2,一种 AI 研究智能体架构,用于解决实验吞吐有限、基于噪声验证的选择不稳定以及单轮静态算子等瓶颈。它结合异步多 GPU worker、Hidden Consistent Evaluation 和交互式 ReAct 智能体,提升长程研究任务表现。
4 篇论文
SkillEvo 通过多轮用户模拟持续生成反馈,逐层暴露智能体技能在交互中出现的缺陷并驱动其演化。独立的治理层主动修复事实退化与结构膨胀,在生产云服务技能上优于自反思和单轮问答驱动的演化方法。
SkillsVote 将 Agent Skills 视为可复用经验资产,通过收集、推荐、归因和演化治理来缓解智能体轨迹噪声与难治理问题。它分析大规模开源技能语料,在执行前推荐结构化技能上下文,并只接纳证据门控的成功发现,以在不更新模型的情况下改进冻结智能体。
Ctx2Skill 面向长且密集上下文中的 context learning,解决人工标注技能成本高、自动构建技能缺少外部反馈的问题。它通过多智能体 self-play 与 Cross-time Replay 自动发现、细化并选择可复用自然语言技能,从而提升不同语言模型的上下文学习解题率。
该论文提出 SkillReducer,一个两阶段优化框架,用于压缩 LLM 智能体技能这类预封装指令集。它在提升功能质量 2.8% 的同时,将技能描述和正文分别压缩 48% 和 39%,降低 token 成本与注意力稀释。
11 篇论文
LongHorizon-Harness 将长程执行重构为显式任务状态管理,仅使用从环境中独立验证的事实更新外部状态。其 Manage-Execute-Audit 循环将规划、全新上下文执行与只读验证分离,在计算机使用和终端任务基准上提升智能体可靠性。
OneDayAgent 将开放式长时程请求转化为受管理的执行流程,在异构工具环境中结合有界子任务分解、上下文压力下的执行记忆,以及全局验证与定向修复。在 AgentIF-OneDay 的 104 项任务上,它使用 GLM-5.2 获得 0.821 分,并可在来自三个模型家族的五种后端 LLM 上无需针对性调优地运行。
该综述定义了自演化编码智能体,并以框架、记忆、技能、工具、模型和协作结构等演化对象为核心建立分类体系,同时从演化时机及其依赖的软件特定证据两个维度补充分析。论文指出可执行反馈、仓库级上下文和编码轨迹构成该领域的独特基础,并梳理了可靠性、安全性、成本、可维护性与泛化等挑战。
Prime Agent 是一个面向长时程评测与编码工作流的开源 harness,结合持久化 IPython REPL、可跨轨迹保留的历史与智能体资产,以及递归协作的子智能体。它在允许模型自主构造策略的同时,统一执行、恢复、验证和资源核算,并显著提升推理、编码与自主任务基准上的表现。
Apodex 1.1 通过环境扩展与智能体协调扩展,提升复杂真实任务上的持续、可验证进展:前者扩展可执行的文件、搜索和代码环境,后者支持有状态的多智能体任务分解、异步协作与重新规划。共享执行 harness 与 AgentOS 将环境轨迹和协调轨迹转化为可靠行为,同时 35B 参数的 Apodex 1.1 Mini 提供了可本地部署的 working capability。
该论文提出 Harness Handbook,通过静态分析与 LLM 辅助结构化构建以行为为中心的表示,将分散在 agent harness 中的系统行为映射到对应源码。其行为引导渐进披露方法在减少规划 token 用量的同时,提升行为定位与编辑计划质量。
该论文提出 LLM-as-a-Verifier,一个无需额外训练的通用验证框架,通过评分 token 的概率分布生成连续分数,并从评分粒度、重复评估和标准分解三个维度扩展验证。它可为代码、机器人和医疗等领域的智能体解答选择与进度跟踪提供准确、细粒度的反馈。
该综述将长时程智能体形式化为由模型策略与外围 harness 耦合而成的决策过程,并以外显的 harness 工程和内化的模型优化为主线提出统一分类体系。论文从六个相互关联的视角梳理领域演进、应用、基准与开放问题。
该论文提出 Nurture-First Development,一种通过结构化对话而非固定代码优先或提示优先方式培养领域专家智能体的范式。它形式化了知识结晶循环、三层认知架构、双工作区模式和螺旋开发模型,用于持续把从业者隐性知识转化为可复用智能体资产。
该论文提出 EvoControl,一个面向算法代码优化的受控自进化框架,在 generate-verify-refine 循环中平衡正确性与探索。它结合分阶段自进化、类遗传种群搜索和进化记忆,在高难算法基准上提升代码质量。
Darwin Gödel Machine(DGM)是一种自改进编码智能体系统,通过反复修改自身代码、在编程基准上验证改动,并从不断扩展的智能体档案中开展开放式探索来持续演化。它将 SWE-bench 和 Polyglot 的性能分别从 20.0% 提升至 50.0% 和从 14.2% 提升至 30.7%,优于缺少自改进或开放式探索的消融基线。
5 篇论文
SWE-Bench ProMax 是一个经专家策划的多语言大规模代码重构基准,包含来自七种编程语言真实提交的 170 个任务,并采用重写的明确任务描述与人工审查的测试。其跨文件任务平均修改 11.4 个文件和 261.6 行代码,而受测最佳前沿模型的解决率仅为 41.2%。
HarnessEval-W 是一个面向世界模型 rollout 的智能体化评测流水线:父智能体将每个案例拆解为可度量的子问题,交由配备专用工具的子智能体分析,再验证证据并生成可审计的证据树,而非仅输出单一分数。在覆盖 18 个世界模型的 330 个评测案例上,其判断与人类偏好高度一致,并能给出细粒度诊断。
LoopArena 评测控制器模型利用结构化证据和循环契约,引导一个独立且固定的编码智能体 Worker 完成长程软件任务的能力。它设置了从下一步契约选择到完整任务控制的三种评测模式;完整任务上的最佳严格成功率为 24.69%,而低成本的压缩任务模式平均可减少 64.4% 的估算推理成本。
AutoLab 提出一个面向超长时程闭环优化的智能体基准,覆盖系统优化、谜题挑战、模型开发和 CUDA 内核四类任务,共包含 36 个专家策划任务,要求智能体在严格预算内反复编辑、运行、测量并改进真实产物。对 17 个前沿模型的评测表明,持续迭代和利用经验反馈比初始尝试质量更能决定成功,因此需要更加关注时间感知与迭代能力的自主智能体研究。
本综述将 rubric 定义为把整体质量判断转化为可验证、可执行标准的显式结构化准则,用于 LLM 评测与训练。论文系统梳理 rubric 的构建、优化、可靠性与基准,并追踪其从评测到密集过程级反馈、再到自我改进的作用。
7 篇论文
MemTrapBench 评测记忆诱发的认知陷阱:即使忠实且语义相关的检索记忆,也可能扭曲 LLM 的推理或信念;基准覆盖推理固化与信念扭曲两类失效模式。论文发现各类记忆框架均低于无记忆基线,并提出推理时提示方法 AdaptiveMem,在缓解这些问题的同时保持标准记忆基准性能。
Agent Memory Distillation 是一个无需训练的框架,通过互补的 Workflow、Subtask 和 Function 三层记忆,将教师智能体的成功经验迁移给 4B-8B 学生智能体,并分别以主动注入支持规划、以响应式检索修复工具调用错误。在四种学生模型上,它相较 zero-shot 在 AppWorld、BFCL V3 和 ToolSandbox 上的平均准确率分别提升 27.2、11.2 和 3.4 个百分点。
该论文提出 ABot-AgentOS,一个位于机器人底层控制器之上的审慎式运行时层,统一协调规划、隔离式技能执行、验证、边云协同与持久多模态图记忆。它还提出 EmbodiedWorldBench 和防泄漏的自进化循环,将诊断出的记忆故障转化为受门控的运行时改进,以支持长时程具身任务。
该论文提出一个从 LLM 智能体执行轨迹中提取可行动经验,并在未来任务中作为上下文记忆检索的框架。它结合轨迹智能提取、决策归因、上下文学习生成和自适应记忆检索,尤其提升复杂 AppWorld 场景的任务完成率。
该论文提出 BEAM,一个由长而连贯对话和探测问题组成的基准,用于评估 LLM 长期记忆;同时提出 LIGHT,一个包含情景记忆、工作记忆和草稿板的记忆框架。二者共同揭示长上下文记忆限制,并提升长程对话推理表现。
该论文提出 MLP Memory,一个轻量级参数模块,通过预训练 MLP 模仿 kNN 检索器行为来内化检索模式。该方法在 RAG 与微调之间架起桥梁。
该论文提出 MemAgent,一个基于多轮对话 RL 的记忆智能体,用线性复杂度处理无限长文档。它旨在解决外推到超长上下文时性能退化的问题。