02
Apodex-1.0:把验证变成 Agent 团队的内在行为
统一运行时如何托管深研、编码与证明三类 heavy-duty 任务,并用团队结构突破单 Agent 的可靠性上限。
9 篇研究手记
以论文为锚点,追踪 Agent、评测与自我改进系统。少看榜单,多看机制;少记结论,多留判断依据。
按研究脉络筛选
统一运行时如何托管深研、编码与证明三类 heavy-duty 任务,并用团队结构突破单 Agent 的可靠性上限。
为什么标量分数不够用,以及结构化标准如何贯穿评测、奖励建模与推理时控制。
统一任务合成、上下文压缩与异步 RL,让 2B–35B 模型共享同一套深研训练配方。
Rubric 不再只是事后打分器,而是在 ReAct 分支点生成标准、核验行为并触发重试。
局部验证每一步、全局验证整条证据链,把“更多工具调用”升级为更可靠的重型研究流程。
从数据合成、轨迹构造到测试时扩展,逐层堵住深研系统中的误差传播链。
用搜索增强的动态规则与判别力筛选,为开放式长文研究构造持续有效的奖励信号。
把交互深度视作独立扩展维度,用长程 ReAct 轨迹研究工具调用如何转化为任务能力。
内容经署名整理自下方参考项目,遵循 CC BY-SA 4.0;页面设计由 LLM Compass 独立完成。 zhoujx4/llm-atlas