Skip to content

DR Tulu: Reinforcement Learning with Evolving Rubrics

Translation status: The English translation is pending. The section structure is synchronized with the Chinese source.

Motivation: Rewarding Open-Ended Long-Form Research

Method: Search-Augmented Evolving Rubrics

RLER Overview

Initialization with Search Results

Rubric Scoring

Rubric-Buffer Management

Training Recipe

Results

Evaluation Setup

Main Results

Cost

GeneticDiseasesQA Case Study

Short-Form QA Generalization

Ablations

Position in the Deep-Research Landscape