This repository summarizes recent research on reinforcement‑learning (RL)‑based agentic search systems. These systems treat information‑seeking as a decision process: when a large language model (LLM) faces a complex question, it can plan and act by issuing search queries, revising those queries, and integrating evidence into its reasoning. RL techniques allow these agents to learn when to search, how intensively to search and how to integrate retrieved evidence into reasoning.
For more details, please check out our survey paper: A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications. If you find this repository helpful, please cite our survey paper.
@article{lin2025comprehensive,
title={A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications},
author={Minhua Lin, Zongyu Wu, Zhichao Xu, Hui Liu, Xianfeng Tang, Qi He, Charu Aggarwal, Hui Liu, Xiang Zhang, Suhang Wang},
journal={arXiv preprint arXiv:2510.16724},
year={2025}
}
We are actively maintaining this repository!
- Overview of RL-based Agentic Search
- Illustrative Framework of RL-based Agentic Search
- Representative Survey
- Method
- Evaluation
The below table summarizes representative works with corresponding optimization strategies. Specifically, ORM and PRM denote the Outcome Reward Model and the Process Reward Model, respectively. “Rule-based” indicates that the reward function is entirely computed from predefined rules; otherwise, an LLM is involved as a reward judge.
📊 Click to expand long table (scrollable).
| Method | RL Func. Role | Cold Start? | Training Env. | RL Alg. | Reward Type | Reward Func. | Opt. Scope | Dataset |
|---|---|---|---|---|---|---|---|---|
| FA-SD | R–S Inter. Training Stability |
- | Real-world Retrieval-Interleaved Search |
Self-Distillation EMA Teacher |
- | KL Self-Distillation Feedback-Augmented Supervision |
Single-agent | Retrieval-interleaved search tasks |
| PCTD | R-Aware Opt. Multi-tool |
- | Tool Retrieval Mobile Multi-Turn |
RL | - | Counterfactual Retrieval Gain Preference Reward |
Module-level | MTDTool |
| VideoSearcher (Code) | Multi-modal Multi-tool R–S Inter. |
- | Real-world Video Deep Research |
BiSPO | - | Tool-Invocation Objective Answer-Accuracy Objective |
Single-agent | VideoSearch-QA |
| DeepSearch-Evolve | Adapt-Search Ctx-Mem. Task / Data Synthesis |
- | Simulated Verifiable |
Self-Distillation Fine-tuning |
- | Trajectory Filtering Data Mixing |
Single-agent | DeepSearch-World (420K tasks) |
| HOTE | Cooperative Multi-Agent Systems Self-Evolving |
- | Real-world Open-Ended Research |
Hybrid-Mode RL | - | Proposer–Solver–Judge Co-Evolution | Multi-agent | Three long-form deep-research benchmarks |
| SearchSwarm | P–E Orches. Ctx-Mem. |
- | Real-world Harness-Guided |
SFT | - | Delegation Trajectory Supervision | Multi-agent | BrowseComp, BrowseComp-ZH |
| LAPO | R–S Inter. Step-level |
- | Local Retrieval | RL | Self-generated PRM | Answer-Likelihood Gain Sign-Consistency Gating |
Step-level | Seven knowledge-intensive QA datasets |
| AWA-RL (Code) | Adapt-Search Reliability |
- | Local Retrieval | RL | ORM + Abstention Reward | Dynamic Abstention Reward Answer Reward |
Single-agent | [MuSiQue, HotpotQA, 2WikiMultiHopQA] |
| GRASP | R-Aware Opt. Search Efficiency Multi-tool |
- | Local Retrieval | RL | ORM+PRM | Answer Accuracy Grounded Reading Complementary Search Turn Efficiency |
Single-agent | Multi-hop reasoning benchmarks |
| DeepRubric | R–S Inter. Task / Data Synthesis |
- | Synthetic Real-world Evaluation |
GRPO | Rubric-based ORM | Evidence-Tree Rubrics Report Quality |
Single-agent | 9K query–rubric pairs; three deep-research benchmarks |
| Libra (Code, Data) | R-Aware Opt. Ctx-Mem. Struct-Nav. |
✓ | Simulated Repository Env. |
Environment Optimization | - | Catalog Healing Localization Feedback |
Environment-level | SWE-bench Lite |
| PaperPilot | Conv-Reform. Struct-Nav. R–S Inter. |
✓ | Scientific Literature | SFT Preference Optimization |
- | Workflow Imitation Preference over Workflow Corruptions |
Single-agent | Scientific literature search |
| Maven | Ctx-Mem. R–S Inter. |
- | Long-context | GRPO | PRM | Evidence-State Rewards Action-level Transition Reward |
Step-level | LongBench v2, LongReason, RULER |
| PlanRAG | Conv-Reform. R-Aware Opt. Search Efficiency |
- | Real-world Query Planning |
Dynamic Programming Cost Model |
- | Logical Query Tree Cost | Module-level | WikiWeb-ERP |
| BaRA (Code) | Multi-tool Search Efficiency |
- | Real-world Web |
BFS Self-reflection |
Rule-based | Liveness Verification Provenance Checks |
Single-agent | Synthetic and real websites |
| Harness-1 (Code, Model) | Adapt-Search Ctx-Mem. Search Efficiency |
- | Real-world Stateful Harness |
RL | - | - | Single-agent | [BrowseComp-Plus, web, finance, patents, multi-hop QA] |
| Query Recycling | Search Efficiency Training Stability |
✓ | Simulated Sandboxed |
GRPO | Rule-based ORM | Zero-Variance Query Recycling Answer Reward |
Single-agent | Multi-hop QA |
| SAAS (Code) | Search Efficiency Adapt-Search |
- | Real-world | GRPO | Rule-based ORM | Boundary-aware search penalty Answer reward |
Single-agent | - |
| SD-Search | R–S Inter. R-Aware Opt. |
- | Real-world | GRPO Self-Distillation |
PRM | Hindsight query distillation Answer reward |
Step-level | - |
| Search-E1 | R–S Inter. Search Efficiency |
- | Real-world | GRPO OPSD |
Self-distillation | Answer EM Token-level KL |
Step-level | QA benchmarks |
| GrepSeek | R-Aware Opt. Struct-Nav. |
✓ | Real-world Direct Corpus Interaction |
GRPO | ORM | Answer EM/F1 | Single-agent | - |
| QUEST | Adapt-Search Ctx-Mem. |
✓ | Synthetic Real-world |
SFT RL |
Rule-based ORM | Verifiable rubric-tree reward | Single-agent | - |
| SciResearcher | Adapt-Search Multi-tool Domain-Specific |
✓ | Synthetic Scientific |
SFT Agentic RL |
ORM | Scientific reasoning reward | Single-agent | [HLE-Bio/Chem-Gold, SuperGPQA-Hard-Biology, TRQA-Literature] |
| OThink-SRR1 | R–S Inter. Search Efficiency |
- | Real-world | GRPO-IR | Rule-based ORM+PRM | Format Retrieval hit Refinement hit Retrieval penalty |
Single-agent | Multi-hop QA |
| CalibAdv (Code) | Training Stability R–S Inter. |
- | Real-world | GRPO | ORM | Advantage Calibration | Step-level | - |
| O-Researcher | P–E Orches. Multi-agent |
✓ | Synthetic | SFT Agentic RL |
- | - | Single-agent | Deep Research Benchmark |
| RAGShaper | Task / Data Synthesis R–S Inter. |
✓ | Synthetic | SFT | - | Robust trajectory synthesis | Single-agent | - |
| MTA-Agent | Multi-modal Multi-tool |
✓ | Synthetic Cached Tool Replay |
SFT | - | Verified multi-hop trajectory synthesis | Single-agent | MTA-Vision-DeepSearch |
| On-Policy Data Evolution | Multi-modal Task / Data Synthesis |
✓ | Real-world On-policy |
SFT RL |
ORM | Rollout-feedback data evolution | Single-agent | - |
| Argus | P–E Orches. Ctx-Mem. |
- | Real-world | RL | - | Evidence Assembly Source-traced Answer |
Multi-agent | [BrowseComp-en] |
| CuSearch (Code) | Search Efficiency R-Aware Opt. |
- | Real-world Simulated |
GRPO RLVR |
Verifiable Reward | Search-Depth Curriculum SDGA |
Single-agent | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| HyperEyes (Code) | Multi-modal Multi-tool Search Efficiency |
✓ | Real-world | SFT RL |
ORM+PRM | TRACE On-Policy Distillation |
Single-agent | [IMEB, MMSearch, LiveVQA, InfoSeek] |
| VISOR | Multi-modal R–S Inter. Search Efficiency |
✓ | Real-world Visual Retrieval |
GRPO | ORM+PRM | Visual Action Evaluation Credit Assignment Search Drift Control |
Single-agent | [ViDoSeek, SlideVQA, MMLongBench] |
| RubricEM | Ctx-Mem. R–S Inter. |
- | Real-world | Stage-Structured GRPO Meta-RL |
PRM | Rubric Judgments Reflection |
Single-agent | Long-form research benchmarks |
| DecEx-RAG (Code) | Adapt-Search R–S Inter. |
- | Real-world | Process-level Policy Optimization | PRM | Decision Optimization Execution Optimization |
Single-agent | Six datasets |
| OpenSearch-VL (Code) | Multi-modal Multi-tool Adapt-Search |
✓ | Real-world | Fatal-aware GRPO | ORM+PRM | Answer Acc Query Quality Format |
Single-agent | [SearchVL-SFT-36k, SearchVL-RL-8k, SimpleVQA, VDR, MMSearch, LiveVQA, BrowseComp-VL, FVQA, InfoSeek] |
| OpenSeeker-v2 | Adapt-Search | ✓ | Real-world | SFT | - | - | Single-agent | [BrowseComp-en, BrowseComp-zh, HLE, XBench] |
| LongSeeker | Ctx-Mem. Search Efficiency |
✓ | Real-world | SFT | - | Context Orchestration | Single-agent | [BrowseComp-en, BrowseComp-zh] |
| Search, Do not Guess | Adapt-Search Search Efficiency |
✓ | Real-world | Fine-tuning | - | Evidence-grounded Search Use | Single-agent | [Bamboogle, HotpotQA] |
| InfoTree | Search Efficiency Multi-tool |
- | Tree-search Tool-use |
GRPO | - | Rollout Informativeness UUCB |
Step-level | [GAIA, HLE-100, BrowseComp-lite, APPS-verified, AgentBench-OS] |
| A$^2$TGPO | Multi-tool Step-level |
- | Real-world | A$^2$TGPO | PRM | Information Gain Adaptive Turn-level Clipping |
Step-level | - |
| IG-Search | R–S Inter. R-Aware Opt. |
- | Real-world | GRPO | Rule-based PRM | Information Gain | Step-level | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| CW-GRPO | R-Aware Opt. R–S Inter. |
- | Real-world | CW-GRPO | ORM+PRM | Retrieval Utility Reasoning Correctness |
Step-level | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| Cycle-Consistent Search | Adapt-Search | - | Real-world | GRPO | PRM | Question Reconstructability | Single-agent | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| APEX-Searcher | Adapt-Search P–E Orches. |
- | Real-world | GRPO | Rule-based ORM | Decomposition F1 | Module-level | [HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| Search More, Think Less | Search Efficiency | ✓ | Real-world | Modified RLOO | ORM | LLM-Judge Format / Tool-use |
Single-agent | [BrowseComp-en, BrowseComp-zh, GAIA, XBench, DeepResearchBench, WebWalkerQA] |
| To Search or Not to Search | Search Efficiency | - | Real-world | DPO | - | Decision Boundary Alignment | Step-level | [NQ, HotpotQA] |
| A-RAG (Code) | R-Aware Opt. R–S Inter. |
- | Real-world Hierarchical Retrieval |
- | - | Hierarchical Retrieval Interfaces Test-time Scaling |
Single-agent | Multi-hop QA |
| SmartSearch | Conv-Reform. R-Aware Opt. |
✓ | Real-world | GRPO | PRM | Query Novelty Query Usefulness |
Step-level | [HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| Evaluate-as-Action | R–S Inter. | - | Real-world | GRPO | PRM | Self-Evaluation Reward | Step-level | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| SE-Search | R–S Inter. Ctx-Mem. |
- | Real-world | GRPO | ORM+PRM | Query Reward Memory Reward Answer Reward |
Step-level | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| Search-P1 | R–S Inter. Search Efficiency |
- | Real-world | GRPO PPO |
ORM+PRM | Path Reward Answer Reward |
Step-level | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, AD-QA] |
| SynPlanResearch-R1 | Adapt-Search Multi-tool |
✓ | Real-world | GRPO | - | - | Single-agent | [HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, GAIA, WebWalkerQA, GPQA] |
| RAPO | R-Aware Opt. Multi-tool |
- | Real-world | RAPO | Retrieval-aware | Retrieval Reward Importance Shaping |
Step-level | Agentic reasoning tasks |
| KARL | Adapt-Search Search Efficiency Ctx-Mem. |
- | Real-world | OAPL | - | - | Single-agent | [BrowseComp-Plus, TREC-Biogen, FinanceBench, QAMPARI, Freshstack, PMBench] |
| GraphSearch | Struct-Nav. R-Aware Opt. |
- | Graph Env. | - | - | Graph-aware Query Planning Hybrid Graph Retrieval |
Single-agent | Node classification, link prediction |
| LiteResearcher (Code) | Adapt-Search Search Efficiency |
- | Simulated Lite Virtual World |
GRPO | ORM | Answer Correctness (LLM-Judge) | Single-agent | [GAIA, FRAMES, XBench] |
| CoSearch (Code) | R-Aware Opt. R–S Inter. |
- | Real-world | GRPO | Rule-based ORM+PRM | Answer F1 Relevance Reward |
Module-level | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| AutoSearch (Code) | Search Efficiency Search Intensity |
- | Real-world | PPO GRPO |
Rule-based ORM+PRM | Format Outcome EM Search Efficiency Search Quality F1 |
Step-level | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, Bamboogle] |
| DR-Venus (Code, Models) | Adapt-Search Ctx-Mem. |
✓ | Real-world | IGPO-based Agentic RL | ORM+Turn-level Reward | Information Gain Format Regularization |
Single-agent | [GAIA, BrowseComp-en, FRAMES] |
| ProMMSearchAgent | Multi-modal Adapt-Search |
- | Simulated Sim-to-Real |
RL with Process-oriented Reward | PRM | Knowledge-Boundary / Search-Decision Reward | Single-agent | [FVQA, InfoSeek, MMSearch] |
| IGPO | Adapt-Search R–S Inter. |
- | Real-world | IGPO | Rule-based ORM+PRM | Answer F1 Information Gain |
Step-level | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| SearchGym (Code) | Adapt-Search | - | Simulated | SearchGym-RL | - | Purified Feedback Curriculum |
Single-agent | - |
| SIGHT | Adapt-Search R–S Inter. Search Efficiency |
- | Real-world | GRPO | - | SES Correctness Information Gain |
Single-agent | - |
| Search-R2 | R–S Inter. | - | Real-world | - | PRM | Dense Process Reward | Single-agent | - |
| DeepControl | Search Efficiency Search Intensity |
- | Real-world | RL | Utility-based control | Information utility Retrieval continuation Granularity control |
Step-level | 7 QA benchmarks |
| WideSeek-R1 | Search Efficiency Cooperative Multi-Agent Systems |
- | Real-world | MARL | - | - | Multi-agent | WideSearch |
| M-ASK (Code) | P–E Orches. Ctx-Mem. |
- | Real-world | - | - | Turn-level Reward | Multi-agent | - |
| PRAISE | Search Efficiency Step-level |
- | Real-world | - | PRM | Intermediate Step Reward | Step-level | - |
| Behavior Priming (Code) | Adapt-Search Ctx-Mem. |
✓ | Real-world Behavior-Primed Trajectories |
SFT RL |
ORM | Behavior-Primed Trajectory Reward | Single-agent | [GAIA, Web benchmarks, multi-hop QA] |
| Fathom-DeepResearch | Adapt-Search Ctx-Mem. Multi-tool |
✓ | Real-world Live Web |
RAPO | PRM+ORM | Step-level Utility Reward Curriculum Pruning |
Single-agent | [SimpleQA, FRAMES, WebWalker, Seal0, MuSiQue, HLE, GPQA, MedQA] |
| Search-R1 | Adapt-Search | ✗ | Real-world | PPO GRPO |
Rule-based ORM | Answer EM | Single-agent | [NQ, TriviaQA, PopQA, HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle] |
| ReSearch | Adapt-Search | ✗ | Real-world | GRPO | Rule-based ORM | Format Answer F1 |
Single-agent | [HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| AutoCoA | Adapt-Search | ✓ | Real-world | GRPO | Rule-based ORM | Format Answer EM |
Single-agent | [NQ, TriviaQA, PopQA, HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle] |
| SimpleDeepSearcher | Adapt-Search | ✓ | Real-world | SFT | - | - | Single-agent | [2WikiMultiHopQA, MuSiQue, Bamboogle, FRAMES, GAIA] |
| ExSearch | Adapt-Search | ✗ | Real-world | GEM | PRM | Trajectory Quality | Single-agent | [NQ, HotpotQA, MuSiQue] |
| IKEA | Search Efficiency | ✗ | Real-world | GRPO | Rule-based ORM | Format Answer EM Knowledge-boundary |
Step-level | [NQ, PopQA, HotpotQA, 2WikiMultiHopQA] |
| R1-Searcher | Adapt-Search | ✓ | Real-world | GRPO Reinforce++ |
Rule-based ORM | Format Answer F1 |
Single-agent | [HotpotQA, 2WikiMultiHopQA, Bamboogle, MuSiQue] |
| R1-Searcher++ | Search Efficiency | ✓ | Real-world | GRPO Reinforce++ |
Rule-based ORM | Format Answer EM Std of Search Calls |
Single-agent | [HotpotQA, 2WikiMultiHopQA, Bamboogle, MuSiQue] |
| DeepRAG | Adapt-Search Search Efficiency |
✓ | Real-world | GRPO | Rule-based ORM | Answer EM Retrieval Cost |
Single-agent | [HotpotQA, 2WikiMultiHopQA, CAG, PopQA, WebQuestions, MuSiQue] |
| UR² | Adapt-Search | ✓ | Real-world Curriculum |
Reinforce++ | Rule-based ORM | Format Answer EM Fallback Penalty |
Single-agent | [MATH, Minerva, MedQA, MMLU-Pro, HotpotQA, Bamboogle, 2WikiMultiHopQA, MuSiQue] |
| SSRL | Adapt-Search | ✓ | Simulated Self-Search |
GRPO | Rule-based ORM | Format Answer EM |
Single-agent | [NQ, TriviaQA, HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle] |
| Pangu DeepDiver | Adapt-Search Search Intensity |
✓ | Real-world | GRPO | Rule-based ORM | Format Answer EM Extra Search |
Single-agent | [Pangu, Bamboogle, WebWalkerQA, FRAMES] |
| ReZero | Search Intensity | ✗ | Real-world | GRPO | ORM+PRM | Format Answer LLM-Judge Retry |
Step-level | [Apollo-3] |
| StepSearch | Adapt-Search Search Intensity |
✗ | Real-world | PPO | Rule-based ORM+PRM | Format Answer F1 Search Key Information Gain Redundancy Penalty |
Step-level | [HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle] |
| VERITAS | Adapt-Search R-Aware Opt. |
✗ | Real-world | PPO | ORM+PRM | Answer EM Enhancing Faithfulness |
Step-level | [NQ, TriviaQA, PopQA, HotpotQA, MuSiQue, 2WikiMultiHopQA, Bamboogle] |
| ReasonRAG | Search Efficiency R-S Inter. |
✗ | Real-world MCTS |
DPO | PRM | Shortest Path | Step-level | [PopQA, HotpotQA, 2WikiMultiHopQA, Bamboogle, MuSiQue] |
| Web-Sailor | Adapt-Search Ctx-Mem. |
✓ | Real-world | DUPO | ORM | Format Answer F1 |
Single-agent | [li2025sailorfogqa, BrowseComp-en, BrowseComp-zh, GAIA, XBench] |
| WebSailor-V2 | Multi-tool Ctx-Mem. |
✓ | Real-world | GRPO | Rule-based ORM | Format Answer F1 |
Single-agent | [li2025sailorfogqav2, BrowseComp-en, BrowseComp-zh, GAIA, XBench, HLE, DeepResearchBench] |
| Search Wisely | Search Efficiency | ✗ | Real-world | β-GRPO | Rule-based ORM | Confidence-based Answer EM | Single-agent | [NQ, HotpotQA, TriviaQA, 2WikiMultiHopQA, Bamboogle, MuSiQue] |
| ZeroSearch | Search Efficiency | ✓ | Simulated Curriculum |
PPO GRPO Reinforce |
Rule-based ORM | Answer F1 | Single-agent | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| ParallelSearch | Search Efficiency | ✓ | Real-world | GRPO | Rule-based ORM | Format Answer EM Query Decomposition Search count |
Single-agent | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| RAG-R1 | Search Efficiency Conv-Reform. |
✓ | Real-world | PPO | ORM | Answer EM | Single-agent | [NQ, PopQA, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| RL-QR | Conv-Reform. R-Aware Opt. |
✓ | Synthetic | GRPO | Rule-based ORM | Verifiable Search Reward | Module-level | MTEB VIDORE V2, MS MARCO v2.1 |
| ConvSearch-R1 | Conv-Reform. | ✓ | Real-world | GRPO | ORM | Format Rank-Incentive |
Step-level | [TopiOCQA], [QReCC] |
| MaskSearch | Conv-Reform. R–S Inter. |
✓ | Real-world Curriculum RAMP |
DAPO | Rule-based ORM | Format Answer Recall Length penalty |
Single-agent | [HotpotQA, FANOUTQA, MuSiQue, 2WikiMultiHopQA, Bamboogle, FreshQA] |
| DeepRetrieval | R-Aware Opt. | ✓ | Simulated | PPO | ORM | Format Answer Recall |
Single-level | [NQ, TriviaQA, SQuAD, FEVER, FactoidQA] |
| WebThinker | Search Efficiency | ✗ | Real-world | DPO | PRM | Answer EM Tool Calls Length penalty |
Single-agent | [GPQA], GAIA, WebWalkerQA, HLE, SuperGPQA, OpenThoughts, NaturalReasoning, NuminaMath |
| s3 | R-Aware Opt. | ✓ | Simulated | PPO | Rule-based ORM | Gain Beyond RAG | Module-level | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue] |
| R-Search | R–S Inter. | ✗ | Real-world | PPO GRPO |
Rule-based ORM+PRM | Format Answer F1 Evidence Quality |
Single-agent | [HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| AutoRefine | R–S Inter. | ✗ | Real-world | GRPO | ORM+PRM | Answer F1 Retrieval Reward |
Step-level | [NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA] |
| EvolveSearch | R–S Inter. | ✓ | Real-world Self-evolving |
GRPO | ORM | Format Answer LLM-Judge |
Single-agent | [NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA] |
| O²-Searcher | R–S Inter. | ✓ | Simulated | GRPO | Rule-based ORM | Format Diversity reward Factual reward |
Single-agent | [NQ, HotpotQA, TriviaQA, PopQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| Atom-Searcher | R–S Inter. | ✓ | Real-world Curriculum |
GRPO | PRM+Rule-based ORM | Format Answer F1 Atomic thought reward |
Step-level | [NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA] |
| ReSum | Ctx-Mem. | ✗ | Real-world | Resume-GRPO | ORM | Answer LLM-Judge | Single-agent | [GAIA, BrowseComp-en, BrowseComp-zh, WebWalkerQA, XBench] |
| SFR-DeepResearch | Ctx-Mem. Multi-tool |
✗ | Real-world | REINFORCE | ORM | Answer LLM-Judge | Single-agent | [FRAMES, GAIA, HLE] |
| MAO-ARAG | P–E Orches. | ✓ | Real-world | PPO | ORM | Format Cost Penalty Answer F1 |
Multi-agent | [NQ, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA, AmbigQA] |
| OPERA | P–E Orches. | ✓ | Real-world | MAPGRPO | PRM+ORM | Answerer Reward Planner Reward Rewriter Reward |
Multi-agent | [HotpotQA, 2WikiMultiHopQA, MuSiQue, NQ, Multihop-rag] |
| AI-SearchPlanner | P–E Orches. | ✗ | Real-world | PPO | ORM | Answer LLM-Judge Trajectory Rationality |
Module-level | [NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, PopQA] |
| AgentFlow | P–E Orches. | ✗ | Real-world | Flow-GRPO | Rule-based ORM | EM LLM Judge |
Module-level | [HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, AIME24, AMC23, Gameof24, GPQA, MedQA] |
| SIRAG | Cooperative Multi-Agent Systems | ✗ | Real-world | PPO | PRM | Process LLM-Judge | Multi-agent | [2WikiMultiHopQA, HotpotQA, NQ, PopQA] |
| MMOA-RAG | Cooperative Multi-Agent Systems R-aware Opt. |
✗ | Real-world | MA-PPO | Rule-based ORM | Answer F1 Efficiency penalty |
Multi-agent | [HotpotQA, 2WikiMultiHopQA, AmbigQA] |
| Tool-Star | Multi tool | ✓ | Real-world | REINFORCE++ GRPO DPO |
Rule-based ORM | Format Answer EM |
Single-agent | [LTMS, MATH, GSM8K, WebWalkerQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle] |
| WebWatcher | Multi tool Multi-modal |
✓ | Real-world | GRPO | ORM | Format Answer LLM-Judge |
Single-agent | [HLE, Wu2025mm, LiveVQA, MMSearch, SimpleVQA] |
| Visual-ARFT | Multi-modal Multi-tool Adapt-Search |
✓ | Real-world | GRPO | Rule-based ORM+PRM | Format Answer F1 Query Semantic Sim. |
Single-agent | [MATSearch] |
| VRAG-RL | Multi-modal Search Efficiency |
✓ | Simulated | GRPO | ORM | Format Answer LLM-Judge Retrieval Efficiency |
Single-agent | [SlideVQA, VidORAG, MMLongBench] |
| MMSearch-R1 | Multi-modal Search Efficiency |
✗ | Real-world | GRPO | Rule-based ORM | Format Answer EM Search Penalty |
Single-agent | [MMSearch, Chen2023can, MMSearch, SimpleVQA, LiveVQA] |
| GRAIL | Adapt-Search Struct-Nav. |
✓ | Real-world Graph Env. |
GRPO | PRM | Process LLM-Judge | Single-agent | [WebQuestions, MetaQA, WebQSP] |
| DynaSearcher | Struct-Nav. | ✗ | Real-world Graph Env. KG+Doc Search |
GRPO | Rule-based ORM | Format Answer F1 Information Gain Retrieval Penalty |
Single-agent | [HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, FRAMES] |
| HARIS | R-S Inter. | ✗ | Real-world | GRPO | Rule-based ORM | Format Answer Accuracy Decision Accuracy |
Multi-agent | [M3, HoVer, CheckWhy] |
| DeepNote | Adapt-Search Conv-Reform. |
✗ | Real-world | DPO | - | - | Single-agent | [HotpotQA, 2WikiMultiHopQA, MuSiQue, StrategyQA, ASQA] |
| DeepResearcher | Adapt-Search Search Efficiency Ctx-Mem. |
✗ | Real-world | GRPO | Rule-based ORM | Format Answer F1 |
Module-level | [NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA] |
| SWiRL | Adapt-Search R-S Inter. |
✗ | Simulated Offline |
Policy Gradient | PRM | Step-wise LLM-Judge (Gemini 1.5 Pro) | Step-level | [HotpotQA, MuSiQue, CoFCA, GSM8K, Qasper, BeerQA] |
| WebDancer (Code) | Multi tool | ✓ | Real-world | DAPO | ORM | Answer EM | Single-agent | [GAIA, WebWalkerQA, BrowseComp-zh, BrowseComp-en] |
| MedResearcher-R1 | Adapt-Search Multi-Tool |
✓ | Real-world Medical Tool |
GRPO | ORM | Answer Acc Response Quality Efficiency penalty |
Single-agent | [XBench, GAIA, MedBrowseComp] |
| Lucy | Search Efficiency R–S Inter. |
✓ | Real-world SLMs |
DAPO | Rule-based ORM | Format/XML validity Answer EM Tool exec. success Visit/Search ratio Efficient thinking |
Single-agent | [WebWalkerQA] |
| ASearcher | R-S Inter. Ctx-Mem. Multi-tool |
✓ | Real-world Browser Env. Asynchronous |
GRPO | ORM | Answer LLM-Judge | Single-agent | [NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, FRAMES, GAIA, XBench] |
| WebExplorer | Ctx-Mem. Conv-Reform. |
✓ | Real-world Curriculum |
GRPO | Rule-based ORM | Format Answer EM |
Single-agent | [BrowseComp-zh, BrowseComp-en, GAIA, WebWalkerQA, FRAMES, XBench, HLE] |
| WebResearcher | Multi-tool | ✓ | Real-world Curriculum |
GSPO | Rule-based ORM | Answer EM | Single-agent | [HLE, GAIA, BrowseComp-en, BrowseComp-zh, XBench, FRAMES] |
| RECON | Ctx-Mem. | ✓ | Real-world | PPO | Rule-based ORM | Answer EM | Single-agent | [NQ, TriviaQA, Bamboogle, HotpotQA, 2WikiMultiHopQA, MuSiQue, PopQA] |
| AgentGym-RL | Cooperative Multi-Agent Systems Multi tool |
- | - | - | - | - | Unified RL Agentic Framework | - |
| Chain-of-Agents | Cooperative Multi-Agent Systems Multi tool |
- | - | - | - | - | Unified RL Agentic Framework | - |
| Verl | Multi tool | - | - | - | - | - | Unified RL Agentic Framework | - |
| VerlTool | Multi tool | - | - | - | - | - | Unified RL Agentic Framework | - |
📊 Click to expand long table (scrollable).
📊 Click to expand long table (scrollable).
📊 Click to expand long table (scrollable).
| Time | Paper Title | Role | Venue | Code |
|---|---|---|---|---|
| 2026.7 | PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool Retrieval | Module-level Optimization | arXiv | |
| 2025.08 | AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning | Module-level Optimization | arXiv | |
| 2025.05 | s3: You Don’t Need That Much Data to Train a Search Agent via RL | Module-level Optimization | arXiv | |
| 2025.04 | Deepresearcher: Scaling deep research via reinforcement learning in real-world environments | Module-level Optimization | arXiv | Code |
📊 Click to expand long table (scrollable).
Below is a compact checklist of commonly used evaluation signals for RL-based agentic search (see the survey for details):
- Answer quality (final output): Exact Match (EM), token-level F1, and LLM-as-a-judge scores for open-ended outputs (e.g., used by Search-R1, ReZero).
- Similarity-based metrics (e.g., BERTScore) are also used for more free-form generations.
- Search effectiveness (retrieval / evidence): retrieval relevance/coverage metrics (e.g., Recall@k / Precision@k / nDCG) and evidence usefulness; some works explicitly optimize or evaluate retrieval behavior (e.g., DeepRetrieval).
- Search efficiency (cost / budget): number of search/tool calls, token/latency cost, and other explicit penalties/rewards (e.g., Pangu DeepDiver, MAO-ARAG, R1-Searcher++).
- Process / trajectory quality (intermediate steps): step-wise correctness, information gain, redundancy penalties, and other process-level signals (often combined with a PRM or heuristic shaping; e.g., StepSearch, VERITAS, ReasonRAG, ConvSearch-R1).
- System-level benchmarks: some benchmarks are designed specifically to evaluate deep-research style agents (e.g., RAG-Gym).

