Skip to content

Latest commit

 

History

49 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 

Repository files navigation

Awesome Search Agent Papers

This repository aims to collect and organize the latest research papers on Search Agents. Search agents leverage dynamic planning and in-depth information retrieval capabilities of intelligent agents, enabling them to dynamically adjust their search plans based on context for more efficient and accurate information acquisition.

This repository covers areas including, but not limited to Search Agent, Agentic RAG (Retrieval-Augmented Generation), Deep Research, Deep Search, Search-enhanced Reasoning Models.

We broadly categorize current solutions into the following types:

  • Early Iterative Retrieval: Papers exploring early mechanisms of iterative retrieval.
  • Tuning-free Methods: Approaches that achieve search agent functionality without extensive specific training data.
  • SFT-based Methods: Methods that train search agents using Supervised Fine-Tuning.
  • RL-based Methods: Methods that train search agents using Reinforcement Learning.

For a deeper look, check out our survey paper: A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges. If you find this repository helpful, please cite our survey paper.

@article{xi2025survey,
  title={A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges},
  author={Xi, Yunjia and Lin, Jianghao and Xiao, Yongzhao and Zhou, Zheli and Shan, Rong and Gao, Te and Zhu, Jiachen and Liu, Weiwen and Yu, Yong and Zhang, Weinan},
  journal={arXiv preprint arXiv:2508.05668},
  year={2025}
}

🔥 News

Table of Contents


Methods

Tuning-free Methods

Time Paper Title Venue
2026.8 EviGraph: Evidence-Guided Autonomous Research Agents arXiv
2026.8 A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems arXiv
2026.8 Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory arXiv
2026.7 PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity arXiv
2026.7 A New Role for Relevance: Guiding Corpus Interaction in Agentic Search arXiv
2026.7 Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data Synthesis arXiv
2026.7 EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents arXiv
2026.7 FinanceHarness: Autonomous Financial Deep Research Framework arXiv
2026.7 DeepResearch Agent System arXiv
2026.7 WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search arXiv
2026.7 Bayesian Uncertainty Propagation for Agentic RAG Pipelines: A Proof-of-Concept Study on Multi-Hop Question Answering arXiv
2026.6 One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution arXiv
2026.6 Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and Novelty arXiv
2026.6 Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search arXiv
2026.6 ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep Research arXiv
2026.6 TreeSeeker: Tree-Structured Trial, Error, and Return in Deep Search arXiv
2026.6 DuMate-DeepResearch: An Auditable Multi-Agent System with Recursive Search and Rubric-Grounded Reasoning arXiv
2026.6 ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning arXiv
2026.6 Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval arXiv
2026.6 MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA arXiv
2026.6 PhotoCraft: Agentic Reasoning with Hierarchical Self-Evolving Memory for Deep Image Search arXiv
2026.5 DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News Retrieval arXiv
2026.5 Hypothesis-Driven Deep Research with Large Language Models: A Structured Methodology for Automated Knowledge Discovery arXiv
2026.5 PresentAgent-2: Towards Generalist Multimodal Presentation Agents arXiv
2026.5 PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement arXiv
2026.5 AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration -- Learning from Cheap, Optimizing Expensive arXiv
2026.5 AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents arXiv
2026.5 ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time Scaling arXiv
2026.5 Parallel Context Compaction for Long-Horizon LLM Agent Serving arXiv
2026.5 The Context Gathering Decision Process: A POMDP Framework for Agentic Search arXiv
2026.5 AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases arXiv
2026.5 Inference-Time Budget Control for LLM Search Agents arXiv
2026.5 Superintelligent Retrieval Agent: The Next Frontier of Information Retrieval arXiv
2026.4 Self-Optimizing Multi-Agent Systems for Deep Research arXiv
2026.4 InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information Seeking arXiv
2026.4 PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection arXiv
2026.4 Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring arXiv
2026.4 Towards Trustworthy Report Generation: A Deep Research Agent with Progressive Confidence Estimation and Calibration arXiv
2026.4 DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling arXiv
2026.4 Towards Knowledgeable Deep Research: Framework and Benchmark arXiv
2026.4 EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools arXiv
2026.3 Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data Lakes arXiv
2026.3 Test-Time Strategies for More Efficient and Accurate Agentic RAG arXiv
2026.2 Keyword search is all you need: Achieving RAG-Level Performance without vector databases using agentic tool use arXiv
2026.2 Evaluating Stochasticity in Deep Research Agents arXiv
2026.2 Knowledge Integration Decay in Search-Augmented Reasoning of Large Language Models arXiv
2026.2 Table-as-Search: Formulate Long-Horizon Agentic Information Seeking as Table Completion arXiv
2026.2 Lemon Agent Technical Report arXiv
2026.2 When Is Enough Not Enough? Illusory Completion in Search Agents arXiv
2026.2 W&D:Scaling Parallel Tool Calling for Efficient Deep Research Agents arXiv
2026.2 PreFlect: From Retrospective to Prospective Reflection in Large Language Model Agents arXiv
2026.2 LawThinker: A Deep Research Legal Agent in Dynamic Environments arXiv
2026.2 FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents arxiv
2026.2 A-MapReduce: Executing Wide Search via Agentic MapReduce arXiv
2026.2 G-MemLLM: Gated Latent Memory Augmentation for Long-Context Reasoning in Large Language Models arXiv
2026.2 Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience arXiv
2026.2 ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search arXiv
2026.2 SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly arXiv
2026.2 RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents arXiv
2026.2 CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering arXiv
2026.2 DeepRead: Document Structure-Aware Reasoning to Enhance Agentic Search arXiv
2026.1 Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification arXiv
2026.1 ExpSeek: Self-Triggered Experience Seeking for Web Agents arXiv
2026.1 Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents arXiv
2026.1 Over-Searching in Search-Augmented Large Language Models arXiv
2026.1 EvoFSM: Controllable Self-Evolution for Deep Research with Finite State Machines arXiv
2026.1 Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search arXiv
2026.1 InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents arXiv
2026.1 EvoRoute: Experience-Driven Self-Routing LLM Agent Systems arXiv
2026.1 RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation Detection arXiv
2026.1 Mind2Report: A Cognitive Deep Research Agent for Expert-Level Commercial Report Synthesis arXiv
2025.12 Multimodal Fact-Checking: An Agent-based Approach arXiv
2025.12 A Hierarchical Tree-based approach for creating Configurable and Static Deep Research Agent (Static-DRA) arXiv
2025.11 RhinoInsight: Improving Deep Research through Control Mechanisms for Model Behavior and Context arXiv
2025.11 Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design arXiv
2025.11 ARISE: Agentic Rubric-Guided Iterative Survey Engine for Automated Scholarly Paper Generation arXiv
2025.11 Evidence-Bound Autonomous Research (EviBound): A Governance Framework for Eliminating False Claims arXiv
2025.11 Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verification arXiv
2025.10 Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research arXiv
2025.10 Dingtalk DeepResearch: A Unified Multi Agent Framework for Adaptive Intelligence in Enterprise Environments arXiv
2025.10 Co-Sight: Enhancing LLM-Based Agents via Conflict-Aware Meta-Verification and Trustworthy Reasoning with Structured Facts arXiv
2025.10 FAIR-RAG: Faithful Adaptive Iterative Refinement for Retrieval-Augmented Generation arXiv
2025.10 BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents arXiv
2025.10 ParallelMuse: Agentic Parallel Thinking for Deep Information Seeking arXiv
2025.10 SQuAI: Scientific Question-Answering with Multi-Agent Retrieval-Augmented Generation arXiv
2025.10 Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search arXiv
2025.10 MIRAGE: Agentic Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning arXiv
2025.10 Enterprise Deep Research: Steerable Multi-Agent Deep Research for Enterprise Analytics arXiv
2025.10 ScholarEval: Research Idea Evaluation Grounded in Literature arXiv
2025.10 FinSight: Towards Real-World Financial Deep Research arXiv
2025.10 Real Deep Research for AI, Robotics and Beyond arXiv
2025.10 PluriHop: Exhaustive, Recall-Sensitive QA over Distractor-Rich Corpora arXiv
2025.10 Scaling Long-Horizon LLM Agent via Context-Folding arXiv
2025.10 Where to Search: Measure the Prior-Structured Search Space of LLM Agents arXiv
2025.10 PRISM: Agentic Retrieval with LLMs for Multi-Hop Question Answering arXiv
2025.10 Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning arXiv
2025.10 ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents arXiv
2025.10 FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection arXiv
2025.10 DualResearch: Entropy-Gated Dual-Graph Retrieval for Answer Reconstruction arXiv
2025.10 FlowSearch: Advancing deep research with dynamic structured knowledge flow arXiv
2025.10 FlashResearch: Real-time Agent Orchestration for Efficient Deep Research arXiv
2025.10 Pushing Test-Time Scaling Limits of Deep Search with Asymmetric Verification arXiv
2025.9 ARK-V1: An LLM-Agent for Knowledge Graph Question Answering Requiring Commonsense Reasoning arXiv
2025.9 Recon-Act: A Self-Evolving Multi-Agent Browser-Use System via Web Reconnaissance, Tool Generation, and Task Execution arXiv
2025.9 InteGround: On the Evaluation of Verification and Retrieval Planning in Integrative Grounding arXiv
2025.9 Deep Research is the New Analytics System: Towards Building the Runtime for AI-Driven Analytics arXiv
2025.9 L-MARS: Legal Multi-Agent Workflow with Orchestrated Reasoning and Agentic Search arXiv
2025.9 Universal Deep Research: Bring Your Own Model and Strategy arXiv
2025.8 You Don't Need Pre-built Graphs for RAG: Retrieval Augmented Generation with Adaptive Reasoning Structures arXiv
2025.8 Improving and Evaluating Open Deep Research Agents arXiv
2025.8 BrowseMaster: Towards Scalable Web Browsing via Tool-Augmented Programmatic Agent Pair arXiv
2025.8 Efficient Agent: Optimizing Planning Capability for Multimodal Retrieval Augmented Generation arXiv
2025.7 SPAR: Scholar Paper Retrieval with LLM-based Agents for Enhanced Academic Search arXiv
2025.7 Agentic RAG with Knowledge Graphs for Complex Multi-Hop Reasoning in Real-World Applications arXiv
2025.7 Deep Researcher with Test-Time Diffusion arXiv
2025.7 Decoupled Planning and Execution: A Hierarchical Reasoning Framework for Deep Search arXiv
2025.6 Towards Robust Fact-Checking: A Multi-Agent System with Advanced Evidence Retrieval arXiv
2025.6 Towards AI Search Paradigm arXiv
2025.6 KnowCoder-V2: Deep Knowledge Analysis arXiv
2025.6 Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework arXiv
2025.6 From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents arXiv
2025.5 AutoData: A Multi-Agent System for Open Web Data Collection arXiv
2025.5 ManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent Framework arXiv
2025.5 Code Researcher: Deep Research Agent for Large Systems Code and Commit History arXiv
2025.5 MA-RAG: Multi-Agent Retrieval-Augmented Generation via Collaborative Chain-of-Thought Reasoning arXiv
2025.5 ITERKEY: Iterative Keyword Generation with LLMs for Enhanced Retrieval Augmented Generation arXiv
2025.3 Open deep search: Democratizing search with open-source reasoning agents. arXiv
2025.3 MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search arXiv
2025.3 Agentic RAG with Human-in-the-Retrieval ICSA-C 2025
2025.2 WebWalker: Benchmarking LLMs in Web Traversal ACL 2025
2025.2 Holistically Guided Monte Carlo Tree Search for Intricate Information Seeking arXiv
2025.2 ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents arxiv
2025.2 Agentic Reasoning: Reasoning LLMs with Tools for the Deep Research arXiv
2025.2 An Agent Framework for Real-Time Financial Information Searching with Large Language Models arXiv
2025.2 DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point Thinking arXiv
2025.2 MCTS-KBQA: Monte Carlo Tree Search for Knowledge Base Question Answering arXiv
2025.1 Search-o1: Agentic search-enhanced large reasoning models arXiv
2025.1 AirRAG: Activating Intrinsic Reasoning for Retrieval Augmented Generation using Tree-based Search arXiv
2025.1 ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding arXiv
2025.1 Retrieval-Augmented Generation by Evidence Retroactivity in LLMs arXiv
2024.12 Level-Navi Agent: A Framework and benchmark for Chinese Web Search Agents arXiv
2024.12 RAG-Star: Enhancing Deliberative Reasoning with Retrieval Augmented Verification and Refinement arXiv
2024.12 Progressive Multimodal Reasoning via Active Retrieval arXiv
2024.11 SRSA: A Cost-Efficient Strategy-Router Search Agent for Real-world Human-Machine Interactions arXiv
2024.10 Plan*rag: Efficient test-time planning for retrieval augmented generation. arXiv
2024.10 Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks arXiv
2024.10 Inference scaling for long-context retrieval augmented generation. ICLR 2025
2024.9 Agent-G: An Agentic Framework for Graph Retrieval Augmented Generation arxiv
2024.8 Into the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent Conversations EMNLP 2024
2024.8 Hierarchical Retrieval-Augmented Generation Model with Rethink for Multi-hop Question Answering arxiv
2024.7 MindSearch: Mimicking Human Minds Elicits Deep AI Searcher arXiv
2024.7 Retrieve, Summarize, Plan: Advancing Multi-hop Question Answering with an Iterative Approach WWW2025 Agent4IR
2024.6 PlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision Makers NAACL 2024
2024.4 Assisting in Writing Wikipedia-like Articles From Scratch with Large Language Models NAACL 2024
2024.2 Metacognitive Retrieval-Augmented Large Language Models WWW 2024
2023.8 Knowledge-Driven CoT: Exploring Faithful Reasoning in LLMs for Knowledge-intensive Question Answering arXiv
2023.4 Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive Tasks WWW 2024

SFT-based Methods

Time Paper Title Venue
2026.7 Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents? arXiv
2026.7 Think Big, Search Small: Where Capacity Matters in Hierarchical Search Agents? arXiv
2026.6 Contrastive Reflection for Iterative Prompt Optimization arXiv
2026.6 Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows arXiv
2026.6 FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents arXiv
2026.5 LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG arXiv
2026.5 LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents arXiv
2026.5 OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories arXiv
2026.5 Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems arXiv
2026.4 Learning to Retrieve from Agent Trajectories arXiv
2026.4 Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents arXiv
2026.3 OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data arXiv
2026.2 ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory Distillation arXiv
2026.2 WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning arXiv
2026.1 RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data Synthesis arXiv
2025.12 DocDancer: Towards Agentic Document-Grounded Information Seeking arXiv
2025.12 Nested Browser-Use Learning for Agentic Information Seeking arXiv
2025.12 Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch arXiv
2025.11 SynClaimEval: A Framework for Evaluating the Utility of Synthetic Data in Long-Context Claim Verification arXiv
2025.11 REAP: Enhancing RAG with Recursive Evaluation and Adaptive Planning for Multi-Hop Question Answering arXiv
2025.10 AgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis arXiv
2025.10 DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling arXiv
2025.10 AgentFold: Long-Horizon Web Agents with Proactive Context Management arXiv
2025.10 Explore to Evolve: Scaling Evolved Aggregation Logic via Proactive Online Exploration for Deep Research Agents arXiv
2025.10 Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms arXiv
2025.10 BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions arXiv
2025.9 AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation arXiv
2025.9 WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research arXiv
2025.9 Open Data Synthesis For Deep Research arXiv
2025.8 Hybrid Deep Searcher: Integrating Parallel and Sequential Search Reasoning arXiv
2025.8 TURA: Tool-Augmented Unified Retrieval Agent for AI Search arXiv
2025.7 Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training arXiv
2025.5 SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesis arXiv
2025.5 Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers arXiv
2025.4 KBQA-o1: Agentic Knowledge Base Question Answering with Monte Carlo Tree Search ICML 2025
2025.3 ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation arXiv
2025.2 RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM Generation arXiv
2025.1 Chain-of-Retrieval Augmented Generation arXiv
2024.11 Auto-rag: Autonomous retrieval-augmented generation for large language models. arXiv
2024.10 Open-RAG: Enhanced Retrieval Augmented Reasoning with Open-Source Large Language Models EMNLP 2025
2023.12 KwaiAgents: Generalized Information-seeking Agent System with Large Language Models WWW 2024
2023.12 ReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM Agent ICLR 2024
2023.10 Self-rag: Learning to retrieve, generate, and critique through self-reflection ICLR 2024

RL-based Methods

Time Paper Title Venue
2026.8 Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember arxiv
2026.8 Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent arxiv
2026.8 ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment arxiv
2026.8 EASy: Towards Efficient LLM-Based Agentic System arxiv
2026.8 HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards arxiv
2026.8 Contextual Information Policy Optimization for Search Agents arxiv
2026.8 Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning arxiv
2026.8 Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding arxiv
2026.8 LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation arxiv
2026.8 ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Models arxiv
2026.8 Mitigating Context Interference for Reliable and Efficient Search Agents arxiv
2026.7 Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism arxiv
2026.7 LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning arxiv
2026.7 ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability) arxiv
2026.7 CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents arxiv
2026.7 PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning arxiv
2026.7 Agent-UCT: Upper Confidence Bounds Applied to Trees for Agentic Workflow Optimization with Cost-Awareness arxiv
2026.7 Reason Before You Retrieve: Agentic Planning for Multi-modal RAG arxiv
2026.7 Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Results arxiv
2026.7 PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning arxiv
2026.7 AREX: Towards a Recursively Self-Improving Agent for Deep Research arxiv
2026.7 WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback arxiv
2026.7 EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff arxiv
2026.7 Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL arxiv
2026.7 Harness-G: A Graph-Structured Harness for Search Agents arxiv
2026.7 Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents arxiv
2026.7 SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation arxiv
2026.7 DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment arxiv
2026.7 Mach-Mind-4-Flash Technical Report arxiv
2026.7 AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs arxiv
2026.7 Multi-Turn Agentic Scientific Literature Search via Workflow Induction arXiv
2026.6 ECHO: Prune to act, trace to learn with selective turn memory in agentic RL arXiv
2026.6 ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents arXiv
2026.6 ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering arXiv
2026.6 Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning arXiv
2026.6 GraphPO: Graph-based Policy Optimization for Reasoning Models arXiv
2026.6 MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments arXiv
2026.6 Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher arXiv
2026.6 HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry arXiv
2026.6 SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating arXiv
2026.6 Agents-K1: Towards Agent-native Knowledge Orchestration arXiv
2026.6 Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training arXiv
2026.6 Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals arXiv
2026.6 TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents arXiv
2026.6 ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents arXiv
2026.6 Adaptive Latent Agentic Reasoning arXiv
2026.6 Self-Evolving Deep Research via Joint Generation and Evaluation arXiv
2026.5 AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering arXiv
2026.5 Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward arXiv
2026.5 LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards arXiv
2026.5 Learning Agent-Compatible Context Management for Long-Horizon Tasks arXiv
2026.5 COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents arXiv
2026.5 PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning arXiv
2026.5 RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards arXiv
2026.5 Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents arXiv
2026.5 CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG arXiv
2026.5 Calibrating LLMs with Semantic-level Reward arXiv
2026.5 Argus: Evidence Assembly for Scalable Deep Research Agents arXiv
2026.5 SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning arXiv
2026.5 Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning arXiv
2026.5 Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents arXiv
2026.5 HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents arXiv
2026.5 Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents arXiv
2026.5 Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers arXiv
2026.4 OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search arXiv
2026.4 CroSearch-R1: Better Leveraging Cross-lingual Knowledge for Retrieval-Augmented Generation arXiv
2026.4 How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum arXiv
2026.4 Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph Optimization arXiv
2026.4 OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models arXiv
2026.4 DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data arXiv
2026.4 $\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data arXiv
2026.4 Mind DeepResearch Technical Report arXiv
2026.4 Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization arXiv
2026.4 ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning arXiv
2026.4 ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents arXiv
2026.4 WebExpert: domain-aware web agents with critic-guided expert experience for high-precision search arXiv
2026.4 Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search arXiv
2026.3 TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs arXiv
2026.3 A Subgoal-driven Framework for Improving Long-Horizon LLM Agents arXiv
2026.3 MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification arXiv
2026.3 Meta-Reinforcement Learning with Self-Reflection for Agentic Search arXiv
2026.3 Improving Search Agent with One Line of Code arXiv
2026.3 Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents arXiv
2026.3 Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented Agents arXiv
2026.3 SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans arXiv
2026.3 KARL: Knowledge Agents via Reinforcement Learning arXiv
2026.3 MemPO: Self-Memory Policy Optimization for Long-Horizon Agents arXiv
2026.3 Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search Agents arXiv
2026.2 Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning arXiv
2026.2 Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training arXiv
2026.2 Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization arXiv
2026.2 OmniGAIA: Towards Native Omni-Modal AI Agents |arXiv |
2026.2 Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric arXiv
2026.2 REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents arXiv
2026.2 KLong: Training LLM Agent for Extremely Long-horizon Tasks arXiv
2026.2 When to Memorize and When to Stop: Gated Recurrent Memory for Long-Context Reasoning arXiv
2026.2 TodoEvolve: Learning to Architect Agent Planning Systems arXiv
2026.2 SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents arXiv
2026.2 SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent arXiv
2026.2 AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents arXiv
2026.2 AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research arXiv
2026.2 DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents arXiv
2026.2 Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation arXiv
2026.2 Training Multi-Turn Search Agent via Contrastive Dynamic Branch Sampling arXiv
2026.2 Scaling Search-Augmented LLM Reasoning via Adaptive Information Control arXiv
2026.2 CRAFT: Calibrated Reasoning with Answer-Faithful Traces via Reinforcement Learning for Multi-Hop Question Answering arXiv
2026.2 TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization arXiv
2026.2 Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward arXiv
2026.2 Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning arXiv
2026.2 Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents arXiv
2026.2 WideSeek: Advancing Wide Research via Multi-Agent Scaling arXiv
2026.2 IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning arXiv
2026.2 Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration arXiv
2026.2 WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning arXiv
2026.2 Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards arXiv
2026.1 SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation arXiv
2026.1 Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning arXiv
2026.1 BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search arXiv
2026.1 Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards arXiv
2026.1 TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG arXiv
2026.1 D2Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning arXiv
2026.1 ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking arXiv
2026.1 PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering arXiv
2026.1 PaperScout: An Autonomous Agent for Academic Paper Search with Process-Aware Sequence-Level Policy Optimization arXiv
2026.1 M3Searcher: Modular Multimodal Information Seeking Agency with Retrieval-Oriented Reasoning arXiv
2026.1 LRAS: Advanced Legal Reasoning with Agentic Search arXiv
2026.1 Dr. Zero: Self-Evolving Search Agents without Training Data arXiv
2026.1 ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration arXiv
2026.1 SmartSearch: Process Reward-Guided Query Refinement for Search Agents arXiv
2026.1 Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search arXiv
2026.1 WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning arXiv
2026.1 O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL arXiv
2026.1 RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation Detection arXiv
2026.1 AT2PO: Agentic Turn-based Policy Optimization via Tree Search arXiv
2025.12 FoldAct: Efficient and Stable Context Folding for Long-Horizon Search Agents arXiv
2025.12 Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization arXiv
2025.12 Step-DeepResearch Technical Report arXiv
2025.12 AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning arXiv
2025.12 An Open and Reproducible Deep Research Agent for Long-Form Question Answering arXiv
2025.12 CoDA: A Context-Decoupled Hierarchical Agent with Reinforcement Learning arXiv
2025.12 LightSearcher: Efficient DeepSearch via Experiential Memory arXiv
2025.12 RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning arXiv
2025.12 Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization arXiv
2025.12 CARL: Critical Action Focused Reinforcement Learning for Multi-Step Agent arXiv
2025.12 On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death Spiral arXiv
2025.11 ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration arXiv
2025.11 ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning arXiv
2025.11 ST-PPO: Stabilized Off-Policy Proximal Policy Optimization for Multi-Turn Agents Training arXiv
2025.11 DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs arXiv
2025.11 DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research arXiv
2025.11 General Agentic Memory Via Deep Research arXiv
2025.11 Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement Learning arXiv
2025.11 Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO arXiv
2025.11 Think Before You Retrieve: Learning Test-Time Adaptive Search with Small Language Models arXiv
2025.11 Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction arXiv
2025.11 TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework arXiv
2025.11 IterResearch: Rethinking Long-Horizon Agents via Markovian State Reconstruction arXiv
2025.11 Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning arXiv
2025.11 MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning arXiv
2025.10 Search Self-play: Pushing the Frontier of Agent Capability without Supervision arXiv
2025.10 Reinforcement Learning for Long-Horizon Multi-Turn Search Agents arXiv
2025.10 DeepAgent: A General Reasoning Agent with Scalable Toolsets arXiv
2025.10 WebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich Seeking arXiv
2025.10 KnowCoder-A1: Incentivizing Agentic Reasoning Capability with Outcome Supervision for KBQA arXiv
2025.10 GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning arXiv
2025.10 InfoFlow: Reinforcing Search Agent Via Reward Density Optimization arXiv
2025.10 Repurposing Synthetic Data for Fine-grained Search Agent Supervision arXiv
2025.10 Tongyi DeepResearch Technical Report arXiv
2025.10 Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth arXiv
2025.10 SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents arXiv
2025.10 Agentic Reinforcement Learning for Search is Unsafe arXiv
2025.10 WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection arXiv
2025.10 PokeeResearch: Effective Deep Research via Reinforcement Learning from AI Feedback and Robust Reasoning Scaffold arXiv
2025.10 Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge Graphs arXiv
2025.10 DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning arXiv
2025.10 Scaling Long-Horizon LLM Agent via Context-Folding arXiv
2025.10 Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation arXiv
2025.10 PoU: Proof-of-Use to Counter Tool-Call Hacking in DeepResearch Agents arXiv
2025.10 DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping arXiv
2025.10 Stop-RAG: Value-Based Retrieval Control for Iterative RAG arXiv
2025.10 Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering arXiv
2025.10 Agentic Entropy-Balanced Policy Optimization arXiv
2025.10 An Efficient Rubric-based Generative Verifier for Search-Augmented LLMs arXiv
2025.10 Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents ICLR 2026
2025.10 Towards Agentic Self-Learning LLMs in Search Environment arXiv
2025.10 From Faithfulness to Correctness: Generative Reward Models that Think Critically arXiv
2025.10 Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window arXiv
2025.10 QAgent: A modular Search Agent with Interactive Query Understanding arXiv
2025.10 A2Search: Ambiguity-Aware Question Answering with Reinforcement Learning arXiv
2025.10 HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation arXiv
2025.10 Search-R3: Unifying Reasoning and Embedding Generation in Large Language Models arXiv
2025.10 Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them arXiv
2025.10 ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards arXiv
2025.10 Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs arXiv
2025.10 Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents arXiv
2025.10 MARS: Optimizing Dual-System Deep Research via Multi-Agent Reinforcement Learning arXiv
2025.10 Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents arXiv
2025.9 InfoAgent: Advancing Autonomous Information-Seeking Agents arXiv
2025.9 SIRAG: Towards Stable and Interpretable RAG with A Process-Supervised Multi-Agent Framework arXiv
2025.9 Towards General Agentic Intelligence via Environment Scaling arXiv
2025.9 ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization arXiv
2025.9 WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning arXiv
2025.9 WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents arXiv
2025.9 Scaling Agents via Continual Pre-training arXiv
2025.9 WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents arXiv
2025.9 DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL arXiv
2025.9 AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning arXiv
2025.9 SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents arXiv
2025.9 VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use arXiv
2025.9 Open Data Synthesis For Deep Research arXiv
2025.8 Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities arXiv
2025.8 AWorld: Orchestrating the Training Recipe for Agentic AI arXiv
2025.8 AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning arXiv
2025.8 Memento: Fine-tuning LLM Agents without Fine-tuning LLMs arXiv
2025.8 OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval arXiv
2025.8 Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL arXiv
2025.8 MedReseacher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis Framework arXiv
2025.8 Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward arXiv
2025.8 WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent arXiv
2025.8 HierSearch: A Hierarchical Enterprise Deep Search Framework Integrating Local and Web Searches arXiv
2025.8 REX-RAG: Reasoning Exploration with Policy Correction in Retrieval-Augmented Generation arXiv
2025.8 Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL arXiv
2025.8 SSRL: Self-Search Reinforcement Learning arXiv
2025.8 UR2: Unify RAG and Reasoning through Reinforcement Learning arXiv
2025.8 ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning arXiv
2025.8 Lucy: edgerunning agentic web search on mobile with machine generated task vectors arXiv
2025.8 MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation arXiv
2025.8 Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge Synergy arXiv
2025.8 GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented Reasoning arXiv
2025.7 Agentic Reinforced Policy Optimization arXiv
2025.7 WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization arXiv
2025.7 DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning arXiv
2025.7 WebSailor: Navigating Super-human Reasoning for Web Agent arXiv
2025.7 RAG-R1 : Incentivize the Search and Reasoning Capabilities of LLMs through Multi-query Parallelism arXiv
2025.6 Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim Verification arXiv
2025.6 R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning arXiv
2025.6 KunLunBaizeRAG: Reinforcement Learning Driven Inference Performance Leap for Large Language Models arXiv
2025.5 Visual Agentic Reinforcement Fine-Tuning arXiv
2025.5 Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning arXiv
2025.5 Search and Refine During Think: Autonomous Retrieval-Augmented Reasoning of LLMs arXiv
2025.5 Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty arXiv
2025.5 Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information Foraging arXiv
2025.5 An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents arXiv
2025.5 VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning arXiv
2025.5 EvolveSearch: An Iterative Self-Evolving Search Agent arXiv
2025.5 ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement Learning arXiv
2025.5 Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning arXiv
2025.5 R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning arXiv
2025.5 Pangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning arXiv
2025.5 MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability arXiv
2025.5 StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization arXiv
2025.5 Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents arXiv
2025.5 WebDancer: Towards Autonomous Information Seeking Agency arXiv
2025.5 ZeroSearch: Incentivize the Search Capability of LLMs without Searching arXiv
2025.5 O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering arXiv
2025.5 s3: You Don't Need That Much Data to Train a Search Agent via RL arXiv
2025.5 Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent arXiv
2025.4 WebThinker: Empowering Large Reasoning Models with Deep Research Capability arXiv
2025.4 Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use arXiv
2025.4 DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments arXiv
2025.4 ReZero: Enhancing LLM Search Ability by Trying One More Time arXiv
2025.3 ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning arXiv
2025.3 Agent models: Internalizing Chain-of-Action Generation into Reasoning models arXiv
2025.3 R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning arXiv
2025.3 Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning arXiv
2025.2 DeepRetrieval: Hacking Real Search Engines and Retrievers with LLMs via Reinforcement Learning arXiv
2025.2 RAG-Gym: Systematic Optimization of Language Agents for Retrieval-Augmented Generation arXiv
2025.2 DeepRAG: Thinking to Retrieval Step by Step for Large Language Models arXiv
2025.1 Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning arXiv
2024.10 SmartRAG: Jointly Learn RAG-Related Tasks From the Environment Feedback ICLR 2025

Early Iterative Retrieval

Time Paper Title Venue
2025.6 Dynamic Context Tuning for Retrieval-Augmented Generation: Enhancing Multi-Turn Planning and Tool Adaptation arXiv
2025.4 Scaling Test-Time Inference with Policy-Optimized, Dynamic Retrieval-Augmented Generation via KV Caching and Decoding arXiv
2025.4 Credible plan-driven RAG method for Multi-hop Question Answering arXiv
2025.3 Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM Reasoning arXiv
2024.11 DMQR-RAG: Diverse Multi-Query Rewriting for RAG arXiv
2024.7 Adaptive Retrieval-Augmented Generation for Conversational Systems NAACL 2025
2024.7 Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid Approach EMNLP 2024
2024.7 REAPER: Reasoning based Retrieval Planning for Complex RAG Systems CIKM 2024
2024.6 Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question Answering ACL 2024
2024.6 Learning to Plan for Retrieval-Augmented Large Language Models from Knowledge Graphs EMNLP 2024
2024.6 A Surprisingly Simple yet Effective Multi-Query Rewriting Method for Conversational Passage Retrieval SIGIR 2024
2024.3 RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon Generation NeurIPS 2024
2024.3 Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity NAACL 2024
2024.3 Generating Multi-Aspect Queries for Conversational Search arXiv
2024.1 Corrective Retrieval Augmented Generation arXiv
2023.5 Enhancing retrieval-augmented large language models with iterative retrieval-generation synergy. EMNLP 2023
2023.5 Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources ICLR 2024
2023.5 Active retrieval augmented generation. EMNLP 2023
2022.12 Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions. ACL 2023
2022.12 DEMONSTRATE–SEARCH–PREDICT: Composing retrieval and language models for knowledge-intensive NLP arXiv
2022.1 Measuring and Narrowing the Compositionality Gap in Language Models EMNLP 2023

Datasets

Multi-Hop QA Dataset

Name Title Venue
HotpotQA HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering EMNLP 2018
WikiMultiHopQA Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps COLING 2020
Bamboogle Measuring and Narrowing the Compositionality Gap in Language Models EMNLP 2023
MuSiQue MuSiQue: Multihop Questions via Single-hop Question Composition TACL 2022
StrategyQA Did Aristotle Use a Laptop? A Question Answering Benchmark with Implicit Reasoning Strategies TACL 2021
FRAMES Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation NAACL 2025
MultiHop-RAG MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries COLM 2024
HoVer HoVer: A dataset for many-hop fact extraction and claim verification EMNLP 2020
FanOutQA FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models ACL 2024
Web24 Level-Navi Agent: A Framework and benchmark for Chinese Web Search Agents arXiv 2025
ViDoRAG ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents arXiv 2025
MoreHopQA MoreHopQA: More Than Multi-hop Reasoning arXiv 2024
CofCA Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark ICLR 2025
BRIDGE BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence arXiv 2026
M$^3$-VQA M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering arXiv 2026

Challenging QA for Deep Search

Name Title Venue
BrowseComp BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents arXiv 2025
InfoDeepSeek InfoDeepSeek: Benchmarking Agentic Information Seeking for Retrieval-Augmented Generation arXiv 2025
ORION ManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent Framework arXiv 2025
BrowseComp-ZH BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese arXiv 2025
PopQA When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories ACL 2023
WebPuzzle Pangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning arXiv 2025
BLUR Browsing Lost Unformed Recollections: A Benchmark for Tip-of-the-Tongue Search and Reasoning arXiv 2025
BRIGHT BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval ICLR 2025
SealQA SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models arXiv 2025
MMSearch MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines arXiv 2024
ScholarSearch ScholarSearch: Benchmarking Scholar Searching Ability of LLMs arXiv 2025
Mind2Web 2 Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge arXiv 2025
BrowseComp-Plus BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent arXiv 2025
MM-BrowseComp MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents arXiv 2025
WebShaperQA WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization arXiv 2025
WebWalkerQA WebWalker: Benchmarking LLMs in Web Traversal ACL 2025
BrowseComp-VL WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent arXiv 2025
MAT-Search Visual Agentic Reinforcement Fine-Tuning arXiv 2025
MMSearch-Plus MMSearch-Plus: A Simple Yet Challenging Benchmark for Multimodal Browsing Agents arXiv 2025
WebDetective Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics arXiv 2025
PaperArena PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature arXiv 2025
WebAggregatorQA Explore to Evolve: Scaling Evolved Aggregation Logic via Proactive Online Exploration for Deep Research Agents arXiv 2025
PluriHopWIND PluriHop: Exhaustive, Recall-Sensitive QA over Distractor-Rich Corpora arXiv 2025
CRUMQs Evaluating Retrieval-Augmented Generation Systems on Unanswerable, Uncheatable, Realistic, Multi-hop Queries arXiv 2025
InteractComp InteractComp: Evaluating Search Agents With Ambiguous Queries arXiv 2025
Needle in the Web Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild arXiv 2025
ShotFinder ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search arXiv 2025
WideSeek WideSeek: Advancing Wide Research via Multi-Agent Scaling arXiv 2025
GISA GISA: A Benchmark for General Information-Seeking Assistant arXiv 2026
BrowseComp-V3 BrowseComp-V3: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents arXiv 2026
LiveNewsBench LiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated News arXiv 2026
OmniGAIA OmniGAIA: Towards Native Omni-Modal AI Agents arXiv 2026
MC-Search MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains arXiv 2026
InterLV-Search InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search arXiv 2026
LoHoSearch LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling arXiv 2026
EvoBrowseComp EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge arXiv 2026

Fact-checking dataset

Name Title Venue
LiveDRBench Characterizing Deep Research: A Benchmark and Formal Definition arXiv 2025
Mocheg End-to-End Multimodal Fact-Checking and Explanation Generation: A Challenging Dataset and Models SIGIR 2023
MFC-Bench MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models ICLR 2025 Workshop
RealFactBench RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking arXiv 2025
LongFact Long-form factuality in large language models NeurIPS 2024
PolitiHop Multi-Hop Fact Checking of Political Claims IJCAI-2021
FM2 Fool Me Twice: Entailment from Wikipedia Gamification NAACL 2021
HoVer HoVer: A Dataset for Many-Hop Fact Extraction And Claim Verification EMNLP 2020
SCIFACT Fact or fiction: Verifying scientific claims EMNLP 2020
EX-FEVER EX-FEVER: A Dataset for Multi-hop Explainable Fact Verification ACL 2024
FEVEROUS FEVEROUS: Fact Extraction and VERification Over Unstructured and Structured information NeurIPS 2021
FactBench FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation arXiv 2024
QuanTemp++ A Benchmark for Open-Domain Numerical Fact-Checking Enhanced by Claim Decompositio arXiv 2025

Open-domain QA for Deep Research

Name Title Venue
O2-QA O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering arXiv 2025
Researchy Questions Researchy Questions: A Dataset of Multi-Perspective, Decompositional Questions for LLM Web Agents. arXiv 2024
MultimodalReportBench Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework arXiv 2025
DeepResearchGym DeepResearchGym: A Free, Transparent, and Reproducible Evaluation Sandbox for Deep Research arXiv 2025
Deep Research Bench Deep Research Bench: Evaluating AI Web Research Agents arXiv 2025
DeepResearch Bench DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents arXiv 2025
WildSeek Into the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent Conversations EMNLP 2024
ProxyQA PROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language Models ACL 2024
Long2RAG Long2RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point Recall EMNLP 2024
ResearcherBench ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry arXiv 2025
ReportBench ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks arXiv 2025
DeepScholar-Bench DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis arXiv 2025
ResearchQA ResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and Rubrics arXiv 2025
DeepResearch Arena DeepResearch Arena: The First Exam of LLMs' Research Abilities via Seminar-Grounded Tasks arXiv 2025
DeepTRACE DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence arXiv 2025
RigorousBench A Rigorous Benchmark with Multidimensional Evaluation for Deep Research Agents: From Answers to Reports arXiv 2025
SurveyBench SurveyBench: How Well Can LLM(-Agents) Write Academic Surveys? arXiv 2025
DRBench DRBench: A Realistic Benchmark for Enterprise Deep Research arXiv 2025
REPORTEVAL Understanding DeepResearch via Reports arXiv 2025
LiveResearchBench LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild arXiv 2025
DeepWideSearch DeepWideSearch: Benchmarking Depth and Width in Agentic Information Seeking arXiv 2025
ResearchRubrics ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents arXiv 2025
DEER DEER: A Comprehensive and Reliable Benchmark for Deep-Research Expert Reports arXiv 2025
IDRBench IDRBench: Interactive Deep Research Benchmark arXiv 2025
VideoDR Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning arXiv 2025
DR-Arena DR-Arena: an Automated Evaluation Framework for Deep Research Agents arXiv 2025
DeepResearchEval DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation arXiv 2025
Deep Research Bench II DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report arXiv 2025
MR DRE Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision arXiv 2025
DeepSurvey-Bench DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Survey arXiv 2026
Vision-DeepResearch Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models arXiv 2026
DDR-Bench Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models arXiv 2026
WLC Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles arXiv 2026
DRACO DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity arXiv 2026
DeepResearch-9K DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent arXiv 2026
KDR-Bench Towards Knowledgeable Deep Research: Framework and Benchmark arXiv 2026
DR$^{3}$-Eval DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation arXiv 2026
AutoResearchBench AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery arXiv 2026
DeepWeb-Bench DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation arXiv 2026

Domain-specific dataset

Name Title Venue
FinSearchBench-24 An Agent Framework for Real-Time Financial Information Searching with Large Language Models arXiv 2024
MIRAGE MIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided Conversations arXiv 2025
xbench xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations arXiv 2025
SolutionBench DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point Thinking arXiv 2025
DQA PlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision Makers NAACL 2024
MedMCQA MedMCQA: A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering PMLR 2022
MedBrowseCom MedBrowseComp: Benchmarking Medical Deep Research and Computer Use arXiv 2025
GPQA Gpqa: A graduate-level google-proof q&a benchmark. COLM 2024
ScIRGen-Geo ScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific Research KDD 2025
OlympiadBench Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems ACL 2024
DeepShop DeepShop: A Benchmark for Deep Research Shopping Agents arXiv 2025
USACO Can Language Models Solve Olympiad Programming? COLM 2024
GAIA GAIA: a benchmark for general AI assistants. arXiv 2023
HLE Humanity's Last Exam arXiv 2025
HERB Benchmarking Deep Search over Heterogeneous Enterprise Data arXiv 2025
FinAgentBench FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering arXiv 2025
FinSearchComp FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning arXiv 2025
AirQA AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation arXiv 2025
FinDeepResearch FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis arXiv 2025
TSVer TSVer: A Benchmark for Fact Verification Against Time-Series Evidence arXiv 2025
FinRpt FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation arXiv 2025
LocalSearchBench LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services arXiv 2025
HotelQuEST HotelQuEST: Balancing Quality and Efficiency in Agentic Search arXiv 2026
Deep FinResearch Bench Deep FinResearch Bench: Evaluating AI's Ability to Conduct Professional Financial Investment Research arXiv 2026
BioMedArena BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents arXiv 2026
SVFSearch SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain arXiv 2026
BigFinanceBench BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents arXiv 2026
Telco-GAIA Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain arXiv 2026
FinResearchBench II: FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality arXiv 2026

Other Aspect

Name Title Venue
Instruct2DS AutoData: A Multi-Agent System for Open Web Data Collection arXiv 2025
IIRC IIRC: A Dataset of Incomplete Information Reading Comprehension Questions EMNLP 2020
Search Arena Search Arena: Analyzing Search-Augmented LLMs arXiv 2025
CONFLICTS DRAGged into CONFLICTS:Detecting and Addressing Conflicting Sources in Search-Augmented LLMs arXiv 2025
WebWalkerQA WebWalker: Benchmarking LLMs in Web Traversal arXiv 2025
ToolQA ToolQA: A Dataset for LLM Question Answering with External Tools arXiv 2023
RAGChecker RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented Generation arXiv 2024
DRComparator Deep Research Comparator: A Platform For Fine-grained Human Annotations of Deep Research Agents arXiv 2025
RAVine RAVine: Reality-Aligned Evaluation for Agentic Search arXiv 2025
WideSearch WideSearch: Benchmarking Agentic Broad Info-Seeking arXiv 2025
ClawBench ClawBench: Can AI Agents Complete Everyday Online Tasks? arXiv 2026
InfoMosaic-Bench InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents arXiv 2025
DeepResearchGuard DeepResearchGuard: Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety arXiv 2025
Pre-Exec Bench Building a Foundational Guardrail for General Agentic Systems via Synthetic Data arXiv 2025
RAGCap-Bench RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems arXiv 2025
HSCodeComp HSCodeComp: A Realistic and Expert-level Benchmark for Deep Search Agents in Hierarchical Rule Application arXiv 2025
Chameleon Benchmark [The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models](https://arxiv.org/abs/2510.16712
) arXiv 2025
LiveSearchBench LiveSearchBench: An Automatically Constructed Benchmark for Retrieval and Reasoning over Dynamic Knowledge arXiv 2025
FACTS The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality arXiv 2025
OverSearchQA Over-Searching in Search-Augmented Large Language Models arXiv 2025
DeepHalluBench Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory arXiv 2025
SAGE SAGE: Benchmarking and Improving Retrieval for Deep Research Agents arXiv 2025
MPW-Bench Evaluating the Search Agent in a Parallel World arXiv 2026
UIS-QA UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking arXiv 2026
BCAS Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search arXiv 2026
MYSQA Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users arXiv 2026
MERRIN MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments arXiv 2026
/ Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents arXiv 2026
DailyReport DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks) arXiv 2026
DISCOBENCH When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search arXiv 2026
DRFLOW DRFLOW: A Deep Research Benchmark for Personalized Workflow Prediction arXiv 2026
PACE PACE: A Proxy for Agentic Capability Evaluation arXiv 2026
DRNOISE DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments arXiv 2026
SimpleWikiSearch SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search arXiv 2026
DeepStress DeepStress: Stress-Testing Deep Search Agents arXiv 2026
SearchAuditor: SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents arXiv 2026
EcoAgent-Bench EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents arXiv 2026

Feel free to open an issue or PR to add new papers and benchmarks!

About

No description, website, or topics provided.

Resources

Stars

187 stars

Watchers

3 watching

Forks

Releases

Packages

Contributors