| 2026.8 |
Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember |
arxiv |
| 2026.8 |
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent |
arxiv |
| 2026.8 |
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment |
arxiv |
| 2026.8 |
EASy: Towards Efficient LLM-Based Agentic System |
arxiv |
| 2026.8 |
HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards |
arxiv |
| 2026.8 |
Contextual Information Policy Optimization for Search Agents |
arxiv |
| 2026.8 |
Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning |
arxiv |
| 2026.8 |
Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding |
arxiv |
| 2026.8 |
LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation |
arxiv |
| 2026.8 |
ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Models |
arxiv |
| 2026.8 |
Mitigating Context Interference for Reliable and Efficient Search Agents |
arxiv |
| 2026.7 |
Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism |
arxiv |
| 2026.7 |
LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning |
arxiv |
| 2026.7 |
ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability) |
arxiv |
| 2026.7 |
CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents |
arxiv |
| 2026.7 |
PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning |
arxiv |
| 2026.7 |
Agent-UCT: Upper Confidence Bounds Applied to Trees for Agentic Workflow Optimization with Cost-Awareness |
arxiv |
| 2026.7 |
Reason Before You Retrieve: Agentic Planning for Multi-modal RAG |
arxiv |
| 2026.7 |
Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Results |
arxiv |
| 2026.7 |
PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning |
arxiv |
| 2026.7 |
AREX: Towards a Recursively Self-Improving Agent for Deep Research |
arxiv |
| 2026.7 |
WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback |
arxiv |
| 2026.7 |
EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff |
arxiv |
| 2026.7 |
Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL |
arxiv |
| 2026.7 |
Harness-G: A Graph-Structured Harness for Search Agents |
arxiv |
| 2026.7 |
Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents |
arxiv |
| 2026.7 |
SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation |
arxiv |
| 2026.7 |
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment |
arxiv |
| 2026.7 |
Mach-Mind-4-Flash Technical Report |
arxiv |
| 2026.7 |
AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs |
arxiv |
| 2026.7 |
Multi-Turn Agentic Scientific Literature Search via Workflow Induction |
arXiv |
| 2026.6 |
ECHO: Prune to act, trace to learn with selective turn memory in agentic RL |
arXiv |
| 2026.6 |
ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents |
arXiv |
| 2026.6 |
ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering |
arXiv |
| 2026.6 |
Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning |
arXiv |
| 2026.6 |
GraphPO: Graph-based Policy Optimization for Reasoning Models |
arXiv |
| 2026.6 |
MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments |
arXiv |
| 2026.6 |
Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher |
arXiv |
| 2026.6 |
HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry |
arXiv |
| 2026.6 |
SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating |
arXiv |
| 2026.6 |
Agents-K1: Towards Agent-native Knowledge Orchestration |
arXiv |
| 2026.6 |
Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training |
arXiv |
| 2026.6 |
Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals |
arXiv |
| 2026.6 |
TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents |
arXiv |
| 2026.6 |
ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents |
arXiv |
| 2026.6 |
Adaptive Latent Agentic Reasoning |
arXiv |
| 2026.6 |
Self-Evolving Deep Research via Joint Generation and Evaluation |
arXiv |
| 2026.5 |
AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering |
arXiv |
| 2026.5 |
Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward |
arXiv |
| 2026.5 |
LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards |
arXiv |
| 2026.5 |
Learning Agent-Compatible Context Management for Long-Horizon Tasks |
arXiv |
| 2026.5 |
COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents |
arXiv |
| 2026.5 |
PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning |
arXiv |
| 2026.5 |
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards |
arXiv |
| 2026.5 |
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents |
arXiv |
| 2026.5 |
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG |
arXiv |
| 2026.5 |
Calibrating LLMs with Semantic-level Reward |
arXiv |
| 2026.5 |
Argus: Evidence Assembly for Scalable Deep Research Agents |
arXiv |
| 2026.5 |
SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning |
arXiv |
| 2026.5 |
Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning |
arXiv |
| 2026.5 |
Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents |
arXiv |
| 2026.5 |
HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents |
arXiv |
| 2026.5 |
Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents |
arXiv |
| 2026.5 |
Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers |
arXiv |
| 2026.4 |
OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search |
arXiv |
| 2026.4 |
CroSearch-R1: Better Leveraging Cross-lingual Knowledge for Retrieval-Augmented Generation |
arXiv |
| 2026.4 |
How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum |
arXiv |
| 2026.4 |
Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph Optimization |
arXiv |
| 2026.4 |
OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models |
arXiv |
| 2026.4 |
DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data |
arXiv |
| 2026.4 |
$\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data |
arXiv |
| 2026.4 |
Mind DeepResearch Technical Report |
arXiv |
| 2026.4 |
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization |
arXiv |
| 2026.4 |
ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning |
arXiv |
| 2026.4 |
ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents |
arXiv |
| 2026.4 |
WebExpert: domain-aware web agents with critic-guided expert experience for high-precision search |
arXiv |
| 2026.4 |
Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search |
arXiv |
| 2026.3 |
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs |
arXiv |
| 2026.3 |
A Subgoal-driven Framework for Improving Long-Horizon LLM Agents |
arXiv |
| 2026.3 |
MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification |
arXiv |
| 2026.3 |
Meta-Reinforcement Learning with Self-Reflection for Agentic Search |
arXiv |
| 2026.3 |
Improving Search Agent with One Line of Code |
arXiv |
| 2026.3 |
Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents |
arXiv |
| 2026.3 |
Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented Agents |
arXiv |
| 2026.3 |
SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans |
arXiv |
| 2026.3 |
KARL: Knowledge Agents via Reinforcement Learning |
arXiv |
| 2026.3 |
MemPO: Self-Memory Policy Optimization for Long-Horizon Agents |
arXiv |
| 2026.3 |
Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search Agents |
arXiv |
| 2026.2 |
Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning |
arXiv |
| 2026.2 |
Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training |
arXiv |
| 2026.2 |
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization |
arXiv |
| 2026.2 |
OmniGAIA: Towards Native Omni-Modal AI Agents |arXiv | |
|
| 2026.2 |
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric |
arXiv |
| 2026.2 |
REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents |
arXiv |
| 2026.2 |
KLong: Training LLM Agent for Extremely Long-horizon Tasks |
arXiv |
| 2026.2 |
When to Memorize and When to Stop: Gated Recurrent Memory for Long-Context Reasoning |
arXiv |
| 2026.2 |
TodoEvolve: Learning to Architect Agent Planning Systems |
arXiv |
| 2026.2 |
SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents |
arXiv |
| 2026.2 |
SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent |
arXiv |
| 2026.2 |
AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents |
arXiv |
| 2026.2 |
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research |
arXiv |
| 2026.2 |
DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents |
arXiv |
| 2026.2 |
Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation |
arXiv |
| 2026.2 |
Training Multi-Turn Search Agent via Contrastive Dynamic Branch Sampling |
arXiv |
| 2026.2 |
Scaling Search-Augmented LLM Reasoning via Adaptive Information Control |
arXiv |
| 2026.2 |
CRAFT: Calibrated Reasoning with Answer-Faithful Traces via Reinforcement Learning for Multi-Hop Question Answering |
arXiv |
| 2026.2 |
TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization |
arXiv |
| 2026.2 |
Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward |
arXiv |
| 2026.2 |
Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning |
arXiv |
| 2026.2 |
Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents |
arXiv |
| 2026.2 |
WideSeek: Advancing Wide Research via Multi-Agent Scaling |
arXiv |
| 2026.2 |
IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning |
arXiv |
| 2026.2 |
Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration |
arXiv |
| 2026.2 |
WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning |
arXiv |
| 2026.2 |
Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards |
arXiv |
| 2026.1 |
SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation |
arXiv |
| 2026.1 |
Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning |
arXiv |
| 2026.1 |
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search |
arXiv |
| 2026.1 |
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards |
arXiv |
| 2026.1 |
TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG |
arXiv |
| 2026.1 |
D2Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning |
arXiv |
| 2026.1 |
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking |
arXiv |
| 2026.1 |
PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering |
arXiv |
| 2026.1 |
PaperScout: An Autonomous Agent for Academic Paper Search with Process-Aware Sequence-Level Policy Optimization |
arXiv |
| 2026.1 |
M3Searcher: Modular Multimodal Information Seeking Agency with Retrieval-Oriented Reasoning |
arXiv |
| 2026.1 |
LRAS: Advanced Legal Reasoning with Agentic Search |
arXiv |
| 2026.1 |
Dr. Zero: Self-Evolving Search Agents without Training Data |
arXiv |
| 2026.1 |
ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration |
arXiv |
| 2026.1 |
SmartSearch: Process Reward-Guided Query Refinement for Search Agents |
arXiv |
| 2026.1 |
Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search |
arXiv |
| 2026.1 |
WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning |
arXiv |
| 2026.1 |
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL |
arXiv |
| 2026.1 |
RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation Detection |
arXiv |
| 2026.1 |
AT2PO: Agentic Turn-based Policy Optimization via Tree Search |
arXiv |
| 2025.12 |
FoldAct: Efficient and Stable Context Folding for Long-Horizon Search Agents |
arXiv |
| 2025.12 |
Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization |
arXiv |
| 2025.12 |
Step-DeepResearch Technical Report |
arXiv |
| 2025.12 |
AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning |
arXiv |
| 2025.12 |
An Open and Reproducible Deep Research Agent for Long-Form Question Answering |
arXiv |
| 2025.12 |
CoDA: A Context-Decoupled Hierarchical Agent with Reinforcement Learning |
arXiv |
| 2025.12 |
LightSearcher: Efficient DeepSearch via Experiential Memory |
arXiv |
| 2025.12 |
RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning |
arXiv |
| 2025.12 |
Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization |
arXiv |
| 2025.12 |
CARL: Critical Action Focused Reinforcement Learning for Multi-Step Agent |
arXiv |
| 2025.12 |
On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death Spiral |
arXiv |
| 2025.11 |
ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration |
arXiv |
| 2025.11 |
ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning |
arXiv |
| 2025.11 |
ST-PPO: Stabilized Off-Policy Proximal Policy Optimization for Multi-Turn Agents Training |
arXiv |
| 2025.11 |
DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs |
arXiv |
| 2025.11 |
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research |
arXiv |
| 2025.11 |
General Agentic Memory Via Deep Research arXiv |
|
| 2025.11 |
Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement Learning |
arXiv |
| 2025.11 |
Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO |
arXiv |
| 2025.11 |
Think Before You Retrieve: Learning Test-Time Adaptive Search with Small Language Models |
arXiv |
| 2025.11 |
Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction |
arXiv |
| 2025.11 |
TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework |
arXiv |
| 2025.11 |
IterResearch: Rethinking Long-Horizon Agents via Markovian State Reconstruction |
arXiv |
| 2025.11 |
Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning |
arXiv |
| 2025.11 |
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning |
arXiv |
| 2025.10 |
Search Self-play: Pushing the Frontier of Agent Capability without Supervision |
arXiv |
| 2025.10 |
Reinforcement Learning for Long-Horizon Multi-Turn Search Agents |
arXiv |
| 2025.10 |
DeepAgent: A General Reasoning Agent with Scalable Toolsets |
arXiv |
| 2025.10 |
WebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich Seeking |
arXiv |
| 2025.10 |
KnowCoder-A1: Incentivizing Agentic Reasoning Capability with Outcome Supervision for KBQA |
arXiv |
| 2025.10 |
GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning |
arXiv |
| 2025.10 |
InfoFlow: Reinforcing Search Agent Via Reward Density Optimization |
arXiv |
| 2025.10 |
Repurposing Synthetic Data for Fine-grained Search Agent Supervision |
arXiv |
| 2025.10 |
Tongyi DeepResearch Technical Report |
arXiv |
| 2025.10 |
Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth |
arXiv |
| 2025.10 |
SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents |
arXiv |
| 2025.10 |
Agentic Reinforcement Learning for Search is Unsafe |
arXiv |
| 2025.10 |
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection |
arXiv |
| 2025.10 |
PokeeResearch: Effective Deep Research via Reinforcement Learning from AI Feedback and Robust Reasoning Scaffold |
arXiv |
| 2025.10 |
Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge Graphs |
arXiv |
| 2025.10 |
DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning |
arXiv |
| 2025.10 |
Scaling Long-Horizon LLM Agent via Context-Folding |
arXiv |
| 2025.10 |
Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation |
arXiv |
| 2025.10 |
PoU: Proof-of-Use to Counter Tool-Call Hacking in DeepResearch Agents |
arXiv |
| 2025.10 |
DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping |
arXiv |
| 2025.10 |
Stop-RAG: Value-Based Retrieval Control for Iterative RAG |
arXiv |
| 2025.10 |
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering |
arXiv |
| 2025.10 |
Agentic Entropy-Balanced Policy Optimization |
arXiv |
| 2025.10 |
An Efficient Rubric-based Generative Verifier for Search-Augmented LLMs |
arXiv |
| 2025.10 |
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents |
ICLR 2026 |
| 2025.10 |
Towards Agentic Self-Learning LLMs in Search Environment |
arXiv |
| 2025.10 |
From Faithfulness to Correctness: Generative Reward Models that Think Critically |
arXiv |
| 2025.10 |
Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window |
arXiv |
| 2025.10 |
QAgent: A modular Search Agent with Interactive Query Understanding |
arXiv |
| 2025.10 |
A2Search: Ambiguity-Aware Question Answering with Reinforcement Learning |
arXiv |
| 2025.10 |
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation |
arXiv |
| 2025.10 |
Search-R3: Unifying Reasoning and Embedding Generation in Large Language Models |
arXiv |
| 2025.10 |
Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them |
arXiv |
| 2025.10 |
ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards |
arXiv |
| 2025.10 |
Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs |
arXiv |
| 2025.10 |
Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents |
arXiv |
| 2025.10 |
MARS: Optimizing Dual-System Deep Research via Multi-Agent Reinforcement Learning |
arXiv |
| 2025.10 |
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents |
arXiv |
| 2025.9 |
InfoAgent: Advancing Autonomous Information-Seeking Agents |
arXiv |
| 2025.9 |
SIRAG: Towards Stable and Interpretable RAG with A Process-Supervised Multi-Agent Framework |
arXiv |
| 2025.9 |
Towards General Agentic Intelligence via Environment Scaling |
arXiv |
| 2025.9 |
ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization |
arXiv |
| 2025.9 |
WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning |
arXiv |
| 2025.9 |
WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents |
arXiv |
| 2025.9 |
Scaling Agents via Continual Pre-training |
arXiv |
| 2025.9 |
WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents |
arXiv |
| 2025.9 |
DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL |
arXiv |
| 2025.9 |
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning |
arXiv |
| 2025.9 |
SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents |
arXiv |
| 2025.9 |
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use |
arXiv |
| 2025.9 |
Open Data Synthesis For Deep Research |
arXiv |
| 2025.8 |
Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities |
arXiv |
| 2025.8 |
AWorld: Orchestrating the Training Recipe for Agentic AI |
arXiv |
| 2025.8 |
AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning |
arXiv |
| 2025.8 |
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs |
arXiv |
| 2025.8 |
OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval |
arXiv |
| 2025.8 |
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL |
arXiv |
| 2025.8 |
MedReseacher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis Framework |
arXiv |
| 2025.8 |
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward |
arXiv |
| 2025.8 |
WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent |
arXiv |
| 2025.8 |
HierSearch: A Hierarchical Enterprise Deep Search Framework Integrating Local and Web Searches |
arXiv |
| 2025.8 |
REX-RAG: Reasoning Exploration with Policy Correction in Retrieval-Augmented Generation |
arXiv |
| 2025.8 |
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL |
arXiv |
| 2025.8 |
SSRL: Self-Search Reinforcement Learning |
arXiv |
| 2025.8 |
UR2: Unify RAG and Reasoning through Reinforcement Learning |
arXiv |
| 2025.8 |
ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning |
arXiv |
| 2025.8 |
Lucy: edgerunning agentic web search on mobile with machine generated task vectors |
arXiv |
| 2025.8 |
MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation |
arXiv |
| 2025.8 |
Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge Synergy |
arXiv |
| 2025.8 |
GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented Reasoning |
arXiv |
| 2025.7 |
Agentic Reinforced Policy Optimization |
arXiv |
| 2025.7 |
WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization |
arXiv |
| 2025.7 |
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning |
arXiv |
| 2025.7 |
WebSailor: Navigating Super-human Reasoning for Web Agent |
arXiv |
| 2025.7 |
RAG-R1 : Incentivize the Search and Reasoning Capabilities of LLMs through Multi-query Parallelism |
arXiv |
| 2025.6 |
Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim Verification |
arXiv |
| 2025.6 |
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning |
arXiv |
| 2025.6 |
KunLunBaizeRAG: Reinforcement Learning Driven Inference Performance Leap for Large Language Models |
arXiv |
| 2025.5 |
Visual Agentic Reinforcement Fine-Tuning |
arXiv |
| 2025.5 |
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning |
arXiv |
| 2025.5 |
Search and Refine During Think: Autonomous Retrieval-Augmented Reasoning of LLMs |
arXiv |
| 2025.5 |
Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty |
arXiv |
| 2025.5 |
Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information Foraging |
arXiv |
| 2025.5 |
An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents |
arXiv |
| 2025.5 |
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning |
arXiv |
| 2025.5 |
EvolveSearch: An Iterative Self-Evolving Search Agent |
arXiv |
| 2025.5 |
ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement Learning |
arXiv |
| 2025.5 |
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning |
arXiv |
| 2025.5 |
R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning |
arXiv |
| 2025.5 |
Pangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning |
arXiv |
| 2025.5 |
MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability |
arXiv |
| 2025.5 |
StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization |
arXiv |
| 2025.5 |
Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents |
arXiv |
| 2025.5 |
WebDancer: Towards Autonomous Information Seeking Agency |
arXiv |
| 2025.5 |
ZeroSearch: Incentivize the Search Capability of LLMs without Searching |
arXiv |
| 2025.5 |
O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering |
arXiv |
| 2025.5 |
s3: You Don't Need That Much Data to Train a Search Agent via RL |
arXiv |
| 2025.5 |
Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent |
arXiv |
| 2025.4 |
WebThinker: Empowering Large Reasoning Models with Deep Research Capability |
arXiv |
| 2025.4 |
Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use |
arXiv |
| 2025.4 |
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments |
arXiv |
| 2025.4 |
ReZero: Enhancing LLM Search Ability by Trying One More Time |
arXiv |
| 2025.3 |
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning |
arXiv |
| 2025.3 |
Agent models: Internalizing Chain-of-Action Generation into Reasoning models |
arXiv |
| 2025.3 |
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning |
arXiv |
| 2025.3 |
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning |
arXiv |
| 2025.2 |
DeepRetrieval: Hacking Real Search Engines and Retrievers with LLMs via Reinforcement Learning |
arXiv |
| 2025.2 |
RAG-Gym: Systematic Optimization of Language Agents for Retrieval-Augmented Generation |
arXiv |
| 2025.2 |
DeepRAG: Thinking to Retrieval Step by Step for Large Language Models |
arXiv |
| 2025.1 |
Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning |
arXiv |
| 2024.10 |
SmartRAG: Jointly Learn RAG-Related Tasks From the Environment Feedback |
ICLR 2025 |