Skip to content

Latest commit

Β 

History

30 Commits

Folders and files

NameName
Last commit message
Last commit date
Β 
Β 
Β 
Β 
Β 
Β 

Repository files navigation

Awesome Retrieval for Agentic Search

Awesome Status

An extensive and commented list of resources on agentic search and agentic deep research β€” systems where an LLM acts as an autonomous agent that plans, searches, inspects, and refines its retrieval in an iterative reasoning loop, rather than retrieving once and generating.

Contents

Foundations

Classic RAG

The retrieve-then-generate paradigm that agentic search builds upon: a single retrieval step followed by generation, without iterative planning or tool use.

  • REALM: Retrieval-Augmented Language Model Pre-Training
    Kelvin Guu, Kenton Lee, Zora Tung, Panupong Pasupat, Ming-Wei Chang
    ICML, 2020
    πŸ“„ paper

  • Dense Passage Retrieval for Open-Domain Question Answering
    Vladimir Karpukhin, Barlas Oğuz, Sewon Min, Patrick Lewis, Ledell Wu, Sergey Edunov, Danqi Chen, Wen-tau Yih
    EMNLP, 2020
    πŸ“„ paper | πŸ› οΈ code

  • Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
    Patrick Lewis, Ethan Perez, Aleksandra Piktus, Fabio Petroni, Vladimir Karpukhin, Naman Goyal, Heinrich KΓΌttler, Mike Lewis, Wen-tau Yih, Tim RocktΓ€schel, Sebastian Riedel, Douwe Kiela
    NeurIPS, 2020
    πŸ“„ paper | πŸ› οΈ code

  • Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering
    Gautier Izacard, Edouard Grave
    EACL, 2021
    πŸ“„ paper | πŸ› οΈ code

Retrieval Interface

How the agent accesses knowledge sources β€” the substrate underlying the entire agentic search loop, from retriever training to structured indexing to raw corpus interaction.

Retriever Training

Training the retriever/embedder itself to be reasoning-aware and agentic-search-aware, rather than treating it as a fixed component.

  • O1 Embedder: Let Retrievers Think Before Action
    Ruiran Yan, Zheng Liu, Defu Lian
    arXiv, 2025
    πŸ“„ paper

  • DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement Learning
    Pengcheng Jiang, Jiacheng Lin, Lang Cao, Runchu Tian, SeongKu Kang, Zifeng Wang, Jimeng Sun, Jiawei Han
    COLM, 2025
    πŸ“„ paper | πŸ› οΈ code

  • ReasonIR: Training Retrievers for Reasoning Tasks
    Rulin Shao, Rui Qiao, Varsha Kishore, Niklas Muennighoff, Xi Victoria Lin, Daniela Rus, Bryan Kian Hsiang Low, Sewon Min, Wen-tau Yih, Pang Wei Koh, Luke Zettlemoyer
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement Learning
    Changtai Zhu, Siyin Wang, Ruijun Feng, Kai Song, Xipeng Qiu
    EMNLP, 2025
    πŸ“„ paper | πŸ› οΈ code

  • RaDeR: Reasoning-aware Dense Retrieval Models
    Debrup Das, SeΓ‘n Γ“ NuallΓ‘in, Razieh Rahimi
    ICML, 2025
    πŸ“„ paper

  • TongSearch-QR: Reinforced Query Reasoning for Retrieval
    Xubo Qin, Jun Bai, Jiaqi Li, Zixia Jia, Zilong Zheng
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • DIVER: A Multi-Stage Approach for Reasoning-intensive Information Retrieval
    Meixiu Long, Duolin Sun, Dan Yang, Junjie Wang, Yecheng Luo, Yue Shen, Jian Wang, Hualei Zhou, Chunxiao Guo, Peng Wei, Jiahai Wang, Jinjie Gu
    arXiv, 2025
    πŸ“„ paper

  • Search-R3: Unifying Reasoning and Embedding Generation in Large Language Models
    Yuntao Gui, James Cheng
    arXiv, 2025
    πŸ“„ paper

  • ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval
    Jianlyu Chen, Junwei Lan, Chaofan Li, Defu Lian, Zheng Liu
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Agentic-R: Learning to Retrieve for Agentic Search
    Wenhan Liu, Xinyu Ma, Yutao Zhu, Yuchen Li, Daiting Shi, Dawei Yin, Zhicheng Dou
    arXiv, 2026
    πŸ“„ paper

  • LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval
    Jiajie Jin, Yanzhao Zhang, Mingxin Li, Dingkun Long, Pengjun Xie, Yutao Zhu, Zhicheng Dou
    SIGIR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • AgentIR: Reasoning-Aware Retrieval for Deep Research Agents
    Zijian Chen, Xueguang Ma, Shengyao Zhuang, Jimmy Lin, Akari Asai, Victor Zhong
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Learning to Retrieve from Agent Trajectories (LRAT)
    Yuqi Zhou, Sunhao Dai, Changle Qu, Liang Pang, Jun Xu, Ji-Rong Wen
    SIGIR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search
    Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems (RTriever / BRIGHT-Pro)
    Yilun Zhao, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao, Arman Cohan
    arXiv, 2026
    πŸ“„ paper

  • LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG
    Yijia Zheng, Marcel Worring
    arXiv, 2026
    πŸ“„ paper

  • Critic-R: Improving Agentic Search using Instruction-tuned Retrievers with Natural Language Introspective Feedback
    Md Zarif Ul Alam, Alireza Salemi, Hamed Zamani
    arXiv, 2026
    πŸ“„ paper

  • RL-Index: Reinforcement Learning for Retrieval Index Reasoning
    Yongjia Lei, Zhisheng Qi, Utkarsh Sahu, Yu Wang, Nedim Lipka, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi
    arXiv, 2026
    πŸ“„ paper

  • Retrieval Grounding Latent Reasoning for Dense Retrieval (RGLT)
    Gang Zhou, Xiongxi Yu, Hu Tian, Yang Wei, Lu Pan, Ke Zeng, Shibiao Xu, Xiaolong Zheng
    arXiv, 2026
    πŸ“„ paper

  • Navigation-Informed Embeddings: Dense-Retriever Adaptation from Agent Search Traces
    Shrey Shah, Levent Ozgur
    arXiv, 2026
    πŸ“„ paper

  • ITER: Interaction-Aware Retrieval for Agentic Search
    Haodong Chen, Shuai Wang, Yu Yin, Shengyao Zhuang, Guido Zuccon, Teerapong Leelanupab
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

Reranking

Reranking components made reasoning-aware or reorganized around agentic search, rather than a fixed sequential pass.

  • Beyond Sequential Reranking: Reranker-Guided Search Improves Reasoning Intensive Retrieval
    Haike Xu, Miao Zhang, Yipeng Kang, Zeyu Zhang, Sian-Chen Huang, Piotr Indyk
    arXiv, 2025
    πŸ“„ paper

  • LimRank: Less is More for Reasoning-Intensive Information Reranking
    Tingyu Song, Yilun Zhao, Siyue Zhang, Chen Zhao, Arman Cohan
    EMNLP, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Adaptive Retrieval for Reasoning-Intensive Retrieval (REPAIR)
    Jongho Kim, Jaeyoung Kim, Seung-won Hwang, Jihyuk Kim, Yu Jin Kim, Moontae Lee
    arXiv, 2026
    πŸ“„ paper

  • Reproducing Adaptive Reranking for Reasoning-Intensive IR
    Mandeep Rathee, Venktesh V, Sean MacAvaney, Avishek Anand
    SIGIR, 2026
    πŸ“„ paper

  • Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning
    Sangkwon Park, Donghun Kang, Jisoo Mok, Sungroh Yoon
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval
    Chunyu Li, Mengyuan Zhang, Jingyi Kang, Ding Chen, Jiajun Shen, Bo Tang, Xuanhe Zhou, Feiyu Xiong, Zhiyu Li
    arXiv, 2026
    πŸ“„ paper

  • Tool-Adaptive LLM Reranker (TALRanker)
    Zichuan Liu, Ruijin Hua
    arXiv, 2026
    πŸ“„ paper

  • Training Documents Reranker with Search Rubrics for Deep Research Agent (RubricRanker)
    Wenhan Liu, Yu Lu, Qiaolin Xia, Hui Xu, Tong Zhao, Jian Xi, Yutao Zhu, Haijin Liang, Haibo Shi, Hao Wang, Zhicheng Dou
    arXiv, 2026
    πŸ“„ paper

Structured & Hierarchical Retrieval

Reorganizing the corpus itself into structures (graphs, hierarchies, wikis) that agents can traverse, rather than a flat similarity index.

  • From Local to Global: A Graph RAG Approach to Query-Focused Summarization (GraphRAG)
    Darren Edge, Ha Trinh, Newman Cheng, Joshua Bradley, Alex Chao, Apurva Mody, Steven Truitt, Jonathan Larson
    arXiv, 2024
    πŸ“„ paper | πŸ› οΈ code

  • HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models
    Bernal JimΓ©nez GutiΓ©rrez, Yiheng Shu, Yu Gu, Michihiro Yasunaga, Yu Su
    NeurIPS, 2024
    πŸ“„ paper | πŸ› οΈ code

  • From RAG to Memory: Non-Parametric Continual Learning for Large Language Models (HippoRAG 2)
    Bernal JimΓ©nez GutiΓ©rrez, Yiheng Shu, Weijian Qi, Sizhe Zhou, Yu Su
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Youtu-GraphRAG: Vertically Unified Agents for Graph Retrieval-Augmented Complex Reasoning
    Junnan Dong, Siyu An, Yifei Yu, Qianwen Zhang, Linhao Luo, Xiao Huang, Yunsheng Wu, Di Yin, Xing Sun
    ICLR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • LLM-Guided Hierarchical Retrieval (LATTICE)
    Nilesh Gupta, Wei-Cheng Chang, Ngot Bui, Cho-Jui Hsieh, Inderjit S. Dhillon
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Deep GraphRAG: A Balanced Approach to Hierarchical Retrieval and Adaptive Integration
    Yuejie Li, Ke Yang, Bolin Chen, Bowen Li, Chengjun Mao, Tao Wang
    arXiv, 2026
    πŸ“„ paper

  • T-Retriever: Tree-based Hierarchical Retrieval Augmented Generation for Textual Graphs
    Chunyu Wei, Huaiyu Qin, Siyuan He, Yunhai Wang, Yueguo Chen
    AAAI, 2026
    πŸ“„ paper | πŸ› οΈ code

  • A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces
    Mingxuan Du, Benfeng Xu, Chiwei Zhu, Shaohan Wang, Pengyu Wang, Xiaorui Wang, Zhendong Mao
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • DeepRead: Document Structure-Aware Reasoning to Enhance Agentic Search
    Zhanli Li, Huiwen Tian, Lvzhou Luo, Yixuan Cao, Ping Luo
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG (Corpus2Skill)
    Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki
    Haoliang Ming, Feifei Li, Xiaoqing Wu, Wenhui Que
    arXiv, 2026
    πŸ“„ paper

  • More Context, Same Budget: Dual-Bounded Relational Recall Beyond Top-K Retrieval (DBRR)
    Thomson D. Nguy
    arXiv, 2026
    πŸ“„ paper

Direct Corpus Interaction

The agent bypasses pre-computed indexes entirely, interacting with the raw corpus via terminal-style tools (grep, file reads, shell commands).

  • Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval
    Yulong Hui, Chao Chen, Zhihang Fu, Yihao Liu, Jieping Ye, Huanchen Zhang
    ICLR, 2026
    πŸ“„ paper | πŸ”— openreview

  • Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction
    Zhuofeng Li, Haoxiang Zhang, Cong Wei, Pan Lu, Ping Nie, Yi Lu, Yuyang Bai, Shangbin Feng, Hangxiao Zhu, Ming Zhong, Yuyu Zhang, Jianwen Xie, Yejin Choi, James Zou, Jiawei Han, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang. arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Rethinking Agentic Search with PI-SERINI: Is Lexical Retrieval Sufficient?
    Tz-Huan Hsu, Jheng-Hong Yang, Jimmy Lin
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Rethinking Agentic RAG: Toward LLM-Driven Logical Retrieval Beyond Embeddings (LogicalRAG)
    Yuqi Zeng, Qixiang Deng, Yulei Wan, Ruiquan Jiang, Xiaoqing Zheng, Xuanjing Huang
    arXiv, 2026
    πŸ“„ paper

  • GrepSeek: Training Search Agents for Direct Corpus Interaction
    Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi, Fernando Diaz, Hamed Zamani
    arXiv, 2026
    πŸ“„ paper

  • Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses
    Pengcheng Jiang, Zhiyi Shi, Kelly Hong, Xueqiang Xu, Jiashuo Sun, Jimeng Sun, Hammad Bashir, Jiawei Han
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Towards Retrieving Interaction Spaces for Agentic Search (RISE)
    Shengyao Zhuang, Yuansheng Ni, Hengxin Fun, Jimmy Lin, Xueguang Ma
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • DR-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion
    Yi Lu, Zhuofeng Li, Ping Nie, Haoxiang Zhang, Yuyu Zhang, Kai Zou, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang
    arXiv, 2026
    πŸ“„ paper

  • Boolean Queries Are All You Need? (Vole)
    Charles L. A. Clarke, Mark D. Smucker
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code (Vole) | πŸ› οΈ code (Cottontail)

  • A New Role for Relevance: Guiding Corpus Interaction in Agentic Search (RARG)
    Jiangnan Li, Yuqing Li, Mo Yu, Jinchao Zhang, Jie Zhou
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Deep Agentic Search for Repository-Level Code Question Answering: An Empirical Study
    Amirkia Rafiei Oskooei, Bora Ilci, Alperen Kayim, Mehmet Egemen Uzun, Berat Can, Kaan Emre Kara, Ozan Orhan, Mehmet S. Aktas
    arXiv, 2026
    πŸ“„ paper

  • Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations
    Sagar Tamang, Ayush Vyas, Tabarakul Hazarika
    arXiv, 2026
    πŸ“„ paper

  • Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Research Agents (SIEVE)
    Shuai Wang, Haodong Chen, Yu Yin, Shengyao Zhuang, Bevan Koopman, Guido Zuccon
    arXiv, 2026
    πŸ“„ paper

  • Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents
    Qi Liu, Yiqun Chen, Zidan Chen, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory (ReFind)
    Ruizhe Li, Licheng Zhang, Benfeng Xu, Mingxuan Du, Zheren Fu, Weidong Chen
    arXiv, 2026
    πŸ“„ paper

  • LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents
    Xingjun Wang, Gongsheng Li, Qi Fan, Yunlin Mao, Luyan Su, Yingda Chen
    arXiv, 2026
    πŸ“„ paper

  • CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence
    Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen, Peng Gao
    arXiv, 2026
    πŸ“„ paper

Retrieval Analysis & Evaluation

Studies characterizing agentic query workloads, comparing retrieval interfaces, and evaluating retrieval quality in deep research settings.

  • Rerank Before You Reason: Analyzing Reranking Tradeoffs through Effective Token Cost in Deep Search Agents
    Sahel Sharifymoghaddam, Jimmy Lin
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • SAGE: Benchmarking and Improving Retrieval for Deep Research Agents
    Tiansheng Hu, Yilun Zhao, Canyu Zhang, Arman Cohan, Chen Zhao
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • A Picture of Agentic Search (ASQ)
    Francesca Pezzuti, Ophir Frieder, Fabrizio Silvestri, Sean MacAvaney, Nicola Tonellotto
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Revisiting Text Ranking in Deep Research
    Chuan Meng, Litu Ou, Sean MacAvaney, Jeff Dalton
    SIGIR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Keyword Search is All You Need: Achieving RAG-Level Performance Without Vector Databases Using Agentic Tool Use
    Shreyas Subramanian, Adewale Akinfaderin, Yanyan Zhang, Ishan Singh, Mani Khanuja, Sandeep Singh, Maira Ladeira Tanke
    AAAI, 2026
    πŸ“„ paper

  • Total Recall QA: A Verifiable Evaluation Suite for Deep Research Agents
    Mahta Rafiee, Heydar Soudani, Zahra Abbasiantaeb, Mohammad Aliannejadi, Faegheh Hasibi, Hamed Zamani
    SIGIR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Reproducing Complex Set-Compositional Information Retrieval
    Vincent Degenhart, Dewi Timman, Arjen P. de Vries, Faegheh Hasibi, Mohanna Hoveyda
    SIGIR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Superintelligent Retrieval Agent: The Next Frontier of Information Retrieval
    Zeyu Yang, Qi Ma, Jason Chen, Anshumali Shrivastava
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Is Grep All You Need? How Agent Harnesses Reshape Agentic Search
    Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah
    arXiv, 2026
    πŸ“„ paper

  • Equal Accuracy, Unequal Evidence: Search APIs as Decision Surfaces for Tool-Using Agents
    Sriram Selvam, Anneswa Ghosh
    arXiv, 2026
    πŸ“„ paper

  • Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search
    Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee
    arXiv, 2026
    πŸ“„ paper

  • Which RAG Paradigm Wins at Scale? A Scaling Study of Retrieval-Augmented Generation Paradigms
    Pengyu Wang, Benfeng Xu, Shaohan Wang, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang
    arXiv, 2026
    πŸ“„ paper

  • Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents
    Qi Liu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua
    arXiv, 2026
    πŸ“„ paper

  • The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior
    Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre CΓ΄tΓ©, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang
    COLM, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories
    Nabira Rashid, Manolis Kellis
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

The Agentic Search Loop

Core papers on the agent's search behavior: how it plans, queries, retrieves, and adapts across the full information-seeking loop. This section is provided for context β€” this list's focus is on the retrieval side of agentic search. For a more in-depth selection of papers on the agentic search loop itself, see Awesome-Search-Agent-Papers.

Planning & Reasoning

Foundational architectures that define the agent's core reasoning loop: interleaving thought, action, and retrieval.

  • WebGPT: Browser-Assisted Question-Answering with Human Feedback
    Reiichiro Nakano, Jacob Hilton, Suchir Balaji, Jeff Wu, Long Ouyang, Christina Kim, Christopher Hesse, Shantanu Jain, Vineet Kosaraju, William Saunders, Xu Jiang, Karl Cobbe, Tyna Eloundou, Gretchen Krueger, Kevin Button, Matthew Knight, Benjamin Chess, John Schulman.
    arXiv, 2021
    πŸ“„ paper

  • ReAct: Synergizing Reasoning and Acting in Language Models
    Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao
    ICLR, 2023
    πŸ“„ paper | πŸ› οΈ code

  • Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions (IRCoT)
    Harsh Trivedi, Niranjan Balasubramanian, Tushar Khot, Ashish Sabharwal
    ACL, 2023
    πŸ“„ paper | πŸ› οΈ code

  • Search-o1: Agentic Search-Enhanced Large Reasoning Models
    Xiaoxi Li, Guanting Dong, Jiajie Jin, Yuyao Zhang, Yujia Zhou, Yutao Zhu, Peitian Zhang, Zhicheng Dou
    EMNLP, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
    Junde Wu, Jiayuan Zhu, Yuyuan Liu, Min Xu, Yueming Jin
    ACL, 2025
    πŸ“„ paper | πŸ› οΈ code

  • LLM-based Search Assistant with Holistically Guided MCTS for Intricate Information Seeking
    Ruiyang Ren, Yuhao Wang, Junyi Li, Jinhao Jiang, Wayne Xin Zhao, Wenjie Wang, Tat-Seng Chua
    SIGIR, 2025
    πŸ“„ paper

  • WebThinker: Empowering Large Reasoning Models with Deep Research Capability
    Xiaoxi Li, Jiajie Jin, Guanting Dong, Hongjin Qian, Yutao Zhu, Yongkang Wu, Ji-Rong Wen, Zhicheng Dou
    NeurIPS, 2025
    πŸ“„ paper | πŸ› οΈ code

  • ArcticSwarm: Deferring Early Consensus in Long-Horizon Multi-Agent Research
    Soyoung Yoon, Boyi Liu, Yite Wang, Ruofan Wu, Canwen Xu, Nikki Lijing Kuang, Seung-won Hwang, Yuxiong He, Zhewei Yao
    arXiv, 2026
    πŸ“„ paper

Query Formulation & Decomposition

How the agent structures, decomposes, and parallelizes its search queries.

  • Decomposed Prompting: A Modular Approach for Solving Complex Tasks (DecomP)
    Tushar Khot, Harsh Trivedi, Matthew Finlayson, Yao Fu, Kyle Richardson, Peter Clark, Ashish Sabharwal
    ICLR, 2023
    πŸ“„ paper | πŸ› οΈ code

  • Measuring and Narrowing the Compositionality Gap with Language Models (Self-Ask)
    Ofir Press, Muru Zhang, Sewon Min, Ludwig Schmidt, Noah A. Smith, Mike Lewis
    EMNLP Findings, 2023
    πŸ“„ paper | πŸ› οΈ code

  • BELLE: A Bi-Level Multi-Agent Reasoning Framework for Multi-Hop Question Answering
    Taolin Zhang, Dongyang Li, Qizhou Chen, Chengyu Wang, Xiaofeng He
    ACL, 2025
    πŸ“„ paper

  • ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning
    Shu Zhao, Tan Yu, Anbang Xu, Japinder Singh, Aaditya Shukla, Rama Akkiraju
    arXiv, 2025
    πŸ“„ paper

  • SmartSearch: Process Reward-Guided Query Refinement for Search Agents
    Tongyu Wen, Guanting Dong, Zhicheng Dou
    SIGIR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • Plan Before Search: Search Agents Need Plan
    Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Jiayi Ji, Chenyi Lei, Wenwu Ou, Xiaoshuai Sun, Qibin Hou
    arXiv, 2026
    πŸ“„ paper

  • ReCite: Agentic Reasoning for Faithful Citation
    Yuyang Huang, Bobo Li, Jiajia Song, Yuzhe Ding, Chong Teng, Fei Li, Donghong Ji
    EMNLP Findings, 2026
    πŸ“„ paper

  • Question's Gambit: The First Move Matters in Agentic Deep Search
    Radin Hamidi Rad, Amin Bigdeli, Negar Arabzadeh, Sajad Ebrahimi, Charles L. A. Clarke, Benjamin C. M. Fung, Ebrahim Bagheri
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

Adaptive Retrieval Control

When to retrieve, how many times, and when to stop β€” including the decision between internal parametric knowledge and external retrieval.

  • Active Retrieval Augmented Generation (FLARE)
    Zhengbao Jiang, Frank F. Xu, Luyu Gao, Zhiqing Sun, Qian Liu, Jane Dwivedi-Yu, Yiming Yang, Jamie Callan, Graham Neubig
    EMNLP, 2023
    πŸ“„ paper | πŸ› οΈ code

  • Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection
    Akari Asai, Zeqiu Wu, Yizhong Wang, Avi Sil, Hannaneh Hajishirzi
    ICLR, 2024
    πŸ“„ paper | πŸ› οΈ code

  • Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity
    Soyeong Jeong, Jinheon Baek, Sukmin Cho, Sung Ju Hwang, Jong C. Park
    NAACL, 2024
    πŸ“„ paper | πŸ› οΈ code

  • Chain-of-Retrieval Augmented Generation (CoRAG)
    Liang Wang, Haonan Chen, Nan Yang, Xiaolong Huang, Zhicheng Dou, Furu Wei
    NeurIPS, 2025
    πŸ“„ paper | πŸ› οΈ code

  • DeepRAG: Thinking to Retrieve Step by Step for Large Language Models
    Xinyan Guan, Jiali Zeng, Fandong Meng, Chunlei Xin, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Jie Zhou
    ICLR, 2026
    πŸ“„ paper

  • Towards Adaptive Memory-Based Optimization for Enhanced Retrieval-Augmented Generation (Amber)
    Qitao Qin, Yucong Luo, Yihang Lu, Zhibo Chu, Xiaoman Liu, Xianwei Meng
    ACL Findings, 2025
    πŸ“„ paper

  • Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information Foraging
    Hongjin Qian, Zheng Liu
    NeurIPS, 2025
    πŸ“„ paper

  • R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning
    Huatong Song, Jinhao Jiang, Wenqing Tian, Zhipeng Chen, Yuhuan Wu, Jiahao Zhao, Yingqian Min, Wayne Xin Zhao, Lei Fang, Ji-Rong Wen.
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Pangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning
    Wenxuan Shi, Haochen Tan, Chuqiao Kuang, Xiaoguang Li, Xiaozhe Ren, Chen Zhang, Hanting Chen, Yasheng Wang, Lu Hou, Lifeng Shang. arXiv, 2025
    πŸ“„ paper

  • Stop-RAG: Value-Based Retrieval Control for Iterative RAG
    Jaewan Park, Solbee Cho, Jay-Yoon Lee
    NeurIPS Workshop, 2025
    πŸ“„ paper

  • Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience (DS-MCM)
    Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu
    arXiv, 2026
    πŸ“„ paper

  • AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
    Jingbo Sun, Wenyue Chong, Songjun Tu, Qichao Zhang, Yaocheng Zhang, Jiajun Chai, Xiaohan Wang, Wei Lin, Guojun Yin, Dongbin Zhao
    ACL Findings, 2026
    πŸ“„ paper | πŸ› οΈ code

  • GRASP: GRanularity-Aware Search Policy for Agentic RAG
    Varun Gandhi, Jaewook Lee, Shantanu Todmal, Andrew Lan, Franck Dernoncourt, Ryan Rossi, Zichao Wang
    arXiv, 2026
    πŸ“„ paper

  • RΒ²-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search
    Sheng Zhang, Junyi Li, Wenlin Zhang, Xiaowei Qian, Yingyi Zhang, Maolin Wang, Yichao Wang, Yong Liu, Xiangyu Zhao
    arXiv, 2026
    πŸ“„ paper

  • TASR: Training-Free Adaptive Stopping for Iterative Retrieval
    Adrian Kieback, Uyiosa Philip Amadasun, Aman Chadha, Aaron Elkins
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • When Deep Research Agents Stagnate: Enhancing Reasoning with Retrieval-Aware Agent Control (RAAC)
    Heydar Soudani, Elizabeth Lingg, Faegheh Hasibi, Navid Rekabsaz
    arXiv, 2026
    πŸ“„ paper

Context & Memory Management

Managing information across long-horizon search trajectories without losing critical context.

  • MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents
    Zijian Zhou, Ao Qu, Zhaoxuan Wu, Sunghwan Kim, Alok Prakash, Daniela Rus, Jinhua Zhao, Bryan Kian Hsiang Low, Paul Pu Liang
    ICLR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • WebResearcher: Unleashing Unbounded Reasoning Capability in Long-Horizon Agents
    Zile Qiao, Guoxin Chen, Xuanzhong Chen, Donglei Yu, Wenbiao Yin, Xinyu Wang, Zhen Zhang, Baixuan Li, Huifeng Yin, Kuan Li, Rui Min, Minpeng Liao, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization
    Xixi Wu, Kuan Li, Yida Zhao, Liwen Zhang, Litu Ou, Huifeng Yin, Zhongwang Zhang, Xinmiao Yu, Dingchu Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Minhao Cheng, Shuai Wang, Hong Cheng, Jingren Zhou. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • AgentFold: Long-Horizon Web Agents with Proactive Context Management
    Rui Ye, Zhongwang Zhang, Kuan Li, Huifeng Yin, Zhengwei Tao, Yida Zhao, Liangcai Su, Liwen Zhang, Zile Qiao, Xinyu Wang, Pengjun Xie, Fei Huang, Siheng Chen, Jingren Zhou, Yong Jiang. arXiv, 2025
    πŸ“„ paper

  • MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
    Sheng Zhang, Junyi Li, Yingyi Zhang, Pengyue Jia, Yichao Wang, Xiaowei Qian, Wenlin Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao
    ACL, 2026
    πŸ“„ paper

  • Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory (ReTree)
    Aijun Yang, Qianxue Guo, Ziyi Huang, Yuxuan Chen, Shiyou Qian, Jian Cao
    arXiv, 2026
    πŸ“„ paper

  • Mitigating Context Interference for Reliable and Efficient Search Agents (CRRL)
    Boyang Xue, Bin Wu, Shuofei Qiao, Sheng Wang, Rui Wang, Yiming Du, Hongru Wang, Jeff Z. Pan, Emine Yilmaz, Kam-Fai Wong, Aldo Lipani
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents
    Kun Li, Zexuan Qiu, Tianhua Zhang, Irwin King, Helen Meng
    arXiv, 2026
    πŸ“„ paper | 🌐 project

Training & Optimization

Methods for training agents to search effectively, through reinforcement learning or synthetic data generation. This section is provided for context β€” this list's focus is on the retrieval side of agentic search. For a more in-depth selection of RL-based agentic search training papers, see Awesome-RL-based-Agentic-Search-Papers.

RL-based Training

  • PaSa: An LLM Agent for Comprehensive Academic Paper Search
    Yichen He, Guanhua Huang, Peiyuan Feng, Yuan Lin, Yuchen Zhang, Hang Li, Weinan E
    ACL, 2025
    πŸ“„ paper | πŸ› οΈ code

  • RAG-Gym: Optimizing Reasoning and Search Agents with Process Supervision
    Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, Zhiyong Lu, Aidong Zhang
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
    Huatong Song, Jinhao Jiang, Yingqian Min, Jie Chen, Zhipeng Chen, Wayne Xin Zhao, Lei Fang, Ji-Rong Wen
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
    Bowen Jin, Hansi Zeng, Zhenrui Yue, Jinsung Yoon, Sercan Γ–. Arik, Dong Wang, Hamed Zamani, Jiawei Han
    COLM, 2025
    πŸ“„ paper | πŸ› οΈ code

  • ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
    Mingyang Chen, Linzhuang Sun, Tianpeng Li, Haoze Sun, Yijie Zhou, Chenzheng Zhu, Haofen Wang, Jeff Z. Pan, Wen Zhang, Huajun Chen, Fan Yang, Zenan Zhou, Weipeng Chen
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-World Environments
    Yuxiang Zheng, Dayuan Fu, Xiangkun Hu, Xiaojie Cai, Lyumanshan Ye, Pengrui Lu, Pengfei Liu
    EMNLP, 2025
    πŸ“„ paper | πŸ› οΈ code

  • ZeroSearch: Incentivize the Search Capability of LLMs without Searching
    Hao Sun, Zile Qiao, Jiayan Guo, Xuanbo Fan, Yingyan Hou, Yong Jiang, Pengjun Xie, Yan Zhang, Fei Huang, Jingren Zhou
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning (AutoRefine)
    Yaorui Shi, Shihan Li, Chang Wu, Zhiyuan Liu, Junfeng Fang, Hengxing Cai, An Zhang, Xiang Wang
    NeurIPS, 2025
    πŸ“„ paper | πŸ› οΈ code

  • s3: You Don't Need That Much Data to Train a Search Agent via RL
    Pengcheng Jiang, Xueqiang Xu, Jiacheng Lin, Jinfeng Xiao, Zifeng Wang, Jimeng Sun, Jiawei Han
    EMNLP, 2025
    πŸ“„ paper | πŸ› οΈ code

  • StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization
    Ziliang Wang, Xuhui Zheng, Kang An, Cijun Ouyang, Jialu Cai, Yuhang Wang, Yichao Wu
    EMNLP, 2025
    πŸ“„ paper

  • Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers (ExSearch)
    Zhengliang Shi, Lingyong Yan, Dawei Yin, Suzan Verberne, Maarten de Rijke, Zhaochun Ren
    NeurIPS, 2025
    πŸ“„ paper

  • MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability
    Weiqi Wu, Xin Guan, Shen Huang, Yong Jiang, Pengjun Xie, Fei Huang, Jiuxin Cao, Hai Zhao, Jingren Zhou
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • WebDancer: Towards Autonomous Information Seeking Agency
    Jialong Wu, Baixuan Li, Runnan Fang, Wenbiao Yin, Liwen Zhang, Zhengwei Tao, Dingchu Zhang, Zekun Xi, Gang Fu, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
    Qingfei Zhao, Ruobing Wang, Dingling Xu, Daren Zha, Limin Liu
    arXiv, 2025
    πŸ“„ paper

  • WebSailor: Navigating Super-Human Reasoning for Web Agent
    Kuan Li, Zhongwang Zhang, Huifeng Yin, Liwen Zhang, Litu Ou, Jialong Wu, Wenbiao Yin, Baixuan Li, Zhengwei Tao, Xinyu Wang, Weizhou Shen, Junkai Zhang, Dingchu Zhang, Xixi Wu, Yong Jiang, Ming Yan, Pengjun Xie, Fei Huang, Jingren Zhou. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL (ASearcher)
    Jiaxuan Gao, Wei Fu, Minyang Xie, Shusheng Xu, Chuyi He, Zhiyu Mei, Banghua Zhu, Yi Wu
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards
    Shiyu Li, Yang Tang, Yifan Wang, Peiming Li, Xi Chen
    arXiv, 2025
    πŸ“„ paper

  • HiPRAG: Hierarchical Process Rewards for Efficient Agentic RAG
    Peilin Wu, Mian Zhang, Kun Wan, Wentian Zhao, Kaiyu He, Xinya Du, Zhiyu Chen
    arXiv, 2025
    πŸ“„ paper

  • InfoFlow: Reinforcing Search Agent via Reward Density Optimization
    Kun Luo, Hongjin Qian, Zheng Liu, Ziyi Xia, Shitao Xiao, Siqi Bao, Jun Zhao, Kang Liu
    arXiv, 2025
    πŸ“„ paper

  • Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward (InfoReasoner)
    Senkang Hu, Yong Dai, Yuzhi Zhao, Yihang Tao, Yu Guo, Zhengru Fang, Sam Tak Wu Kwong, Yuguang Fang
    ICML, 2026
    πŸ“„ paper | πŸ› οΈ code

  • KARL: Knowledge Agents via Reinforcement Learning
    Jonathan D. Chang, Andrew Drozdov, Shubham Toshniwal, Owen Oertell, Alexander Trott, Jacob Portes, Abhay Gupta, Pallavi Koppol, Ashutosh Baheti, Sean Kulinski, Ivan Zhou, Irene Dea, Krista Opsahl-Ong, Simon Favreau-Lessard, Sean Owen, Jose Javier Gonzalez Ortiz, Arnav Singhvi, Xabi Andrade, Cindy Wang, Kartik Sreenivasan, Sam Havens, Jialu Liu, Peyton DeNiro, Wen Sun, Michael Bendersky, Jonathan Frankle
    arXiv, 2026
    πŸ“„ paper

  • SubSearch: Intermediate Rewards for Unsupervised Guided Reasoning in Complex Retrieval
    Roxana Petcu, Evangelos Kanoulas, Maarten de Rijke
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries
    Qingying Niu, Ruiyang Ren, Wayne Xin Zhao, Yaliang Li
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation
    Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang
    arXiv, 2026
    πŸ“„ paper

Data Synthesis

  • HopWeaver: Cross-Document Synthesis of High-Quality and Authentic Multi-Hop Questions
    Zhiyu Shen, Jiyuan Liu, Yunhe Pang, Yanghui Rao, Fu Lee Wang, Jianxing Yu
    ACL, 2026
    πŸ“„ paper | πŸ› οΈ code

  • SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesis
    Shuang Sun, Huatong Song, Yuhao Wang, Ruiyang Ren, Jinhao Jiang, Junjie Zhang, Fei Bai, Jia Deng, Wayne Xin Zhao, Zheng Liu, Lei Fang, Zhongyuan Wang, Ji-Rong Wen. EMNLP Findings, 2025
    πŸ“„ paper | πŸ› οΈ code

  • WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization
    Zhengwei Tao, Jialong Wu, Wenbiao Yin, Junkai Zhang, Baixuan Li, Haiyang Shen, Kuan Li, Liwen Zhang, Xinyu Wang, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

Analysis & Ablations

Empirical studies analyzing reinforcement learning dynamics and reward design for agentic search training.

  • Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
    Wenlin Zhang, Xiangyang Li, Kuicai Dong, Yichao Wang, Pengyue Jia, Xiaopeng Li, Yingyi Zhang, Derong Xu, Zhaocheng Du, Huifeng Guo, Ruiming Tang, Xiangyu Zhao
    arXiv, 2025
    πŸ“„ paper

  • An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents
    Bowen Jin, Jinsung Yoon, Priyanka Kargupta, Sercan Γ–. ArΔ±k, Jiawei Han
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?
    Yibo Zhao, Zichen Ding, Jiayi Wu, Zun Wang, Xiang Li
    arXiv, 2026
    πŸ“„ paper

  • HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards
    Zhuowen Liu, Bohan Cui, YinShang Guo, Yuting Wang, Hao Li
    arXiv, 2026
    πŸ“„ paper

Systems & Benchmarks

Systems & Frameworks

End-to-end systems, serving-efficiency work, and open multi-agent frameworks.

  • Demystifying and Enhancing the Efficiency of LLM-Based Search Agents (SearchAgent-X)
    Tiannuo Yang, Zebin Yao, Bowen Jin, Lixiao Cui, Yusen Li, Gang Wang, Xiaoguang Liu
    ICLR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • ManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent Framework
    Lisheng Huang, Yichen Liu, Jinhao Jiang, Rongxiang Zhang, Jiahao Yan, Junyi Li, Wayne Xin Zhao
    EMNLP, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Tongyi DeepResearch Technical Report
    Tongyi DeepResearch Team
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

Benchmarks

  • HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering
    Zhilin Yang, Peng Qi, Saizheng Zhang, Yoshua Bengio, William W. Cohen, Ruslan Salakhutdinov, Christopher D. Manning
    EMNLP, 2018
    πŸ“„ paper | πŸ› οΈ code

  • MuSiQue: Multihop Questions via Single-hop Question Composition
    Harsh Trivedi, Niranjan Balasubramanian, Tushar Khot, Ashish Sabharwal
    TACL, 2022
    πŸ“„ paper | πŸ› οΈ code

  • GAIA: A Benchmark for General AI Assistants
    GrΓ©goire Mialon, ClΓ©mentine Fourrier, Craig Swift, Thomas Wolf, Yann LeCun, Thomas Scialom
    ICLR, 2024
    πŸ“„ paper

  • Researchy Questions: A Dataset of Multi-Perspective, Decompositional Questions for Deep Research
    Corby Rosset, Ho-Lam Chung, Guanghui Qin, Ethan C. Chau, Zhuo Feng, Ahmed Awadallah, Jennifer Neville, Nikhil Rao
    SIGIR, 2025
    πŸ“„ paper

  • BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval
    Hongjin Su, Howard Yen, Mengzhou Xia, Weijia Shi, Niklas Muennighoff, Han-yu Wang, Haisu Liu, Quan Shi, Zachary S. Siegel, Michael Tang, Ruoxi Sun, Jinsung Yoon, Sercan Γ–. Arik, Danqi Chen, Tao Yu
    ICLR, 2025
    πŸ“„ paper | πŸ› οΈ code

  • AssistantBench: Can Web Agents Solve Realistic and Time-Consuming Tasks?
    Ori Yoran, Samuel Joseph Amouyal, Chaitanya Malaviya, Ben Bogin, Ofir Press, Jonathan Berant
    EMNLP, 2024
    πŸ“„ paper | πŸ› οΈ code

  • FRAMES: Fact, Fetch, and Reason β€” A Unified Evaluation of Retrieval-Augmented Generation
    Satyapriya Krishna, Kalpesh Krishna, Anhad Mohananey, Steven Schwarcz, Adam Stambler, Shyam Upadhyay, Manaal Faruqui
    NAACL, 2025
    πŸ“„ paper

  • WebWalker: Benchmarking LLMs in Web Traversal
    Jialong Wu, Wenbiao Yin, Yong Jiang, Zhenglin Wang, Zekun Xi, Runnan Fang, Linhai Zhang, Yulan He, Deyu Zhou, Pengjun Xie, Fei Huang
    ACL, 2025
    πŸ“„ paper

  • Humanity's Last Exam (HLE)
    Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, et al.
    arXiv, 2025
    πŸ“„ paper

  • BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents
    Jason Wei, Zhiqing Sun, Spencer Papay, Scott McKinney, Jeffrey Han, Isa Fulford, Hyung Won Chung, Alex Tachard Passos, William Fedus, Amelia Glaese
    arXiv, 2025
    πŸ“„ paper

  • BrowseComp-ZH: Benchmarking Web Browsing Ability of LLMs in Chinese
    Peilin Zhou, Bruce Leon, Xiang Ying, Can Zhang, Yifan Shao, Qichen Ye, Dading Chong, Zhiling Jin, Chenxuan Xie, Meng Cao, Yuxin Gu, Sixin Hong, Jing Ren, Jian Chen, Chao Liu, Yining Hua. arXiv, 2025
    πŸ“„ paper

  • InfoDeepSeek: Benchmarking Agentic Information Seeking for Retrieval-Augmented Generation
    Yunjia Xi, Jianghao Lin, Menghui Zhu, Yongzhao Xiao, Zhuoying Ou, Jiaqi Liu, Tong Wan, Bo Chen, Weiwen Liu, Yasheng Wang, Ruiming Tang, Weinan Zhang, Yong Yu
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
    Mingxuan Du, Benfeng Xu, Chiwei Zhu, Xiaorui Wang, Zhendong Mao
    arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • Dr. Bench: A Multidimensional Evaluation for Deep Research Agents, from Answers to Reports Yang Yao, Yixu Wang, Yuxuan Zhang, Yi Lu, Tianle Gu, Lingyu Li, Dingyi Zhao, Keming Wu, Haozhe Wang, Ping Nie, Yan Teng, Yingchun Wang arXiv, 2025 πŸ“„ paper | πŸ› οΈ code

  • Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge
    Boyu Gou, Zanming Huang, Yuting Ning, Yu Gu, Michael Lin, Weijian Qi, Andrei Kopanev, Botao Yu, Bernal Jimenez Gutierrez, Yiheng Shu, Chan Hee Song, Jiaman Wu, Shijie Chen, Hanane Moussa, Tianshu Zhang, Jian Xie, Yifei Li, Tianci Xue, Zeyi Liao, Kai Zhang, Boyuan Zheng, Zhaowei Cai, Viktor Rozgic, Morteza Ziyadi, Huan Sun, Yu Su
    NeurIPS, 2025
    πŸ“„ paper | πŸ› οΈ code

  • BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agents
    Zijian Chen, Xueguang Ma, Shengyao Zhuang, Ping Nie, Kai Zou, Andrew Liu, Joshua Green, Kshama Patel, Ruoxi Meng, Mingyi Su, Sahel Sharifymoghaddam, Yanxi Li, Haoran Hong, Xinyu Shi, Xuye Liu, Nandan Thakur, Crystina Zhang, Luyu Gao, Wenhu Chen, Jimmy Lin. arXiv, 2025
    πŸ“„ paper

  • Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus (XBCP)
    Yuheng Lu, Qingcheng Zeng, Heli Qi, Puxuan Yu, Fuheng Zhao, Rui Yang, Hitomi Yanaka, Naoto Yokoya, Weihao Xuan
    arXiv, 2026
    πŸ“„ paper

  • Projecting BrowseComp-Plus onto ClimbMix: Toward More Realistic Corpora for Agentic Search
    Sahel Sharifymoghaddam, Lingwei Gu, Yijun Ge, Jimmy Lin
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • WideSearch: Benchmarking Agentic Broad Info-Seeking
    Ryan Wong, Jiawei Wang, Junjie Zhao, Li Chen, Yan Gao, Long Zhang, Xuan Zhou, Zuo Wang, Kai Xiang, Ge Zhang, Wenhao Huang, Yang Wang, Ke Wang
    ICLR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • InteractComp: Evaluating Search Agents With Ambiguous Queries
    Mingyi Deng, Lijun Huang, Yani Fan, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, Xiangru Tang, Nan Tang, Chenglin Wu, Yuyu Luo. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ code

  • One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents (IDRBench)
    Yingchaojie Feng, Qiang Huang, Xiaoya Xie, Zhaorui Yang, Jun Yu, Wei Chen, Anthony K. H. Tung
    arXiv, 2026
    πŸ“„ paper

  • DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent
    Tongzhou Wu, Yuhao Wang, Xinyu Ma, Xiuqiang He, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao
    SIGIR, 2026
    πŸ“„ paper | πŸ› οΈ code

  • PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR
    James Burgess, Jan N. Hansen, Duo Peng, Yuhui Zhang, Alejandro Lozano, Min Woo Sun, Emma Lundberg, Serena Yeung-Levy
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code

  • DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation
    Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma
    arXiv, 2026
    πŸ“„ paper

  • ClawBench: Can AI Agents Complete Everyday Online Tasks?
    Yuxuan Zhang, Yubo Wang, Yipeng Zhu, Penghui Du, Junwen Miao, Xuan Lu, Zhuofeng Li, Xingwei Qu, Dongfu Jiang, Ping Nie, Jiaheng Liu, Wenhu Chen, Kelsey R. Allen, et al.
    arXiv, 2026
    πŸ“„ paper | πŸ› οΈ code | 🌐 project

  • VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval
    Lexiang Hu, Yanzhao Zhang, Mingxin Li, Dingkun Long, Yikang Li, Fuwei Zhang, Yisen Wang, Zhouchen Lin
    arXiv, 2026
    πŸ“„ paper | 🌐 project

  • Q2D-Web: A Large-Scale Benchmark for Retrieval in Agentic RAG Systems
    Maximilian Schall, Sedigheh Eslami, Markus Krimmel, Antoine Chaffin, Louis Milliken, Bo Wang, Denis Bykov
    arXiv, 2026
    πŸ“„ paper | 🌐 leaderboard

  • Benchmarking Hybrid Deep Research Across Database Querying and Web Search (HybridDeepResearch)
    Ruofan Wu, Peiran Xu, Xiaolong Li, Fan Shu, Soyoung Yoon, Yite Wang, Xiaodong Yu, Boyi Liu, Feng Yan, Debiao Li, Yuxiong He, Zhewei Yao
    arXiv, 2026
    πŸ“„ paper

Resources

Surveys & Position Papers

  • Towards AI Search Paradigm
    Yuchen Li, Hengyi Cai, Rui Kong, Xinran Chen, Jiamin Chen, Jun Yang, Haojie Zhang, Jiayi Li, Jiayi Wu, Yiqun Chen, Changle Qu, Wenwen Ye, Lixin Su, Xinyu Ma, Lingyong Yan, Long Xia, Daiting Shi, Junfeng Wang, Xiangyu Zhao, Jiashu Zhao, Haoyi Xiong, Shuaiqiang Wang, Dawei Yin
    arXiv, 2025
    πŸ“„ paper

  • Deep Research Agents: A Systematic Examination And Roadmap
    Yuxuan Huang, Yihang Chen, Haozheng Zhang, Kang Li, Huichi Zhou, Meng Fang, Linyi Yang, Xiaoguang Li, Lifeng Shang, Songcen Xu, Jianye Hao, Kun Shao, Jun Wang. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ repo

  • From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents
    Weizhi Zhang, Yangning Li, Yuanchen Bei, Junyu Luo, Guancheng Wan, Liangwei Yang, Chenxuan Xie, Yuyao Yang, Wei-Chieh Huang, Chunyu Miao, Henry Peng Zou, Xiao Luo, Yusheng Zhao, Yankai Chen, Chunkit Chan, Peilin Zhou, Xinyang Zhang, Chenwei Zhang, Jingbo Shang, Ming Zhang, Yangqiu Song, Irwin King, Philip S. Yu. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ repo

  • Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMs
    Yangning Li, Weizhi Zhang, Yuyao Yang, Wei-Chieh Huang, Yaozu Wu, Junyu Luo, Yuanchen Bei, Henry Peng Zou, Xiao Luo, Yusheng Zhao, Chunkit Chan, Yankai Chen, Zhongfen Deng, Yinghui Li, Hai-Tao Zheng, Dongyuan Li, Renhe Jiang, Ming Zhang, Yangqiu Song, Philip S. Yu. EMNLP Findings, 2025
    πŸ“„ paper | πŸ› οΈ repo

  • A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges
    Yunjia Xi, Jianghao Lin, Yongzhao Xiao, Zheli Zhou, Rong Shan, Te Gao, Jiachen Zhu, Weiwen Liu, Yong Yu, Weinan Zhang. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ repo

  • The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
    Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ repo

  • Reinforcement Learning Foundations for Deep Research Systems: A Survey
    Wenjun Li, Zhi Chen, Jingru Lin, Hannan Cao, Wei Han, Sheng Liang, Zhi Zhang, Kuicai Dong, Dexun Li, Chen Zhang, Yong Liu. arXiv, 2025
    πŸ“„ paper

  • A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications Minhua Lin, Zongyu Wu, Zhichao Xu, Hui Liu, Xianfeng Tang, Qi He, Charu Aggarwal, Hui Liu, Xiang Zhang, Suhang Wang. arXiv, 2025
    πŸ“„ paper | πŸ› οΈ repo

List Maintainers

Francesco Benocci (ISTI-CNR, Pisa, Italy)

About

An extensive and commented list of resources on agentic search and agentic deep research

Topics

Resources

Stars

14 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages