IR Evaluation

IR: Information Retrieval

Momentum

15 papers in the last four weeks, up 36% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 122

All topics
CardsList
  1. Superintelligent Retrieval Agent: The Next Frontier of Agentic Retrieval

    May 7, 2026Zeyu Yang, Qi Ma, Jason Chen +1Agentic RetrievalInformation Retrieval

  2. OBLIQ-Bench: Exposing Overlooked Bottlenecks in Modern Retrievers with Latent and Implicit Queries

    May 7, 2026Diane Tchuindjo, Devavrat Shah, Omar KhattabInformation RetrievalIR Evaluation

  3. DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

    May 6, 2026Bryan Li, William Walden, Yu Hou +6Language Model Generation EvaluationRAG Evaluation

  4. Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems

    May 5, 2026Yilun Zhao, Jinbiao Wei, Tingyu Song +3Agentic SearchSynthetic Data Generation

  5. Reproducing Complex Set-Compositional Information Retrieval

    May 5, 2026Vincent Degenhart, Dewi Timman, Arjen P. de Vries +2Query ComplexityLexical Retrieval

  6. Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

    May 3, 2026Zhuofeng Li, Haoxiang Zhang, Cong Wei +16Agentic SearchIR Evaluation

  7. FollowTable: A Benchmark for Instruction-Following Table Retrieval

    May 1, 2026Rihui Jin, Yuchen Lu, Ting Zhang +7Information RetrievalTable Retrieval

  8. How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews

    Apr 30, 2026Riley Grossman, Songjiang Liu, Michael K. Chen +3Generative Engine OptimizationGenerative Retrieval

  9. A Survey of Reasoning-Intensive Retrieval: Progress and Challenges

    Apr 30, 2026Yiyang Wei, Tingyu Song, Siyue Zhang +1LLM RerankingIR Evaluation

  10. A Reproducibility Study of LLM-Based Query Reformulation

    Apr 30, 2026Amin Bigdeli, Radin Hamidi Rad, Hai Son Le +4LLM EvaluationLLM Prompting

  11. Hypencoder Revisited: Reproducibility and Analysis of Non-Linear Scoring for First-Stage Retrieval

    Apr 29, 2026Arne Eichholtz, Yongkang Li, Jutte Vijverberg +2Learning to RankHypernetworks

  12. Health System Scale Semantic Search Across Unstructured Clinical Notes

    Apr 28, 2026Faith Wavinya Mutinda, Spandana Makeneni, Anna Lin +14HealthcareSemantic Search

  13. Citation-Driven Multi-View Training for Patent Embeddings: QaECTER and Sophia-Bench

    Apr 24, 2026Younes Djemmal, You Zuo, Kim Gerdes +1Legal IRText Embedding Models

  14. A Large-Scale, Cross-Disciplinary Corpus of Systematic Reviews

    Apr 23, 2026Pierre Achkar, Tim Gollub, Arno Simons +2Evidence SelectionDocument Information Extraction

  15. Semantic Recall for Vector Search

    Apr 22, 2026Leonardo Kuffo, Ioanna Tsakalidou, Roberta De Viti +3IR EvaluationApproximate Nearest Neighbor Search

  16. Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies

    Apr 20, 2026Lorenz Brehme, Thomas Ströhle, Ruth BreuMulti-Hop QALLM-as-a-Judge

  17. TeleEmbedBench: A Multi-Corpus Embedding Benchmark for RAG in Telecommunications

    Apr 20, 2026Pranshav Gajjar, Vijay K ShahText Embedding EvaluationText Embedding Models

  18. SeekerGym: A Benchmark for Reliable Information Seeking

    Apr 18, 2026Remy Kim, Minseung Lee, Shuo Li +1AI Agent ReliabilityAgentic Search

  19. JFinTEB: Japanese Financial Text Embedding Benchmark

    Apr 17, 2026Masahiro Suzuki, Hiroki SakajiText Embedding EvaluationText Embedding Models

  20. UsefulBench: Towards Decision-Useful Information as a Target for Information Retrieval

    Apr 17, 2026Tobias Schimanski, Stefanie Lewandowski, Christian Woerle +3Information RetrievalIR Evaluation

  21. LMEB: Long-horizon Memory Embedding Benchmark

    Mar 13, 2026Xinping Zhao, Xinshuo Hu, Jiaxin Xu +9Text Embedding EvaluationIR Evaluation

  22. Diagnosing LLM Reranker Behavior Under Fixed Evidence Pools

    Feb 20, 2026Baris Arat, Emre SeferLLM EvaluationLLM Reranking

  23. SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise

    Feb 13, 2026Yuejie Li, Ke Yang, Yueying Hua +4Noise RobustnessIR Evaluation

  24. WebArxiv: A Reproducible Benchmark for Evaluating Multimodal Web Agents on arXiv Tasks

    Jul 1, 2025Zihao Sun, Zijing Shi, Ling ChenWeb Agent BenchmarksMultimodal Agents