IR Evaluation

IR: Information Retrieval

Momentum

15 papers in the last four weeks, up 36% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 122

All topics
CardsList
  1. Entity Labels Are Not Entity Signals: A Framework for Observable Relevance in Document Re-Ranking

    Jun 14, 2026Utshab Kumar Ghosh, Shubham ChatterjeeLearning to RankInformation Retrieval

  2. GIScholarBench: Benchmarking LLM Overconfidence in GIS Research

    Jun 6, 2026Zongrng Li, Mingzheng Yang, Lei Zou +8LLM EvaluationAI-Assisted Scientific Research

  3. PaperFlow: Profiling, Recommending, and Adapting Across Daily Paper Streams

    Jun 5, 2026Fuqiang Wang, Song Tan, Zheng Guo +8Information RetrievalRecommender Systems

  4. Meaning in Order, Order in Meaning: Semantic R-precision for Keyphrase Evaluation

    Jun 5, 2026Shamira Venturini, Steffen KinkelAutomated EvaluationIR Evaluation

  5. QO-Bench: Diagnosing Query-Operator-Preserving Retrieval over Typed Event Tuples

    Jun 3, 2026Mengao Zhang, Xiang Yang, Chang Liu +2Information RetrievalRAG Evaluation

  6. ANN Search: Recall What Matters

    Jun 3, 2026Dimitris Dimitropoulos, Nikos MamoulisIR EvaluationApproximate Nearest Neighbor Search

  7. Variance Reduction for Heavy-Tailed Monetization Metrics in Ranking Experiments via Post-Stratification

    Jun 2, 2026Neeti Pokharna, Olivier Jeunen, Yatharth Saraf +1Causal Effect EstimationA/b Testing

  8. Do Neural Retrievers Prefer Certain Documents? Evidence of Learned Relevance Priors

    Jun 1, 2026Francisco Valentini, Edgar Altszyler, Martin FajcikIR EvaluationDense Retrieval

  9. CanLegalRAGBench: Evaluating Retrieval-Augmented Generation on Canadian Case Law

    May 28, 2026Ethan Zhao, Maksym Taranukhin, Wei Cui +2Retrieval-Augmented GenerationLegal QA

  10. Rethinking Literature Search Evaluation: Deep Research Helps, and Human Citation Lists Are Not a Ground Truth

    May 28, 2026Gaurav Sahu, Laurent Charlin, Christopher PalLLM RerankingInformation Retrieval

  11. Do Agents Need Semantic Metadata? A Comparative Study in Agentic Data Retrieval

    May 27, 2026Shiyu Chen, Tarfah Alrashed, Alon Halevy +1LLM Agent EvaluationAgentic Retrieval

  12. Plans for Evaluating Structured Generative Search Summaries

    May 26, 2026Tetsuya Sakai, Jina Lee, Hanpei Fang +1Language Model Generation EvaluationSummarization Evaluation

  13. Resolving Ambiguity in Composed Image Retrieval via Calibrated Interaction

    May 23, 2026Amsisan Tran, Baogh Le, Tuan Kiet Pham +1Conversational SearchImage Retrieval

  14. Benchmarking Patent Embeddings: A Multi-Task Evaluation of 22 Models Across Retrieval, Classification, and Clustering

    May 22, 2026Amirhossein Yousefiramandi, Ciaran CooneyLegal IRClustering

  15. IdioLink: Retrieving Meaning Beyond Words Across Idiomatic and Literal Expressions

    May 21, 2026Kai Golan Hashiloni, Daniel Fadlon, Lior Livyatan +3Figurative Language UnderstandingSemantic Search

  16. SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval

    May 21, 2026Ningyuan Li, Haiyang Shen, Mugeng Liu +4Web Search AgentsAI Agent Benchmarks

  17. MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks

    May 20, 2026Junhao Ruan, Abudukeyumu Abudula, Bei Li +8Conversational SearchSynthetic Benchmark Generation

  18. Chunking German Legal Code

    May 19, 2026Max Prior, Natalia Milanova, Andreas SchultzDocument ChunkingRetrieval-Augmented Generation

  19. CommitDistill: A Lightweight Knowledge-Centric Memory Layer for Software Repositories

    May 18, 2026Divya Chukkapalli, Thejesh Avula, Aditya Aggarwal +2Agent MemorySoftware Engineering Agents

  20. The 99% Success Paradox: When Near-Perfect Retrieval Equals Random Selection

    May 14, 2026Vyzantinos Repantis, Harshvardhan Singh, Tony Joseph +5IR Evaluation

  21. Useful for Exploration, Risky for Precision: Evaluating AI Tools in Academic Research

    May 11, 2026Anthea Dathe, Kiran Hoffmann, Aline MangoldAI-Assisted Scientific ResearchScientific Reproducibility

  22. Matching Meaning at Scale: Evaluating Semantic Search for 18th-Century Intellectual History through the Case of Locke

    May 10, 2026Yu Wu, Ananth Mahadevan, Filip Ginter +2Historical Document AnalysisSemantic Textual Similarity

  23. TRACE: Tourism Recommendation with Accountable Citation Evidence

    May 8, 2026Zixu Zhao, Sijin Wang, Yu Hou +6Recommender SystemsIR Evaluation