IR Evaluation

IR: Information Retrieval

Momentum

15 papers in the last four weeks, up 36% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 122

All topics
CardsList
  1. Language Models for Page-Level Layout Decisions in E-commerce Search

    Oct 7, 2026Varun Joshi, Eva C. Song, ChengXiang ZhaiE-Commerce SearchIR Evaluation

  2. Towards Explaining Query Expansion Performance in Information Retrieval

    Oct 7, 2026Sourav Saha, Aditya Dutta, Soumajit Pramanik +1Information RetrievalQuery Expansion

  3. A Systematic Study of Semantic ID Spaces for Generative Information Retrieval

    Oct 6, 2026Alexia Allal, Hicham Randrianarivo, Sylvain LamprierResidual VQVector Quantization

  4. Beyond Semantic Similarity: Performance and Costs of Agentic Retrieval for Complex Tasks

    Oct 5, 2026Reza Esfandiarpoor, Radek Osmulski, Yauhen Babakhin +8Agentic RetrievalInformation Retrieval

  5. Better Retrieval, Limited Clustering Gains: A Controlled Study of Multilingual Company Entity Resolution

    Oct 4, 2026Yijiashun Qi, Yuxuan Li, Hanzhe GuoEntity ResolutionClustering

  6. ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research

    Oct 1, 2026Sohyeon Kim, Yoonho Lee, Bo Liu +11AI Agents for Scientific DiscoveryAgentic Search

  7. Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts

    Sep 29, 2026Hongmin Li, Wanli ZhaoAI Agent AuditingScientific QA

  8. Generated Query Expansion Still Helps Strong Sparse Retrieval: A Controlled Study with SPLADE-v3

    Sep 29, 2026Ryan C. Barron, Cade W. Trotter, Maksim E. Eren +3Learned Sparse RetrievalLexical Retrieval

  9. Beyond Readability: Evaluating Task Information Recoverability

    Sep 29, 2026Yiwei LiuIR EvaluationOptical Character Recognition

  10. READ-Bench: Benchmarking Historical Instance Retrieval for Time-Series Diagnosis

    Sep 26, 2026Gerardo Pastrana, Haojun Li, Dhruv Mehta +4Temporal IRIR Evaluation

  11. SEEK: Skill-Routed Evaluation with Evolvable Knowledge for Industrial Search

    Sep 24, 2026Zhongxin Huang, Songyang Li, Renzhe Zhou +5LLM EvaluationAutomated Evaluation

  12. FinFIRST: Benchmarking Search Agents for Financial Information Retrieval, Sourcing and Traceability

    Sep 21, 2026Wenqing Wang, Haitao Xiang, Xinyi Zhao +8Financial QAAI Agent Benchmarks

  13. Re:CAP - Auditing Retrieval Coverage in Production RAG Pipelines

    Sep 21, 2026Aviral Joshi, Hanoz Bhathena, Max Nelson +1RAG EvaluationIR Evaluation

  14. TRACE: Accountable Agentic Retrieval for Source Discovery in Digital Archives

    Sep 17, 2026Donghan Bian, Marie Puren, Florian CafieroData ProvenanceAgentic Retrieval

  15. Diagnosing the Fact-Grounding Gap in Multi-Hop Question Answering

    Sep 15, 2026Kevin Mo, Nathan Mo, Richard ZhuMulti-Hop QAMulti-Hop Reasoning

  16. Q2D-Web: A Large-Scale Benchmark for Retrieval in Agentic RAG Systems

    Sep 8, 2026Maximilian Schall, Sedigheh Eslami, Markus Krimmel +4Agentic RetrievalMultilingual IR

  17. OntologyBench: Can Dense Retrieval Satisfy Structured Biomedical Constraints?

    Sep 8, 2026Xiao Yu Cindy Zhang, Wyeth Wasserman, Jian ZhuInformation RetrievalBiomedical IR

  18. Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines

    Sep 4, 2026Siddharth Vohra, Runmin Jiang, Xiaomo Li +1Question AnsweringRAG Evaluation

  19. SHELF: A Synthetic Harness for Multi-Task Bibliographic Benchmarking

    Sep 2, 2026Michael J. BommaritoLLM EvaluationLibrary and Information Science

  20. Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories

    Sep 1, 2026Nabira Rashid, Manolis KellisLLM RerankingInformation Retrieval

  21. RATIO: A Benchmark for Retrieval Across Typed Ideation Operations in Scientific Literature

    Aug 27, 2026Maayan Sharon, Tom HopeAI-Assisted Scientific ResearchIR Evaluation

  22. The "Curse of Knowledge" in LLM Query Simulation: Concept Provenance for Tracing Answer-Side Intrusion

    Aug 26, 2026Chenglong Ma, Xinye Wanyan, Danula Hettiachchi +2LLM AuditingIR Evaluation

  23. GreekBarRetrieval: A Benchmark for Greek Statutory Retrieval

    Aug 19, 2026Ernest Beta, Odysseas S. Chlapanis, Dimitrios Galanis +1Legal IRQuery Reformulation

  24. Post-Calibration Reliability Reranking of Relevance Decisions via Label-wise Monotone Projection

    Aug 11, 2026Inwoo Tae, Yongjae LeePost-Hoc CalibrationIR Evaluation

  25. Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

    Aug 11, 2026Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie +1LLM EvaluationLLM-as-a-Judge