Language Model Ensembles

Momentum

15 papers in the last four weeks, up 400% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 93

All topics
CardsList
  1. JudgeMoE: Distributional Aggregation for LLM-as-a-Judge

    Oct 5, 2026Yiqi Liu, Joseph James, Yang Wang +3LLM EvaluationLLM-as-a-Judge

  2. Adapter Thickets: Splitting an RLVR Budget Beats Concentrating It

    Oct 1, 2026Jonathan Williams, Esin Tureci Karthik R. NarasimhanRL for Language Model ReasoningLow-Rank Adaptation

  3. Beyond Leaderboards: Tokenomics of Agentic Small Language Model Ensembles

    Oct 1, 2026Alexei N. Skurikhin, Emily M. Taylor, Nathan A. DeBardelebenLLM Inference EfficiencyLanguage Model Generation Evaluation

  4. RAIM: Robust Aggregation of Inexpensive Models for Hallucination Detection

    Sep 30, 2026Elia Onofri, Roberto Di PietroLLM EvaluationLLM-as-a-Judge

  5. Which Models Work Well Together? Measuring Heterogeneity for LLM Team Selection

    Sep 29, 2026Liangyu Teng, Hengsong Liu, Juncen Guo +4Language Model EnsemblesEnsemble Diversity

  6. MERGE: Multi-LLM Ensemble for Retrieval via Generative Enrichment

    Sep 29, 2026Tzu-I Ho, Yung-Yu Shih, Shang-Yu Su +2LLM PromptingAutomatic Prompt Optimization

  7. How Many Humans Are 32 LLM Judges Worth?

    Sep 18, 2026Chao Li, Yingying Yu, Yunfeng LiAnnotator DisagreementLLM-as-a-Judge

  8. Mo' Models, Mo' Problems: How to best select model pools when designing Multi-Agent Systems

    Sep 15, 2026Sara Vera Marjanović, Jiacheng Xu, Aleksandr Laptev +3Model SelectionMulti-Agent LLM Systems

  9. Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration

    Sep 14, 2026Gemma Zhang, Prachi Badarayani, Asmi Kumar +2LLM EvaluationLLM-as-a-Judge

  10. LLM-Enhanced Dual-Branch Learning for Large-Scale Multi-Label Text Classification

    Sep 14, 2026Hui Ye, Jing Zhang, Xiulong Yang +1Multi-Label ClassificationLanguage Model Ensembles

  11. Bag of Tricks or Bag of Myths? Reducing Modeling Complexity with Task Knowledge in Explainable Suicide Risk Assessment

    Sep 7, 2026Shlok Shelat, Shrey Salvi, Souvik Roy +2Language Model EnsemblesSuicide Risk Modeling

  12. Retrieval-Augmented Multi-Prompt Ensemble for Minor-Grain Breeding Information Extraction

    Sep 7, 2026Hang Zhao, Jiahao WangRetrieval-Augmented GenerationDocument Information Extraction

  13. Inferred Generative-Process Diversity Predicts Correlated Failure Across Language Models

    Sep 3, 2026Ross Tieman, Evan MarkouLLM ReliabilityLanguage Model Ensembles

  14. Unifying Conformal Language Tasks with In-Context Ensembles

    Sep 2, 2026Xiao Shi Huang, Chen-Yuan Lin, Bruce Kuwahara +2Conformal PredictionLanguage Model Ensembles

  15. When Do Supervised UQ Ensembles Improve LLM Hallucination Detection? A Robustness Study

    Aug 25, 2026Mohit Singh Chauhan, Vipin Gyanchandani, Dylan BouchardLLM Hallucination DetectionLLM Uncertainty Estimation

  16. Opportunity Is Not Realizability: Selection-Valid Diagnostics for Multi-LLM Routing

    Aug 8, 2026Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus SwaqeebModel SelectionLLM Evaluation

  17. Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination

    Aug 5, 2026Ruitong Li, Binjie Guo, Aisheng Mo +3LLM EvaluationLLM Answer Verification

  18. HomoEnsNER: Does Language Alignment Outperform Architectural Complexity in Gujarati Named Entity Recognition?

    Aug 4, 2026Chandrakant K. BhogayataNamed Entity RecognitionLanguage Model Ensembles

  19. Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct

    Jul 31, 2026Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau +2Language Model EnsemblesClinical Language Model Evaluation

  20. Reasoning Consensus: Structural Ensembling of LLM Reasoning via Weighted DAG Aggregation

    Jul 30, 2026Amruta Parulekar, Jinu Lee, Dilek Hakkani-Tür +1LLM Reasoning with GraphsLLM Interpretability

  21. RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning

    Jul 25, 2026Xi Chen, Hongru Zhou, Shiyu Feng +24Rare Disease DiagnosisHealthcare

  22. Verbalized Particle Posterior: Bayesian Inference over Natural Language Hypotheses

    Jul 25, 2026Yan Zhang, Shikan Lian, Shibo LiBayesian InferenceLanguage Model Ensembles

  23. PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity

    Jul 22, 2026Anmol Kankariya, Sercan Ö. ArıkTest-Time ScalingLanguage Model Ensembles