Mmlu-Pro

Momentum

5 papers in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 25

All topics
CardsList
  1. Measuring Collapse and Correction in Homogeneous-Panel LLM Debate

    Sep 28, 2026Xin Li, Mengbing Liu, Chau YuenDebateLarge Language Model Decisions

  2. Disaggregated Quantization: Specializing LLM Prefill and Decode

    Sep 22, 2026Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi +2Large Language Model QuantizationQuantizer

  3. Turkish MMLU Pro: Traceable Option Augmentation and Its Validity Limits in Turkish Multiple-Choice Evaluation

    Sep 14, 2026M. Ali BayramMultiple-Choice QuestionsMmlu-Pro

  4. Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models

    Aug 8, 2026Ali Janati, Kaoutar El Maghraoui, Chengke Zou +2ExpertsLow-Rank Adaptation Framework

  5. Shorter Reasoning, Earlier Answers? An Evaluation of Reasoning Interfaces

    Aug 4, 2026Francesca Carlon, Vincent Ginis, Andres AlgabaReasoning TracesMmlu-Pro

  6. Understanding Tone-Dependent Inference Cost in Large Language Models

    Jul 27, 2026Akhil Kumar, Om DobariyaInference CostMmlu-Pro

  7. Building a European Multilingual Evaluation Dataset: The MMLU Localisation Project within the EMT Network

    Jul 20, 2026Pilar Sánchez-Gijón, Susana Valdez, Sofía Calvo Del Barrio +3MultilingualMmlu-Pro

  8. Capability Provenance in Language Models: A Case Study in Social Reasoning

    Jun 17, 2026Glenn Matlin, Chandreyi Chakraborty, Saehee Eom +8Social ReasoningReasoning Skills

  9. Decompose Sparsely Where You Should, Absorb Densely Where You Should No

    Jun 12, 2026Ruixuan Deng, Zehao Jin, Zekun Wang +1Improving Sparse AutoencodersSparsity

  10. Resolution Diagnostics for Paired LLM Evaluation

    May 28, 2026Anany KotawalaLarge Language Model EvaluationSpearman Correlation

  11. Law of Neural Interaction: Depth-Width Shape, Interaction Efficiency, and Generalization

    May 27, 2026Wenjie Sun, Jinning Yang, Shuai Zhang +1Interaction PredictionMmlu-Pro

  12. K-Quantization and its Impact on Output Performance

    May 19, 2026Robin Baki Davidsson, Pierre NuguesLarge Language Model QuantizationMmlu-Pro

  13. Benchmarking Local Language Models for Social Robots using Edge Devices

    May 4, 2026Dorian Lamouille, Matevž B. Zorec, Farnaz Baksh +1Small Large Language ModelsLarge Language Model Benchmarks

  14. Multilingual Refusal Alignment for Safer Large Language Models

    Apr 24, 2026Aleksandra Krasnodębska, Wojciech Kusa, Aldo LipaniMultilingual SafetyLarge Language Model Alignment

  15. Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas

    Apr 21, 2026Jon-Paul CacioliMmlu-ProMulti-Turn Benchmark

  16. Modeling LLM Unlearning as an Asymmetric Two-Task Learning Problem

    Apr 16, 2026Zeguan Xiao, Siqing Li, Yong Wang +4Large Language Model UnlearningLarge Language Model Training

  17. UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding

    Date pendingAhmer Tabassum, Sarfraz Ahmad, Hasan Iqbal +3UrduMultilingual Benchmark