Chatbot Arena

Momentum

3 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 18

All topics
CardsList
  1. XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?

    Sep 10, 2026Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein +1XaiExplainable Artificial Intelligence

  2. DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation

    Aug 11, 2026Xiaotong Wang, Dazhen DengChatbot Arena

  3. CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models

    Jul 27, 2026Dengzhe Hou, Lingyu Jiang, Fangzhou Lin +1Cognitive ScienceChatbot Arena

  4. LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports

    Jul 27, 2026Jonas Schröder, Jonas Schweisthal, Oliver Müller +2Large Language Model ForecastingChatbot Arena

  5. SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

    Jun 24, 2026Yeqi Feng, Yuxin Chen, Tianxing HeNegotiationChatbot Arena

  6. AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

    Jun 16, 2026Jiahui Niu, Huizi Yu, Wenkong Wang +11Large Language Model EvaluationReal-World Clinical Workflows

  7. ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer

    Jun 4, 2026Jintao Huang, Xiaomin Li, Gaurav Mittal +1Agentic FrameworkChatbot Arena

  8. For How Long Should We Be Punching? Learning Action Duration in Fighting Games

    May 20, 2026Hoang Hai Nguyen, Kurt Driessens, Dennis J. N. J. SoemersChatbot Arena

  9. Generalized Priority-Aware Shapley Value

    May 14, 2026Kiljae Lee, Ziqi Liu, Weijing Tang +1Shapley ValuePrioritization

  10. Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards

    Apr 23, 2026Minji Jung, Minjae Lee, Yejin Kim +2LeaderboardChatbot Arena

  11. LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition

    Oct 10, 2025Yushuo Zheng, Tongrui Ye, Zicheng Zhang +3Chatbot ArenaLarge Multimodal Models

  12. Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings

    Aug 16, 2025Jenny Y. Huang, Yunyi Shen, Dennis Wei +1RankingChatbot Arena