Prompt Sensitivity

Momentum

9 papers in the last four weeks, down 10% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 68

All topics
CardsList
  1. Old Ideas, Novel Problems: The Instability of LLM-Based Novelty Evaluation

    Oct 1, 2026Noy Sternlicht, Simra Shahid, Peter Jansen +3Prompt SensitivityLLM-as-a-Judge

  2. Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs

    Oct 1, 2026Nagham Omar, Mahmoud Jabarin, Maya Rozenshtein +3Prompt SensitivityLLM Evaluation

  3. Semifactual Credit-Augmented Policy Optimization

    Sep 30, 2026Junshu Pan, Zhizhang Fu, Shulin Huang +5Prompt SensitivityRL for Language Model Reasoning

  4. Pass or Fail? Evaluating LLMs on Two Greek Examination Benchmarks

    Sep 28, 2026Panagiota Kyriazi, Eleni Kasoura, Prokopis ProkopidisMultilingual Language Model EvaluationPrompt Sensitivity

  5. Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams

    Sep 24, 2026Ali Habibullah, Yazan Alshoibi, Mohammad Alshiekh +2Prompt SensitivityLLM-as-a-Judge

  6. Memory vs. Context? Influential Factors of Factual Recall in Language Models

    Sep 21, 2026Guilhem Fouilhé, Nicholas Asher, Philippe MullerPrompt SensitivityMemorization in Language Models

  7. Cross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models

    Sep 17, 2026Farooq Ahmad Wani, Maria Sofia Bucarelli, Mujtaba Hussain Mirza +5VLM RobustnessPrompt Sensitivity

  8. IchthyoNoma: Nomenclature and Context Sensitivity of Zero-Shot Biological Vision--Language Models for Bangladeshi Freshwater Fish Recognition

    Sep 3, 2026Nazim-E-Alam, Tarek Rahman, Md Kishor MorolVLM RobustnessPrompt Sensitivity

  9. Analysis of Prompt Engineering for Drug Toxicity Prediction

    Sep 3, 2026Mia MacGregor, Aakash Welgamage Don, Mark BartlettPrompt SensitivityLLM Prompting

  10. Prompt-Robust Language Models: Which Training Strategies Work?

    Sep 1, 2026Frederic Sadrieh, Michal ŠtefánikPrompt SensitivityLLM Fine-Tuning

  11. StateSwap: Probing Support-Elimination Hidden States in Multiple-Choice Questions

    Sep 1, 2026Chao Gao, Haijiang Liu, Qiyuan Li +3Prompt SensitivityMultiple-Choice Question Answering

  12. The Fragility of Jailbreak Robustness Across Operational States

    Aug 31, 2026Yuna Park, Hwang Youn Kim, Yujin Kim +3Prompt SensitivityLanguage Model Safety Evaluation

  13. Beyond the Payload: How User Invocation Shapes Coding Agent Vulnerability to Repository Poisoning

    Aug 31, 2026Fukang Zhu, Binbin Zhao, Ruixiao Lin +3Prompt SensitivityAI Coding Agents

  14. The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

    Aug 12, 2026Shailja Thakur, Sungeun An, Chad DeLuca +1Prompt SensitivityLLM Evaluation

  15. Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

    Aug 10, 2026Siyang Wu, Yibo Jiang, Bryon AragamPrompt SensitivityLLM Evaluation

  16. When Do Task Vectors Interfere? Mapping the Validity Boundaries of Weight-Space Composition

    Aug 10, 2026Chencheng Zhu, Xiaoyang Li, Taotao CaiPrompt SensitivityWeight-Space Analysis

  17. Confirming Our Biases? Evaluating the Capabilities, Risks, and Societal Impact of Large Language Models

    Aug 7, 2026Mudar Adas, Polina Tsvilodub, Michael Franke +1Prompt SensitivityLLM Sycophancy

  18. The Transformer Revolution, Part 1: Dynamic Processing through Output-Weight Interconnections

    Aug 4, 2026Marco Giunti, Fabrizia Giulia GaravagliaTransformer InferencePrompt Sensitivity

  19. Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

    Aug 1, 2026Yongxi Zhou, Junwei Yao, Yuanzhe Liu +4LLM Safety BenchmarksPrompt Sensitivity

  20. Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing

    Jul 22, 2026Langchen Huang, Sebastian Padó, Franziska WeeberPrompt SensitivityLLM Interpretability

  21. Production and Perception in LLMs: A Token Probability Approach

    Jul 13, 2026Anna Marklová, Jiří Milička, Martina Vokáčová +1Prompt Sensitivity

  22. Understanding Evaluation Illusion in Diffusion Large Language Models

    Jun 28, 2026Hengxiang Zhang, Jiaxi Ren, Renchunzi Xie +1Prompt SensitivityLLM Evaluation

  23. Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions

    Jun 25, 2026Abla Bedoui, Ashley L. Greene, Mohammed CherkaouiPrompt SensitivityLLM Auditing

  24. Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

    Jun 20, 2026Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh RaoVLM EvaluationZero-Shot Learning