Language Model Robustness

Latest papers 338

All topics
CardsList
  1. Addressing Over-Refusal in LLMs with Competing Rewards

    Jun 30, 2026Taeyoun Kim, Aviral KumarRL for Language Model ReasoningLLM Safety

  2. Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues

    Jun 30, 2026Mohammadamin Shafiei, Shuyue Stella Li, Yulia TsvetkovLanguage Model Safety EvaluationLanguage Model Bias Evaluation

  3. Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies

    Jun 30, 2026Xudong Shen, Li Yuan, Ye Chen +3LLM EvaluationAdversarial Attacks on LLMs

  4. Beyond Clean Text: Evaluating Encoder and Decoder Robustness for Bangla Event Detection in Noisy Text

    Jun 29, 2026Tanvir Ahmed Sijan, S. M Golam Rifat, Nayeemul Islam +1Decoder-Only Language ModelsLow-Resource Language Processing

  5. Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

    Jun 29, 2026Avisha Das, Mihir Parmar, Mohana Ramnath +1Multilingual Language Model EvaluationInstruction Following

  6. AURORA: Asymmetry and Update-Induced Rotation for Robust Hallucination Detection in Large Language Models

    Jun 28, 2026Zishuai Zhang, Hainan Zhang, Zhiming ZhengHallucination in Language ModelsLLM Hallucination Detection

  7. Invariant Reasoning Directions in Latent Trajectories of Language Models

    Jun 28, 2026Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut +3Reasoning Consistency in Language ModelsImplicit Reasoning in Language Models

  8. Towards Reliable and Robust LLM Planning: Symbolic Feedback-Driven Iterative Self-Refinement Framework

    Jun 26, 2026Jiajing Zhang, Jiamei Jiang, Chenyang Zhang +3LLM Self-RefinementLLM Planning

  9. From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

    Jun 26, 2026Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen +3Uncertainty QuantificationHallucination in Language Models

  10. Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions

    Jun 25, 2026Abla Bedoui, Ashley L. Greene, Mohammed CherkaouiPrompt SensitivityLLM Auditing

  11. Diagnosing Task Insensitivity in Language Agents

    Jun 25, 2026Jingyu Liu, Xiaopeng Wu, Kehan Chen +2OOD GeneralizationLLM Agents

  12. LLM-Based Scientific Peer Review: Methods, Benchmarks, and Reliability Challenges

    Jun 23, 2026Thi Huyen Nguyen, Zahra AhmadiScholarly Peer ReviewLLM Security

  13. Evidence for feature-specific error correction in LLMs

    Jun 23, 2026Francisco Ferreira da Silva, Stefan HeimersheimLLM InterpretabilityLanguage Model Robustness

  14. WaveDetect: Robust Framework for Machine-Generated Text Detection via Wavelet Transform

    Jun 22, 2026Zhichen Liu, Kaitong Qin, Linhan He +1AI-Generated Text DetectionLanguage Model Robustness

  15. First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers

    Jun 21, 2026Arjun Pillai, Christian Hoang, Anjelo Jann LarozaMultilingual Language ModelsLLM Interpretability

  16. Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports

    Jun 17, 2026Qingyu Lu, Ruochen Li, Liang Ding +3Clinical Language Model EvaluationLanguage Model Robustness

  17. ChLogic: Evaluating Robustness of Logical Reasoning in Chinese Expressions

    Jun 16, 2026Peixian Zhou, Yuxu Chen, Chaorui Zhang +3Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  18. Automated jailbreak attack targeting multiple defense strategies

    Jun 15, 2026Qi Wang, Chengcheng Wan, Weijia He +4Adversarial Prompt GenerationLLM Jailbreak Attacks

  19. PromptShift-CRC: Drift-Aware Conformal Risk Control for Foundation Models Under Prompt and Domain Shift

    Jun 14, 2026Jeffery Opoku, David BanaheneConformal PredictionLanguage Model Calibration

  20. Emergent retokenization symmetry in large language models: phenomenology and applications

    Jun 14, 2026Kanishk Jain, Matthew Day, Tankut CanLanguage Model Robustness

  21. Prefill Awareness in Large Language Models

    Jun 10, 2026Andy Wang, Parv Mahajan, David Demitri Africa +3Language Model Safety EvaluationLLM Auditing

  22. Normative Robustness as a Frontier for Non-Verifiable Reasoning in LLMs

    Jun 10, 2026Elizaveta Tennant, Benjamin Henke, Anita Keshmirian +5Moral Reasoning in Language ModelsLanguage Model Robustness

  23. Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

    Jun 10, 2026Hongjian Zhou, Xinyu Zou, Jinge Wu +19LLM ReliabilityMedical QA