Language Model Robustness

Latest papers 338

All topics
CardsList
  1. Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA

    May 29, 2026Hao Chen, Xing Tang, Qirui Liu +6Retrieval-Augmented GenerationHallucination in Language Models

  2. Toxic HallucinAItions: Perturbing Prompts and Tracing LLM Circuits

    May 29, 2026Soorya Ram Shimgekar, Agam Goyal, Amruta Parulekar +6Prompt SensitivityLLM Interpretability

  3. PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges

    May 29, 2026Swastik Roy, Rajkumar Pujari, Tharindu Kumarage +5LLM-as-a-JudgeLLM Auditing

  4. Triaging Threats to Specialized Guardrails

    May 29, 2026Wenjie Jacky Mo, Xiaofei Wen, Rui Cai +6LLM Safety BenchmarksLLM Guardrails

  5. Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs

    May 28, 2026Mahdi Alkaeed, Adnan Qayyum, Nabeel Abo Kashreef +2Prompt SensitivityClinical Language Model Evaluation

  6. Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models

    May 28, 2026Zizhuo Lin, Quanling Liu, Jinsheng Quan +6LLM GroundingReasoning Consistency in Language Models

  7. GRUFF: LLM Pronoun Fidelity, Reasoning, and Biases in German

    May 28, 2026Fabian Mewes, Anne Lauscher, Vagrant GautamGender Bias in Language ModelsLinguistic Bias in Language Models

  8. Temporal Stability and Few-Shot Prompting in Math Task Assessment

    May 28, 2026Danielle S. Fox, Brenda L. Robles, Elizabeth DiPietro Brovey +1Generative AI in EducationFew-Shot Prompting

  9. Harnessing non-adversarial robustness in large language models

    May 28, 2026Qinghua Zhou, Ellina Aleshina, Andrey Lovyagin +6LLM Fine-TuningNeural Network Robustness

  10. The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF

    May 28, 2026Zeli Su, Zhankai Xu, Tianlei Chen +4Language Model Scaling LawsLanguage Model Robustness

  11. Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization

    May 28, 2026Zhihao Liu, Yifan Wu, Jian Lou +3LLM AlignmentZeroth-Order Optimization

  12. Mind Your Tone: Does Tone Alter LLM Performance?

    May 27, 2026Om Dobariya, Akhil KumarLLM EvaluationLLM Prompting

  13. FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks

    May 27, 2026Nishal Thomas, Noel ThomasMathematical Reasoning BenchmarksBenchmark Auditing

  14. The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

    May 27, 2026Eric Onyame, Runtao Zhou, Kowshik Thopalli +2CoT FaithfulnessMultilingual Language Model Evaluation

  15. Generating Robust Portfolios of Optimization Models using Large Language Models

    May 26, 2026Eleni Straitouri, Cheol Woo Kim, Milind TambeLarge Language Model-Guided OptimizationLanguage Model Robustness

  16. SeDT: Sentence-Transformer Decision-Transformer Conditioning for Multi-Turn Conversation Reliability

    May 26, 2026Ramakrishna Vamsi Setti, Jagadeesh Rachapudi, Sachin Chaudhary +2LLM ReliabilityLanguage Model Robustness

  17. Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games

    May 26, 2026Mingyuan Fan, Weiguang Han, Daixin Wang +3LLM EvaluationAI Agent Benchmarks

  18. Conceptual Steganography

    May 26, 2026Zhejian Zhou, Jonathan MayCoT ReasoningLLM Security

  19. When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation

    May 25, 2026Liyun Zhang, Jiayi GuoCoT ReasoningLLM Agent Evaluation

  20. Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework

    May 23, 2026Ali Şenol, Garima Agrawal, Huan LiuLLM EvaluationLanguage Model Robustness

  21. ChaosBench-Logic v2: Evaluating LLM Logical Reasoning over Dynamical Systems at Scale

    May 23, 2026Noel ThomasLLM EvaluationLanguage Model Robustness

  22. Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

    May 22, 2026Chuyifei Zhang, Hongyu Cui, Xiaowen Huang +1LLM EvaluationLong-Context Language Model Evaluation