10 papers in the last four weeks, down 33% on the four weeks before. 0.1% of all new papers.
Oct 7, 2026·Zhankai Ye, Yanning Wang, Yukai Jin +5Refusal Behavior in Language ModelsLLM Safety Alignment
Florida State University · Texas Christian University · University of Pennsylvania +1
Oct 4, 2026·Swadesh Swain, Sanghamitra DuttaAdversarial Attacks on LLMsMechanistic Interpretability
University of Maryland, College Park
Sep 29, 2026·Philipp E. Glass, Alina MironLLM AuditingInstruction Tuning
Department of Computer Science, Brunel University of London
Sep 28, 2026·Xu Wang, Difan Zou, Xuansheng WuLLM SycophancyLanguage Model Safety Evaluation
The University of Hong Kong · Shenzhen Loop Area Institute · Shanghai Artificial Intelligence Laboratory
Sep 28, 2026·Abel Rodríguez, Giuseppe Garofalo, Lieven Desmet +1Language Model Safety EvaluationLLM Agent Safety
DistriNet, KU Leuven
Sep 24, 2026·Yu-Ling Liao, Tzu-Chin Chiu, Zong-You Chen +2Audio-Language ModelsJailbreak Defense
National Taiwan University
Sep 16, 2026·Soyeon Park, Seogyeong Jeong, Sunwoo Kim +1LLM InterpretabilityLLM Safety
KAIST
Sep 16, 2026·Yizheng Yang, Haining Yu, Yuechen Wang +4LLM Safety AlignmentInference-Time Intervention
Harbin Institute of Technology, Harbin, China · Guangzhou University, Guangzhou, China · City University of Macau, Macau, China
Sep 14, 2026·Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas +2Long-Horizon Agent EvaluationAI Agent Safety Benchmarks
Rensselaer Polytechnic Institute · IBM Research
Sep 13, 2026·Orion Reblitz-RichardsonLLM AlignmentMoral Reasoning in Language Models
Distiller Labs.
Sep 9, 2026·Yi Shi, Tanyu Chen, Kai ShenMixture-of-Experts Language ModelsLLM Alignment
Continuum AI
Sep 5, 2026·Sripad KarneLanguage Model Safety EvaluationLLM Guardrails
Columbia University
Sep 3, 2026·Hoang Cuong Nguyen, Mark Dras, Usman NaseemMechanistic InterpretabilityCircuits in Language Models
Macquarie University, Sydney, Australia
Sep 1, 2026·Yuri Son, Seunghee Kim, Hyuhng Joon Kim +1LLM InterpretabilityLLM Refusal Behavior
1Hanyang University · 2Samsung Electronics
Aug 31, 2026·Guoli Wang, Haonan Shi, Tu Ouyang +1Language Model Safety EvaluationDiffusion Language Model Decoding
Case Western Reserve University 10900 Euclid Avenue, Cleveland, OH 44106, USA
Aug 31, 2026·Kirill Bunin, Dmitry Bylinkin, Vladimir Aletov +3Language Model SteeringRefusal Behavior in Language Models
1Basic Research of Artificial Intelligence Laboratory (BRAIn Lab) · 2Kandinsky Lab · 3Innopolis University
Aug 31, 2026·Ruoxuan Li, Pinqiao Wang, Sheng Li +1Language Model Safety EvaluationPragmatic Reasoning in Language Models
Stony Brook University · University of Virginia
Aug 31, 2026·Yuna Park, Hwang Youn Kim, Yujin Kim +3Prompt SensitivityLanguage Model Safety Evaluation
Yonsei University · Korea Institute of Science and Technology (KIST) · Korea University +1
Aug 31, 2026·Md Mokarram Chowdhury, Ernie Chang, Yang LiJailbreak AttacksLLM Jailbreak Attacks
Department of Computer Science, Iowa State University, United States · Meta, United States
Aug 31, 2026·Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim +1Language Model SteeringLLM Safety Alignment
Department of Artificial Intelligence, Chung-Ang University · Graduate School of Advanced Imaging Science, Multimedia & Film, Chung-Ang University
Aug 26, 2026·Andrey LabunetsAdversarial Attacks on LLMsAdversarial Robustness of Language Models
UC San Diego
Aug 18, 2026·Rubén Balbastre, Juan Manuel Orduña, Mariano PérezGroup Relative Policy OptimizationRubric-Based RL
University of Valencia
Aug 12, 2026·Haoyu Zhang, Haowen Xu, Xiao Luo +7LLM Safety BenchmarksLanguage Model Safety Evaluation
Northeastern University
Aug 12, 2026·Guang Yang, Fengchen Liu, Alex Wang +2VLM EvaluationRefusal Behavior in Language Models
University of California, Los Angeles · University of California, Berkeley · Stanford University
Aug 12, 2026·Mingyu Zong, Sampad Mohanty, Bhaskar KrishnamachariLLM AlignmentLLM Interpretability
Department of Computer Science University of Southern California Los Angeles, CA 90007
Aug 10, 2026·Waleed Jamil, Raphael SchmittLLM Safety BenchmarksLLM Safety Evaluation
1Independent Researcher, Edinburgh, United Kingdom · School of Computation, Information and Technology, Technical University of Munich, Germany · Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg, Germany
Aug 8, 2026·Ramakrishna P. Kompella, Aadit MahajanMultilingual Language ModelsMixture-of-Experts Language Models
Gödel Machines · IIT Madras
Aug 8, 2026·Laiqiao Qin, Tianqing Zhu, Longxiang Gao +1Prompt Injection DefensePrompt Injection Attacks on LLMs
City University of Macau, Macau · Qilu University of Technology
Aug 5, 2026·Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt +1Adversarial Attacks on LLMsLLM Safety Alignment
University of Mannheim · Technical University Clausthal
Aug 5, 2026·Xuzheng Yang, Jun Ling, Tao Huang +2RL for Language ModelsGroup Relative Policy Optimization
School of Computer Science and Engineering, University of Electronic Science and Technology of China