2 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.
Sep 28, 2026·Pengcheng Jiang, Fabien RogerLanguage Model SteeringLanguage Model-Based Control
Anthropic Fellows Program · Anthropic
Sep 7, 2026·Vinícius Ferraz, Leon Houf, Enrico FerreaLLM InterpretabilityStrategic Reasoning Risks in Language Models
Institute of Management and KD2Lab, Karlsruhe Institute of Technology (KIT), Karlsruhe, Germany · Singularity AI Research, Singularity.Inc, Vienna, Austria · BrainSpot Labs, BrainSpot.AI, London, UK +2
Aug 12, 2026·Yi Wu, Zhimin HuStrategic Reasoning Risks in Language ModelsLong-Horizon LLM Agents
University of Chicago · University of Wisconsin-Madison
Jul 30, 2026·Joshua Caiata, Sreepriya Pulyassary, Xiang Li +1LLM Fine-TuningStrategic Reasoning Risks in Language Models
University of Waterloo
Jun 23, 2026·Arnaud RicciStrategic Reasoning Risks in Language ModelsAI Agent Benchmarks
Independent researcher, Switzerland.
Jun 11, 2026·Pratham Singla, Shivank Garg, Vihan SinghGame-Playing AgentsStrategic Reasoning Risks in Language Models
Indian Institute of Technology Roorkee · Raeth AI
May 28, 2026·Kevin Wang, Anna Thöni, Benjamin Kempinski +50LLM Agent EvaluationStrategic Reasoning Risks in Language Models
May 22, 2026·Vartan Shadarevian, Kia Ghods, Alex Kenich +1LLM EvaluationImperfect-Information Games
Princeton University · Google
Apr 23, 2026·Tharindu Kumarage, Lisa Bauer, Yao Ma +7Reward HackingLanguage Model Safety Evaluation
Amazon Nova Responsible AI