Software Engineering Agents

Momentum

32 papers in the last four weeks, up 220% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 204

All topics
CardsList
  1. Measuring Cross-Task Behavioral Consistency in Language Model Agents

    Jul 31, 2026Amritesh Banerjee, Pranil RaichuraAI Agent ReliabilitySoftware Engineering Agents

  2. ORCA-bench: How Ready Are Language Model Agents for Oncall?

    Jul 30, 2026Albert Gong, Kyuseong Choi, Abhineet Agarwal +5Software Engineering AgentsAI Agent Benchmarks

  3. AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration

    Jul 30, 2026Xinxing Ren, Qianbo Zang, Ziyan Wang +4Software Engineering AgentsLong-Horizon LLM Agents

  4. Specula: Scaling formal specifications for autonomous model checking of system code

    Jul 28, 2026Qian Cheng, Saad Mohammad Rafid Pial, Ruize Tang +6Software Engineering AgentsFormal Verification

  5. Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

    Jul 27, 2026Bowen Qin, Yi XieSoftware Engineering AgentsAI Agent Benchmarks

  6. How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests

    Jul 23, 2026Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse KhomhSoftware Engineering AgentsAI Coding Agents

  7. PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents

    Jul 21, 2026Tianyue Jiang, Yanlin Wang, Xin He +7LLM Self-CorrectionSoftware Engineering Agents

  8. Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution

    Jul 16, 2026Harris Borman, Herman Wandabwa, Fusun Yu +4Software Engineering AgentsBusiness Process Automation

  9. NexForge: Scaling Executable Agent Tasks via Requirement-First Synthesis

    Jul 15, 2026Jiarong Zhao, Zhikai Lei, Zhiheng Xi +5Software Engineering AgentsSynthetic Data Generation

  10. Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

    Jul 14, 2026Ruhan Wang, Yucheng Shi, Zongxia Li +7Software Engineering AgentsLLM Agent Harnesses

  11. Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

    Jul 14, 2026Junjie Yin, Xinyu FengSoftware Engineering AgentsLLM Agent Evaluation

  12. ToFu: A White-Box, Token-Efficient Agent Harness for Researchers

    Jul 13, 2026Junhao Ruan, Yuan Ge, Bei Li +7Tool-Augmented Language Model AgentsSoftware Engineering Agents

  13. Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs

    Jul 13, 2026Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei LeeLLM ServingSoftware Engineering Agents

  14. How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Study

    Jul 12, 2026Yunbo Lyu, David Williams, Jieke Shi +5Software Engineering AgentsLLM Agent Evaluation

  15. Do These Violent Delights Have Violent Ends? Measuring the Post-Merge Fate of Agentic Code

    Jul 10, 2026Chunqiu Steven Xia, Courtney MillerSoftware EngineeringSoftware Engineering Agents

  16. Aleena: Alignment Agent for Research Software Engineering Collaborations

    Jul 9, 2026Kshitij Dani, Cordero Core, Landung Setiawan +4Software Engineering AgentsHuman-AI Collaboration

  17. Reliable and Developer-Aligned Evaluation of Agents for Software Engineering

    Jul 7, 2026Razvan Mihai PopescuSoftware Engineering AgentsLLM Agent Evaluation

  18. Harnessing Code Agents for Automatic Software Verification

    Jul 7, 2026Shuangxiang Kan, Shuanglong Kan, Sebastian ErtelSoftware Engineering AgentsAutomated Theorem Proving

  19. What Do AI Agents Actually Change? An Empirical Taxonomy of Mutation Patterns in Performance-Improving Pull Requests

    Jul 6, 2026Illia Dovhoshliubnyi, Nima Soroush, Ashkan Sami +1Software EngineeringSoftware Engineering Agents

  20. CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents

    Jul 6, 2026Yujiang Li, Zhenyu Hou, Yi Jing +2Software Engineering AgentsLong-Horizon LLM Agents

  21. Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

    Jul 5, 2026Haiwen Yi, Xinyuan SongSoftware Engineering AgentsLLM Agent Evaluation