Model Debugging

Momentum

0 papers in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 14

All topics
CardsList
  1. Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators

    Aug 3, 2026Yansong Sun, Shenxiu Wu, Siyuan Chen +6Model DebuggingRepair

  2. CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

    Jul 31, 2026Weijia Zhang, Kunlun Zhu, Zeyi Liu +8Model DebuggingComputer-Use Agents

  3. AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

    Jul 21, 2026Kunlun Zhu, Xuyan Ye, Zhiguang Han +9Model DebuggingLarge Language Model Agents

  4. VeriPilot: An LLM-Powered Verilog Debugging Framework

    Jun 22, 2026Yihan Wang, Cheng Liu, Jiazheng Zhang +4Model DebuggingHigh-Level Synthesis

  5. DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

    Jun 2, 2026Qinyan Zhou, Peixin Zhang, Jun Sun +2Large Language Model SafetyRefusals

  6. ModuLoop : Low-Level Code Generation using Modular Synthesizer and Closed-Loop Debugger for Robotic Control

    Jun 2, 2026Gina Yoon, Sumin Lee, Joo Yong SimCode GenerationReal-World Manipulation Tasks

  7. DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents

    May 17, 2026Sirui Hong, Zhijie Liu, Tengfei Li +3Model DebuggingDiagnosis

  8. Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents

    May 9, 2026Chenyu Zhao, Shenglin Zhang, Yihang Lin +7Model DebuggingDiagnosis

  9. CUDABeaver: Benchmarking LLM-Based Automated CUDA Debugging

    May 8, 2026Shiyang Li, Haoyang Chen, Mattia Fazzini +1Model DebuggingCuda

  10. Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems

    Apr 24, 2026Mengzhuo Chen, Junjie Wang, Fangwen Mu +4Latent Failure PatternsModel Debugging

  11. Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

    Apr 19, 2026Miaosen Chai, Wang Bill Zhu, Shangshang Wang +5Model DebuggingLarge Language Model Benchmarks