Code Quality

Momentum

13 papers in the last four weeks, up 117% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 124

All topics
CardsList
  1. Correct Code, Broken Contributions? SWE-CC: Benchmarking Repository Policy Compliance for Coding Agents

    Oct 5, 2026Hai Dang Truong, Rayner Goh, Thanh Le-Cong +1Code QualityCoding Agents

  2. Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents

    Oct 1, 2026Junyu Guo, Shangding Gu, Ming Jin +1Code QualityReviewer

  3. ConflictGuide: AutoResearch Improves When Competing Behaviors Are Made Visible

    Sep 30, 2026Binqian Xu, Qiran Zou, Xiangbo Shu +1Code QualityAdversarial Evaluation

  4. Complexity-Aware Evaluation of LLM Comprehension

    Sep 29, 2026Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. AjilaCode Quality

  5. CRJudgeBench: Can AI Detect Plausible but Invalid Code Reviews?

    Sep 29, 2026Yue Pan, Jiawei Li, Ziyuan Zhang +2Code QualityRaw Judge Outputs

  6. Breaking the Illusion of Review Reliability under Static Evaluation: SCOPE Fuzzing for LLM-based Scientific Reviewers

    Sep 29, 2026Zhuo Chen, Hao Zeng, Jiawei Liu +6Peer ReviewFuzzing

  7. Style, Not Self: Surface Cues Explain Zero-Shot Code Attribution by Large Language Models

    Sep 24, 2026Ehsan Barkhordar, Surendrabikram ThapaCode QualityMle-Bench Lite

  8. Can LLMs Catch a Rigged Backtest? A Clean-Control Calibration Benchmark

    Sep 23, 2026Makar Ulesov, Vladislav Smirnov, Omar Ibrahim +1Model AuditingCode Quality

  9. Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen

    Sep 22, 2026Om Nepal, Sushant Aryal, Oluseyi Olukola +1Vulnerable CodeCode Quality

  10. Code-as-Auditor: Executable Compliance Reasoning via Regulation-to-Code

    Sep 16, 2026Jisoo Kim, Taeyoon Kwack, Jinwoo Jang +2ComplianceLegal Reasoning Tasks

  11. What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code

    Sep 14, 2026Cristina Improta, Pietro Liguori, Domenico CotroneoCode QualityCode Generation

  12. ExecCritic: Learn to Test, Test to Improve for Coding Agents

    Sep 8, 2026Leitian Tao, Baolin Peng, Haorui Wang +7Coding AgentsTest Generation

  13. When Models Edit Too Much: On the Fidelity of Minimal Code Edits

    Sep 3, 2026Tongyao Zhu, Wei Hern Lim, Min-Yen KanCode QualityEdit

  14. Dude: A Dual-Detection Multi-Agent System for Paper-Code Discrepancy Detection

    Sep 3, 2026Weijie Liu, Running Zhao, Wenhao Yuan +4Code QualityArtificial Intelligence Detection

  15. Commit-first LLM judging inherits the judge's own errors

    Aug 31, 2026Idil GozelJudgesCode Quality

  16. Exploring Semantic Stability Across Reviews in the Linux Kernel

    Aug 10, 2026Lucas Ciziks, Paulo Meirelles, Marco Aurélio GerosaCode QualityReview

  17. Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design

    Aug 8, 2026Jianbin Luo, Weibin Lin, Yiran Lin +2Code QualityMulti-Agent Large Language Model Systems

  18. DevIntent: How Much Does LLM-Generated Code Violate Developer Intent?

    Aug 7, 2026Susana Haing, Natan Vidra, Spurthi SettyCode QualityViolation

  19. Characterizing the Quality Profile of AI-Generated C++ in Production

    Aug 6, 2026Michael Tran, Fred Lewis, Kun Yang +5Code QualityCode Generation

  20. The Order Is the Guarantee: Verifier-Budgeted Code Deletion with Static-First Learned Proposals

    Aug 5, 2026Ruitong Li, Binjie Guo, Aisheng Mo +4Code QualityVerification Framework

  21. AgentForge: An Immersive Role-Playing Platform for Learning Agentic Software Engineering

    Aug 4, 2026Zihan Fang, Yueke Zhang, Yu HuangSoftware EngineeringSoftware

  22. AgentPanel: Toward a New Paradigm for Human--AI Collaboration in Exploring Scientific Questions

    Aug 4, 2026Zhiyao Cui, Qianyi Wang, Haoyang Yan +26Human-Ai CollaborationCollaboration

  23. Effective and Efficient Context Retrieval via Partial Dependency Graph for Repository-Level Code Generation

    Aug 3, 2026Zhongxin Liu, Zhonghao Jiang, Zhifan Ye +3Code GenerationGraph-Based Retrieval Augmented Generation

  24. From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale

    Jul 31, 2026Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan +4Code QualityPeer Review

  25. To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

    Jul 30, 2026Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia +2Code QualityDeletion

  26. SecDrift: Measuring Sector-Conditioned Security Drift in AI-Generated Code

    Jul 28, 2026Narayanaswami Natraj Bharadwaj, Dhivya ChandramouleeswaranCode QualityLarge Language Model Safety

  27. Evaluating the Impact of Explainable AI on Trust in AI-Assisted Code Review

    Jul 27, 2026Zhenhan Gao, Marvin Muñoz Barón, Umm-e Habiba +2Code QualityExplainable Artificial Intelligence

  28. Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study)

    Jul 24, 2026Junda Zhao, Shurui Zhou, Eldan CohenTest GenerationCode Quality

  29. MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation

    Jul 24, 2026Zhen Zhao, Qihang Yang, Feifei Dai +2Code GenerationCode Quality

  30. Transformer-Assisted LLM-Based Source Code Summarisation: to Enable More Secure Software Development

    Jul 23, 2026Jesse Phillips, Tracy Hall, Paul Rayson +1Code QualitySummarization

  31. Code Monitor Red Teaming for Public-Test-Passing Code

    Jul 23, 2026Junchi Liao, Jiawen Deng, Fuji RenCode QualityRed-Teaming

  32. Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

    Jul 22, 2026Zuodong Xiang, Yike Zhang, YueMing Zhang +1Code QualityLlm-As-A-Judge

  33. Learning to Detect UI Principle Violations via Reinforcement Learning

    Jul 22, 2026Nishi Mehta, Swathi Alse, Himani Kumawat +2Code QualityInteraction Design

  34. SynH-Rank: Quality-Aware Code Search via Diverse Data Synthesis and Hierarchical Ranking Training

    Jul 19, 2026Keyu Liang, Haoye Wang, Yanfu Yan +2Code QualityRanking

  35. Conditional Reliability of Toxicity Signals for Multilingual and Code-Mixed Abuse Detection

    Jul 17, 2026Indraveni Chebolu, Rohan Singh, Arnab Mallick +1ToxicityContent Moderation

  36. Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

    Jul 16, 2026Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez +5Code GenerationMultilingual Benchmark

  37. Quantize with Confidence? An Empirical Study of Quantization for Code Generation

    Jul 15, 2026Saima Afrin, Md. Zahidul Haque, Antonio MastropaoloQuantizedCode Generation

  38. Can LLMs Perform Technical Comprehension of Computer Architecture Papers?

    Jul 13, 2026Nishant Aggarwal, Aishwarya Lekshmi Chithra, Ayushi Dubal +8CritiqueCode Quality

  39. Mitigating LLM Sycophancy in Code Smell Detection Using Evidence-Guided Reasoning Prompts

    Jul 11, 2026Istiaq Ahmed Fahad, Kamruzzaman Asif, Md. Nurul Ahad TawhidCode QualitySycophancy

  40. 3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse

    Jul 8, 2026Shyam Agarwal, Courtney Miller, Christian Kästner +1Pull RequestsCode Quality

  41. Deployment Risk Assessment Using Diff-Aware Features: A Case Study at Prime Video

    Jul 7, 2026Mayur Kurup, Hyunjae Suh, Swathi Vaidyanathan +3Code QualityRisk

  42. Static Metrics Are Insufficient: Predicting Java Method Energy Usage with Execution Time

    Jul 7, 2026Muhammad Imran, Vincenzo Stoico, Ivano MalavoltaEnergy ConsumptionSmooth Execution

  43. Multi-Channel Spread-Spectrum Code Watermarking

    Jul 7, 2026Soohyeon Choi, Debin Gao, Yue DuanWatermarksCode Quality

  44. Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

    Jul 7, 2026Mingchen Li, Meikang Qiu, Zifan Peng +4Large Language Model SafetyModel Vulnerabilities

  45. LLM-Driven CI-CD Workflow Intelligence for Cyber Systems Engineering

    Jul 6, 2026Bonan Shen, Jiazhou Gao, Tao Ning +2Code QualityAgentic Workflow Design

  46. Is Agentic Code Review Helpful? Mining Developers' Feedback to CodeRabbit Reviews in the Wild

    Jul 3, 2026Hong Yi Lin, Mingzhao Liang, Kla Tantithamthavorn +1Code QualityReviewer

  47. A Preliminary Study on Explaining Risk of Code Changes using LLM-Based Prediction Models

    Jul 2, 2026Yalin Liu, Kosay Jabre, Rui Abreu +10Code QualityRisk

  48. An Exploratory Study on LLM-Generated Code and Comments in Code Repositories

    Jul 2, 2026Yongyi Ji, Jiaji Wang, Yi Zhou +2Code QualityCode Generation

  49. A Methodology for Investigating AI Patterns Prevalence in Software Repositories

    Jul 1, 2026Srinath Perera, Hasinthaka Piyumal, Frank Leymann +1Code QualityMethodology

  50. When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs

    Jun 26, 2026Xinyuan Song, Zekun Cai, Liang ZhaoCode QualityCode Generation

  51. The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators

    Jun 24, 2026Alex Iacob, Andrej Jovanović, William F. Shen +10Self-Improving AgentsSelf-Evolving Agents