Code Language Models

Momentum

10 papers in the last four weeks, up 150% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 85

All topics
CardsList
  1. Mind the Gaps: From Failure Attribution to Closed-Form Repair of Code Language Models

    Oct 4, 2026Jian Gu, Hongyu Zhang, Chunyang Chen +1Causal Interventions in Language ModelsCode Language Models

  2. Hidden in the Comments: A Context-Injection Attack Surface in Code LLMs

    Oct 4, 2026Noor Munir, Francesco Quinzan, Stephen RobertsLLM SecurityIndirect Prompt Injection

  3. Complexity-Aware Evaluation of LLM Comprehension

    Sep 29, 2026Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. AjilaSoftware EngineeringLLM Evaluation

  4. UNBIND: UNlearning By INference-time Directional Steering for Code LLMs

    Sep 28, 2026Zhengyang Shan, Jiayun Xin, Yanjun Lin +7Activation SteeringLLM Unlearning

  5. An Empirical Evaluation of Cost-Efficient Large Language Models on Algorithmic Programming Tasks

    Sep 16, 2026Chandimal Adikari, Nandika HerathCode GenerationLLM Reliability

  6. Retrieval-Augmented Generation for Scientific Code Understanding

    Sep 14, 2026Aaron Nobile, Andreas Adelmann, Mohsen SadrRetrieval-Augmented GenerationLLM Grounding

  7. The Vibe Shift in Software Engineering: Evaluating AI-Led Conversational Programming for Performance, Cognition, and Responsible Adoption

    Sep 10, 2026Sales G. Aribe Jr., Louie Jay S. LabastidaCode Generation EvaluationHuman-AI Collaboration

  8. CodeTD: Topology of Attention Detects Hallucinations in Code LLMs

    Sep 7, 2026Daria Voronkova, Ilya Trofimov, Anton Dmitriev +3LLM Hallucination DetectionCode Generation Evaluation

  9. CROCODIL: Cross-Model Code Editing with LLMs

    Sep 3, 2026Linghan Zhong, Aditya Thimmaiah, Jayanth Srinivasa +2Reinforcement LearningLLM Post-Training

  10. Predicting Program Exit Code with LLMs and Programming Language Semantics

    Sep 1, 2026Lara Marinov, Aditya Thimmaiah, Jayanth Srinivasa +2LLM EvaluationCode Language Models

  11. Memorization Diagnostics for Code LLMs Should be Scale-Aware

    Aug 13, 2026Prateek Kumar Rajput, Abdoul Aziz Bonkoungou, Alberick Euraste Djiré +6Memorization in Language ModelsCode Language Models

  12. On the Robustness of LLMs' Internal Representation of Code Correctness

    Aug 8, 2026Francisco Ribeiro, Sohaila Abdulsattar, Renata Gonzalez +2LLM ReliabilityLanguage Model Robustness

  13. LangChoiceBench: Measuring and Explaining Programming-Language Choice in LLMs

    Aug 6, 2026Lukas Twist, Twm Stone, Helen Yannakoudakis +1LLM EvaluationLanguage Model Bias Evaluation

  14. OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

    Aug 5, 2026Indraneil Paul, Falko Helm, Goran Glavaš +1Software EngineeringLong-Context Language Modeling

  15. To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

    Jul 30, 2026Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia +2LLM ReliabilityLanguage Model Editing

  16. Learning from 53.6K Real-World Developer Edits of AI-Generated Code

    Jul 27, 2026Jenny T. Liang, Mihika Bairathi, Wayne Chi +3Code Generation EvaluationCode Language Models

  17. Transformer-Assisted LLM-Based Source Code Summarisation: to Enable More Secure Software Development

    Jul 23, 2026Jesse Phillips, Tracy Hall, Paul Rayson +1Code Language Models

  18. Line-Anchored Feedback Cuts Token Costs and Improves Correctness in AI Code Editing

    Jul 14, 2026William Franz LambertiCode Generation EvaluationCode Language Models

  19. Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

    Jul 14, 2026Yubo Wang, Jiarong Liang, Yuxuan Zhang +5Masked Language ModelingCoding Agents

  20. Code-MUE: Measuring Code LLMs' Uncertainty through Execution-based Semantic Interaction Graphs

    Jul 14, 2026Xiaoning Ren, Yinxing Xue, Lei Ma +1Uncertainty QuantificationLLM Uncertainty Estimation

  21. Fail-Aware and Explainable Test Oracle Prediction

    Jul 13, 2026Yue Zhao, Binish Tanveer, Jelena ZdravkovicAutomated Software TestingFault Detection

  22. TypeProbe: Recovering Type Representations from Hidden States of Pre-trained Code Models

    Jul 9, 2026Giuliano Gorgone, Fausto CarcassiLLM InterpretabilityRepresentation Geometry in Language Models

  23. Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions

    Jul 9, 2026Anjun Gao, Yueyang Quan, Zhuqing Liu +1LLM Backdoor AttacksBackdoor Detection

  24. Functional and Secure Code Generation with Task Vectors

    Jul 8, 2026Felix Wang, Anudeep Das, Mei Nagappan +1Code GenerationLLM Safety Alignment

  25. Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse

    Jul 5, 2026Raj Jaiswal, Anany Singh Divy, Savar Bhasin +3LLM Self-CorrectionAutomated Program Repair

  26. Teaching Code LLMs to Reason with Intermediate Formal Specifications

    Jul 5, 2026Minh Le-Anh, Cuong Chi Le, Tien N. NguyenFormal VerificationCode Language Models

  27. Benchmarking Large Language Models on Floating-Point Error Classification

    Jun 30, 2026Lisa Taldir, Muhammad Ahmad Saeed, David Defour +2LLM EvaluationStatic Code Analysis

  28. SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models

    Jun 29, 2026Shuaimin Li, Liyang Fan, Zeyang Li +9LLM EvaluationLLM Auditing

  29. When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs

    Jun 26, 2026Xinyuan Song, Zekun Cai, Liang ZhaoSelf-TrainingModel Collapse

  30. Recall Before Rerank: Benchmarking Deep Learning Models for Large-Scale Code-to-Code Retrieval

    Jun 24, 2026Leonardo Venuta, Francesco Tosoni, Paolo FerraginaLLM EvaluationSemantic Search

  31. Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

    Jun 23, 2026Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-ZakenOOD GeneralizationCode Language Models

  32. From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs

    Jun 16, 2026Siyue Chen, Yifu Guo, Yuquan Lu +9LLM InterpretabilityCode Language Models

  33. Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

    Jun 12, 2026Kirill Vasilevski, Ximing Dong, Benjamin Rombaut +8Software Engineering AgentsLLM-as-a-Judge

  34. Detecting Functional Memorization in Code Language Models

    Jun 11, 2026Matthieu Meeus, Anil Ramakrishna, Matthew Grange +2Memorization in Language ModelsLLM Auditing

  35. CODEBLOCK: Learning to Supervise Code at the Right Granularity

    Jun 10, 2026Zhijie Deng, Ling Li, Jinlong Pang +5Supervised Fine-TuningCode Language Models

  36. CodeAlchemy: Synthetic Code Rewriting at Scale

    Jun 8, 2026Ankit Gupta, Aditya Prasad, Rameswar PandaSynthetic Data PretrainingSynthetic Data Generation

  37. Code Is More Than Text: Uncertainty Estimation for Code Generation

    Jun 8, 2026Yuling Shi, Caiqi Zhang, Yuexian Li +4Confidence Estimation in Language ModelsLLM Reliability

  38. Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

    Jun 7, 2026Sayed Erfan ArefinCode Generation EvaluationCode Language Models

  39. Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests

    May 27, 2026Richard J. Young, Gregory D. MoodyClassificationLLM Safety Evaluation

  40. Poison with Style: A Practical Poisoning Attack on Code Large Language Models

    May 26, 2026Khang Tran, Yazan Boshmaf, Issa Khalil +3LLM Backdoor AttacksData Poisoning Attacks

  41. Merge-Bench: Resolve Merge Conflicts with Large Language Models

    May 25, 2026Benedikt Schesch, Michael D. ErnstSoftware EngineeringCode Language Models

  42. TRACER: A Semantic-Aware Framework for Fine-Grained Contamination Detection in Code LLMs

    May 22, 2026Yifeng Di, Xuliang Huang, Tianyi ZhangLLM AuditingData Contamination in Language Models

  43. Syntax Without Semantics: Teaching Large Language Models to Code in an Unseen Language

    May 15, 2026Vinayshekhar Bannihatti Kumar, Disha Makhija, Manoj Ghuhan Arivazhagan +1LLM Fine-TuningCode Language Models

  44. Code-Centric Detection of Vulnerability-Fixing Commits: A Unified Benchmark and Empirical Study

    May 13, 2026Nils Loose, Joseph Bienhüls, Kristoffer Hempel +2Software Vulnerability DetectionSoftware Engineering Benchmarks

  45. SemChunk-C: Semantic Segmentation for C Code

    May 12, 2026Boris Nazarov, Darya Frolova, Shaked Leibzirer +1Small Language ModelsCode Language Models