Test Generation

Momentum

9 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 82

All topics
CardsList
  1. Verification Trap: Understanding Test-Time Selection Failures under False Premises in Code Generation

    Oct 4, 2026Feng He, Hejia Wang, Linghao Meng +2Test GenerationVerification Framework

  2. A2Z GameSpec-Bench: How Faithfully Can Coding Agents Generate Games from Game Design Specifications?

    Sep 30, 2026Seonho Lee, Wonryeol Jeong, Alberto Cereser +4Test GenerationFeedback

  3. LatentSift: Policy-State Filtering for Token-Efficient Verification of Software Engineering Agents

    Sep 28, 2026Yuning Han, Yangchenchen Jin, Tyler Jandreau +1Verification FrameworkSwe-Bench Verified

  4. Scenario-Driven Neuroevolution: Using Models to Guide Test Generation for Games

    Sep 23, 2026Gijs van Cuyck, Patric Feldmeier, Jan Tretmans +1Test GenerationNeuroevolution

  5. Teach-to-Crash: A Closed-Loop Student-Teacher LLM Framework for Collision-Inducing Test Scenario Generation

    Sep 23, 2026Zaid Ghazal, Khouloud Gaaloul, Bruce MaximAutonomous Driving SimulationCrashes

  6. A Study of the Reliability of Agentic AI-Generated Programs

    Sep 16, 2026Ayesha Shafique, Barton P. MIller, Elisa R. HeymannTest GenerationCode Generation

  7. Confidence-Gated Transductive Test Generation for Code Reranking

    Sep 14, 2026Sungjae Lee, Youngsik Yoon, Seockbean Song +3Test GenerationTest Time

  8. ExecCritic: Learn to Test, Test to Improve for Coding Agents

    Sep 8, 2026Leitian Tao, Baolin Peng, Haorui Wang +7Coding AgentsTest Generation

  9. Two-Stage Reinforcement Learning for Sound and Adversarial Test Generation in Code LLMs

    Sep 3, 2026Jiacheng Xu, Wentao Zhang, Zhiyi Lyu +4Test GenerationLarge Language Model Generation

  10. Answer Probing-Guided Search for Diverse Solution Exploration of LLMs

    Aug 31, 2026Yi Fang, Que Shen, Chengpeng Li +6LLM Reasoning StrategiesReasoning Paths

  11. Can LLMs Test Terminal User Interfaces?

    Aug 4, 2026Chao Peng, Ruida Hu, Ajitha Rajan +3Generative User InterfaceTest Generation

  12. Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch

    Aug 3, 2026Shuyang Xie, Shuxiao Xie, Feng Zhu +2Raw Judge OutputsTest Generation

  13. Agentic Method for Deterministic Validation of Legacy Code Migration

    Jul 30, 2026Andras Ferenczi, Jordan Docherty, Mariya Bessonov +2Test GenerationAgentic

  14. Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests

    Jul 24, 2026Junda Zhao, Shurui Zhou, Eldan CohenTest GenerationLarge Language Models Fail

  15. Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study)

    Jul 24, 2026Junda Zhao, Shurui Zhou, Eldan CohenTest GenerationCode Quality

  16. Code Monitor Red Teaming for Public-Test-Passing Code

    Jul 23, 2026Junchi Liao, Jiawen Deng, Fuji RenCode QualityRed-Teaming

  17. Beyond Fail-to-Pass: Iterative Hardening of Co-Generated Bug Reproduction Tests and Fixes

    Jul 22, 2026Yuhao Tan, Zhibang Yang, Fangkai Yang +9Automated Program RepairTest Generation

  18. Integrating High-Level Requirements to Low-Level Tests with Machine-Readable V&V Specifications

    Jul 20, 2026Mansur Arief, Nur Ahmad Khatim, Ali Akarma +1Test GenerationHigh-Level Source Code

  19. Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

    Jul 16, 2026Leanne Tan, Rohan Jaggi, Shaun Khoo +1Artificial Intelligence EvaluationRubrics

  20. Faithful Autoformalization of Natural Language Assertions

    Jul 14, 2026Hongyi Liu, Madhusudan Parthasarathy, Adithya MuraliAutoformalizationSystemverilog Assertions

  21. Fail-Aware and Explainable Test Oracle Prediction

    Jul 13, 2026Yue Zhao, Binish Tanveer, Jelena ZdravkovicTest GenerationOracles

  22. Generative Testing of Automated Speech Recognition Systems

    Jul 10, 2026Yanis Xabier Wilbrand Peña, Oliver Weißl, Andrea StoccoAutomatic Speech RecognitionGrapheme-To-Phoneme

  23. SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation

    Jul 9, 2026Sijia Gu, Noor Nashid, Ali MesbahTest GenerationCoding Agents

  24. Specification Grounding Drives Test Effectiveness for LLM Code

    Jul 7, 2026Amin Haeri, Mahdi GhelichiTest GenerationGrounding

  25. An Exploration of Agentic Information Fusion for Test Maintenance Prediction

    Jul 6, 2026Jingxiong Liu, Nasser Mohammadiha, Gregory GayTest GenerationRepository-Level Code Understanding

  26. EvoOtter: Evolutionary Reproduction Test Generator

    Jul 3, 2026Toufique Ahmed, Jatin Ganhotra, Avraham Shinnar +1Test GenerationEvolutionary Optimization

  27. TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution

    Jul 2, 2026Jiale Amber Wang, Kaiyuan Wang, Pengyu NieTest GenerationCo-Evolution

  28. Prompt Coverage Adequacy

    Jul 2, 2026Florian Tambon, Michael Konstantinou, Cedric Richter +3Test GenerationPrompt Engineering

  29. TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation

    Jul 1, 2026Yaniv Melamed, Yoni Zukerman, Michal Shechter +3Test GenerationAgentic Framework

  30. SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests

    Jul 1, 2026Yaoqi Guo, Yang Liu, Jie M. Zhang +3Swe-Bench VerifiedTest Generation

  31. MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models

    Jun 23, 2026Pablo Valle, Shaukat Ali, Aitor Arrieta +1Action GenerationTest Generation

  32. Context-Aware Generative AI for Automated Telecom Test Script Generation

    Jun 19, 2026Gautam Prasad, Chandramohan T. N., Joy BoseTest GenerationMobile Networks

  33. Library-Aware Doubles and Iterative Repair for Large Language Model-Generated Unit Tests in OpenSIL Firmware

    Jun 18, 2026Ma Toan Bach, Yuchi Zheng, Haingo Razafindranto +4Test GenerationChip Design

  34. All Smoke, No Alarm: Oracle Signals in Agent-Authored Test Code

    Jun 16, 2026Dipayan Banik, Kowshik Chowdhury, Shazibul Islam ShamimCode QualityTest Generation

  35. Structured Testbench Generation for LLM-Driven HDL Design and Verification-Oriented Data Curation

    Jun 11, 2026En-Ming Huang, Yu-Hung Kao, Ren-Hao Deng +10Hierarchical Register Transfer Level GenerationTest Generation

  36. PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

    Jun 10, 2026Pengfei He, Lesly Miculicich, Vishesh Sharma +5Prompt-Injection DetectorsAttacker Large Language Model

  37. AI-Driven Test Case Generation from Natural Language Requirements: A Survey of Techniques and Research Gaps

    Jun 4, 2026Orimoloye Folorunsho, Hassan RezaTest GenerationNatural Language

  38. Latent Anchor-Driven Test Generation for Deep Neural Networks

    Jun 3, 2026Bin Duan, Matthew B. Dwyer, Guowei YangTest GenerationLatent Space

  39. FATE-VLA:Failue-aware test generation for vision-language-action models

    Jun 1, 2026Arusa Kanwal, Pablo Valle, Shaukat Ali +1Vision-Language-Action FrameworkRobot Policies

  40. FVSpec: Real-World Property-Based Tests as Lean Challenges

    May 31, 2026Quinn Dougherty, Max von Hippel, Simon Henniger +2Formal VerificationTest Generation

  41. GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective Testing

    May 30, 2026Ming Wang, Shuang Wu, Bixuan Wang +7Psychometric PropertiesPsychology

  42. GUITestScape: Towards Open-set Evaluation on Exploratory GUI Testing

    May 28, 2026Xiaoyi Chen, Yifei Gao, Yang Xu +3Graphical User InterfaceTest Generation

  43. STAB: Specification-driven Testing for Algorithmic Bottlenecks

    May 27, 2026Soohan Lim, Joonghyuk Hahn, Hyundong Jin +1Test GenerationBottlenecks

  44. AssertLLM2: A Comprehensive LLM Benchmark for Assertion Generation from Design Specifications

    May 26, 2026Yuchao Wu, Wenji Fang, Jing Wang +3Systemverilog AssertionsHigh-Level Synthesis

  45. Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications

    May 24, 2026Xiaoyue Lu, Xianglin Yang, Haijun Liu +4Artificial Intelligence SafetyTest Generation

  46. SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

    May 21, 2026Yuxuan Sun, Yuze Zhao, Yufeng Wang +6Test GenerationSwe-Bench Verified

  47. Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation

    May 15, 2026Jinuk Kim, Junsoo Byun, Donghwi Hwang +2Test GenerationChip Design

  48. Autonomous Intelligent Agents for Natural-Language-Driven Web Execution with Integrated Security Assurance

    May 14, 2026Vinil Pasupuleti, Siva Rama Krishna Varma Bayyavarapu, Shrey TyagiPenetration TestingBrowser Agent

  49. Given, When, Then, Again: Mining Subscenario Refactoring Candidates in Behaviour-Driven Test Suites with ML Classifiers and LLM-Judge Baselines

    May 14, 2026Ali Hassaan Mughal, Noor Fatima, Muhammad BilalCode RefactoringTest Generation

  50. PBT-Bench: Benchmarking AI Agents on Property-Based Testing

    May 13, 2026Lucas Jing, Xinqi Wang, Liao Zhang +1Agentic BenchmarksTest Generation

  51. CA2: Code-Aware Agent for Automated Game Testing

    May 13, 2026Valliappan Chidambaram Adaikkappan, Vincent Martineau, Joshua Romoff +1Test GenerationCoding Agents

  52. Cochise: A Reference Harness for Autonomous Penetration Testing

    May 12, 2026Andreas Happe, Jürgen CitoPenetration TestingTest Generation

  53. Arcane: An Assertion Reduction Framework through Semantic Clustering and MCTS-Guided Rule Exploring

    May 11, 2026Hongqin Lyu, Yonghao Wang, Zhiteng Chao +2Systemverilog AssertionsHigh-Level Synthesis