Skillgym

Momentum

13 papers in the last four weeks, up 333% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 54

All topics
CardsList
  1. AuraForge: Scaling Security Supervision for Training Coding Agents

    Oct 1, 2026Danqing Wang, Songwen Zhao, Harsh Sharma +4Coding AgentsForge

  2. ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality

    Sep 30, 2026Xisen Jin, Jingheng Li, Zhenglun Chen +2Long-Horizon AgentsLong-Term Agent Memory

  3. ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

    Sep 29, 2026İbrahim Ethem Deveci, Funda Tan Çalık, Barış Deniz Sağlam +1Reasoning BenchmarkLLM Reasoning Strategies

  4. SkillGym: Training Skill-Use Agents with Automatic Verifiable Environment Generation

    Sep 29, 2026Renxi Wang, Mingshan Hee, Fajri Koto +2SkillgymSupervised Finetuning

  5. Foundations of Proactive Agents: Principles, Technical Layers, and Proactivity-Gym

    Sep 29, 2026Jio Oh, Seunghyun Do, Young-Jun Lee +2Large Language Model AgentsUser Simulation

  6. Real2Gym: Building Gyms from Videos, Bringing Skills to Robots

    Sep 29, 2026Kerui Ren, Yingxiang Xu, Kaiwen Song +4Robotic SystemsRobot Systems

  7. WitnessGym: Benchmarking Coding Agents on the Construction of Bug Witnesses

    Sep 29, 2026Haomin Qi, Xiangzhe Xu, Yiming Huang +2BugCoding Agents

  8. V-Gym: Enhancing Agentic Visual Reasoning via Skill-Data Co-Evolution

    Sep 28, 2026Bei Yan, Yuecong Min, Jie Zhang +3Multimodal AgentsMultimodal Reasoning Benchmarks

  9. SkillGym: Internalizing Human Skills into LLMs for Real-World Problem Solving

    Sep 23, 2026Zhilong Ge, Yuting Shao, Yutao Yang +6Reusable Agent SkillsSkills

  10. DeliveryGym: An RL Environment for Long-Horizon Embodied Agent Planning with Adaptive Curriculum

    Sep 17, 2026Haoqiang Kang, Yiming Zhang, Yiyang Guo +5Embodied AgentsSkillgym

  11. SAiFE-gym: Model-based Environments for Automated Market Making with Concentrated Liquidity

    Sep 15, 2026Georgios Chionas, Charalampos Kleitsikas, Stefanos Leonardos +2TradingMatching Markets

  12. Feyospace-v1: How the Cyber Mercury Seven Trained Frontier Cyber Models

    Sep 8, 2026Zongjie Li, Alan Z. W, John Nicolas J +4Agentic LearningFrontier Models

  13. PaperGym: Rubric-Centered Evolution for Research-Plan Generation

    Aug 31, 2026Yuhan Wang, Zhengxi Lu, Yuchen Yan +6Research AutomationRubrics

  14. Beyond Forgetting: Diagnosing and Harnessing Shared Reasoning in Continual RLVR

    Aug 19, 2026Lirui Luo, Guoxi Zhang, Hongming Xu +3Reinforcement Learning With Verifiable RewardIcr-Rl

  15. RideGym: A Standardized Interface for Real-World Large-Scale Ride-Sharing System

    Jul 11, 2026Zijian Zhao, Yulong Hu, Sen LiBike-Sharing SystemsRoad Networks

  16. Gimitest: A Comprehensive Tool for Testing Reinforcement Learning Policies

    Jul 8, 2026Dennis Gross, Quentin Mazouni, Helge Spieker +1Multi-Agent Reinforcement LearningSkillgym

  17. FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games

    Jul 7, 2026Chase McDonald, Nathan Tsang, Wesley N. KerrImperfect-Information GamesSkillgym

  18. AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

    Jul 6, 2026Zhiheng Xi, Dingwen Yang, Jiaqi Liu +22Large Language Model AgentsSkillgym

  19. EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

    Jul 2, 2026Zhilin Wang, Han Song, Runzhe Zhan +13On-Policy Self-EvolutionSkillgym

  20. STEMGym: Benchmarking Sequential Decision-Making under Dose Budgets in Autonomous Electron Microscopy

    Jun 28, 2026Can Polat, Erchin Serpedin, Mustafa Kurban +1Electron MicroscopyDose

  21. GLACIER: Rethinking Mass Spectrum Prediction as an Object Detection Problem

    Jun 28, 2026Rui-Xi Wang, Runzhong Wang, Connor W. ColeyTandem Mass SpectraDetection Transformer

  22. SVGym (SciVerseGym): An Environment for Reinforcement Learning and Bayesian Optimization in Crystal Discovery

    Jun 21, 2026Bin CaoCrystalData-Driven Materials Discovery

  23. MassSpecGym in the Wild: Uncovering and Correcting Evaluation Pitfalls in AI-Driven Molecule Discovery

    Jun 17, 2026Hongxuan Liu, Roman Bushuiev, Ivy Lightheart +12Tandem Mass SpectraMle-Bench Lite

  24. SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

    Jun 16, 2026Congjie Zheng, Chuanyi Xue, Bin Liang +2Self-Evolving AgentsAgent Harness

  25. SkillChain-Gym: A Benchmark for Reskilling-Aware Production-Inventory Control under Disruptions

    Jun 15, 2026Carlos Eduardo SanojaInventory ControlJob Shop Scheduling

  26. LatentGym: A Testbed For Cross-Task Experiential Learning With Controllable Latent Structure

    Jun 13, 2026Daksh Mittal, Tommaso Castellani, Thomson Yen +7Agentic LearningSkillgym

  27. CyberGym-E2E: Scalable Real-World Benchmark for AI Agents' End-to-End Cybersecurity Capabilities

    Jun 3, 2026Tianneng Shi, Robin Rheem, Dongwei Jiang +13CybersecuritySecurity Evaluation

  28. A Unified Benchmark for Dynamic Medical Treatment Reinforcement Learning

    May 31, 2026Yuepeng Wang, Ken Kawano, Yoshihiko Fujisawa +12TreatmentSkillgym

  29. Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

    May 26, 2026Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal +6AutoformalizationRaw Judge Outputs

  30. MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research

    May 25, 2026Dingbang Wu, Rui Hao, Haiyang Wang +8SkillgymSimulation-Based Reinforcement Learning

  31. CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents

    May 25, 2026Bowen Wang, Dunjie Lu, Junli Wang +11Reinforcement Learning With Verifiable RewardSynthetic Environments

  32. From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents

    May 21, 2026Murong Ma, Tianyu Chen, Yun Lin +7Swe-Bench VerifiedImitation

  33. MemGym: a Long-Horizon Memory Environment for LLM Agents

    May 20, 2026Wujiang Xu, Yu Wang, Kai Mei +8Agentic MemoryLarge Language Model Agents

  34. ShopGym: An Integrated Framework for Realistic Simulation and Scalable Benchmarking of E-Commerce Web Agents

    May 15, 2026Chinmay Savadikar, Mingyu Zhao, Yuanzheng Zhu +5Synthetic EnvironmentsSkillgym

  35. Chrono-Gymnasium: An Open-Source, Gymnasium-Compatible Distributed Simulation Framework

    May 14, 2026Bocheng Zou, Harry Zhang, Khailanii Slaton +5Physics SimulationRigid-Body Dynamics

  36. Towards Affordable Energy: A Gymnasium Environment for Electric Utility Demand-Response Programs

    May 12, 2026Jose E. Aguilar Escamilla, Lingdong Zhou, Xiangqi Zhu +1Demand ResponseElectricity Markets

  37. MDGYM: Benchmarking AI Agents on Molecular Simulations

    May 9, 2026Vinay Kumar, Satyendra Rajput, Mausam +1Molecular DynamicsArtificial Intelligence Agents

  38. NARRA-Gym for Evaluating Interactive Narrative Agents

    May 8, 2026Yue Huang, Yuchen Ma, Jiayi Ye +14SkillgymEmotion

  39. Coopetition-Gym v1: A Formally Grounded Platform for Mixed-Motive Multi-Agent Reinforcement Learning under Strategic Coopetition

    May 3, 2026Vik Pant, Eric YuCooperationMulti-Agent Reinforcement Learning

  40. EO-Gym: A Multimodal, Interactive Environment for Earth Observation Agents

    May 2, 2026Sai Ma, Zhuang Li, Sichao Li +4Earth ObservationGeospatial Reasoning

  41. D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

    Apr 30, 2026Hanane Nour Moussa, Yifei Li, Zhuoyang Li +7Data Science AgentsSkillgym

  42. A Reproducibility Study of LLM-Based Query Reformulation

    Apr 30, 2026Amin Bigdeli, Radin Hamidi Rad, Hai Son Le +4ReproducibilitySkillgym

  43. SeekerGym: A Benchmark for Reliable Information Seeking

    Apr 18, 2026Remy Kim, Minseung Lee, Shuo Li +1SkillgymCompletion

  44. CoGrid & the Multi-User Gymnasium: A Framework for Multi-Agent Experimentation

    Apr 16, 2026Chase McDonald, Cleotilde GonzalezMulti-Agent SimulationsHuman-Ai Interaction

  45. MMAI Gym for Science: Training Liquid Foundation Models for Drug Discovery

    Mar 3, 2026Maksim Kuznetsov, Zulfat Miftahutdinov, Rim Shayakhmetov +17Drug DiscoveryMolecular Optimization

  46. VectorGym: A Multi-Task Benchmark for SVG Code Generation, Sketching and Editing

    Feb 22, 2026Joan Rodriguez, Haotian Zhang, Abhay Puri +14Scalable Vector GraphicSketches

  47. The HydroGym Reinforcement Learning Platform for Fluid Dynamics

    Dec 19, 2025Christian Lagemann, Sajeda Mokbel, Miro Gondrum +18Fluid DynamicsFluid Controls

  48. ICR-RL: Deep Reinforcement Learning via In-Context Regression

    Sep 14, 2025David Schiff, Ofir Lindenbaum, Yonathan EfroniIcr-RlIn-Context Learning

  49. BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Injection

    Aug 12, 2025Sekh Mainul Islam, Nadav Borenstein, Siddhesh Milind Pawar +3Large Language Model BiasBiases

  50. SafeOR-Gym: A Benchmark Suite for Safe Reinforcement Learning Algorithms on Practical Operations Research Problems

    Jun 2, 2025Asha Ramanujam, Adam Elyoumi, Hao Chen +5Safety ConstraintsOperations Research

  51. OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

    Date pendingKaicheng Zhang, Wen Ge, Lei Jiang +5SkillgymTrading