Frontier Models

Momentum

23 papers in the last four weeks, up 229% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 125

All topics
CardsList
  1. Finetuning with Sampling: SFT Learns Better Than You Think

    Oct 1, 2026Aayush Karan, Sitan Chen, Yilun DuSupervised FinetuningPost-Training

  2. Growing an Agent/Prover Interface: Evolutionary Tool Design for Cost-Efficient Theorem Proving in Rocq and Lean

    Sep 30, 2026Jules Viennot, Guillaume Baudart, Marc LelargeTheorem ProvingMath Problems

  3. Make Code as Policy Great Again: Frontier Agents Write, Call, and Evolve Robot Tools

    Sep 30, 2026Shijia Ge, Alex Zhou, Jianshu Zeng +12Robotic SystemsFrontier Models

  4. When Context Changes: Understanding Update Failures in LLMs

    Sep 30, 2026Junyu Guo, Yuchen Fang, Shangding Gu +3Large Language Models FailGradient Staleness

  5. Climbing the Hill: Prompt Injection Red-Teaming Against Frontier Models with Curriculum Reinforcement Learning

    Sep 27, 2026Chenlong Yin, Xiaolong Jin, Wei Zou +2Attacker Large Language ModelRed-Teaming

  6. Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models

    Sep 22, 2026Xiaoyu Luo, Tao Ren, Wenrui Yu +3Frontier ModelsChain-of-Thought Reasoning

  7. Dual-Frontier: When Can an Agent Trust Its World Model?

    Sep 22, 2026Huatai Zhu, Qiang Chen, Ziqian Kou +5World ModelsCounterfactual Learning

  8. Evaluating Decision Models for Text Annotation in Computational Social Science

    Sep 21, 2026Hazem Ibrahim, Yasir ZakiLarge Language Model AnnotationsComputational Social Science

  9. Calibrated Decisions at Scale: Converting Police Crash Narratives into Probabilistic Crash Variables with a System One Model (Jev)

    Sep 21, 2026Amir Rafe, Subasish DasAccidentsCrashes

  10. Alignment Forecasting: Predicting Misalignment From Training Data

    Sep 19, 2026Chen Yueh-Han, Bruce W. Lee, Ilia Sucholutsky +1Large Language Model AlignmentMisalignment Persona

  11. Stress-testing Alignment Midtraining

    Sep 17, 2026Sid Baines, Jonathan Bostock, Maria Angelica Martinez +3Post-TrainingFrontier Models

  12. Do Frontier Models Seek Safety Evidence Before Acting?

    Sep 15, 2026Omer TafveezFrontier Models

  13. Data-Efficient Language Modeling: From Frontier Advancement to Principle-Guided Model Improvement

    Sep 12, 2026Shuxing Yang, Kaihao Zhu, Junjie Yang +13Frontier ModelsFrontiers

  14. Feyospace-v1: How the Cyber Mercury Seven Trained Frontier Cyber Models

    Sep 8, 2026Zongjie Li, Alan Z. W, John Nicolas J +4Agentic LearningFrontier Models

  15. GVS5H: Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance

    Aug 27, 2026Victor Gao, Vida Khosrowshahi, Ali Khosrowshahi +4Frontier ModelsTraining-Free

  16. Chartography: A Benchmark for Professional Chart Understanding

    Aug 11, 2026Suhaas Garre, Chris Mutty, Sushant Mehta +1ChartDiagnostic Benchmark

  17. Not a Monolith: Lab-Level Divergence in the Cooperative Equilibria of Chinese Frontier LLM Agents

    Aug 10, 2026Francisco León Zúñiga BolívarFrontier Large Language Model AgentsFrontier Models

  18. Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

    Aug 9, 2026Yijun Pan, Yukun Lian, Kunyu Shi +5Large Language Model AgentsWebarena Domains

  19. Memory--Batch Tradeoffs in Lipschitz Bandits

    Aug 8, 2026Zicheng Lyu, Zengfeng HuangContextual Bandit FrameworkInformation-Theoretic Limits

  20. Ask-E: An Environment for Calibrated Question Generation

    Aug 7, 2026Sarah Pratt, Jae Sung Park, Scott Geng +1Faithful Question GenerationQuestion

  21. SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models

    Aug 5, 2026Sihan Hu, Lyuhan Huang, Youjin Deng +1Frontier Models

  22. Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings

    Aug 5, 2026Agatha Duzan, Asa Cooper SticklandFrontier ModelsChain-of-Thought Reasoning

  23. The Order Is the Guarantee: Verifier-Budgeted Code Deletion with Static-First Learned Proposals

    Aug 5, 2026Ruitong Li, Binjie Guo, Aisheng Mo +4Code QualityVerification Framework

  24. CurveShift: Is Agent Progress Scalar? Separating Level from Shape

    Jul 31, 2026Hanwen Xing, Pengyun Wang, BingXu Meng +8Agentic BenchmarksHard

  25. Distilling Answer Set Programming Theories from Large Language Models

    Jul 30, 2026Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-CondreiAnswer Set ProgrammingNeuro-Symbolic Framework

  26. Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control

    Jul 30, 2026Takumi Shioda, Kohei Terashima, Tatsuo NagaiHvac ControlReinforcement Fine-Tuning

  27. Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks

    Jul 29, 2026Jeff Mohl, Nelson Gardner-Challis, Magda Dubois +6Model AuditingAgentic Benchmarks

  28. Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

    Jul 29, 2026Mayank Sharma, Savira Nadela, Tyler MattesonFrontier ModelsAssessment

  29. APEX-Accounting

    Jul 29, 2026Julien Benchek, Austin Bennett, Jasmin Kern +8Frontier ModelsToken Budget Allocation

  30. HoF-Bench: Rediscovering Real AI-Discovered CVEs Without Frontier Models

    Jul 29, 2026Petr Simecek, Elnaz Babayeva, Jiri Balhar +23Common Vulnerabilities And ExposureOpen-Source

  31. Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

    Jul 20, 2026Jia Ao Sun, Hao Yu, Fengran Mo +4Knowledge GraphsSparql

  32. FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches

    Jul 20, 2026Jiacheng Ding, Cong Guo, Jason XuLarge Language Model ForecastingBetting

  33. Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

    Jul 17, 2026Ajay Patel, Kartik Hosanagar, Ramayya Krishnan +2Artificial Intelligence BenchmarksHuman-Annotated Benchmark

  34. Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs

    Jul 13, 2026Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei LeeCoding AgentsCode Optimization

  35. Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

    Jul 9, 2026Ethan Leung, Elias Lumer, Corey Feld +3Large Language Model JudgesCitations