Model Checkpoints

Momentum

5 papers in the last four weeks, down 17% on the four weeks before. 0.1% of all new papers.

Jul 6Week of Sep 21

Latest papers 36

All topics
CardsList
  1. Reliability-Aware Checkpoint Selection for Domain Generalization

    Sep 30, 2026Jinshi Liu, Jiahao Li, Pan Liu +5Multimodal Domain GeneralizationModel Checkpoints

  2. What Does Post-Training Change in Multilingual Reasoning?

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +2Multilingual Language ModelsLLM Reasoning Strategies

  3. QAM: Quadratic-Accurate Checkpoint Merging via Sequential Consistency

    Sep 28, 2026Shihao Wang, Rui Kong, Xinran Chen +7Model CheckpointsContinual Model Merging

  4. Query Expansion and Key Specialization in Transformer Attention Geometry

    Sep 28, 2026Vidit Gupta, Siddhesh Nadkarni, Mihik Chaudhari +2Transformer AttentionTransformer Architectures

  5. Scored vs. Generated Readouts in Behavioral Language Models: An Empirical Study of Elicitation Format

    Sep 9, 2026Touchapon Kraisingkorn, Krittin Pachtrachai, Wachiravit ModecruaFree-Form Textual RationalesReadout

  6. Lagged Coupling: Internal Representations Become Readable Before They Become Causal

    Sep 1, 2026Xining XunReadoutCausal

  7. The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

    Aug 24, 2026Kai Li, Wenze Ren, Junjie Li +11Speech EnhancementAudio-Visual Consistency

  8. Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification

    Aug 14, 2026Aman Singh Thakur, Rayan KhouryModel CheckpointsModel Weights

  9. Tevatron-Elastic: A Unified Abstraction for Training Elastic Retrievers and Rerankers

    Aug 9, 2026Yu Wang, Shengyao Zhuang, Xueguang Ma +4RetrieversTransformer Architectures

  10. When Oracle Conditioning Misleads Deployment: Conditioning-Availability Bias in Echocardiographic Segmentation

    Aug 4, 2026Dang P. M. Cao, Hieu D. Pham, Hieu PhamEchocardiographyOracles

  11. CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

    Jul 30, 2026Tomer Erez, Moshe Kimhi, Chaim Baskin +1Chest X-RayModel Checkpoints

  12. Similar Models Learn Differently: Final-Window Pretraining Shapes Post-Training Beyond SFT

    Jul 27, 2026Cen Lu, Yung-Chen Tang, Andrea CavallaroModel CheckpointsPost-Training

  13. Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs

    Jul 2, 2026Altay Toktassyn, Jurn-Gyu ParkParameter-Efficient Fine-Tuning MethodsVision Foundation Models

  14. Continual Learning for Sequential Personalization of Small Language Models: A Stability Monitoring Analysis

    Jun 26, 2026Thomas S. Paula, Lucas S. Kupssinskü, Rodrigo C. BarrosSmall Large Language ModelsReplay-Based Continual Learning

  15. Test-Time Training with Next-Token Prediction

    Jun 19, 2026Xuan Ouyang, Zefan Cai, Junjie HuTest-Time TrainingNext-Token Prediction

  16. Quality Is Not a Safety Proxy Under Quantization

    Jun 8, 2026Sahil KadadekarQuantizedSafety Benchmarks

  17. BrainSurgery: Reproducible and Reliable Declarative Weight Manipulations for Model Editing and Upcycling

    Jun 8, 2026Gianluca Barmina, Annemette Broch Pirchert, Andrea Blasi Núñez +2Model CheckpointsModel Weights

  18. Model Merging by Output-Space Projection

    May 27, 2026Bethan Evans, Benjamin Etheridge, Stephen Roberts +1Continual Model MergingMulti--Task Learning

  19. SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

    May 27, 2026Kaihua Qin, Dawn Song, Arthur GervaisSmart ContractsDisassembly

  20. How the Optimizer Shapes Learned Solutions in Equivariant Neural Networks

    May 26, 2026Teodor-Mihai Stupariu, Andrei ManolacheEquivariant Neural NetworksMuon

  21. Position: Weight Space Should Be a First-Class Generative AI Modality

    May 18, 2026Zhangyang Wang, Peihao Wang, Kai WangModel CheckpointsModel Weights

  22. TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training

    May 18, 2026Shujie Han, Feng Jiang, Patrick P. C. Lee +5Model CheckpointsLarge Language Model Training

  23. Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models

    May 17, 2026Ethan TangChessModel Checkpoints

  24. Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

    May 13, 2026Qinwu Xu, Zhuoheng Li, Jessie SalasMultimodal EvaluationLarge Language Model Evaluation

  25. Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes

    Apr 30, 2026Tianyuan Wu, Chaokun Chang, Lunxi Cao +2SandboxIntermediate Checkpoints

  26. Don't stop me now: How Validation Criteria Affect Checkpoint Selection and Early Stopping

    Feb 25, 2026Andrea Apicella, Francesco Isgrò, Andrea Pollastro +1Early StoppingModel Checkpoints

  27. Concertina: Data-Centric Adaptive Pipeline Parallelism for Efficient Heterogeneous Long-Context LLM Training

    Sep 25, 2025Shiju Wang, Yujie Wang, Fangcheng Fu +6Efficient Long-Context InferenceLarge Language Model Training

  28. Cell as Point: One-Stage Framework for Efficient Cell Tracking

    Nov 22, 2024Yaxuan Song, Jianan Fan, Heng Huang +2Multi-Object TrackingCells