Sequential Scaling

Momentum

11 papers in the last four weeks, up 120% on the four weeks before. 0.1% of all new papers.

Jul 6Week of Sep 21

Latest papers 74

All topics
CardsList
  1. In-context Learning of Single-index Targets: Comparing Kernel and Feature Learners

    Oct 1, 2026Haotian Gu, Yizhou Xu, Lenka ZdeborováIn-Context LearningLinear Attention

  2. Looping Beyond Twice: A Scalable Recipe for Looped Mixture-of-Experts

    Oct 1, 2026Di He, Pengxiang Li, Da Chang +3Mixture-Of-Experts Large Language ModelsMixture-Of-Experts

  3. Does Scaling Reinforcement Learning Really Require More Training?

    Oct 1, 2026Bangji Yang, Jiajun Fan, Hongba Ma +2Offline Reinforcement LearningSequential Scaling

  4. Overcoming Kernel Redundancy for Scaling Logic Gate Networks

    Oct 1, 2026Sejin Park, Hongjae Lee, Changwoo Han +1Differentiable Logic Gate NetworksSequential Scaling

  5. Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

    Sep 30, 2026Minki Kang, Ryo Hachiuma, Shaokun Zhang +8Test-Time ScalingAgent Harness

  6. TRACE: Trajectory Selection for Parallel Scaling of Search Agents

    Sep 30, 2026Qisheng Zhou, Zhen Xiong, Qiaoyu TanSearch AgentsTraces

  7. Towards Better Exploration in Sequential Test-Time Scaling

    Sep 30, 2026Joseph Rance, Fabio Pizzati, Juil Sock +4Test-Time ScalingSequential Scaling

  8. SteerQuant: Steering Quantization Error with Action-Guided Scaling in World-Action Models

    Sep 30, 2026Yunhan Wang, Haodong Wang, Zhiming Liu +7SteeringSequential Scaling

  9. Mitigating the Length-Scaling Tax with Online Distillation

    Sep 30, 2026Xu Wan, Wenyue Xu, Shengjie Zhao +1Sequential ScalingSymbolic Distillation

  10. Pruning for Efficiency, Paying in Fairness: Demographic Disparities in Pruned Speech-LLMs

    Sep 29, 2026Ganesh Pavan Kartikeya Bharadwaj Kolluri, Michael Kampouridis, Ravi ShekharCharacter Error RateDisparities

  11. Port-Hamiltonian Latent Deliberation: Mitigating the Deliberation Drift Cliff in Test-Time Compute Scaling

    Sep 29, 2026Zeyu JiaTest-Time ScalingEfficient Latent Reasoning

  12. Longer Records, Broader Invariance: The Hidden Scaling Problem in Longitudinal Contrastive Learning

    Sep 29, 2026Rameen Mahmood, Xuhai "Orson" Xu, Zachary Beattie +2Longitudinal DataContrastive Learning

  13. From Search to Research: Exploring Search Scaling in Autonomous Quantitative Factor Mining

    Sep 28, 2026Kangcheng Deng, Hui Cai, Jiacheng Lu +6Research AutomationSequential Scaling

  14. DISCO: Distributed Long Context Scaling with Grounding-Reasoning Disaggregation

    Sep 27, 2026Guanzheng Chen, Viet Dac Lai, Subhojyoti Mukherjee +5Efficient Long-Context InferenceLLM Reasoning Strategies

  15. NaviScale: Generating Large-Scale Semantic Map Datasets for Object Navigation

    Sep 23, 2026Chuanlin Lan, Yanwei Zheng, Yuxi Jing +6Object Goal NavigationNavigation

  16. Taking a Second Look: Correcting Sea Ice Forecasts with Sparse Observations

    Sep 21, 2026Tianshuo Zhang, Xianglei Xing, Aowen Yang +4Sea-Surface Temperature DataForecast

  17. Rethinking Procedural Audio Pre-training: Source Scaling and Objective Adaptation

    Sep 14, 2026Jiajun Peng, Fengrui Liu, Xinyu Liu +1Neural AudioProcedural

  18. Inference for Newton Methods with Accelerated Sketch-and-Project via Random Scaling

    Sep 14, 2026Xinchen Du, Elizaveta Rebrova, Micha\l Dereziński +1NewtonCovariance

  19. Scalability Analysis of Distributed Kolmogorov-Arnold Network Training on High-Performance Computing Systems

    Sep 7, 2026Guangneng Chen, David Garcia Selfa, Pablo Quesada BarriusoKolmogorov-Arnold NetworksHigh-Performance Computing

  20. Correlated initialization of deep residual networks

    Sep 3, 2026Felix Benning, Ivan Nourdin, Giovanni PeccatiResidual NetworksInfinities

  21. HBQ: Hierarchical Scaling Block Quantization with Hardware-Efficiency-Aware Design for Accurate LLM Inference

    Aug 31, 2026Chun-Ting Chen, Dongmin Han, Hangyeol Mun +6Gradient QuantizationLLM Inference Optimization

  22. RSLM: Training-Free Vector Quantization for Approximate Nearest Neighbor Search

    Aug 31, 2026Rastislav Lenhardt, Teodora Dobos, Thomas Vecchiato +2Residual Vector QuantizationApproximate Nearest-Neighbor Search

  23. Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation

    Aug 28, 2026Di Wu, Sergey Troshin, Christof Monz +2Test-Time ScalingMachine Translation

  24. XYZFlow:Scaling Multi dimensional Shortcut Flows for Efficient Generative Modeling

    Aug 12, 2026Jinxiu Liu, Xuanming Liu, Kangfu Mei +2Generative Flow NetworksDiffusion Models

  25. Online Learning of Scale Parameters in Score-Driven Filters

    Aug 10, 2026Fabrizio Lillo, Giulia Livieri, Gianluca PalmariMirror DescentSequential Scaling

  26. Spatiotemporal Context-dependent Personalized Movement Compensation in Delayed Telemanipulation

    Aug 8, 2026Sai Jiang, Zonghe ChuaTeleoperationSequential Scaling

  27. ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

    Aug 4, 2026Yang Yang, Qinyu Zhao, Mouxiang Chen +5Multimodal Large Language ModelsVision Transformer

  28. KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models

    Jul 30, 2026Sparsh Roy, Samuel Girmachew, Nishita ChavanFairness AuditsRisk Stratification

  29. Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

    Jul 14, 2026Xinyu Tang, Qianggang Cao, Yurou Liu +13Reinforcement Learning With Verifiable RewardTest-Time Scaling

  30. Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks

    Jul 8, 2026Yedi Zhang, Peter E. Latham, Leena Chennuru Vankadara +1BatchSequential Scaling

  31. Will Scaling Improve Social Simulation with LLMs?

    Jul 2, 2026Caleb Ziems, William Held, Su Doga Karaca +3Scaling Improve Social SimulationSequential Scaling

  32. Optimal scaling of MCMC algorithms: the Hamiltonian approach

    Jul 1, 2026P. Dobson, J. M. Sanz-Serna, K. C. ZygalakisMarkov Chain Monte CarloSequential Scaling

  33. MixTTA: Low-Rank Cross-Channel Mixing for Reliable Test-Time Adaptation

    Jun 26, 2026Mansoo Jung, Youngwook Kim, Jungwoo LeeStable Test-Time AdaptationTest-Time Adaptation

  34. Model selection with proper scoring rules on data sets of time series: prefer the mean scaled score

    Jun 23, 2026Giorgio Corani, Stefano Damato, Dario Azzimonti +1Model SelectionProbabilistic Forecasting

  35. Self-Adaptive Scale Handling for Forecasting Time Series with Scale Heterogeneity

    Jun 18, 2026Xu Zhang, Zhengang Huang, Yunzhi Wu +6Time Series ForecastingTime Series

  36. Recursive Scaling in Masked Diffusion Models

    Jun 16, 2026Alba Carballo-Castro, Julianna Piskorz, Paulius Rauba +2Masked Diffusion Language ModelsDiffusion Models

  37. Training and Evaluating Diffusion Policies with Long Context Lengths

    Jun 15, 2026Abhinav Agarwal, Adam Wei, Taylan Kargin +6Imitation LearningDiffusion Policies

  38. The Hidden Power of Scaling Factor in LoRA Optimization

    Jun 11, 2026Zicheng Zhang, Haoran Li, Jiaxing Wang +10BatchMulti-Lora

  39. A Riemannian Approach to Low-Rank Optimal Transport

    Jun 10, 2026Pratik Jawanpuria, Bamdev MishraLow-Rank StructureRiemannian Optimization

  40. AVIS: Adaptive Test-Time Scaling for Vision-Language Models

    Jun 10, 2026Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni +8Fast InferenceEfficient Inference

  41. Exploring the Scale and Diversity of Speech Anti-spoofing Datasets: Experiments and Analysis

    Jun 6, 2026Zhuolin Yi, Jun Xue, Yanzhen Ren +5Cross-Dataset BenchmarkSequential Scaling

  42. HORIZON: Recoverability-Governed Curriculum for Physical-Domain Scaling

    Jun 3, 2026Chenhao Bai, Liqin Lu, Kaijun Wang +5Robot PoliciesCurriculum

  43. Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

    Jun 3, 2026Yacouba Kaloga, Shashi Kumar, Shakeel A. Sheikh +3Automatic Speech RecognitionTransformer Architectures

  44. Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking

    Jun 2, 2026Zekun Qi, Xuchuan Chen, Dairu Liu +10Generative Pretrained TransformersSequential Scaling

  45. Provable Data Scaling Law for Meta Learning via Complexity Minimization

    Jun 1, 2026Kazuto Fukuchi, Ryuichiro Hataya, Kota MatsuiMeta-LearningPretraining

  46. Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling

    May 30, 2026Qiao Xiao, Boqian Wu, Patrik Okanovic +6Large Language Model TrainingSparsity

  47. Balancing Learning Rates Across Layers: Exact Two-Step Dynamics and Optimal Scaling in Linear Neural Networks

    May 29, 2026Tianyu Pang, Vignesh Kothapalli, Shenyang Deng +3BatchTwo-Layer Neural Networks

  48. Snippet-Driven Supply Chain Discovery with LLMs: Scaling Visibility in China

    May 27, 2026Hiroto Fukada, Takayuki MizunoSupply Chain OptimizationKnowledge Graphs

  49. RAS: Reflection-Augmented Scaling with In-Context Learning for Executable Cypher Query Generation

    May 21, 2026Minseok Jung, Abhas Ricky, Muhammad Rameez ChatniInference-TimeText2Cypher

  50. Position: The Turing-Completeness of Autoregressive Transformers Relies Heavily on Context Management

    May 19, 2026Guanyu Cui, Zhewei Wei, Kun HeAutoregressive TransformersTransformer Architectures