Loop Dropout: Regularizing Shared Updates in Looped Language Models
Abstract
Looped language models separate computational depth from parameter count by repeatedly applying the same transformer block. Adapting these models requires a shared update that remains effective as hidden states evolve throughout the recurrent computation. Our empirical analysis reveals a pronounced late-loop bias in standard low-rank adaptation (LoRA): the shared update provides limited adaptation at early loop positions. This imbalance motivates training shared updates under varying combinations of their applications. Randomly omitting adapter applications alone, however, does not improve task performance; it reduces expected update strength during training while leaving inference unchanged. We introduce Loop Dropout, which couples stochastic masking of adapter applications with inverse-survival rescaling to preserve expected update strength and promote effective adaptation across loops. Extensive experiments demonstrate improved mathematical reasoning across model sizes, adapter ranks and training recipes, with benefits extending to general instruction tuning and code generation. Loop Dropout outperforms existing LoRA variants and adapter regularizers, while further analysis shows stronger early-loop adaptation. Every backbone loop remains active, and inference applies the adapter at all loops using standard LoRA without additional trainable parameters or inference computation. Code is available at https://github.com/NUS-HPC-AI-Lab/loop-dropout .
Figures & tables
| Ouro-1.4B | Ouro-2.6B | |||||
|---|---|---|---|---|---|---|
| Benchmark | LoRA | LoRA+ | Loop Dropout | LoRA | LoRA+ | Loop Dropout |
| GSM8K | 85.34 0.64 | 85.54 0.23 | 86.53 0.44 | 87.62 0.52 | 87.21 0.38 | 88.73 0.31 |
| MATH-500 | 38.87 1.67 | 38.13 0.42 | 47.53 2.61 | 42.87 1.17 | 43.40 0.53 | 47.20 0.53 |
| Method | GSM8K | MATH-500 | Train (min) | Memory (GB) |
|---|---|---|---|---|
| LoRA | 85.34 0.64 | 38.87 1.67 | 110.6 | 45.36 |
| LoRA+ | 85.54 0.23 | 38.13 0.42 | 112.8 | 45.40 |
| CoTo-on-Ouro | 85.60 0.76 | 37.80 1.06 | 94.1 | 45.28 |
| LoRA Dropout | 85.77 0.70 | 42.13 0.31 | 444.9 | 45.37 |
| Loop Dropout | 86.53 0.44 | 47.53 2.61 | 128.9 | 45.36 |
| Method | Only loop 1 | Only loop 2 | Only loop 3 | Only loop 4 |
|---|---|---|---|---|
| LoRA | 0.03 0.04 | 0.30 0.46 | 2.63 3.07 | 6.07 4.42 |
| Loop Dropout | 1.31 0.69 | 64.72 13.56 | 86.23 0.84 | 86.18 0.78 |
| Method | GSM8K | MATH-500 |
|---|---|---|
| LoRA | 85.32 0.92 | 40.13 1.62 |
| Unscaled | 84.71 0.19 | 39.33 1.70 |
| Dose control | 85.57 0.88 | 38.60 1.71 |
| Module-wise | 85.52 0.62 | 41.13 0.76 |
| Low-rank weight noise | 85.70 0.54 | 39.13 0.83 |
| Parallel noise | 85.62 0.64 | 37.93 1.33 |
| Without loop mask | With loop mask | |||||
|---|---|---|---|---|---|---|
| Adapters | Rank | Params | GSM8K | MATH-500 | GSM8K | MATH-500 |
| Shared | 16 | 15.1M | 84.69 | 37.00 | 87.04 | 48.40 |
| Independent | 4 | 15.1M | 84.08 | 39.60 | 87.57 | 44.40 |
| Independent | 16 | 60.6M | 84.53 | 39.40 | 86.43 | 43.80 |
Appendix figures & tables25 assets
Supplementary material from the paper’s appendix.
Appendix
| MetaMath-GSM-100k | GSM8K | Tülu 2-100k | |
| Training examples | 100,000 | 6,973 | 98,415 |
| Epochs / optimizer steps | 1 / 3,125 | 2 / 1,744 | 1 / 769 |
| Effective batch | |||
| Maximum sequence length | 1,024 | 512 | 2,048 |
| Warm-up | 3% | 5% | 3% |
| Learning rates | See below | 3e-5 to 6e-4 | 1e-4 |
| Method | Per-seed time | Mean SD | Memory (GB) |
|---|---|---|---|
| LoRA | 111.93 / 106.74 / 113.28 | 110.65 3.45 | 45.36 |
| LoRA+ | 111.20 / 107.74 / 119.40 | 112.78 5.99 | 45.40 |
| CoTo-on-Ouro | 94.95 / 93.32 / 94.06 | 94.11 0.82 | 45.28 |
| LoRA Dropout | 442.39 / 438.34 / 453.98 | 444.91 8.12 | 45.37 |
| Loop Dropout | 130.86 / 128.16 / 127.65 | 128.89 1.72 | 45.36 |
| LoopUS-Qwen3-4B | Huginn | |||
|---|---|---|---|---|
| Benchmark | LoRA | Loop Dropout | LoRA | Loop Dropout |
| GSM8K | 83.93 | 85.52 | 59.89 | 60.11 |
| MATH-500 | 34.60 | 40.80 | 13.00 | 13.80 |
| Method | LR | GSM8K seeds 101 / 102 / 103 | MATH-500 seeds 101 / 102 / 103 |
|---|---|---|---|
| LoRA | 1e-4 | 84.6 / 85.0 / 86.4 | 39.2 / 42.0 / 39.2 |
| Loop Dropout | 1e-4 | 87.7 / 87.0 / 88.0 | 44.0 / 45.4 / 42.6 |
| Unscaled | 1e-4 | 84.5 / 84.7 / 84.9 | 40.6 / 40.0 / 37.4 |
| Unscaled | 2e-4 | 83.8 / 83.8 / 84.8 | 35.6 / 38.0 / 37.4 |
| Dose control | 1e-4 | 85.4 / 84.8 / 86.5 | 36.8 / 40.2 / 38.8 |
| Dose control | 2e-4 | 85.5 / 84.9 / 85.9 | 37.8 / 42.4 / 37.8 |
| Metric | LoRA | Loop Dropout |
|---|---|---|
| MMLU (0-shot) | 68.64 0.40 | 68.91 0.13 |
| BBH (3-shot CoT) | 71.20 0.14 | 70.78 0.11 |
| TruthfulQA MC2 | 47.32 1.02 | 48.19 0.68 |
| HumanEval | 71.54 2.14 | 72.56 0.61 |
| HumanEval+ | 67.68 3.05 | 69.92 0.35 |
| MBPP | 75.57 0.40 | 76.72 0.53 |
| Variant | Mask | LR 1e-4 | LR 3e-4 |
|---|---|---|---|
| LoRA | none | 80.6 0.3 | 78.1 1.0 |
| Loop Dropout | uniform | 81.7 0.2 | 81.3 0.7 |
| Early-heavy profile | 82.1 0.2 | 79.4 2.6 | |
| Late-heavy profile | 80.0 0.5 | 77.9 1.0 | |
| Ramp down | 80.7 0.8 | 79.3 0.4 | |
| Ramp up | 80.0 0.8 | 79.0 2.6 |
| Rank | Benchmark | LoRA | Loop Dropout | Difference |
|---|---|---|---|---|
| 4 | GSM8K | 85.82 0.20 | 86.38 0.50 | |
| 4 | MATH-500 | 39.00 1.25 | 46.07 1.17 | |
| 64 | GSM8K | 85.44 1.12 | 87.01 0.49 | |
| 64 | MATH-500 | 37.87 1.70 | 43.33 1.85 | |
| 128 | GSM8K | 85.06 0.62 | 86.48 0.22 | |
| 128 | MATH-500 | 34.80 1.00 | 41.60 1.39 |
| Missing answers (%) | Net gain (points) | ||||
|---|---|---|---|---|---|
| Rank | LoRA | Loop Dropout | Both extractable | Missing in either | Total |
| 4 | 8.80 | 9.60 | 6.80 | 0.27 | 7.07 |
| 64 | 7.60 | 5.60 | 4.80 | 0.67 | 5.47 |
| 128 | 7.80 | 5.67 | 6.00 | 0.80 | 6.80 |
| Method | Rank | LR | GSM8K | MATH-500 | |
|---|---|---|---|---|---|
| LoRA | 4 | 1e-4 | – | 85.90 / 85.60 / 85.97 | 38.0 / 38.6 / 40.4 |
| Loop Dropout | 4 | 1e-4 | – | 86.13 / 86.05 / 86.96 | 45.6 / 47.4 / 45.2 |
| LoRA | 64 | 1e-4 | – | 84.15 / 86.20 / 85.97 | 36.2 / 39.6 / 37.8 |
| Loop Dropout | 64 | 1e-4 | – | 87.57 / 86.66 / 86.81 | 44.4 / 41.2 / 44.4 |
| LoRA | 128 | 1e-4 | – | 84.91 / 84.53 / 85.75 | 35.8 / 33.8 / 34.8 |
| Loop Dropout | 128 | 1e-4 | – | 86.35 / 86.35 / 86.73 | 43.2 / 40.8 / 40.8 |
| Seed | GSM8K | MATH-500 |
|---|---|---|
| 101 | 84.84 | 37.40 |
| 102 | 85.60 | 39.00 |
| 103 | 86.35 | 37.00 |
| Mean SD | 85.60 0.76 | 37.80 1.06 |
| LoRA+ | LoRA Dropout | |||
|---|---|---|---|---|
| Seed | GSM8K | MATH-500 | GSM8K | MATH-500 |
| 101 | 85.29 | 37.80 | 85.44 | 42.20 |
| 102 | 85.60 | 38.60 | 85.29 | 41.80 |
| 103 | 85.75 | 38.00 | 86.58 | 42.40 |
| Mean SD | 85.54 0.23 | 38.13 0.42 | 85.77 0.70 | 42.13 0.31 |
| Method | Params | GSM8K | MATH-500 |
|---|---|---|---|
| Shared LoRA, rank 16 | 30.3M | 87.62 0.52 | 42.87 1.17 |
| LoRA+, rank 16 | 30.3M | 87.21 0.38 | 43.40 0.53 |
| Independent, rank 4 | 30.3M | 85.95 2.59 | 43.60 0.40 |
| Independent, rank 16 | 121.1M | 85.87 0.87 | 41.40 1.71 |
| Loop Dropout, rank 16 | 30.3M | 88.73 0.31 | 47.20 0.53 |
| Method | LR | GSM8K | MATH-500 |
|---|---|---|---|
| Shared LoRA, rank 16 | 88.02 / 87.04 / 87.79 | 42.00 / 44.20 / 42.40 | |
| LoRA+, rank 16 | 87.04 / 86.95 / 87.64 | 43.80 / 42.80 / 43.60 | |
| Independent, rank 4 | 86.88 / 87.95 / 83.02 | 43.20 / 44.00 / 43.60 | |
| Independent, rank 16 | 85.90 / 84.99 / 86.73 | 39.80 / 41.20 / 43.20 | |
| Loop Dropout, rank 16 | 89.01 / 88.78 / 88.40 | 47.80 / 47.00 / 46.80 |
| Rank | Method | GSM8K | MATH-500 |
|---|---|---|---|
| 4 | LoRA | 85.82 0.20 | 39.00 1.25 |
| 4 | Loop Dropout | 86.38 0.50 | 46.07 1.17 |
| 16 | LoRA | 85.34 0.64 | 38.87 1.67 |
| 16 | Loop Dropout | 86.53 0.44 | 47.53 2.61 |
| 64 | LoRA | 85.44 1.12 | 37.87 1.70 |
| 64 | Loop Dropout | 85.87 0.48 | 40.73 1.42 |
| Rank | Method | LR | GSM8K | MATH-500 |
|---|---|---|---|---|
| 4 | LoRA | 85.90 / 85.60 / 85.97 | 38.00 / 38.60 / 40.40 | |
| 4 | Loop Dropout | 86.13 / 86.05 / 86.96 | 45.60 / 47.40 / 45.20 | |
| 16 | LoRA | 84.69 / 85.37 / 85.97 | 37.00 / 40.20 / 39.40 | |
| 16 | Loop Dropout | 87.04 / 86.35 / 86.20 | 48.40 / 49.60 / 44.60 | |
| 64 | LoRA | 84.15 / 86.20 / 85.97 | 36.20 / 39.60 / 37.80 | |
| 64 | Loop Dropout | 85.60 / 85.60 / 86.43 | 42.00 / 39.20 / 41.00 |
| Group | LoRA | Loop Dropout | Difference | |
|---|---|---|---|---|
| Algebra | 124 | 58.33 3.05 | 72.04 3.05 | |
| Counting & Probability | 38 | 29.82 9.24 | 39.47 2.63 | |
| Geometry | 41 | 32.52 6.14 | 38.21 3.73 | |
| Intermediate Algebra | 97 | 19.59 1.03 | 25.43 6.21 | |
| Number Theory | 62 | 40.32 5.59 | 44.09 4.06 | |
| Prealgebra | 82 | 54.88 4.40 | 62.60 1.86 |
| Method | Train | Eval | Eval | Eval |
|---|---|---|---|---|
| LoRA | 4 | 79.9 1.0 | 75.0 1.0 | 70.8 1.9 |
| LoRA | 6 | 82.4 1.1 | 82.3 0.7 | 77.8 0.7 |
| LoRA | 8 | 80.3 1.4 | 81.8 0.6 | 81.6 0.9 |
| Loop Dropout | 4 | 81.8 0.5 | 78.0 1.7 | 75.6 1.3 |
| Loop Dropout | 6 | 83.0 0.3 | 83.3 0.7 | 80.5 0.8 |
| Loop Dropout | 8 | 83.4 0.5 | 83.6 0.5 | 82.1 0.8 |
| Model | Method | LR | GSM8K |
|---|---|---|---|
| Ouro-1.4B | LoRA | 1e-4 | 79.9 1.0 |
| Ouro-1.4B | LoRA+ | 1e-4 | 79.8 0.5 |
| Ouro-1.4B | rsLoRA | 1e-4 | 79.8 0.9 |
| Ouro-1.4B | Loop Dropout | 1e-4 | 81.8 0.5 |
| Ouro-1.4B | LoRA | 1e-4 | 80.4 0.6 |
| Ouro-1.4B | Loop Dropout | 1e-4 | 81.9 0.4 |
| LR | LoRA | Loop Dropout | |
|---|---|---|---|
| 3e-5 | 80.4 0.4 | 80.9 0.3 | |
| 1e-4 | 80.4 0.6 | 81.9 0.4 | |
| 2e-4 | 79.8 1.5 | 82.2 0.6 | |
| 3e-4 | 78.6 1.1 | 81.2 0.6 | |
| 6e-4 | 72.4 0.7 | 73.8 0.8 |
| GSM8K-Platinum | GSM-Plus mini | ||||
| Method | LR | Accuracy | vs. LoRA | Accuracy | vs. LoRA |
| LoRA | 1e-4 | 82.4 0.0 | – | 58.9 0.7 | – |
| Input dropout | 1e-4 | 81.7 0.4 | 59.1 0.4 | ||
| Loop Dropout | 1e-4 | 83.8 0.4 | 60.0 0.2 | ||
| LoRA | 3e-4 | 80.3 0.4 | – | 56.0 1.0 | – |
| Input dropout | 3e-4 | 80.7 1.7 | 57.0 1.1 | ||
| Seeds | LoRA | Loop Dropout | ||
|---|---|---|---|---|
| 2 | 0–2 | 68.6 0.8 | 70.7 0.3 | |
| 4 | 0–4 | 80.4 0.6 | 81.9 0.4 | |
| 6 | 0–2 | 81.6 0.6 | 83.2 1.2 | |
| 4 | 101–103 | 79.9 1.0 | 81.8 0.5 | |
| 6 | 101–103 | 82.3 0.7 | 83.3 0.7 | |
| 8 | 101–103 | 81.6 0.9 | 82.1 0.8 |
| Final-loop loss | All-on | |||||
|---|---|---|---|---|---|---|
| Method | LR | Only 1 | Only 2 | Only 3 | Only 4 | accuracy |
| LoRA | 0.7437 | 0.6834 | 0.6208 | 0.5709 | 80.59 | |
| Unscaled | 0.5309 | 0.5082 | 0.4984 | 0.5037 | 77.03 | |
| Loop Dropout | 0.5847 | 0.5475 | 0.5409 | 0.5432 | 81.73 | |
| LoRA | 0.7493 | 0.6835 | 0.6159 | 0.5317 | 77.86 | |
| Unscaled | 0.5152 | 0.4907 | 0.4824 | 0.4895 | 73.84 | |
| Readout | LoRA | Loop Dropout |
|---|---|---|
| Loop 1 | 1.240 0.041 | 1.047 0.010 |
| Loop 2 | 0.836 0.006 | 0.765 0.005 |
| Loop 3 | 0.742 0.009 | 0.717 0.002 |
| Loop 4 | 0.737 0.010 | 0.700 0.005 |