Inference-Time Language Model Alignment

Latest papers 36

All topics
CardsList
  1. Efficient Best-of-N policy evaluation for inference-time alignment

    Oct 7, 2026Jonas Schweisthal, Yuxin Wang, Athiya Deviyani +2Best-of-N SamplingOff-Policy Evaluation

  2. The Asymptotics of Language Model Alignment with Memory

    Oct 1, 2026Haricharan Balasundaram, V. Arvind RameshwarRL for Language ModelsLLM Alignment

  3. HeadEdit: Calibrating Language Model Behavior Through the Frozen Unembedding Matrix

    Oct 1, 2026Zirui He, Haiyan Zhao, Jingyu Hu +5Language Model SteeringLanguage Model Calibration

  4. Ready2Blend: From Natural-Language Instructions to Composable Alignment Prompts

    Sep 30, 2026Jeesu Jung, Hwan Chang, Juseon Do +5Continual Learning for LLMsLLM Alignment

  5. Aligned Data Can Induce Misalignment via Context Confusion

    Sep 29, 2026Yavuz Bakman, Duygu Nur Yaldiz, Baris Askin +4LLM AlignmentLLM Post-Training

  6. Rethinking Personalized Generation: Test-Time Alignment via Factorized Ranking Models

    Sep 28, 2026Qiyao Ma, Junshan Zhang, Zhe ZhaoLearning to RankLLM Reranking

  7. Direct Hidden-State Alignment: Mapping and Controlling Preference Expression in LLMs

    Sep 27, 2026Fansheng Zhang, Shengran Guo, Zexiao Wang +3LLM AlignmentPreference Alignment

  8. Minimally Invasive Steering of Language Models

    Sep 24, 2026Taha Entesari, Jingyu Zhang, Daniel Khashabi +1Language Model SteeringInference-Time Language Model Alignment

  9. From Static Personal Values to Contextualized Personalization: Bayesian Personalized Value Alignment for LLMs

    Sep 24, 2026Hanze Guo, Aixuan Song, Jing Yao +4LLM AlignmentPersonalized Language Models

  10. An Efficient and Modular Framework for Targeted Harm Mitigation in LLMS

    Sep 12, 2026Roberto Campbell, Momin Abbass, Muneeza Azmat +5LLM Safety AlignmentLow-Rank Adaptation

  11. Inference-Time Nash Alignment

    Sep 8, 2026Hadi Hosseini, Debmalya Mandal, Duohan ZhangInference-Time OptimizationPreference Alignment

  12. Trust Your Guide Only When Certain: Uncertainty-Aware Sparse Alignment at Inference Time

    Sep 1, 2026Zeen Zhu, Zhuo Li, Weiyang Guo +4LLM Safety AlignmentInference-Time Language Model Alignment

  13. Beyond Token-Level Guidance: Inference-Time Alignment of Specialized LLMs via Cross-Family Representation Steering

    Aug 31, 2026Jin Gan, Xin Li, Jun LuoLLM Safety AlignmentLanguage Modeling

  14. Evolutionary Soups: Evolving Mixture-of-Experts for Multi-Objective LLM Alignment

    Aug 30, 2026Lingxiao Kong, Steffen Staab, Cong Yang +2Mixture-of-Experts Language ModelsMulti-Objective Language Model Alignment

  15. Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport

    Aug 11, 2026Bohan Zhang, Anqi Ni, Yixin Wang +1Supervised Fine-TuningLLM Personalization

  16. CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

    Aug 10, 2026Bingcan Guo, Eryue Xu, Jijie Zhou +2Preference AlignmentInference-Time Language Model Alignment

  17. Deployable Per-Instance Multi-Layer Activation Steering for Large Language Models

    Aug 9, 2026Muhammad Faishal Adly Nelwan, Alfan Farizki WicaksonoLanguage Model SteeringControllable Text Generation

  18. Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

    Jul 25, 2026Rares A. C. Diaconescu, Iulia Slanina, Alina Florea +5LLM AlignmentLLM Safety Alignment

  19. Best-of-Better-NN: Generating Pre-Aligned Responses with In-Context Learning

    Jul 3, 2026Eric Lei, Hsiang Hsu, Chun-Fu ChenLLM AlignmentBest-of-N Sampling

  20. Safe Inference-Time Alignment via Lagrangian Reward Augmentation

    Jul 2, 2026Yaswanth Chittepu, Ativ Joshi, Sohini Chintala +1LLM AlignmentLLM Safety Alignment

  21. Towards Spec Learning: Inference-Time Alignment from Preference Pairs

    Jun 22, 2026Dhriti Krishnan, Tejas Goyal, Jaromir SavelkaLLM AlignmentPrompt Optimization

  22. ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing

    Jun 10, 2026Chirag Chawla, Pratinav Seth, Vinay Kumar SankarapuLLM AlignmentLLM Safety Alignment

  23. Gradient-Guided Reward Optimization for Inference-time Alignment

    Jun 8, 2026Hankun Lin, Ruqi ZhangReward HackingLLM Alignment

  24. Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

    Jun 3, 2026Kyungmin Park, Taesup KimAdversarial Attacks on LLMsLLM Safety Alignment

  25. Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models

    May 16, 2026Yueqing Hu, Tianhong WangComputational Cognitive ModelingInference-Time Scaling

  26. Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment

    May 13, 2026Ye Wang, Jing Liu, Toshiaki Koike-AkinoReward HackingLLM Alignment

  27. Training-Free Cultural Alignment of Large Language Models via Persona Disagreement

    May 11, 2026Huynh Trung Kiet, Dao Sy Duy Minh, Tuan Nguyen +5LLM AlignmentCultural Alignment

  28. One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

    Apr 28, 2026Yixiao Zhou, Dongzhou Cheng, zhiliang wu +3LLM AlignmentRL for Language Model Reasoning

  29. Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

    Apr 26, 2026Imranul Ashrafi, Inigo Jauregi Unanue, Massimo PiccardiLLM AlignmentRepresentation Engineering

  30. To Intervene or Not: Guiding Inference-time Alignment with Probabilistic Model Blending

    Apr 22, 2026Jin Gan, Xin Li, Jun LuoLLM AlignmentInference-Time Language Model Alignment

  31. On the Rejection Criterion for Proxy-based Test-time Alignment

    Apr 17, 2026Ayoub Hammal, Pierre Zweigenbaum, Caio CorroLLM AlignmentInference-Time Language Model Alignment