Inference-Time Language Model Alignment

Latest papers 36

All topics
CardsList
  1. The Asymptotics of Language Model Alignment with Memory

    Oct 1, 2026Haricharan Balasundaram, V. Arvind RameshwarRL for Language ModelsLLM Alignment

  2. HeadEdit: Calibrating Language Model Behavior Through the Frozen Unembedding Matrix

    Oct 1, 2026Zirui He, Haiyan Zhao, Jingyu Hu +5Language Model SteeringLanguage Model Calibration

  3. Ready2Blend: From Natural-Language Instructions to Composable Alignment Prompts

    Sep 30, 2026Jeesu Jung, Hwan Chang, Juseon Do +5Continual Learning for LLMsLLM Alignment

  4. Aligned Data Can Induce Misalignment via Context Confusion

    Sep 29, 2026Yavuz Bakman, Duygu Nur Yaldiz, Baris Askin +4LLM AlignmentLLM Post-Training

  5. Rethinking Personalized Generation: Test-Time Alignment via Factorized Ranking Models

    Sep 28, 2026Qiyao Ma, Junshan Zhang, Zhe ZhaoLearning to RankLLM Reranking

  6. Direct Hidden-State Alignment: Mapping and Controlling Preference Expression in LLMs

    Sep 27, 2026Fansheng Zhang, Shengran Guo, Zexiao Wang +3LLM AlignmentPreference Alignment

  7. Minimally Invasive Steering of Language Models

    Sep 24, 2026Taha Entesari, Jingyu Zhang, Daniel Khashabi +1Language Model SteeringInference-Time Language Model Alignment

  8. From Static Personal Values to Contextualized Personalization: Bayesian Personalized Value Alignment for LLMs

    Sep 24, 2026Hanze Guo, Aixuan Song, Jing Yao +4LLM AlignmentPersonalized Language Models

  9. An Efficient and Modular Framework for Targeted Harm Mitigation in LLMS

    Sep 12, 2026Roberto Campbell, Momin Abbass, Muneeza Azmat +5LLM Safety AlignmentLow-Rank Adaptation

  10. Inference-Time Nash Alignment

    Sep 8, 2026Hadi Hosseini, Debmalya Mandal, Duohan ZhangInference-Time OptimizationPreference Alignment

  11. Trust Your Guide Only When Certain: Uncertainty-Aware Sparse Alignment at Inference Time

    Sep 1, 2026Zeen Zhu, Zhuo Li, Weiyang Guo +4LLM Safety AlignmentInference-Time Language Model Alignment

  12. Beyond Token-Level Guidance: Inference-Time Alignment of Specialized LLMs via Cross-Family Representation Steering

    Aug 31, 2026Jin Gan, Xin Li, Jun LuoLLM Safety AlignmentLanguage Modeling

  13. Evolutionary Soups: Evolving Mixture-of-Experts for Multi-Objective LLM Alignment

    Aug 30, 2026Lingxiao Kong, Steffen Staab, Cong Yang +2Mixture-of-Experts Language ModelsMulti-Objective Language Model Alignment

  14. Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport

    Aug 11, 2026Bohan Zhang, Anqi Ni, Yixin Wang +1Supervised Fine-TuningLLM Personalization

  15. CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

    Aug 10, 2026Bingcan Guo, Eryue Xu, Jijie Zhou +2Preference AlignmentInference-Time Language Model Alignment

  16. Deployable Per-Instance Multi-Layer Activation Steering for Large Language Models

    Aug 9, 2026Muhammad Faishal Adly Nelwan, Alfan Farizki WicaksonoLanguage Model SteeringControllable Text Generation

  17. Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

    Jul 25, 2026Rares A. C. Diaconescu, Iulia Slanina, Alina Florea +5LLM AlignmentLLM Safety Alignment

  18. Best-of-Better-NN: Generating Pre-Aligned Responses with In-Context Learning

    Jul 3, 2026Eric Lei, Hsiang Hsu, Chun-Fu ChenLLM AlignmentBest-of-N Sampling

  19. Safe Inference-Time Alignment via Lagrangian Reward Augmentation

    Jul 2, 2026Yaswanth Chittepu, Ativ Joshi, Sohini Chintala +1LLM AlignmentLLM Safety Alignment

  20. Towards Spec Learning: Inference-Time Alignment from Preference Pairs

    Jun 22, 2026Dhriti Krishnan, Tejas Goyal, Jaromir SavelkaLLM AlignmentPrompt Optimization

  21. ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing

    Jun 10, 2026Chirag Chawla, Pratinav Seth, Vinay Kumar SankarapuLLM AlignmentLLM Safety Alignment

  22. Gradient-Guided Reward Optimization for Inference-time Alignment

    Jun 8, 2026Hankun Lin, Ruqi ZhangReward HackingLLM Alignment

  23. Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

    Jun 3, 2026Kyungmin Park, Taesup KimAdversarial Attacks on LLMsLLM Safety Alignment

  24. Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models

    May 16, 2026Yueqing Hu, Tianhong WangComputational Cognitive ModelingInference-Time Scaling

  25. Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment

    May 13, 2026Ye Wang, Jing Liu, Toshiaki Koike-AkinoReward HackingLLM Alignment

  26. Training-Free Cultural Alignment of Large Language Models via Persona Disagreement

    May 11, 2026Huynh Trung Kiet, Dao Sy Duy Minh, Tuan Nguyen +5LLM AlignmentCultural Alignment

  27. One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

    Apr 28, 2026Yixiao Zhou, Dongzhou Cheng, zhiliang wu +3LLM AlignmentRL for Language Model Reasoning

  28. Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

    Apr 26, 2026Imranul Ashrafi, Inigo Jauregi Unanue, Massimo PiccardiLLM AlignmentRepresentation Engineering

  29. To Intervene or Not: Guiding Inference-time Alignment with Probabilistic Model Blending

    Apr 22, 2026Jin Gan, Xin Li, Jun LuoLLM AlignmentInference-Time Language Model Alignment

  30. On the Rejection Criterion for Proxy-based Test-time Alignment

    Apr 17, 2026Ayoub Hammal, Pierre Zweigenbaum, Caio CorroLLM AlignmentInference-Time Language Model Alignment