Preference Alignment Learning

Latest papers 271

All topics
CardsList
  1. Not All Is Lost: Repairing Lossy User Preference States of Personalization Encoders

    Oct 1, 2026Parthiv Chatterjee, Dhiraj Golhar, Ummesalma Diwan +3Preference Alignment LearningRecommendation

  2. Evaluating LLM-Generated Preference Distributions

    Oct 1, 2026Fan Huang, Minsuk Kim, C. Tyler Diggans +1Preference Alignment LearningDistributions

  3. Robust Nash Alignment under Preference Uncertainty

    Sep 30, 2026Shihab Ahmed, Debamita Ghosh, David Tang +3Preference AlignmentNash Equilibrium

  4. Where's Waldo? Query-language Preference under Cross-lingual Knowledge Disparities

    Sep 30, 2026Dayeon Ki, Ruochen Zhang, Silviu Cucerzan +2Cross-Lingual ConsistencyPreference Alignment Learning

  5. Discrete Annotation, Continuous Preference: Rethinking Supervision for Accurate and Generalizable Aesthetic Image Cropping

    Sep 30, 2026Ziqing Zhang, Xiao Liu, Kai Liu +4CroppingPreference Alignment Learning

  6. Fenchel Tilting: Weighted Correction for Efficient Finetuning of Generative Models

    Sep 30, 2026Maksim Bobrin, Maksim Zhdanov, Dmitry DylovGenerative Flow NetworksGenerative Models

  7. Patient-Centered Treatment Planning for Chronic Multimorbidity: A Hierarchical Reinforcement Learning Framework for Preference Modeling

    Sep 30, 2026Nafiseh Payani, Soham Das, G. Anthony Wilson +1MultimorbidityTreatment

  8. Belief-Based Maximum Occupancy Principle and Active Inference

    Sep 30, 2026Manolis Mylonas, Rubén Moreno BoteStochastic ExplorationGoal-Directed Behavior

  9. How Reliable Are Predicted MOS for Reproducing Human System-Level Preferences in Speech Enhancement?

    Sep 30, 2026Nahomi Kusunoki, Tsubasa Ochiai, Naohiro Tawara +4Mean Opinion ScoresSpeech Enhancement

  10. Optimal Design for Active Preference Learning with Biased LLM Judges

    Sep 30, 2026Zhongman Du, Huiming Zhang, Haodong Zhu +1Preference LearningPreference Alignment Learning

  11. Uncertainty-Normalized Margins for Direct Preference Optimization

    Sep 29, 2026Sadegh Khorasani, Petrus Mikkola, Matthias GrossglauserBacktranslation Augmented Direct Preference OptimizationPreference Alignment Learning

  12. ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

    Sep 29, 2026İbrahim Ethem Deveci, Funda Tan Çalık, Barış Deniz Sağlam +1Reasoning BenchmarkLLM Reasoning Strategies

  13. EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making

    Sep 29, 2026Yuhan Guo, Jinming Liu, Liang Xu +8WorldPost-Training

  14. Language Models Act on Hidden Valence

    Sep 28, 2026Cameron Berg, Caspar KaiserHidden StatesLanguage Model Computes

  15. How Well Can LLMs Simulate Real Learner Evaluations of Educational Feedback?

    Sep 28, 2026Momoka Furuhashi, Kouta Nakayama, Takashi Kodama +2Large Language Model EvaluationFeedback

  16. From Normative Frameworks to Alignment Data: Constructing and Evaluating SFT and Preference Data

    Sep 28, 2026Husrev Taha Sencar, Rezart Beka, Danish Naeem +6Large Language Model AlignmentSocial Norms

  17. Using Context Is Not Enough: Test-Time Training for Personalized Reward Modeling

    Sep 28, 2026Bohao Wang, Xiaoyan Zhao, Yang Zhang +4Large Language Model PersonalizationPreference Alignment Learning

  18. From Soft Targets to Reward Signals: How Assignment and Reward Objectives Interact

    Sep 28, 2026Jiangtao Lin, Bangyang Wei, Siyi Liu +2Response-Level RewardsReward Signal

  19. From Preference to Reciprocity: Decentralized Matching with Empirically Grounded LLM-agent Based Modeling

    Sep 28, 2026Wangxuan Fan, Xiaoyu Nie, Zhoutian Shi +5Distribution MatchingGame Theory

  20. FestDPO: Few-step Generator Alignment with Direct Preference Optimization

    Sep 28, 2026Jaewoo Lee, Kyuil Sim, Hyeongyu Kang +3Generative ModelsDiffusion Alignment

  21. A General Harness for Protein Foundation Model Fitness Prediction

    Sep 28, 2026Yang Tan, Qijia Tian, Gangyu Sun +5Wireless Foundation ModelsSirus

  22. SpeechCritic: Learning a Diagnostic Speech Judge from Limited Human Preferences

    Sep 28, 2026Mingyue Huo, Shivam Mehta, Bhavin Jawade +2Large Audio Language ModelsCritic

  23. Over-Personalization Is a Decision Failure: Generation-Induced Apply Bias in LLMs

    Sep 28, 2026Haeun Jang, Yonghyun Jun, Hwanhee LeeLarge Language Model PersonalizationLarge Language Model Bias

  24. PrefLUT: Reusable and Refinable Personalized Color Editing from Pairwise Preferences

    Sep 28, 2026Chuanzhi Xu, Langyi Chen, Chengkun Yue +5Image EditingPreference Alignment Learning

  25. Direct Hidden-State Alignment: Mapping and Controlling Preference Expression in LLMs

    Sep 27, 2026Fansheng Zhang, Shengran Guo, Zexiao Wang +3Preference Alignment LearningReinforcement Learning From Human Feedback

  26. Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference

    Sep 27, 2026Yilong Li, Chengpo Yan, Aayan Arish +1Large Language Model ResponsesFactual Recall

  27. On Preference Coverage Collapse from Hindsight Relabeling in Multi-Objective Reinforcement Learning

    Sep 22, 2026Baptiste Bonin, Caro Strickland, Audrey DurandMulti-Objective Reinforcement LearningHindsight

  28. Error Bounds for Statistical Estimators in BTL Model with Parametric Multivariate Utility Functions

    Sep 22, 2026Yicheng Li, Huifu XuMaximum LikelihoodFinite-Sample

  29. COPE: Continual Personalization of LLMs under Sparse User Feedback via User Embeddings and Self-Evaluation

    Sep 22, 2026Ruike Cao, Fugen Yao, Liang Dong +3Large Language Model PersonalizationPersonalization

  30. Deflecting the Value Compass: Interacting with Large Language Models Temporarily Shifts Human Value Priorities Toward Personal Focus

    Sep 22, 2026Hasibur Rahman, Malak Sadek, Smit DesaiLarge Language Model DecisionsMulti-Turn Large Language Model Conversations

  31. Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses

    Sep 16, 2026Mahsa Amani, Seungeon Lee, Abhisek Dash +9Agentic SearchResponses

  32. Too Good to Be Real? Diagnosing and Reducing the Gap Between AI Preference and Real User Engagement

    Sep 16, 2026Xinglang Zhang, Yuanmeng Xiang, Yunyao Zhang +3AnalyticsPreference Alignment Learning

  33. Re2A: Situated Conversational Recommendation via Rubric-based Preference Reasoning and Alignment

    Sep 16, 2026Dongding Lin, Jian Wang, Xiaoyan Zhao +1RecommendationPreference Alignment Learning

  34. Learning Heterogeneous Preferences

    Sep 15, 2026Shiwali Mohan, Matt Hong, Dule Shu +3Preference LearningPreference Alignment Learning

  35. Understanding User Preferences of a Slope-Aware Variable-Admittance Filter for a Robot Guide Dog

    Sep 14, 2026Federico Esposito, Mario Selvaggio, Aaron Link +1Equivariant FilterRobot Systems

  36. Steering Generative Robot Policies with Lexicographic Preferences

    Sep 14, 2026Yixuan Jia, Jonathan P. HowRobot PoliciesRobot Systems

  37. GUIDE: Generative Utility Inference and Decision Engine

    Sep 14, 2026Anagha Tiwari, Alexander G. Gray, Nick Feamster +3Preference Alignment LearningElicitation

  38. Deep and shallow biases in language models

    Sep 9, 2026An Vo, Vy Tuong Dang, Khai-Nguyen Nguyen +4Large Language Model BiasBiases

  39. HyperTrace: Hypothesis-Based Preference Tracing for Online LLM Personalization

    Sep 9, 2026Jianzhi Shen, Keyu Mao, Minghao Shao +7Large Language Model PersonalizationPersonalization

  40. Same Values, Different Languages? From Multilingual Probing to Steering LLMs Toward Chinese Social Values

    Sep 8, 2026Yuemei Xu, Kexin Xu, Jian Zhou +3Human ValuesLanguage Pairs

  41. Bridging the Semantic-Utility Gap in Multimodal RAG via Generator-in-the-Loop Alignment

    Sep 8, 2026Zhan-Lun Chang, Dong-Jun Han, Seyyedali Hosseinalipour +2Multimodal Retrieval Augmented GenerationVision-Language Alignment

  42. ToPO: Token-Conditioned Preference Routing for Attention-Based Latent Diffusion Models

    Sep 3, 2026Juntao Xu, Shihong Li, Hoi Fan Au +1Identity-Conditioned Latent Diffusion ModelsDiffusion Models

  43. VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences

    Sep 1, 2026Yiwen Jiang, Yang Deng, Stephanie Fong +9Large Language Model PersonalizationPreference Alignment Learning

  44. Towards Effective Structured Context Modeling for Conversational Recommender Systems via Dual-node Monte Carlo Tree Search

    Sep 1, 2026Jincheng Zhang, Chen Huang, Wenqiang Lei +2Preference Alignment LearningMonte Carlo Tree Search

  45. Autoresearch for Marketplace Catalogs: From Legacy Forms to AI-Native Matching

    Aug 31, 2026Kartik Ravisankar, Hojat Abdolanezhad, Daniel Capo +3Agentic CommerceTaxonomy

  46. Hypotheses-Guided Self Distillation for Continual Personalization

    Aug 31, 2026EunJeong Hwang, Kushan Mitra, Dan Zhang +2PersonalizationPreference Alignment Learning