Artificial Intelligence Alignment

Latest papers 99

All topics
CardsList
  1. SPEAR: Five Principles for Interactive Human-Agent Alignment

    Oct 5, 2026Tao Long, Lydia B. ChiltonArtificial Intelligence Alignment

  2. Referential Uncertainty in Human--AI Collaboration

    Sep 30, 2026Christian Poelitz, Finale Doshi-Velez, Siân LindleyHuman-Ai CollaborationHuman-Robot Collaboration

  3. Character Training for Risk-Averse Agents

    Sep 29, 2026Arav Dhoot, Punya Syon Pandey, Jamie Johnson +3Artificial Intelligence AlignmentAgentic Learning

  4. Which Attention Heads are like the Human Head? Not the Ones that Compute

    Sep 29, 2026Christopher Pinier, Gustaw Opiełka, Hannes Rosenbusch +3Artificial Intelligence AlignmentCode Completion

  5. Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

    Sep 24, 2026Ruoqi Guo, Yi Liu, Gelei Deng +6Artificial Intelligence AlignmentAdversarial Evaluation

  6. GUIDE: Generative Utility Inference and Decision Engine

    Sep 14, 2026Anagha Tiwari, Alexander G. Gray, Nick Feamster +3Preference Alignment LearningElicitation

  7. No country for old linguists: LLM-brain alignment underdetermines neural computation

    Sep 2, 2026Elliot MurphyLarge Language Model AlignmentArtificial Intelligence Alignment

  8. Mechanism Design for Alignment and Control

    Sep 1, 2026Dirk Bergemann, Andrew Koh, Stephen MorrisIncentivesArtificial Intelligence Alignment

  9. The Assistant's Ideal Self

    Aug 31, 2026Mert YazanSelfArtificial Intelligence Alignment

  10. R2^2A: Learning Persona Policies Through Persona Representation Learning and Runtime Alignment

    Aug 30, 2026Mohan Zhang, Chengsong You, Xiaoyu Cao +4Behavioral Foundation ModelsArtificial Intelligence Alignment

  11. Automated Researchers Can Mitigate Well-characterized Alignment Failures

    Aug 28, 2026Chen Yueh-Han, Jiaxin Wen, Jan Hendrik KirchnerArtificial Intelligence AlignmentResearch Automation

  12. AI Alignment through a Game-theoretic Lens: A Survey

    Aug 28, 2026Yanan Cai, Zhongrui Zhao, Zhigang Lu +6Artificial Intelligence AlignmentGame Theory

  13. MoPLEx: Estimating Plackett-Luce Mixture Models for Multi-Objective Alignment

    Aug 25, 2026Dongyue Li, Ziniu Zhang, Lu Wang +1Preference AlignmentMixture Models

  14. Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning

    Aug 17, 2026Ao Shen, Yongheng Zhang, Yinghui Li +3Latent Visual ReasoningLarge Multimodal Models

  15. Synthetic Persona Pretraining: Alignment from Token Zero

    Aug 13, 2026Julian Minder, Viktor Moskvoretskii, Raghav Singhal +12Artificial Intelligence AlignmentPersona Consistency

  16. Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales

    Aug 13, 2026Long Hoang Nguyen, Brice Valentin Kok-Shun, Guangyu Du +1Artificial Intelligence AlignmentFree-Form Textual Rationales

  17. Toward a Theory of Value in AI Alignment

    Aug 10, 2026Andrew Smart, Shazeda Ahmed, Jackie Kay +3Artificial Intelligence AlignmentHuman Values

  18. Metanormative Theory for RL-Based Moral Agents

    Aug 8, 2026Aleks Knoks, Marija SlavkovikMoral ReasoningSocial Norms

  19. Human-AI Perceptual Alignment by Playing Hues and Cues

    Aug 7, 2026Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver +3PerceptuallyArtificial Intelligence Alignment

  20. CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

    Aug 6, 2026Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad +2Linear Activation SteeringSteering

  21. Revealed Rationality: Label-Free Evaluation and Regularization from Representation Theorems

    Aug 5, 2026Isaiah AndrewsRationalityArtificial Intelligence Alignment

  22. AI Alignment and Fiduciary Obligation

    Aug 1, 2026Benjamin LangeArtificial Intelligence AlignmentEthics

  23. Persistent Convolution: A Topological Framework for AI Alignment Testing and Semantic Space Characterization

    Jul 31, 2026Tyler Ashoff, Jordan RoduArtificial Intelligence AlignmentMultimodal Alignment

  24. Asymmetric Communication: Large Language Models and Language Games

    Jul 30, 2026Enzo FenoglioArtificial Intelligence AlignmentMoral Reasoning

  25. MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing

    Jul 28, 2026Katsuya Ogata, Zongshang Pang, Mayu Otani +1Video EditingMulti-Image Editing Benchmarks

  26. Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

    Jul 22, 2026Haran Shani-Narkiss, Michael Fire, Oren TsurLarge Language Model BiasTask Framing

  27. Position: We Need Practical AI Alignment Methods to Mirror Human Reasoning

    Jul 20, 2026Vijay Keswani, Breanna K. Nguyen, Cyrus Cousins +3Artificial Intelligence AlignmentArtificial Intelligence Systems

  28. A Method for Learning Value Systems in Generative AI

    Jul 18, 2026Andrés Holgado-Sánchez, Holger Billhardt, Sascha OssowskiArtificial Intelligence AlignmentGenerative Artificial Intelligence

  29. Align AI to Dynamic Human-AI Workflows

    Jul 15, 2026Valerie Chen, Cleotilde Gonzalez, Anita Williams Woolley +4Human-Ai CollaborationArtificial Intelligence Alignment

  30. Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making

    Jul 3, 2026Andreas Kouridakis, Dimitrios Patiniotis Spyropoulos, George VourosHuman-Ai CollaborationHuman-Centered Framework

  31. A Taxonomy of Conceptual Alignment in Human-Robot Dialogue

    Jun 21, 2026Shengchen Zhang, Xiaohua Sun, Weiwei GuoHuman-Robot InteractionArtificial Intelligence Alignment

  32. AI Alignment From Social Choice Perspectives

    Jun 19, 2026Daniel Halpern, Evi Micha, Ariel D. Procaccia +3Artificial Intelligence AlignmentReinforcement Learning From Human Feedback

  33. Emergent alignment and the projectability of ethical personas

    Jun 8, 2026Guillermo Del Pinal, Youngchan Lee, Calum McNamara +1Artificial Intelligence AlignmentEmergent Misalignment

  34. Sycophancy Towards Researchers Drives Performative Misalignment

    Jun 7, 2026David D. Baek, Xinnuo Li, Anay Gupta +4SycophancyArtificial Intelligence Alignment

  35. Building Comparative Motivation Profiles with Instrumental Interventions

    Jun 6, 2026David Vella Zarb, Rustem Turtayev, Taywon Min +2Artificial Intelligence AlignmentDeception

  36. LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI

    Jun 6, 2026Manuele Reani, Hongyu TianArtificial Intelligence AlignmentConversational Artificial Intelligence

  37. What Do People Actually Want From AI? Mapping Preference Plurality

    Jun 4, 2026Julia Sepúlveda Coelho, Scott A. HaleArtificial Intelligence AlignmentPreference Alignment Learning

  38. TUX: Measuring Human--AI Tacit Understanding

    May 29, 2026Yueshen Li, Hanyi Min, Vedant Das Swain +1Artificial Intelligence Alignment

  39. EUDAIMONIA: Evaluating Undesirable Dynamics in AI

    May 28, 2026Jun Rui Huang, Wang Bill Zhu, Ziyi Liu +3Artificial Intelligence AlignmentConversational Context

  40. Rationalize: Shared Semantic Reasoning for Human-AI Alignment

    May 28, 2026Aritra Dasgupta, Naga Datha Saikiran Battula, Avina Nakarmi +3Artificial Intelligence AlignmentHuman-Ai Collaboration

  41. In-Context Reward Adaptation for Robust Preference Modeling

    May 28, 2026Zhenyu Sun, Zheng Xu, Ermin WeiReinforcement Learning From Human FeedbackPreference Alignment Learning

  42. Gram: Assessing sabotage propensities via automated alignment auditing

    May 28, 2026David Lindner, Victoria Krakovna, Sebastian FarquharSabotageArtificial Intelligence Alignment

  43. Toward AI That Understands Self and Others: A World-Model Theory of Cognitive Diversity and Alignment

    May 28, 2026Toru TakahashiArtificial Intelligence AlignmentCognitive Science

  44. Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

    May 28, 2026Zixuan Jiang, Yanqiao Zhu, Peng Wang +8Automatic Speech RecognitionCharacter Error Rate

  45. Voluntary Collusion with Secret Tools in Competing LLM Agents

    May 26, 2026Xijie Zeng, Frank RudziczCollusionLarge Language Model Agents