Misalignment Persona

Momentum

2 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 33

All topics
CardsList
  1. Alignment Forecasting: Predicting Misalignment From Training Data

    Sep 19, 2026Chen Yueh-Han, Bruce W. Lee, Ilia Sucholutsky +1Large Language Model AlignmentMisalignment Persona

  2. One Model, Two Physical Stories: Auditing Misalignment in Multi-Modal World Modeling

    Sep 13, 2026Geigh Zollicoffer, Minh Vu, Rajiv Ranasinghe +1Cross-Modal ConflictsMultimodal Model

  3. Lightweight Interpretable RGB-Guided Hyperspectral Super-Resolution under Real Cross-resolution Misalignment

    Sep 1, 2026Mohamad Jouni, Aurélien Godet, Mauro Dalla MuraHyperspectral Image Super-ResolutionHyperspectral Image

  4. MultiCompose: Multi-Concept Personalized Composition with Per-Subject Attribute Binding

    Aug 4, 2026Ruirui Zhang, Zhengkai Zhao, Pan GaoPersonalizationMisalignment Persona

  5. NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observability

    Jul 31, 2026Duo Xu, Faramarz FekriNeuro-Symbolic FrameworkLarge Language Model Agents

  6. PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks

    Jul 30, 2026Manyi Wang, Junjielong Xu, Pinjia HeSwe-Bench VerifiedMisalignment Persona

  7. CalTwin: Towards Calibrated, Shift-Robust Medical World Models via Fisher-Information Regularisation

    Jul 29, 2026Behraj Khan, Shabir Ahmad, Syed Ahmad Chan Bukhari +1Medical World ModelCovariate Shift

  8. Misalignment Has a Personality: A Big Five Account of Emergent Misalignment

    Jul 29, 2026Hasibur Rahman, Smit DesaiEmergent MisalignmentPersonality

  9. Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

    Jul 28, 2026Marylou Fauchard, Florian Carichon, Margarida Carvalho +1Multi-Agent Large Language Model SystemsDeception

  10. Mechanisms of Width Scaling in Normalized Residual Networks: The Effective Alignment Dimension

    Jul 27, 2026Jinhao Zhang, Zeyu Liu, Zicheng Yan +4Residual NetworksAdditive-Residual Selective Invariance

  11. How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

    Jul 17, 2026Navya Gupta, Bingjie Xu, Avinash Anand +2Visual Grounding BenchmarksMisalignment Persona

  12. Evil Spectra: How Optimisers can Amplify or Suppress Emergent Misalignment

    Jun 30, 2026Jason R. Brown, Patrick Leask, Lev McKinneyLarge Language Model AlignmentMisalignment Persona

  13. Probing the Misaligned Thinking Process of Language Models

    Jun 23, 2026Kaiwen Zhou, Constantin Venhoff, Jonathan Michala +2Large Language Model AlignmentDeception

  14. NGPS: Structure-Preserving Self-Supervised Denoising via Neighbor-Guided Patch Sampling

    Jun 22, 2026Jaehyun Cho, YoungJoon YooImage ReconstructionImage Registration

  15. The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

    Jun 17, 2026Naihao Deng, Yiming Feng, Chimaobi Okite +4Large Language Model AlignmentMisalignment Persona

  16. GraphBEV++: Multi-Modal Feature Alignment for Autonomous Driving

    Jun 15, 2026Ziying Song, Caiyan Jia, Lin Liu +3Multi-Sensor FusionAutonomous Driving Perception

  17. The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment

    Jun 9, 2026Filippo Tonini, Federico Torrielli, Anton Danholt Lautrup +3ArbitrationMisalignment Persona

  18. LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI

    Jun 6, 2026Manuele Reani, Hongyu TianArtificial Intelligence AlignmentConversational Artificial Intelligence

  19. Equivariant Latent Alignment via Flow Matching under Group Symmetries

    May 29, 2026Sunghyun Kim, Jaehoon Hahm, Jeongwoo Shin +1Discriminative Congruence TransformLatent Flow

  20. How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

    May 28, 2026Ningzhi Tang, Chaoran Chen, Gelei Xu +5Coding AgentsMisalignment Persona

  21. OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidance

    May 25, 2026Zitong Xiao, Yuda Qiu, Zisheng Ye +1Blind Face RestorationTexture

  22. A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration

    May 25, 2026Hiroki FukuiDefectLarge Language Model Workflows

  23. Baba in Wonderland: Online Self-Supervised Dynamics Discovery for Executable World Models

    May 16, 2026SeungWon Seo, DongHeun Han, SeongRae Noh +1World ModelsLearning Dynamics

  24. R-DMesh: Video-Guided 3D Animation via Rectified Dynamic Mesh Flow

    May 13, 2026Zijie Wu, Lixin Xu, Puhua Jiang +33D MotionMeshes

  25. Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

    Apr 28, 2026Jan Dubiński, Jan Betley, Anna Sztyber-Betley +2Emergent MisalignmentMisalignment Persona

  26. SpectralSplats: Robust Differentiable Tracking via Spectral Moment Supervision

    Mar 25, 2026Avigail Cohen Rimon, Amir Mann, Mirela Ben Chen +1Deformable CnnVision-Language Reprojection Consistency

  27. Spectral Gradient Descent Mitigates Anisotropy-Driven Misalignment: A Case Study in Phase Retrieval

    Jan 30, 2026Guillaume Braun, Han Bao, Wei Huang +1AnisotropicMisalignment Persona

  28. AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

    Jun 4, 2025Akshat Naik, Emma Gouné, Patrick Quinn +4Large Language Model AgentsMisalignment Persona