LLM Interpretability

LLM: Large Language Model

Latest papers 546

All topics
CardsList
  1. Where is the Mind? Persona Vectors and LLM Individuation

    Date pendingPierre Beckmann, Patrick ButlinLLM InterpretabilityPersonality Modeling in Language Models

  2. Tracing Computation Density in LLMs

    Date pendingCorentin Kervadec, Iuliia Lysova, Iuri Macocco +2Transformer InterpretabilityLLM Interpretability

  3. ReasoningFlow: Discourse Structures for Understanding LLM Reasoning Traces

    Date pendingJinu Lee, Shivam Agarwal, Amruta Parulekar +3LLM Reasoning with GraphsLLM Auditing

  4. SAEExplainer: Interpreting SAE Features with Activation-Guided Preference Optimization

    Date pendingJingyi He, Haiyan Zhao, Ruxue Shi +4LLM InterpretabilitySparse Autoencoders

  5. A retrieval conditioned rebinding circuit for dynamic entity tracking in large language models

    Date pendingSoyoung Oh, Vera DembergLLM InterpretabilityMechanistic Interpretability