Language Model Probing

Latest papers 192

All topics
CardsList
  1. Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders

    Jul 23, 2026Pablo Santiago Potes Velasco, María del Mar García Matabanchoy, Óscar Julián Pérez Ladino +3LLM InterpretabilityCultural Bias in Language Models

  2. Geometric Configurations of Perturbed Jailbreak Prompts

    Jul 22, 2026Lynn Delcon, Andres Algaba, Vincent GinisJailbreak AttacksLLM Jailbreak Attacks

  3. Diagnosing Correctness Probes under Self-Judgement Confounding

    Jul 18, 2026Yi-Long LuLLM InterpretabilityLanguage Model Self-Assessment

  4. Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

    Jul 14, 2026Binwen Liu, Yilin RenLLM EvaluationPragmatic Reasoning in Language Models

  5. SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models

    Jul 11, 2026Dongxu Zhang, Yiding Sun, Zihao Guo +5LLM InterpretabilityActivation Steering

  6. TypeProbe: Recovering Type Representations from Hidden States of Pre-trained Code Models

    Jul 9, 2026Giuliano Gorgone, Fausto CarcassiLLM InterpretabilityRepresentation Geometry in Language Models

  7. Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade

    Jul 7, 2026Kai Ruan, Zihe Huang, Ziqi Zhou +4LLM Inference EfficiencyEarly Stopping

  8. SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

    Jul 7, 2026Yimeng Zhang, Yingying Zhuang, Ziyi Wang +12LLM EvaluationConfidence Estimation in Language Models

  9. Latent Programming Horizons in Coding Agents

    Jul 6, 2026André Silva, Han Tu, Martin MonperrusLLM InterpretabilityCoding Agents

  10. Knowledge Knows, Verbalization Tells: Disentangling Latent Directions for Mathematical Solvability in LLMs

    Jul 6, 2026Nikolaos Xiros, Maria-Eleni Zoumpoulidi, Georgios ParaskevopoulosHallucination in Language ModelsRepresentation Geometry in Language Models

  11. CrossHallu: Do Hallucination Signals Generalize Across Languages and Domains in Large Language Model's Internals?

    Jul 4, 2026Aisha Alansari, Malak Alkhorasani, Hamzah LuqmanMultilingual Language Model EvaluationLLM Hallucination Detection

  12. Revealing Hidden Model Behaviors with Task-Specific Self-Reports

    Jul 3, 2026Taras Kutsyk, Bartosz ZielińskiLLM AuditingLanguage Model Introspection

  13. Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

    Jul 3, 2026Kaley Brauer, Claudio Mayrink Verdun, Samuel MarksLLM AuditingLLM Interpretability

  14. Probe Choice Changes Canary-Memorization Verdicts: Three Post-Hoc Disagreement Case Studies in a Text-Dominant LoRA-Tuned Autoregressive Testbed

    Jun 30, 2026Zhichao Fan, Zexin Zhuang, Yanhang LiMemorization in Language ModelsLLM Auditing

  15. ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs

    Jun 27, 2026Mohamed Amine Kerkouri, Simon D. Hernandez, Marouane Tliba +3LLM Reasoning with GraphsStructured Reasoning

  16. From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

    Jun 26, 2026Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen +3Uncertainty QuantificationHallucination in Language Models

  17. Probing the Misaligned Thinking Process of Language Models

    Jun 23, 2026Kaiwen Zhou, Constantin Venhoff, Jonathan Michala +2LLM AlignmentLLM Auditing