Language Model Probing

Latest papers 192

All topics
CardsList
  1. Investigating Assistant Bias in LLM User Simulators Using a Role Vector

    Sep 1, 2026Daeheon Jeong, Yoonjoo Lee, Eugene Choi +2Large Language Model-Based Role-Play SimulationUser Simulation

  2. Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores

    Aug 31, 2026Qiyao Yan, Chenpeng Wang, Liangming PanLLM EvaluationLanguage Model Calibration

  3. Answer Probing-Guided Search for Diverse Solution Exploration of LLMs

    Aug 31, 2026Yi Fang, Que Shen, Chengpeng Li +6Language Model ProbingLLM Reasoning

  4. Small Language Models as Judges for Rubric-Based Reinforcement Learning

    Aug 30, 2026Fengyu Xie, Yilun Zhao, Bingsen Chen +2LLM-as-a-JudgeLanguage Model Generation Evaluation

  5. Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators

    Aug 30, 2026Armaan Singh, Ryan Trinh Le, Jasmine Kaur +5LLM EvaluationLLM Interpretability

  6. Memorization Diagnostics for Code LLMs Should be Scale-Aware

    Aug 13, 2026Prateek Kumar Rajput, Abdoul Aziz Bonkoungou, Alberick Euraste Djiré +6Memorization in Language ModelsCode Language Models

  7. Task- and dataset-specific information in protein language models

    Aug 12, 2026Roman Joeres, Ilya Senatorov, Anastasia Kolchina +2Protein Language ModelsProtein Representation Learning

  8. One Adapter Pair per Model: A Universal Activation Interface for Language Models

    Aug 10, 2026Su-Hyeon Kim, Jiwan Mun, Yo-Sub HanRepresentation Geometry in Language ModelsLanguage Model Probing

  9. On the Robustness of LLMs' Internal Representation of Code Correctness

    Aug 8, 2026Francisco Ribeiro, Sohaila Abdulsattar, Renata Gonzalez +2LLM ReliabilityLanguage Model Robustness

  10. "Many Are My Names": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders

    Aug 8, 2026Adelaide Danilov, Aria Nourbakhsh, Oleksandr Marchenko Breneur +1Large Language Model-Based Role-Play SimulationPersonality Modeling in Language Models

  11. Geo-Spatial Concept Probing of Large Language Models: Abstraction, Compositionality, and Grounding

    Aug 7, 2026Karim Radouane, Jose G Moreno, Lynda TamineSpatial Reasoning BenchmarksLLM Grounding

  12. Measuring Concept Content in Text from LLM Activations: ESG Evidence from Concept Vectors and Linear Probes

    Aug 7, 2026Luc Hazenoot, Zhaochun Ren, Amirhossein ZohrehvandLinear ProbingLLM Interpretability

  13. STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation

    Aug 5, 2026Bhiman Kumar Baghel, Anna Chrabaszcz, Tessa Warren +3LLM EvaluationControllable Text Generation

  14. Don't Let Me Ask for It: LLMs Show Deficiencies in Active Multi-Turn Information Acquisition for Abductive Inference

    Aug 4, 2026Shahrukh Mohiuddin, Chalamalasetti Kranti, Sherzod Hakimov +1LLM EvaluationLanguage Model Probing

  15. Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains

    Aug 4, 2026Yanchao Li, Wanhao Liu, Jiaqing Xie +4LLM EvaluationLLM Auditing

  16. ChaosProbe: A Neurochaotic Lens on Frozen Transformer Input-Embedding Spaces

    Aug 3, 2026Kunal Kumar Pant, Nithin NagarajLanguage Model FingerprintingRepresentation Probing

  17. BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning

    Jul 31, 2026Keshu Fu, Keqin Peng, Jun Bai +6Efficient Language Model ReasoningEfficient Language Model Inference

  18. RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

    Jul 30, 2026Yanshi Li, Xueru Bai, Shuman Liu +1LLM EvaluationLLM Interpretability

  19. Sky sphere representation in language models

    Jul 29, 2026Aleksandr Berdnikov, Yevgeny LiokumovichFactual Knowledge in Language ModelsRepresentation Geometry in Language Models

  20. Stemma: Induced Decision Regions Reveal LLM Provenance

    Jul 28, 2026Keyu Zhang, Vadim Safronov, Andrew MartinLanguage Model FingerprintingLanguage Model Probing