Language Model Probing

Latest papers 192

All topics
CardsList
  1. TIPS: Topological Ill-Posedness Probing and Steering in Large Language Models

    Jun 22, 2026Guangyu Jiang, Sizhe Tang, Mahdi Imani +2Language Model SteeringQuestion Answering

  2. TriggerBench: Investigating Prospective Memory for Large Language Models

    Jun 22, 2026Tianhua Zhang, Xinjiang Wang, Qianxi Zhang +6LLM EvaluationLong-Context Language Model Evaluation

  3. SCOPE: Sequential Conformal Probing for Reliable OOD Rejection in LLM Services

    Jun 19, 2026Zhuoyun Li, Boxuan Wang, Changshun Wu +2Conformal PredictionOOD Detection

  4. From Texts to Scores: Tracing the Emergence of Essay Quality Representations in Large Language Models

    Jun 18, 2026Jiaxu Zuo, Mu You, Kaixin Lan +5LLM InterpretabilityAutomated Essay Scoring

  5. Comparing Linear Probes with Mahalanobis Cosine Similarity

    Jun 17, 2026Zhuofan Josh Ying, Peter Hase, Nikolaus KriegeskorteLinear ProbingMahalanobis Distance

  6. Zero-source LLM Hallucination Detection with Human-like Criteria Probing

    Jun 11, 2026Jiahao Yang, Shuhai Zhang, Hailong Kang +3Hallucination DetectionLLM Hallucination Detection

  7. Scenario-based Probing and Steering Cultural Values in Large Language Models--Extended Version

    Jun 9, 2026Trung Duc Anh Dang, Tung Kieu, Sarah MasudLanguage Model SteeringCultural Alignment

  8. Predicting Future Behaviors in Reasoning Models Enables Better Steering

    Jun 9, 2026Evgenii Kortukov, Piotr Komorowski, Florian Klein +5Language Model SteeringRepresentation Steering

  9. MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

    Jun 9, 2026Pratibha Revankar, Kargi Chauhan, Jihye Kim +3LLM InterpretabilityAI Agent Security

  10. PRISM: Recovering Instruction Sets from Language Model Activations

    Jun 8, 2026Gilad Gressel, Rahul Pankajakshan, Julia Diament +3Neural DecodingLLM Interpretability

  11. Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking

    Jun 4, 2026Bonan Shen, Youting Wang, Dingyan Shang +1Reward HackingLanguage Model Probing

  12. Light or Full Verb? A Minimal-Pair Dataset for Probing Phraseological Competence in Language Models

    Jun 3, 2026Francesca Franzon, Nicolas Rosàs Gómez, Leo WannerLanguage Model Probing

  13. FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses

    Jun 3, 2026Nicholas SabanLLM EvaluationAgent Evaluation

  14. What Am I Missing? Question-Answering as Hidden State Probing

    May 29, 2026Chu Fei Luo, Samuel Dahan, Xiaodan ZhuLLM Self-RefinementLanguage Model Self-Assessment

  15. Knowledge boundary probing and demand-guided intervention for LLM-based power system code generation

    May 29, 2026Hui Wu, Xiaoyang Wang, Zhong FanAutomated Program RepairCode Generation

  16. Probing the Prompt KV Cache: Where It Becomes Dispensable

    May 28, 2026Vinayshekhar Bannihatti Kumar, Manoj Ghuhan Arivazhagan, Disha Makhija +1KV CachingKV-Cache Management

  17. Latent Performance Profiling of Large Language Models

    May 28, 2026Tanmoy Chakraborty, Ayan Sengupta, Suparna Bhattacharya +7LLM EvaluationLLM Interpretability

  18. Reverse Probing: Supervised Token-level Uncertainty Quantification for Large Language Models in Clinical Text

    May 27, 2026Bushi Xiao, Sarvesh Soni, Daisy Zhe WangText SummarizationLLM Uncertainty Estimation