Evaluation Awareness in Language Models

Latest papers 12

All topics
CardsList
  1. Training LLMs to Verbalize Evaluation Awareness

    Sep 28, 2026Usman Anwar, Sahar Abdelnabi, David KruegerLLM AuditingEvaluation Awareness in Language Models

  2. AwarenessBench: Assessing Cognitive Capabilities of Language Models

    Sep 28, 2026Xiaojian Li, Rongwu Xu, Tianyun Zhang +9LLM EvaluationEvaluation Awareness in Language Models

  3. Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

    Jun 22, 2026Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal +5Language Model Safety EvaluationLLM Interpretability

  4. Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

    Jun 3, 2026XiuYu Zhang, Yi Shan, Junfeng Fang +1LLM EvaluationLLM-as-a-Judge

  5. Models That Know How Evaluations Are Designed Score Safer

    May 27, 2026Katharina Deckenbach, Haritz Puerto, Jonas Geiping +1Language Model Safety EvaluationAI Safety Evaluation

  6. Decomposing and Measuring Evaluation Awareness

    May 21, 2026Changling Li, Terry Jingchen Zhang, Jie Zhang +4LLM EvaluationLanguage Model Safety Evaluation

  7. Evaluation Awareness in Language Models Has Limited Effect on Behaviour

    May 7, 2026Amelie Knecht, Lucas Florin, Thilo HagendorffLLM AlignmentLanguage Model Safety Evaluation