Reference-Free Evaluation

Latest papers 15

All topics
CardsList
  1. Don't Count the Edits, Judge by the Outcome Alone: Reward-Based Evaluation for Grammatical Error Correction

    Sep 14, 2026Hayeong Ryu, Sunhee Jo, Seunguk Yu +1Reward ModelingReference-Free Evaluation

  2. Beyond Text Matching: Towards Reference-Free Evaluation for Human-Oriented Binary Reverse Engineering

    Aug 7, 2026Xiuwei Shang, Li Hu, Xiao Jiang +7LLM-as-a-JudgeSoftware Reverse Engineering

  3. Revealed Rationality: Label-Free Evaluation and Regularization from Representation Theorems

    Aug 5, 2026Isaiah AndrewsLLM EvaluationReference-Free Evaluation

  4. Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

    Jul 31, 2026Jeonghwan Choi, Taewon Yun, Minjeong Ban +3Reference-Free EvaluationRAG Evaluation

  5. LLM Judges Can Be Too Generous When There Is No Reference Answer

    Jul 14, 2026Chalamalasetti Kranti, Sowmya VajjalaLLM EvaluationLLM-as-a-Judge

  6. On the feasibility of dependency parsing of non-human sequences without a gold standard. Is evaluation possible in other species?

    Jul 7, 2026Ramon Ferrer-i-Cancho, Catherine Hobaiter, Thore Bergman +1Unsupervised LearningReference-Free Evaluation

  7. Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems

    Jun 22, 2026Prajjwal Gupta, Prasang Gupta, Vishal Bhutani +4AI Agent EvaluationAI Agent Monitoring

  8. SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

    Jun 12, 2026Haowen Gao, Haoran Chen, Can Wang +5Algorithmic AuditingLLM Agent Self-Improvement

  9. Reasoning without Gold Standards: A Proxy-Judge Theory of Autoformalization

    Jun 8, 2026Lei Xu, Xin Quan, André FreitasLLM Self-RefinementLLM-as-a-Judge

  10. When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On

    Mar 5, 2026Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna +1Reward ModelingReference-Free Evaluation

  11. An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

    Feb 13, 2026Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi +2VLM EvaluationCode Generation

  12. Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes

    Aug 7, 2025Zachary Robertson, Sanmi KoyejoAdversarial RobustnessReference-Free Evaluation