cs.AIAug 17, 2026

MAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy

Authors: Aniri, Chen Yilin, Jinhe Bi, Zengjie Jin, Yujun Wang, Yijun Tian, Volker Tresp, Fei Shen, +2 more

Organizations: Ludwig Maximilian University of Munich · Munich Center for Machine Learning · East China University of Science and Technology · National University of Singapore · Amazon

Abstract

Vision-Language-Action models (VLAs) integrate visual perception, language instruction, and action generation into end-to-end policies across heterogeneous architectures. However, enabling VLAs to self-evaluate their action generation reliability without external supervision remains a major challenge. Existing methods either rely on expert annotations or estimate uncertainty only from output statistics, largely ignoring internal signals. In this work, we observe that internal visual modality entropy exhibits consistent distinctions between successful and failed tasks across heterogeneous VLAs. Although VLAs' architectures differ in their action generation, we show that they share a common latent action generation abstraction evolving under visual perception, language instruction, and State Input, which we formulate as a Conditional Generative Markov Chain. Based on this formulation, we propose MAE (Markov Attention Entropy), a self-evaluation framework that directly converts internal attention signals into architecture-aware reliability scores, and introduce LIBERO-Reflect, a 4,000-episode benchmark combining 2,000 standard episodes and 2,000 challenging episodes across four subsets. Extensive experiments across heterogeneous VLA architectures and diverse scenarios show that MAE consistently outperforms state-of-the-art baselines on AUPR, AUROC, and FPR@95.

Figures & tables

Appendix figures & tables14 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models

    Mar 14, 2026Suhwan Choi, Yunsung Lee, Yubeen Park +4Preprocessing

  2. VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models

    Dec 27, 2025Borong Zhang, Jiahao Li, Jiachen Shen +7Diffusion-Based Vision-Language-ActionsRobot Policies

  3. FATE-VLA:Failue-aware test generation for vision-language-action models

    Jun 1, 2026Arusa Kanwal, Pablo Valle, Shaukat Ali +1Vision-Language-Action FrameworkRobot Policies