Visual Evidence

Momentum

37 papers in the last four weeks, up 164% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 189

All topics
CardsList
  1. Visual Orchestration Tax in Agentic VLM Pipelines: Auditing and Certifying Visual Evidence Reuse

    Oct 6, 2026Lingteng ZengVisual Evidence

  2. MoLE: Mixture of Latent Experts for Complementary Visual Reasoning

    Oct 1, 2026Yingcheng Liu, Tianyi Jiang, Yujuan Ding +5Latent Visual ReasoningVisual Reasoning

  3. Same Reward, Different Skills: When Multimodal RL Learns to Look

    Oct 1, 2026Haocun Ye, Xinlong Jiang, Qile Chen +6Multimodal Reasoning BenchmarksVisual Evidence

  4. Video-Index: A Curated Meta-Benchmark for Video Understanding

    Oct 1, 2026Enxin Song, Yinuo Xu, Shusheng Yang +2Long-Video BenchmarksLong Videos

  5. Faithful Chart Generation for Multimodal Deep Research: Frame-Evidence Co-Adaptation

    Sep 30, 2026Yuxin Yue, Yingchen Zhang, Ruqing Zhang +3Visual EvidenceVisual Reasoning

  6. CRAFT: Causal Responsibility and Failure Tracing in Medical Vision Language Models

    Sep 30, 2026Chunzheng Zhu, Jiaqi Zeng, Hongbo Zhao +3Medical Vision-Language ModelsVisual Evidence

  7. Composition, Not Conversation: VLMs Lose the Scene, Not the Thread

    Sep 29, 2026L. D. M. S. Sai Teja, Ufaq Khan, N. Siva Gopala Krishna +5TextvqaRecent Vision-Language Models

  8. A Benchmark & Dataset for Detecting AI-Manipulated Visual Evidence in the Court System

    Sep 29, 2026Kelly McConvey, Sajad Ebrahimi, Nima Jamali +10Multimedia ForensicsVisual Evidence

  9. TAEC: Trajectory-Aware Evidence Coordination for Multi-Step Visual RAG

    Sep 29, 2026Yalun Wu, Bingzhou Wang, Boyang Wang +5Visual EvidenceMultimodal Retrieval Augmented Generation

  10. Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom

    Sep 29, 2026Xijia Tao, Yihua Teng, Xinyu Fu +5Multiple Vision TasksVisual Evidence

  11. Beyond Readability: Evaluating Task Information Recoverability

    Sep 29, 2026Yiwei LiuReadabilityMultiple Vision Tasks

  12. On-Policy Visual Evidence Distillation

    Sep 29, 2026Shaohang Wei, Feifan Song, Guangyue Peng +9Visual EvidenceOn-Policy

  13. RED: Reconstruction Evolution Dynamics for Generalizable AI-Generated Image Detection

    Sep 29, 2026Wenpeng Mu, Junshan Jin, Tanfeng Sun +2Ai-Generated Image DetectionDigital Forensics

  14. Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning

    Sep 29, 2026Zhongan Bi, Kepeng Lin, Xuanang Gao +2Multimodal Reasoning BenchmarksVisual Evidence

  15. When Words Speak Louder than Images: Towards Understanding Language Bias in Vision-Language Models

    Sep 28, 2026Yizhou Fang, Siyue Chen, Zimo Qi +3LinguisticsVisual Evidence

  16. DF-CBM: Region-Aware Concept Bottleneck Models for Deepfake Detection

    Sep 28, 2026Georgios Tsoumplekas, Vazgken Vanian, Alexandros Doumanoglou +4Deepfake DetectionUnsupervised Detection

  17. InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision

    Sep 28, 2026Guanghao Zhu, Zeyu Liu, Zhitian Hou +9Multimodal Clinical DataMultimodal Foundation Model

  18. When VLMs Trust Context: Evaluating Scene Text Recognition under Misleading Context

    Sep 28, 2026Yuxing Cheng, Yuan Wu, Yi ChangScene Text RecognitionVision-Language Foundation Models

  19. Evidence-Aligned Multimodal On-Policy Self-Distillation for Fine-Grained Visual Understanding

    Sep 28, 2026Nanxing Hu, Qiwei Yan, Jinchao Zhang +1Cross-Modal DistillationFine-Grained Perception

  20. Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

    Sep 28, 2026Xi Xiao, Tianchen Zhao, Youngeun Kim +10Latent Visual ReasoningVisual Reasoning

  21. TLC-DiT: Task-Aligned Local Visual Conditioning for Robust Multitask Robot Manipulation

    Sep 28, 2026Xianbo Cai, Hideyuki Ichiwara, Zihang Wang +2Robotic ManipulationDiffusion Transformers

  22. A Visual Classification Dataset and Model Evaluation for Historical Manuscript Illustrations

    Sep 27, 2026Yoav Evron, Michal Bar-Asher Siegal, Michael FireVision DatasetsHistorical Manuscripts

  23. MIC: Explaining Image-Claim Inconsistencies in AI-Generated Multimodal Misinformation

    Sep 27, 2026Ruihong Zeng, Jonathan Tonglet, Preslav Nakov +1MisinformationReference-Guided Multimodal In-Context Verification

  24. AnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios

    Sep 23, 2026Zhipeng Bao, Wenjie Zhao, Tianle Zhu +4Autonomous DrivingHuman Driving

  25. Self-Evolving Multimedia Verification through Memory Consolidation of Contestation Experiences

    Sep 23, 2026Truong Thanh Hung Nguyen, Vo Thanh Khang Nguyen, Hoang-Loc Cao +4Reference-Guided Multimodal In-Context VerificationVisual Evidence

  26. Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning

    Sep 21, 2026Santi Ram Tiwari, Nihal Naik, Devbrat Pandey +1Fine-Grained PerceptionRecent Vision-Language Models

  27. PREM: Prefix-Steered Recurrent Memory for Long-Video Understanding

    Sep 20, 2026Siru Zhong, Qiongyan Wang, Xiaohui Lv +5Frozen Vision-Language ModelsLong-Video Benchmarks

  28. Decodable but Misrouted: Sparse Features Uncover a Readout Gap in Vision-Language Models for Harmful Meme Detection

    Sep 16, 2026Girish A. Koushik, Diptesh Kanojia, Helen TreharneReadoutVisual Evidence

  29. EDCT-Bench: Uncovering Faithfulness Gaps in VLMs via Explanation-Driven Counterfactual Testing

    Sep 16, 2026Sihao Ding, Santosh Vasa, Aditi Ramadwar +1Visual EvidenceExplainable AI Methods

  30. Semantic-Spatial Agreement Verification for Mitigating Object Hallucination in Multimodal Large Language Models

    Sep 15, 2026Ziheng Ren, Qian Gao, Jun Fan +3Hallucination MitigationReference-Guided Multimodal In-Context Verification

  31. Probe-VAD: Ordinal Likelihood Probing for Training-Free Video Anomaly Detection

    Sep 15, 2026Jiawei Gu, Qilin Zhao, Tengkuo Guo +6Training-Free Video Anomaly DetectionAnomaly Score

  32. OPD-Aha: From Linguistic Momentum to Visual Reflection in Multimodal On-Policy Distillation

    Sep 15, 2026Chenhao Qiu, Dawei Li, Yechao Zhang +2Multimodal ReasoningTeacher

  33. Navigating Sparse Evidence: Agentic Visual RAG via Explicit Context Selection and Consolidation

    Sep 14, 2026Yucheng Shen, Lingyong Yan, Jiulong Wu +4Visual EvidenceKnowledge-Based Visual Question Answering

  34. Omni-Streaming Thinking

    Sep 14, 2026Enjun Du, Siyi Liu, Ziyu Zheng +4Omni-ModalAudio-Visual Reasoning

  35. Concentrate After Imagination: Text-Conditioned Evidence Grounding for Partially Relevant Video Retrieval

    Sep 8, 2026Shuaiqi Cheng, Siyu You, Yanbi Wu +3Visual EvidenceImagination

  36. EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV Reasoning

    Sep 8, 2026Jingpu Yang, Fengxian Ji, Mingxuan Cui +4Motion-Based PerceptionFine-Grained Video Understanding

  37. FailBench: How Reliable are VLMs at Judging Robot Task Success?

    Sep 3, 2026Zaruhi Navasardyan, Tatul Danielyan, Hrant DavtyanRobotic ManipulationRobot Systems

  38. VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

    Sep 2, 2026Wenzhuo Xu, Yuchen Zhu, Chongjian Ge +8Physical PlausibilityGeneration Provenance

  39. InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations

    Sep 1, 2026Maeve Hutchinson, Syed Mahbubul Huq, Mohammad Albinhassan +3Category-Aware Atomic ClaimsVisual Evidence

  40. LOCI: A Locator-Critic with Refinement Loop

    Aug 31, 2026Walid Bousselham, Mathilde Caron, Arsha Nagrani +1Recent Vision-Language ModelsVisual Evidence

  41. CheXGround: Anatomical Region Tokens for Grounded Longitudinal Chest X-ray Interpretation

    Aug 31, 2026Adonay Demewez Gebremedhin, Wessam Shehieb, Sara Alansari +4Chest X-RayMedical Vision-Language Models

  42. VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

    Aug 31, 2026Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1Citation Hallucination DetectionVisual Evidence

  43. Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

    Aug 30, 2026Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan +3Recent Vision-Language ModelsLarge Language Model Hallucination

  44. CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

    Aug 13, 2026Peng Ling, Yingda Yin, Lingting Zhu +5Visual Token Pruning3D Spatial Reasoning

  45. TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

    Aug 13, 2026Fnu Pramono, John Cai, Sourabh KulkarniVisual EvidenceAbstention

  46. Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence

    Aug 13, 2026Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik +3Medical Visual Question AnsweringMultiple-Choice Visual Question Answering

  47. Verifiably grounded machine interpretation of lunar geology

    Aug 10, 2026Tom Sander, Kay Wohlfarth, Christian WöhlerGeological Semantic UnderstandingRosetta

  48. RobustDefect-LLM: Explainable and Robustness-Aware Industrial Surface Defect Classification with Decision Support and AI-Assisted Reporting

    Aug 9, 2026Nazlıcan Düşünmez, Halûk GümüşkayaDefect DetectionInspection

  49. Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

    Aug 7, 2026Chen Ling, Hanqian Li, Dongnan Liu +9Multimodal Large Language ModelsVisual Evidence

  50. The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

    Aug 6, 2026Zhiheng Wang, Bo Peng, Lai Wei +1Visual EvidenceIllusions

  51. Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

    Aug 6, 2026Yuyang Dai, Xueqing Peng, Yuxia Wang +2Multimodal Large Language ModelsVisual Evidence

  52. Positive-Unlabeled Preference Optimization For Chest X-ray Report Generation

    Aug 5, 2026Yuta Kobayashi, Pradyun Ramesh, Muhammad Ahmed Chaudhry +5Radiology Report GenerationMedical Vision-Language Models

  53. Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

    Aug 5, 2026Yang Yang, Jiawei Chen, Tairan Chen +1Spatial ReasoningMultimodal Large Language Models

  54. Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling

    Aug 5, 2026Han Chen, Ming Li, Hong Jiao +1Visual Evidence