Query Image

Momentum

9 papers in the last four weeks, up 29% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 85

All topics
CardsList
  1. Comparing a gradient boosting algorithm to the GOES FDC for wildfire detection

    Oct 1, 2026Asaf Vanunu, Boaz Nadler, Arnon KarnieliWildfire DetectionXgboost Model

  2. Sparse cubical complexes for efficient topology-preservation in image data

    Sep 29, 2026Alexander H. Berger, Marco Fontana, Daniel Rueckert +3Persistent HomologyTopology

  3. ModalFidelity: Routing Modalities for Deepfake Detection on a Budget

    Sep 29, 2026Oguzhan Baser, Kaan Kale, Sriram Vishwanath +1Deepfake DetectionDigital Forensics

  4. Exploring Learning Models for Topological Relationship Recognition from Image Data

    Sep 28, 2026Saptak Das, Monidipa DasImage ClassificationTopology

  5. MMSkillRisk: Can Agents Stay Safe When Multimodal Skills Become Traps?

    Sep 28, 2026Lingqi Jiang, Jialuo Chen, Jianan Ma +8Multimodal AgentsSecurity Evaluation

  6. Constrained Edit Fields for Training-Free Flow Editing

    Sep 27, 2026Jingxuan Kang, Yinsong Wang, Che Liu +1Diffusion-Based Image EditingEdit

  7. From Explicit References to Scene Manifolds: Distributional Fidelity and Realism for Radiance Field Quality Assessment

    Sep 7, 2026Saeed Mahmoudpour, Gi-Mun Um, Hyon-Gon Choo +1Novel View SynthesisScene Reconstruction

  8. LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes

    Sep 3, 2026Chuyan Chen, Haoxing Chen, Kun Chen +27Multi-Reference Image GenerationVisual Generation

  9. Understanding Autonomous Driving Datasets by Describing Differences between Image Subsets in Natural Language

    Sep 3, 2026Julian Truetsch, Felix Hauser, Christoph Stiller +1Naturalistic Driving DataAutonomous Driving

  10. FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-Making

    Sep 1, 2026Vahid Reza Khazaie, Ahmed Y. Radwan, Shaina RazaRecent Vision-Language ModelsAlgorithmic Fairness

  11. MegaStyle++: Scaling Image Style Space through Hierarchical Style Definition

    Sep 1, 2026Junyao Gao, Sibo Liu, Jiaxing Li +4Large-Scale Image DatasetsStyle

  12. StainPresetNet: Stain Preset Network for Fast Multi-to-Multi Stain Normalization

    Sep 1, 2026Hongtao Kang, Die Luo, Li Chen +4Digital PathologyNormalization

  13. Revisiting Face Recognition for Monozygotic Twins: The Celeb Twins Test Set

    Sep 1, 2026Michael Zang, Haiyu Wu, Mrinal Sharma +1TwinsQuery Image

  14. Gaze Target Estimation Anywhere with Concepts

    Aug 11, 2026Xu Cao, Houze Yang, Vipin Gunda +5Gaze Target EstimationObject Localization

  15. When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning

    Aug 4, 2026Yiming Chen, Kemou Li, Haiwei Wu +1Multimodal Contrastive LearningModalities

  16. V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory

    Aug 2, 2026Dingyi Kang, Dongming Jiang, Yi Li +2Multimodal MemoryModality Gap

  17. DS@GT ARC at AnimalCLEF 2026: Species-Aware Graph Construction for Multi-Species Animal Re-Identification

    Jul 17, 2026Evan Sinclair Smith, Anthony Miyaguchi, Snigdha Palamari +1Animal Re-IdentificationSpecies

  18. Handwritten and Printed Text Segmentation via Region-Aware Human-Writing Descriptor Engineering

    Jul 17, 2026Zhixian Lu, Jianwei Zhang, Lei Zhang +5HandwritingDocument Segmentation

  19. MMAgent-R2^2: Learning to Rerank and Reject for Agentic mRAG

    Jul 8, 2026Tao Zhang, Ziqi Zhang, Zongyang Ma +7Knowledge-Based Visual Question AnsweringMultimodal Retrieval Augmented Generation

  20. VEIL: How Visual Encoding Hijacking Induces Bias In Vision Models

    Jul 6, 2026Suranjana Sooraj, Xuyang Chen, Madhumitha Venkatesan +1Visual AnalyticsVisual Representations

  21. A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication

    Jul 6, 2026Avina Nakarmi, Sohom Sen, Xun Song +2Scientific FigureChart

  22. Hybrid Deep Learning for Traceability and Classification of Industrial Slate Tiles

    Jul 6, 2026Soren Antebi, Stefan Eickeler, Sandra Halscheidt +4Image ClassificationRe-Identification

  23. AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer

    Jul 6, 2026Yongwen Lai, Chaoqun WangPhotorealistic Style TransferStyle

  24. Show Me Examples: Inferring Visual Concepts from Image Sets

    Jul 2, 2026Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3Visual In-Context LearningVisual Representations

  25. Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners

    Jun 30, 2026Yunhan Wang, Eshika Khandelwal, Edson Araujo +3Few-Shot LearningImage Classification

  26. Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition

    Jun 30, 2026Zhiyao Shu, Jiacheng Yang, Yang Lu +3Visual Place RecognitionUrban Environments

  27. Confidence-feedback-weighted graph matching network: online-offline laser-induced damage site matching under complex interference

    Jun 28, 2026Yueyue Han, Guanhua Chen, Hangcheng Dong +6Harder Better Faster Denser Feature MatchingQuery Image

  28. Toward Robust In-Context Segmentation via Concept Guidance

    Jun 26, 2026Zhigang Chen, Xiawu Zheng, Rongrong JiIn-Context LearningSpatial Grounding

  29. SAM2Matting: Generalized Image and Video Matting

    Jun 25, 2026Ruiqi Shen, Guangquan Jie, Chang Liu +1Multi-Object TrackingQuery Image

  30. MedDiffuseMix: Preserving Diagnostic Evidence with Saliency-Aware Diffusion Medical Image Data Augmentation

    Jun 25, 2026Teerath Kumar, Raja Vavekanand, Muhammad TurabMedical Image ClassificationData Augmentation

  31. MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG

    Jun 25, 2026Inderjeet Singh, Andrés Murillo, Motoyoshi Sekiya +2Multimodal Retrieval Augmented GenerationPoisoning

  32. Color Matters: Trigger Color Affects Success in Federated Backdoor Attacks

    Jun 24, 2026Kavindu Herath, Joshua C. Zhao, Saurabh BagchiFewer Surprising BackdoorsFederated Learning

  33. Bengal-HP_RU: A Dataset of Bengal People For Head Pose Estimation

    Jun 23, 2026Md. Ahanaf Arif Khan, Md. Tawhidur Rahman, Sangeeta Biswas +4Wifi-Csi 3D Human Pose EstimationTraining-Set Long-Tail Motions

  34. Beyond Damage Assessment: Recyclable Material Detection in Aerial Disaster Imagery Using a Lightweight Patch-Based Framework

    Jun 19, 2026Mahmoud Hazem, Karim HammoudiPost-Disaster Damage AssessmentAerial Imagery

  35. Triangular Consistency as a Universal Constraint for Learning Optical Flow

    Jun 18, 2026Yi Xiao, Carlos Rodriguez Coronel, Jing Zhan +3Optical FlowQuery Image

  36. ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

    Jun 17, 2026Yuyang Zhang, Wenyao Zhang, Zekun Qi +7World ModelsVideo Generation

  37. When to Align, When to Predict: A Phase Diagram for Multimodal Learning

    Jun 9, 2026Ilay Kamai, Hugues Van Assel, Aviv Regev +2Multimodal LearningMultimodal Representations

  38. iMaC: Translating Actions into Motion and Contact Images for Embodied World Models

    Jun 8, 2026Zhenyu Wu, Xiuwei Xu, Yukun Zhou +8Efficient World-Action ModelRobotic Manipulation

  39. Classifying galaxies in the Galaxy10 DECals dataset using Inception and Residual CNNs

    Jun 7, 2026Lanz Anthonee A. Lagman, Prospero C. Naval, Reinabelle C. ReyesConvolutional Neural NetworksAstronomical Images

  40. PairWise Image Finder: An Open-source Tool for Finding Visually Aligned Street-Level Image Pairs for Urban Perception Studies

    Jun 7, 2026Jussi TorkkoChange DetectionQuery Image

  41. DroneDAR: Long-Range Drone Distance Estimation Using Monocular Vision and Bounding-Box Features

    Jun 5, 2026Knut Peterson, Zaid Mayers, David HanMonocularBounding Box

  42. Beyond Semantics: Modeling Factual and Affective Perceptual Experiences from Vision-Language Data

    Jun 2, 2026Youssef Mohamed, Kenneth Ward Church, Mohamed ElhoseinyPerceptuallyPerception

  43. Cross-modal linkage risk in clinical vision-language models

    Jun 1, 2026Soroosh Tayebi Arasteh, Mahshad Lotfinia, Sven Nebelung +1Medical Vision-Language ModelsVision-Language Alignment

  44. Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization

    Jun 1, 2026Liyuan Ma, Xueji Fang, Guo-Jun QiText-To-Image Diffusion ModelsImage Editing

  45. TECCI: Tricky Edits of Collected and Curated Images

    May 31, 2026Aishwarya Agrawal, Roy Hirsch, Yasumasa Onoe +2Multi-Image Editing BenchmarksImage Editing

  46. ProductWebGen: Benchmarking Multimodal Product Webpage Generation

    May 31, 2026Zhihong Liu, Siqi Kou, Zheng Li +5Multimodal GenerationQuery Image

  47. Envisioning Beyond the Few: Disentangled Semantics and Primitives for Few-Shot Atypical Layout-to-Image Generation

    May 29, 2026Nan Bao, Yifan Zhao, Wenzhuang Wang +1Few-Shot LearningQuery Image

  48. GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration

    May 29, 2026Xiangtao Kong, Jixin Zhao, Lingchen Sun +2Image RestorationQuery Image

  49. Boosting Zero-Shot 3D Style Transfer with 2D Pre-trained Priors

    May 28, 2026Xin Dong, Yunzhi Teng, Wenfeng Deng +1Photorealistic Style Transfer3D Scene Understanding

  50. Vision-Language Binding in In-Context Image Generation

    May 23, 2026Chris Ge, Rohit Gandikota, Antonio Torralba +1Multimodal GenerationQuery Image

  51. From Activation to Causality: Discovery of Causal Visual Representations in the Human Brain

    May 22, 2026Yuval Golbari, Navve Wasserman, Matias Cosarinsky +5Causal Representation LearningFunctional Magnetic Resonance Imaging

  52. AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

    May 21, 2026Hanjun Luo, Zhimu Huang, Sylvia Chung +6Evaluation AgentQuery Image

  53. Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning

    May 19, 2026Zichao Zeng, June Moh Goo, Junwei Zheng +4Visual Place RecognitionVisual Token Pruning