Semantic Region

Momentum

9 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 6Week of Sep 21

Latest papers 55

All topics
CardsList
  1. When Text Matters: Design Principles for Visual Token Pruning in Vision-Language Model

    Sep 28, 2026Minchan Kang, Kyeonghye Park, Seoyoung Cho +2Visual Token PruningRecent Vision-Language Models

  2. ActGaze: Learning Action-Grounded Gaze through Counterfactual Visual Interventions for High-Precision Manipulation

    Sep 24, 2026Jinxuan Zhu, Jiaheng Wang, Chao Tang +7Robotic ManipulationGaze Behavior

  3. Beyond Mean Foils: Auditing Worst-Foil Specificity in Frozen CLIP Region Explanations

    Sep 23, 2026Kaixin Liu, Zhipeng Ye, Feng Jiang +2Semantic RegionFrozen Contrastive Language-Image Pre-Training Visual Encoder

  4. TACIT: Tactile Contact Supervision for Spatial Attention in Dexterous Manipulation

    Sep 21, 2026Yanhou Lai, Fucai Zhu, Ruiqiang Wang +1TactileContact-Rich Dexterous Manipulation

  5. PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection

    Sep 16, 2026Sara Pieri, Evangelos Kazakos, Shizhe Chen +2Panoptic SegmentationImage Difference Captioning

  6. BrainFocus: EEG-Guided ROI Selection for Efficient Vision-Language Models

    Sep 15, 2026Yihui Peng, Guorui Lu, Qinyu ChenVisual Question Answering BenchmarksElectroencephalography Decoding

  7. Event-based Selective Attention for Multi-resolution Fast Region of Interest (ROI) Detection

    Sep 15, 2026Luca Peres, Giulia D'Angelo, Chiara Bartolozzi +1Neuromorphic ComputingSemantic Region

  8. Can a Neural Encoding Model Replicate an fMRI Visualization Study?

    Sep 14, 2026Erfan Nasirzadeh Orang, Zack WhileFunctional Magnetic Resonance ImagingHuman Visual Cortex

  9. SCoCaT: Success Conditioned Constrained Reinforcement Learning for Spacecraft Docking

    Sep 5, 2026Aman Arora, Ricard Marsal I Castan, Matteo El-Hariry +1Safety ConstraintsSpacecraft

  10. IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training

    Aug 31, 2026Rongze Tang, Jianjie Fang, Zhaolu Wang +8Efficient World-Action ModelInteraction Prediction

  11. Attention from Action, for Action: Emergent Visual Bottlenecks for Policy Learning

    Aug 13, 2026Zheyu Zhuang, Ruiyu Wang, Nick Heppert +4Visuomotor PolicyOpen-Vocabulary Action Recognition

  12. DiCoR: Decoupled Referent Disambiguation and Contour Recalibration for Efficient Referring Remote Sensing Image Segmentation

    Aug 13, 2026Ziyang Gao, Zhizhuo Jiang, Jingjing Chang +5Remote Sensing Image SegmentationSemantic Region

  13. RegionDet: A Benchmark for Region Detection Beyond Object Instances

    Aug 7, 2026Liang Wan, Yuhan Wang, Yupeng Zhang +4Semantic Region

  14. Global Attention-Fused Image Cropping with Attention-Guided and Global-Aligned Crop Evaluator

    Aug 5, 2026Haotian Yang, Zhile Yang, Kin-Man Lam +2CroppingInpainting

  15. EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

    Aug 5, 2026Xinyuan Guan, Feifan Chen, Xinyu Zhan +3Egocentric VisionGoal-Conditioned Dynamic Manipulation

  16. Generative Optimization for Incentivized Advertising with Global Level Constraints

    Aug 5, 2026Gege Chen, Ning Luo, Hao Jiang +7AdsIncentives

  17. InstancePin: Instance-Addressable Layout-to-Image Diffusion via Coordinate Pinning

    Aug 1, 2026Chaoyue Wu, Yunfei Zhang, Si WuSemantic Region

  18. R-SLPR: Region-based Small-to-Large Point-cloud Registration with Contrastive Learning

    Jul 29, 2026Yusen Wan, Zeyuan Chen, Qianshi Zou +1Point Cloud RegistrationImage Registration

  19. Beyond Local Inspection: Global, Guideline-Grounded Evaluation of Post-hoc XAI Methods for ECG Classification

    Jul 27, 2026Nils Gumpfer, Michael Guckert, Samuel Sossalla +2Electrocardiogram ClassificationXai

  20. AI Strategy: How to Choose What AI Product to Implement

    Jul 26, 2026Foster Provost, Panos IpeirotisArtificial Intelligence EvaluationFinancial Strategy Research

  21. Can Generative Recommendation Reach Cold Items? A Temporal Perspective on Semantic-ID Generation

    Jul 23, 2026Jie Peng, Yanping Zheng, Zhewei Zhe +3Sequential RecommendationReachability

  22. Importance-Aware OBS Pruning for Diffusion Models

    Jul 22, 2026Ba-Thinh Lam, Srijan Das, Hieu LeDiffusion ModelsGenerative Image Compression

  23. Latent-Action-Guided Vision-Language Contrastive Learning for Surgical Interaction Recognition

    Jul 22, 2026Jiajun Cheng, Sainan Liu, Subarna Tripathi +2Diffusion-Based Vision-Language-ActionsVision Encoders

  24. Inhibited Self-Attention: Sharpening Focus in Vision Transformers

    Jul 14, 2026Peter R. D. van der Wal, Nicola Strisciuglio, George AzzopardiSelf-Supervised Vision TransformersVision Transformer

  25. Water Reflection Detection Using Symmetric Attention

    Jul 12, 2026Shuxuan Yao, Chengjia Wang, Jianyuan Sun +2Underwater Object DetectionWater

  26. Disturbance-aware Motion Planning for Over-actuated Underwater Vehicles Exploiting Actuation Redundancy for High-fidelity 3D Reconstruction

    Jul 8, 2026Yuer Gao, Tongqing Xu, Qingyang Liu +1Underwater RobotsAutonomous Underwater Vehicles

  27. Text as Illumination: Spatial Contrastive Retinex Learning for Language-guided Medical Image Segmentation

    Jun 26, 2026Jian Shi, Cheng Zhen, Pingping Zhang +6Semi-Supervised Medical Image SegmentationRetinex Theory

  28. Intracranial Aneurysm Classification and Segmentation via Tri-Axial ROI and Multi-Task Learning

    Jun 25, 2026Pengcheng Shi, Kaiyuan Yang, Houjing Huang +6Vessel SegmentationSemi-Supervised Medical Image Segmentation

  29. Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data

    Jun 24, 2026Shangkun Li, Jie Xu, Yi Guo +2Medical Vision-Language ModelsFunctional Magnetic Resonance Imaging

  30. DART: A design-aware microfluidic chip paradigm for real-time live-cell image analysis

    Jun 16, 2026Johannes Seiffarth, Matthias Pesch, Lukas Scholtes +3MicroscopyFluid Controls

  31. LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

    Jun 15, 2026Zhou Tao, Fang Zhang, Zewen Ding +5Fine-Grained PerceptionVisual Cues

  32. Semantic DLM+: Improving Diffusion Language Models through Bias-variance Trade-off in Transition Kernel Design

    Jun 13, 2026Keyue Jiang, Yuxiang Wang, Yanan Zhao +7Diffusion Language ModelsDiffusion Models

  33. SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing

    Jun 11, 2026Xiangyu Lyu, Dan LeiImage EditingVision-Language Foundation Models

  34. Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

    Jun 10, 2026Lu Qiu, Yizhuo Li, Yi Chen +3Efficient World-Action ModelWorld Models

  35. Site4Drug: Predicting Drug-Binding Target Sites with an AI Agent

    Jun 1, 2026Taehan Kim, Sarrah Rose Mikhail Leung, Bharat Mekala +1ProteinMultimodal Search Agents

  36. Improving Visual Grounding in Remote Sensing via Cluster-Guided Refinement and Model Ensemble Voting

    May 30, 2026Panav Shah, Geet Sethi, Ashutosh GandheRemote Sensing Image SegmentationRemote Sensing

  37. Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence

    May 21, 2026Xingyue Wang, Bo Liu, Meng Wang +4Medical Visual Question AnsweringMedical Vision-Language Models

  38. DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding

    May 15, 2026Yichao Liu, Huawen Shen, Liu Yu +3Graphical User InterfaceMultimodal Search Agents

  39. Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement

    May 12, 2026Zhenxin Qin, Qiang Li, Qingzhuo Wang +3Object HallucinationSemantic Region

  40. Focusable Monocular Depth Estimation

    May 12, 2026Yuxin Du, Tao Lin, Zile Zhong +7Monocular Depth EstimationDepth Estimation

  41. FoR-Net: Focus-on-Regions Network for Semantic Segmentation

    May 4, 2026Sheng-Wei Chan, Hsin-Jui Pan, Jen-Shiun ChiangEfficient Semantic SegmentationSemantic Segmentation

  42. Object-Level Explanations for Image Geolocation Models: a GeoGuessr use-case

    Apr 29, 2026Emilie Durrieu, Christophe Hurter, Philippe Muller +1Cross-View Geo-LocalizationSemantic Region

  43. PPEDCRF: Dynamic-CRF-Guided Selective Perturbation for Background-Based Location Privacy in Video Sequences

    Apr 18, 2026Bo Ma, Weiqi Yan, Jinsong WuPrivacyPrivacy-Utility Trade-Offs

  44. H2VLR: Heterogeneous Hypergraph Vision-Language Reasoning for Few-Shot Anomaly Detection

    Apr 16, 2026Jianghong Huang, Luping Ji, Weiwei Duan +1Semantic Region

  45. EfficientUICoder: A Bidirectional Token Compression Framework for Efficient MLLM-Based UI Code Generation

    Sep 15, 2025Jingyu Xiao, Zhongyi Zhang, Yuxuan Wan +3Token CompressionImage-To-Code Generation

  46. Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers

    Jul 21, 2025Ian Chuang, Jinyu Zou, Andrew Lee +2Robotic PerceptionScalable Robot Learning

  47. Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation

    Jun 29, 2025Sunggu Kyung, Jinyoung Seo, Hyunseok Lim +7Radiology Report GenerationCone-Beam Computed Tomography