Image-Text Alignment

Latest papers 63

All topics
CardsList
  1. Frozen Scenes, Shifting Winners: Configuration Fragility in Text-to-3D Evaluation

    Sep 30, 2026Anson Y. Lam, Shuqing Li, Michael R. Lyu3D Generative ModelsImage-Text Alignment

  2. GATE-ST: Gene-Aware Text-image Encoder for Spatial Transcriptomics

    Sep 30, 2026Lucas Ni, Jian Luo, Wentao Huang +1Spatial TranscriptomicsImage-Text Alignment

  3. Dual-Mode Low-Rank Learner with Bridge-Prototype Ensemble for Vision-Language Class-Incremental Learning

    Sep 29, 2026Chiyuan He, Zihuan Qiu, Fanman Meng +5Class-Incremental LearningImage-Text Alignment

  4. TOLA: Text-aware One-Step Latent Adaptation for Diffusion-based Text Image Super-Resolution

    Sep 24, 2026Yike Xu, Yue Shi, Yong Guo +1Real-World Image Super-ResolutionText-To-Image Diffusion Models

  5. SVG-Score: Human-Aligned Evaluation of Text-to-SVG Generation

    Sep 3, 2026Marco Cipriano, Leonardo Zini, Alexandra Schild +5Scalable Vector GraphicImage-Text Alignment

  6. ViTAL-X: Video-Text Alignment with Cross-Modal Temporal Edits

    Sep 1, 2026Sethuraman T, Savya Khosla, Onkar Kishor Susladkar +6Video-Language ModelsImage-Text Alignment

  7. Embedding Rotation Invariance for Provable Multi-Oriented Scene Text Recognition

    Aug 11, 2026Zhibin Ma, Pengwen Dai, Yi Liu +3Scene Text RecognitionDetection Transformer

  8. Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

    Aug 2, 2026Zhiyue Liu, Wenkai Zhou, Jian Qin +1Image Difference CaptioningImage-Text Alignment

  9. Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation

    Jul 30, 2026Simone Giano, Lorenzo Severini, Alessandro Galdelli +1Multimodal DatasetCross-Modal Distillation

  10. EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

    Jul 24, 2026Hao Yang, Jin Wang, Xuejie ZhangMemesRecent Vision-Language Models

  11. TextSLIP: Text Self-Supervised CLIP for Medical Report Generation

    Jul 24, 2026Haoyu Jiang, Ziping CongMedical Vision-Language ModelsImage-Text Alignment

  12. DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

    Jul 23, 2026Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh +1Open-Vocabulary SegmentationImage-Text Alignment

  13. Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels

    Jul 12, 2026Venkanna Babu Guthula, Oswin Krause, Dimitri Gominski +5Semantic SegmentationImage-Text Alignment

  14. VTaMo: Video-Text Alignment Model for Sign Language Translation

    Jul 10, 2026Junyi Hu, Zhewen He, Haomian Huang +2Gloss-Free Sign Language TranslationSign Language Translation

  15. Efficient bias mitigation in T2I diffusion models using Concept Graphs

    Jul 3, 2026Mansi, Avinash Kori, Francesco LeofanteText-To-Image Diffusion ModelsDiffusion Alignment

  16. MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

    Jul 1, 2026Peiyuan Zhu, Shaoan Xie, Zijian Li +5Image-Text AlignmentEntanglement

  17. HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

    Jul 1, 2026Ji Ha Jang, Hayeon Kim, Chulwon Lee +2Contrastive Language-Image Pre-Training ModelEfficient Long-Context Inference

  18. The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

    Jul 1, 2026Adeel Yousaf, Soumik Ghosh, James Beetham +2Text-To-Image Diffusion ModelsText-To-Image

  19. TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

    Jun 26, 2026Boyuan Chen, Zichen Dang, Chuang Yang +2Scene Text RecognitionImage-Text Alignment

  20. UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

    Jun 23, 2026Jiahao Lyu, Pei Fu, Zhenhang Li +6Unpaired Image-To-Image TranslationImage-Text Alignment

  21. Token-to-Token Alignment of Text Embeddings for Semantic Blending

    Jun 22, 2026Saar Huberman, Ron Mokady, Or Patashnik +1Image-Text AlignmentText-To-Image

  22. Text-Vision Co-Instructed Image Editing

    Jun 15, 2026Chenxi Xie, Yuhui Wu, Qiaosi Yi +1Image EditingVisual In-Context Learning

  23. Improving Text-Instance Alignment Of Foreground Conditioned Out-Painting Via Customized Concept Embedding

    Jun 9, 2026Yihao Zhao, Xuan Han, Bin He +1InpaintingImage-Text Alignment

  24. STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model

    Jun 9, 2026Hailan Zhang, Haipeng Liu, Bo Fu +1Text-To-Image Diffusion ModelsImage-Text Alignment

  25. VT-3DAD: Cross-Category 3D Anomaly Detection via Visual-Text Normal Space Alignment

    Jun 3, 2026Zi Wang, Katsuya Hotta, Yawen Zou +4Multimodal Anomaly DetectionFrozen Contrastive Language-Image Pre-Training Visual Encoder

  26. End-to-End Text Line Detection and Ordering

    Jun 2, 2026Benjamin KiesslingScene Text RecognitionText Analysis and Detection

  27. G2LoRA: Gradient Orthogonal Low-Rank Adaptation Framework for Graph Continual Learning on Text-Attributed Graphs

    Jun 1, 2026Yuhan Wang, Yibo Ding, Yutong Ye +4Replay-Based Continual LearningMulti-Lora

  28. Training-free image inversion for one-step diffusion models

    May 31, 2026Tao Wu, Senmao Li, Yaxing Wang +3Diffusion-Based Image EditingDiffusion Inversion

  29. Omni-Supervised Motion Editing: Balancing Change and Invariance through Positive-Negative Learning

    May 29, 2026Zhenwu Shi, Jingyu Gong, Peiwei Wang +7Text-To-Motion GenerationImage-Text Alignment

  30. Semantic Motion Anchors: Bridging Motion and Meaning in Co-Speech Gestures

    May 28, 2026Varsha Suresh, Mohammad Mahdi Abootorabi, Mohamed Salman +5Co-Speech Gesture GenerationSemantic Anchor

  31. Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models

    May 28, 2026Jaa-Yeon Lee, Yeobin Hong, Taesung Kwon +1Text-To-Image Diffusion ModelsDiffusion Alignment

  32. Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences

    May 25, 2026Bao Li, Yuliang Xiu, Zhen LiuAnatomical PriorsImage-Text Alignment

  33. Do Image-Text Metrics Respect Semantic Invariances?

    May 23, 2026Amit Agarwal, Hitesh Laxmichand Patel, Meizhu Liu +9Image-Text AlignmentExplanation Consistency Score

  34. Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics

    May 20, 2026Yunlong Wang, Jinjin Shi, Wenbin Gao +3Text-To-Image Diffusion ModelsImage-Text Alignment

  35. Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting

    May 18, 2026Antonio Colombo, Giovanni BianchiScene Text RecognitionRectification

  36. Beyond Detection: A Structure-Aware Framework for Scene Text Tracking

    May 17, 2026Chenmin Yu, Liu Yu, Daiqing Wu +3Scene Text RecognitionMulti-Object Tracking

  37. Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending

    May 16, 2026Jingqi Hou, Hongtian WangFew-Shot Font GenerationOcclusion

  38. Masked Next-Scale Prediction for Self-supervised Scene Text Recognition

    May 14, 2026Zhuohao Chen, Zeng Li, Yifei Zhang +2Scene Text RecognitionMulti-Scale Attention

  39. Flow-OPD: On-Policy Distillation for Flow Matching Models

    May 8, 2026Zhen Fang, Wenxuan Huang, Yu Zeng +8Text-To-Image Diffusion ModelsImage-Text Alignment

  40. LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment

    May 4, 2026Junyi Hu, Qiji Zhou, Lei Zhang +1Image-Text Alignment

  41. COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

    Apr 30, 2026Bingli Wang, Huanze Tang, Haijun Lv +5Multimodal Large Language ModelsImage-Text Alignment

  42. ESICA: A Scalable Framework for Text-Guided 3D Medical Image Segmentation

    Apr 27, 2026Yu Xin, Gorkem Can Ates, Jun Ma +53D Medical Image SegmentationImage-Text Alignment

  43. MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation

    Apr 26, 2026Haojie Zhang, Di Wu, Bingyan Liu +5Interactive Video GenerationCinematic Ideal

  44. Oracle Noise: Faster Semantic Spherical Alignment for Interpretable Latent Optimization

    Apr 26, 2026Haosen Li, Wenshuo Chen, Lei Wang +3Diffusion AlignmentText-To-Image Diffusion Models

  45. From Global to Local: Rethinking CLIP Feature Aggregation for Person Re-Identification

    Apr 24, 2026Aotian Zheng, Winston Sun, Bahaa Alattar +2Re-IdentificationContrastive Language-Image Pre-Training Model

  46. Rethinking Cross-Domain Evaluation for Face Forgery Detection with Semantic Fine-grained Alignment and Mixture-of-Experts

    Apr 23, 2026Yuhan Luo, Tao Chen, Decheng LiuFace Forgery DetectionCross-Dataset Benchmark

  47. Towards Universal Skeleton-Based Action Recognition

    Apr 18, 2026Jidong Kuang, Hongsong Wang, Jie GuiSkeleton-Based Action RecognitionOpen-Vocabulary Action Recognition

  48. LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

    Apr 16, 2026Zhanhao Liang, Tao Yang, Jie Wu +2Contrastive Flow MatchingImage-Text Alignment

  49. ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis

    Mar 26, 2026Xike Zhang, Maoyuan Ye, Juhua Liu +1Segment Anything ModelScene Text Recognition

  50. Fine-grained Motion Retrieval via Joint-Angle Motion Images and Token-Patch Late Interaction

    Mar 10, 2026Yao Zhang, Zhuchenyang Liu, Yanlan He +2Text-To-Motion GenerationLatent Motion

  51. Anchor to Expand: Semantic Anchoring for Personalized Text-to-Image Diffusion Models

    Nov 27, 2025Seoyun Yang, Gihoon Kim, Taesup KimText-To-Image Diffusion ModelsImage-Text Alignment

  52. Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

    Nov 25, 2025Taehoon Kim, Henry Gouk, Timothy HospedalesDiffusion AlignmentText-To-Image Diffusion Models

  53. TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval

    Oct 11, 2025Zixu Zhao, Yang Zhan, Yunhao Li +1Text-To-Video Generation ModelImage-Text Alignment