Visual Generation

Latest papers 89

All topics
CardsList
  1. PhysTacGen: Physics-Aware Visual-Tactile Sensor Image Generation

    Oct 6, 2026Guo Tang, Yongtao WangTactileVisual Generation

  2. Imagine to Act: High-Fidelity Data Synthesis via Image Editing World Model for Scalable GUI Agent Training

    Oct 5, 2026Yongxin Ning, Runliang Niu, Qianli Xing +4Visual GenerationIndoor Scene Generation

  3. DMAD: Distribution Matching as Adversarial Distillation for Fast Visual Generation

    Oct 1, 2026Zhengming Yu, Junkun Yuan, Haotian Yang +8Distribution Matching DistillationDataset Distillation

  4. Form and Void: Entangled Composition through an Autonomous AI Agent

    Oct 1, 2026Shiwen Wang, Jian Yang, Xu Wang +2Visual GenerationMultimodal Generation

  5. AutoGUIWorld: Image Generators as Visual World Models for GUI Agent

    Oct 1, 2026Cheng Yang, Yifan Wu, Yutao Huang +18Visual GenerationAction Generation

  6. OmniTaskonomy: When Does Visual Generation Improve Visual Understanding?

    Sep 29, 2026Jiaxin Ge, Yiming Qin, Ji Xie +13Visual Generation

  7. Think Before You Score: Thinking Reward Model for Visual Generation

    Sep 29, 2026Xuehai Bai, Zhenchen Tang, Yang Shi +9Progress Reward ModelingVisual Generation

  8. Unifying Distributional Training for One-Step Visual Generation

    Sep 28, 2026Chi Zhang, Shi Haoyang, Yueyi Liu +9Generative Flow NetworksVisual Generation

  9. SolveEdit: Benchmarking Visual Problem Solving in Generative Models

    Sep 28, 2026Wenjie Shu, Yexin Liu, Harold Haodong Chen +9Visual GenerationVisual Reasoning

  10. DrawingsDreamer: A Unified Multi-View Engineering Drawings Generation Model

    Sep 28, 2026Shurui Liu, Weide Chen, Changwang Yi +1Scalable Vector GraphicVisual Generation

  11. What Visual Generators Need from Teachers: Rethinking Representation Alignment

    Sep 28, 2026Yongcong Wang, Hingchin Chen, Mingyu Fan +6Diffusion AlignmentDiffusion Transformers

  12. MaLiang-Harness: A Programmable Path to Image and Video Generation

    Sep 28, 2026Haoyu Zhao, Zihao Zhang, Xudong Wang +4Visual GenerationVideo Generation

  13. SciGen-Verifier: A Multimodal Reasoner for Explainable Verification in Scientific Image Generation

    Sep 27, 2026Jiali Chen, Zhengteng Lin, Zuqi Wang +6Scientific FigureReference-Guided Multimodal In-Context Verification

  14. Seeing Is Not Perceiving: When Synthetic Consumers Can and Cannot Pretest Visual Marketing

    Sep 22, 2026Yi-Lin Tsai, Yung-Hsiu, LaiGenerative Artificial IntelligenceVisual Generation

  15. GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

    Sep 21, 2026Jiahao Lu, Minghao Yin, Wenbo Hu +5Playable Video World GenerationVideo Latents

  16. Reasoning with Image Generation

    Sep 14, 2026Nishad Singhi, Hector Garcia Rodriguez, Aditya Arora +2Visual ReasoningVisual Generation

  17. Programmable World Model

    Sep 9, 2026Zheng-Hui Huang, Guixu Lin, Jiacheng Lin +8Video World ModelsWorld Models

  18. Editable Visual Design

    Sep 3, 2026Junyan Ye, Wei Liu, Dongzhi Jiang +9Visual GenerationAesthetics

  19. VisCAD: A Foundation Model Suite with Multimodal Industrial CAD Intelligence

    Sep 3, 2026JoyIndustrial VisCAD Team, Linxin Cai, Qiuhe Hong +103D ModelsVisual Generation

  20. LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes

    Sep 3, 2026Chuyan Chen, Haoxing Chen, Kun Chen +27Multi-Reference Image GenerationVisual Generation

  21. Figures as Programs: Recursive Generation of Editable Scientific Figures

    Sep 1, 2026Yepeng Liu, Dasen Dai, Chengzhi Liu +7Scientific FigureScalable Vector Graphic

  22. From Terminology to Diagrams: Visual-Instruction Generation for Scientific Diagram Understanding

    Sep 1, 2026Raul Ortega, José Manuel Gómez-PérezDiagramsReasoning Graphs

  23. CANVAS: Consistency-Aware Navigation via Visual Adaptive Sampling for Long-Context Text-to-SVG Generation

    Aug 31, 2026Yichen Wu, Haoxuan Qu, Yihang Lou +2Scalable Vector GraphicSketches

  24. From Local Mismatch to Global Impact: Optimizing Cache Reuse Policy for Efficient Diffusion

    Aug 13, 2026Xichen Ye, Yifan Wu, Zhikang Xie +3Diffusion ModelsDenoising Trajectory

  25. From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

    Aug 12, 2026Houston H. Zhang, Tao Zhang, Li Gu +5Image-To-Code GenerationGenerative User Interface

  26. Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models

    Aug 12, 2026Hao Zhang, Jiaxin Qi, Zhijiang Tang +1Multimodal ModelVisual Generation

  27. AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

    Aug 11, 2026Mingju Gao, Jingkai Zhou, Kun Gai +2Fréchet Inception DistanceVisual Generation

  28. Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

    Aug 10, 2026Shulin Tian, Ziqi Huang, Fan Zhang +3Agentic EvaluationsEvaluation Agent

  29. Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

    Aug 5, 2026Ye Leng, Junjie Chu, Yiting Qu +3Hate SpeechHate Speech Detection

  30. GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting Scenarios

    Jul 30, 2026Yiming Xu, Jihua Kang, Chunsai Du +5Scalable Vector GraphicDiagrams

  31. Amortized Moment Matching for Visual Generation

    Jul 29, 2026Wenze Liu, Xintao Wang, Pengfei Wan +1Fréchet Inception DistanceContrastive Flow Matching

  32. UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling

    Jul 27, 2026Zhipeng Bao, Zhen Zhu, Nupur Kumari +4Autoregressive Image GenerationVisual Generation

  33. ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

    Jul 21, 2026Yuan Wang, Yongchao Du, Mengting Chen +4Multimodal Reasoning BenchmarksVisual Generation

  34. Knowledge-Centric Agents for Workflow Generation in ComfyUI

    Jul 17, 2026Zhendong Li, Lei Sun, Ruibo Ming +4Agentic WorkflowsData Generation Pipelines

  35. Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition

    Jul 16, 2026Qifan Zhou, Yuan Wang, Yanbin Hao +4Concept ErasureVisual Generation

  36. SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

    Jul 13, 2026Jinxiu Liu, Jianru Li, Tanqing Kuang +4Visual GenerationMultimodal Generation

  37. MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

    Jul 13, 2026Yufei Cai, Xuesong Niu, Hao Lu +3Novel View SynthesisGeometric Priors

  38. Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

    Jul 10, 2026Wenxi Gao, Guanxi Lu, Didi Zhu +5Multimodal ReasoningVisual Generation

  39. AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

    Jul 7, 2026Yuanmin Huang, Zhenfei Zhang, Mi Zhang +5Text-To-Image Diffusion ModelsText-To-Image

  40. Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

    Jul 6, 2026Haozhe Wang, Weijia Feng, Jinpeng Yu +8Visual GenerationMultimodal Search Agents

  41. Representation Distribution Matching for One-Step Visual Generation

    Jul 2, 2026Lan Feng, Wuyang Li, Eloi Zablocki +2Multi-Reference Image GenerationVisual Generation

  42. Optimizing Visual Generative Models via Distribution-wise Rewards

    Jul 2, 2026Ruihang Li, Mengde Xu, Shuyang Gu +4Generative ModelsVisual Generation

  43. DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing

    Jul 2, 2026Zhaokai Wang, Mingxin Liu, Zirun Zhu +11Visual GenerationLarge Reasoning Models

  44. KathaTrace: Diagnosing Semantic Trajectory Collapse in Generated Visual Narratives

    Jul 1, 2026Jamuna S. Murthy, Amin Karimi Monsefi, Rajiv RamnathVideo StorytellingNarratives

  45. Representation as a Bottleneck for Mechanistic Interpretability: The Manifestation Unit Protocol

    Jun 30, 2026Hussein Chouman, Wataru Sasaki, Tomokazu Matsui +2Mechanistic InterpretabilityInterpretability

  46. UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

    Jun 30, 2026Yaozhi Zheng, Yilei Jiang, Manyuan Zhang +5Image-To-Code GenerationVisual Generation

  47. ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

    Jun 30, 2026Xuchang Zhong, He Zheng, Chenxu Zhao +8Autonomous DrivingAutoregressive Diffusion

  48. COrigami: An AI Pipeline for Co-Designing Flat-Foldable Visually Recognisable Origami

    Jun 24, 2026Tom Zahavy, Shaobo Hou, Thomas Tumiel +16Asymmetric Origami BendingGenerative Artificial Intelligence

  49. SACE: Concept Erasure at the Semantic Singularity in Visual Autoregressive Models

    Jun 14, 2026Siya Yang, Nanxiang Jiang, Zhaoxin Fan +1Visual Autoregressive ModelsConcept Erasure

  50. OmniGen-AR: AutoRegressive Any-to-Image Generation

    Jun 8, 2026Junke Wang, Xun Wang, Qiushan Guo +4Autoregressive Image GenerationVisual Generation

  51. Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation

    Jun 3, 2026Tobia Poppi, Silvia Cappelletti, Sara Sarto +5Visual GenerationGenerative Models

  52. MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation

    Jun 3, 2026Dewei Zhou, Xinyu Huang, Xun Wang +6Visual GenerationSpatial Grounding

  53. Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs

    May 30, 2026Xin Gao, Cheng Yang, Chufan Shi +1Multimodal Knowledge EditingMultimodal Model

  54. APE: Agentic Prompt Enhancer for Image Generation and Editing

    May 29, 2026Zijian Huang, Jay Zhangjie Wu, Zian Wang +5Visual GenerationImage Generation