Visual Fidelity

Momentum

10 papers in the last four weeks, up 43% on the four weeks before. 0.1% of all new papers.

Jul 6Week of Sep 21

Latest papers 82

All topics
CardsList
  1. TexTailor: Texture-Preserving Video Virtual Try-On via Adaptive Garment Conditioning

    Sep 30, 2026Zijing Qin, Jun Zhou, Ruicheng Zhang +5Virtual Try-OnGarments

  2. WeLike2Party! In-Context Motion Transfer for Multi-Human Image Animation

    Sep 29, 2026Sangeyl Lee, Seunghyun Shin, Seungho Park +2Training-Set Long-Tail MotionsMotion

  3. OREO: Fidelity Alignment in 3D Generation via On-the-fly Rendering-Editing Optimization

    Sep 24, 2026Zhiyuan Ma, Wenbo Hu, Wang Zhao +3Visual FidelityDiffusion Priors

  4. When Visual Quality Misleads: Intent Recognition under Rendered Avatar Distortions

    Sep 23, 2026Ning-Hsuan Chang, Kai-Siang Ma, Yu-Chih ChenVisual FidelityOpen-Vocabulary Action Recognition

  5. JewelTry: Mask-Free Scale Aware Jewelry Virtual Try-On

    Sep 15, 2026Xinlei Niu, Peixia Li, Jun Wang +5Virtual Try-OnLarge-Scale Image Datasets

  6. Efficient Text-to-Image Generation: An Adaptive Step Schedule Controller for Diffusion Models

    Sep 15, 2026Kuluhan Binici, Cihan Acar, Shivam Aggarwal +2Text-To-Image Diffusion ModelsText-To-Image

  7. CrossDistill: Balancing Quality and Diversity via Trajectory-Level Hybrid Few-Step Distillation

    Sep 13, 2026Yuxi Liu, Haoyu Li, Yixiang Cai +8Few-Step DistillationText-To-Video Diffusion Models

  8. CVT-GS: Learning to Simplify 3D Gaussian Splatting with Centroidal Voronoi Tessellation

    Sep 8, 2026Bingxian Li, Yilong Li, Jingliang Peng +63D GaussianDifferentiable Rendering

  9. FlashRender: Few-Step Generative Rendering via Camera-Controlled Video MeanFlow

    Sep 3, 2026Byeongjun Park, Byung-Hoon Kim, Hyungjin ChungDenoising TrajectoryVisual Fidelity

  10. Audio-Driven Adversarial Defense for 3D Talking Face Generation with totally Visual Fidelity Preservation

    Aug 31, 2026Rui-Qing Sun, Chen-Hao Cui, Hui-Yang Zhao +3Distortion3D Generation

  11. Can Video World Models Track Unobserved World States?

    Aug 31, 2026Joonghyuk Shin, Yicong Hong, Jaesik Park +1Video World ModelsHidden States

  12. Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention

    Aug 31, 2026Bingde Liu, Wu Ran, Jinglei Zhang +2Depth EstimationVisual Fidelity

  13. Beyond Global Realism: Virtual Try-On Evaluation and Optimization with Dimension-wise Garment Fidelity Assessment

    Aug 30, 2026Kaidong Zhang, Yukang Ding, Xiaoyu Liu +1Virtual Try-OnGarments

  14. VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

    Aug 19, 2026Yinming Huang, Shuyuan Tu, Xi Yan +6Audio-Video GenerationPreference Datasets

  15. RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement

    Aug 10, 2026Ziheng Jia, Jiaying Qian, Zicheng Zhang +3Generative Video ModelsVideo Generation

  16. When Does An Extra View Help? Adapting Single-View 3D Reconstruction with Extra Imagery

    Aug 8, 2026Y Huynh, Duc Thanh Nguyen, Thao Minh Le +13D ReconstructionMulti-View

  17. Degradation-Aware Prompt Learning with Cross-Modal Compensation for Adverse Weather Removal

    Aug 7, 2026Wanshu Fan, Yunzhe Zhang, Yue Shen +5Query-Specific Degradation-Aware RepresentationVisual Degradation

  18. ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE

    Aug 7, 2026Yunkai Yang, Yudong Zhang, Xinying Chen +7Diffusion TransformersVisual Fidelity

  19. A Multi-Layer System for Ultra-High-Resolution Static 360-Degree Telepresence

    Aug 6, 2026Jiapeng Chi, Gerd Bruder, Carsten Neumann +2Omnidirectional ImagesImmersion

  20. Information Bottleneck Learning for Faithful Time Series Forecasting Explanations

    Jul 30, 2026Xu Zheng, Wei Cheng, Zhuomin Chen +3Time Series ForecastingData-Driven Forecasting

  21. Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

    Jul 29, 2026Xiaolong Liu, Junjian Li, Yuan Xiao +4Text-To-Image Diffusion ModelsText-To-Image

  22. OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

    Jul 28, 2026Yajing Xu, Yarong Lan, Jiaoyan Chen +6Text-To-ImageOmnichem

  23. Bake It Till You Make It: Ultrafast Spatial Texture-Atlas Splatting

    Jul 15, 2026Neel Kelkar, Simon Niedermayr, Kaloian Petkov +2Visual FidelityUltrafast

  24. VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation

    Jul 15, 2026Songyu Xu, Xin Wang, Qiang Chen +6Video GenerationVisual Fidelity

  25. Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

    Jul 14, 2026Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal +1Representational Similarity AnalysisVisual Fidelity

  26. ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

    Jul 13, 2026Mingchao Sun, Luyang Tang, Yu Liu +343D WorldWorld

  27. Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators

    Jul 8, 2026Christian Oefinger, Finn Rasmus Schäfer, Korbinian Moller +2World ModelsAdmissibility

  28. OmniSCS: Omni Safety-Critical Scenario Synthesis for Autonomous Driving via a Fully Editable Driving World

    Jul 7, 2026Xiaoyun Dong, Qian Xu, Yang Lu +3Autonomous Driving SimulationAutonomous Driving

  29. Clustered Codebook Quantization for 2D Gaussian-based Image Compression

    Jul 6, 2026Runze Cheng, Yicheng Zhan, Josef Spjut +1Residual Vector QuantizationRate-Distortion Theory

  30. Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising

    Jul 6, 2026Guangting Zheng, Haojing Chen, Hao Li +6Video Diffusion ModelsVisual Fidelity

  31. Learning Video Dynamics with Predictive Differentiable Rendering

    Jun 30, 2026Yujin Tang, Tian Zhou, Xin Lin +5Future Video PredictionDifferentiable Rendering

  32. RAGA: Real Time Ray Traced Gaussian Shadow Casting for 3DGS Avatar-Scene Interaction

    Jun 28, 2026Aymen Mir, Riza Alp Guler, Jian Wang +3Raymap-Induced GeometryVisual Fidelity

  33. Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

    Jun 26, 2026Anya Ji, Abhijith Varma Mudunuri, David M. Chan +1Long-Video BenchmarksRecent Vision-Language Models

  34. SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

    Jun 26, 2026Ruoyu Wang, Jialun Liu, Huayang Huang +5Video Diffusion ModelsHuman Motion Generation

  35. Do Image Editing Models Understand Lighting?

    Jun 25, 2026Tim Küchler, Johann-Friedrich Feiden, Matthias Nießner +1LightingMulti-Image Editing Benchmarks

  36. Benchmarking the Alignment of Data-Quality Metrics, Human Judgment and Land-Cover Segmentation Performance for Earth Observation

    Jun 23, 2026Ümit Mert Çağlar, Alptekin TemizelSynthetic DataData Quality

  37. Semantic Browsing: Controllable Diversity for Image Generation

    Jun 22, 2026Sara Dorfman, Maya Vishnevsky, Omer Dahary +2Modern Text-To-Image ModelsImage Generation

  38. SketchKeyAnime: Reference-anchored Sparse Key-Sketch Animation Synthesis

    Jun 18, 2026Meixi Li, Xianlin Zhang, Yue Zhang +1Keyframe SelectionSketches

  39. RGFVR: Reference-Guided Face Video Restoration with Flow Matching

    Jun 15, 2026Cem Eteke, Batuhan Tosun, Eckehard SteinbachBlind Face RestorationVideo Restoration

  40. Learned Image Compression for Vision-Language-Action Models

    Jun 15, 2026Hyeonjun Kim, Jegwang Ryu, Sangbeom Ha +4Diffusion-Based Vision-Language-ActionsLearned Image Compression

  41. SiGnature: Explicit Motion Diffusion for Stylized Semantic Gesture

    Jun 14, 2026Adi Rosenthal, Tomer Koren, Nadav Shaked +2Co-Speech Gesture GenerationHuman Motion Generation

  42. IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

    Jun 9, 2026Yitong Chen, Zijie Diao, Junke Wang +5Autoregressive Image GenerationAutoencoder Architectures

  43. SwiftVR: Real-Time One-Step Generative Video Restoration

    Jun 8, 2026Jiaqi Yan, Xiangyu Chen, Xinlin Zhong +5Video RestorationVisual Fidelity

  44. CoVEBench: Can Video Editing Models Handle Complex Instructions?

    Jun 7, 2026Jiangtao Wu, Jiaming Wang, Yiwen He +7Video EditingVisual Fidelity

  45. Physics in 2-Steps: Locking Motion Priors Before Visual Refinement Erases Them

    Jun 4, 2026Woojung Han, Seil Kang, Youngjun Jun +3Denoising TrajectoryDiffusion Models

  46. PHAF-Personalized Hand Avatars in a Flash

    Jun 2, 2026Meghana Shankar, Akanxit Upadhyay, Anmol Namdev +2Avatars3D Hand

  47. Pixel Cube: Diffusion-based Portrait Video Relighting Through Realistic Lighting Reproduction

    Jun 1, 2026Yufan Zhang, Yu Ji, Ayo Ajiboye +4Image RelightingLighting

  48. Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment

    Jun 1, 2026Huayang Huang, Ruoyu Wang, Jinhui Zhao +5Text-To-Image Diffusion ModelsText-To-Image

  49. CanonCGT: Reference-Based Color Grading via Canonical Pivot Representation

    Jun 1, 2026Jinwon Ko, Keunsoo Ko, Chang-Su KimVisual Fidelity

  50. Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models

    May 29, 2026Jiazheng Xing, Hangjie Yuan, Lingling Cai +9Generative Video ModelsVisual Fidelity

  51. Latent Geometric Chords for Query-Efficient Decision-Based Adversarial Attacks

    May 29, 2026Ei Hmue Khine, Yao Li, Jiebao Sun +3Black-Box Adversarial AttacksDiscriminative Congruence Transform

  52. Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation

    May 29, 2026Hanlin Chen, Jiaxin Wei, Xibin Song +5Autoregressive Video GenerationVideo Latents

  53. GeoMag: Geometric-Aware Video Motion Magnification via State Space Model

    May 28, 2026Kecheng Han, Yuchen Zhang, Bingqing Liu +3Visual Geometry Grounded TransformerMotion Estimation

  54. MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models

    May 28, 2026Tianzhuo Yang, Zihan Shen, Zirui Mi +7PessimismVisual Fidelity

  55. LongCat-Video-Avatar 1.5 Technical Report

    May 26, 2026Meituan LongCat Team, Xunliang Cai, Meng Cheng +10Audio-Video GenerationVisual Fidelity

  56. PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution

    May 25, 2026Wenxue Li, Jingjing Ren, Peng Zhang +4Video GenerationVisual Fidelity