Spatial Encoding

Latest papers 61

All topics
CardsList
  1. Here the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation

    Sep 30, 2026Hanmo Chen, Chengcheng Liu, Tianxiao Chen +7Audio-Visual ConsistencyAudio-Video Generation

  2. PhyProbe: Rethinking Physical Consistency Evaluation in Generated Videos

    Sep 29, 2026Max Ku, Jiaojiao Fan, Zekun Hao +5Explanation Consistency ScoreSpatial Encoding

  3. Functional Autoencoders for Amplitude-Phase Representation Learning

    Sep 28, 2026Peida Wu, Xinyang Xiong, Pengcheng ZengAutoencoder ArchitecturesSpatial Encoding

  4. RegRet: Enhancing Region-Level Retrieval in Large Multimodal Models

    Sep 15, 2026Xun Liang, Honghui Yang, Weihang Pan +6Multimodal RetrievalLarge Multimodal Models

  5. MANAS-2: Constrained Reconstruction for EEG Foundation Models

    Sep 12, 2026Arvasu Kulkarni, Aditya Ray Mishra, Jeet Bandhu Lahiri +5Electroencephalography Foundation Models3D Masked Autoencoders

  6. RAMamba-Net: A Reliability-Aware and Mamba-Based Multimodal Fusion Network for Auditory Attention Detection

    Sep 12, 2026Xingyi He, Ziwei Wang, Dongrui WuAuditory AttentionMultimodal Fusion

  7. TempTPI: Informer-Based trajectory prediction for maritime vessels

    Sep 9, 2026Kevin Ferneding, Veronika Lietavcova, Aleksandra M. Blachowiak +1Maritime NavigationEgo-Trajectory Prediction

  8. RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

    Aug 13, 2026Tianyu Sun, Zhoujie Fu, Zihui Gao +2Human-Robot InteractionRgb-Depth Cameras

  9. SLED: Scalable Location Encoding via Distillation

    Aug 6, 2026Kevin Lane, Zhongying Wang, Esther Rolf +1Spatial EncodingEarth Observation

  10. Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams

    Aug 6, 2026Feiyu Ji, Xiang Li, Hao Ma +6Large Inter-Frame DisplacementsSpatial Encoding

  11. Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding

    Aug 4, 2026Duo Zhang, Zhehui Yin, Zhiyun Yao +8Millimeter WaveHuman Activity Recognition

  12. TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval

    Aug 3, 2026Ji Huang, Yongsheng Dai, Tianyu Ren +2Video Temporal GroundingSpatio-Temporal Scene Graphs

  13. TransSLR: A Lightweight Transformer for Sign Language Recognition

    Aug 3, 2026Lucia Yen Wanchi, Samuel Johnny, Victor Tolulope Olufemi +2Sign Language TranslationSpatial Encoding

  14. SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

    Aug 3, 2026Jing Wu, Jianhua Wu, Jiayi Guan +5Recent Vision-Language ModelsStable Spatial Understanding

  15. The balance between compactness and forecast accuracy of data-driven latent-space reduced-order models in controlled wake flows

    Jul 27, 2026Alberto Solera-Rico, Patricia García-Caspueñas, Carlos Sanmiguel Vila +1Reduced-Order ModelsLatent Dynamics

  16. mmSimPrior: Learning Simulation Priors for Data-Efficient and Generalizable Real-World Radar-based Human Motion Reconstruction

    Jul 25, 2026Cheng Guo, Qiming Cao, Shengkai Xu +4Kinematic PriorsPrior Knowledge Integration

  17. GeoChrono: Benchmarking and Rethinking Long-Term Temporal Understanding in Remote Sensing

    Jul 17, 2026Yujie Li, Jiancheng Pan, Zhiwei Wei +3Remote SensingLand Cover

  18. TEDDY: A Pediatric Foundation Model for Risk Forewarning from ICD-Coded Diagnostic Histories

    Jul 15, 2026Matthew Brady Neeley, Jorge Botas, Johnathan Jia +5Readmission PredictionSpatial Encoding

  19. Evaluating Encoding Strategies for Closed-Loop Classification in Biological Neural Networks

    Jul 15, 2026Martin Schottlender, Veronika Volkova, Pengjie Zhou +3Neural NetworkSpatial Encoding

  20. Vision-Based Dribbling for Humanoid Soccer via Privileged Representation Learning

    Jul 14, 2026Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli +5BadmintonHumanoid Robotics

  21. Multimodal Spatiotemporal-Frequency Fusion with Peak Enhancement for Cellular Traffic Forecasting

    Jul 8, 2026Qingzhong Li, Yue Hu, Hui Ma +4Accurate Traffic ForecastingTwo-Level Spatial-Frequency Fusion Strategy

  22. Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video

    Jun 30, 2026Siyuan Li, Weiying Chen, Yilin Wang +34D ReconstructionMonocular Video

  23. ConTex: Reformulating Counterfactual Generation For Time Series Forecasting

    Jun 16, 2026Jan Voets, Hasan Tercan, Tobias Meisen +1Counterfactual GenerationForecasting Backbone

  24. T-Rex: Tactile-Reactive Dexterous Manipulation

    Jun 15, 2026Dantong Niu, Zhuoyang Liu, Zekai Wang +31TactileContact-Rich Dexterous Manipulation

  25. More with LESS -- Local Scene Representations for Tactile Imaging

    Jun 12, 2026Zohar Rimon, Elisei Shafer, Tal Tepper +4TactileSemantic Scene Understanding

  26. DynaTok: Token-Based 4D Reconstruction from Partial Point Clouds

    Jun 10, 2026Weirong Chen, Keisuke Tateno, Hidenobu Matsuki +34D ReconstructionPoint Clouds

  27. ProSarc: Prosody-Aware Sarcasm Recognition Framework via Temporal Prosodic Incongruity

    Jun 4, 2026Prathamjyot Singh, Ashima Sood, Sahil Sharma +1ProsodyHumor

  28. Probing Spatial Structure in Pretrained Audio Representations

    Jun 4, 2026Chuyang Chen, Sivan Ding, Adrian S. Roman +1Spatial AudioNeural Audio

  29. Breaking the Cascade: Compact Nonlinear Optical Computing with Single-Layer Encoder-Decoder Co-Localization

    May 31, 2026Yuntian Wang, Alexander Chen, Md Sadman Sakib Rahman +1Photonic Transformer AcceleratorsNonlinearity

  30. ParCo-SDF: Learning Prior-Free Partial-to-Complete Signed Distance Fields of Deformable Objects

    May 28, 2026Deokmin Hwang, Minseok Song, Daehyung ParkGeometric ReconstructionContinuous Distance Field

  31. Agent-Centric Social Trajectory Prediction: A Free Energy Principle Perspective

    May 25, 2026Yanping Wu, Ji Zhang, Hao Chen +2Ego-Trajectory PredictionSpatial Encoding

  32. PhenoYieldNet: Learning Crop-Aware Phenological Responses for Multi-Crop Yield Prediction

    May 22, 2026Yu Luo, Xiaogang Zhu, Shan Zeng +4Agricultural PredictionSpatial Encoding

  33. Improving Viewpoint-Invariance and Temporal Consistency for Action Detection

    May 21, 2026Yannick Porto, Renato Martins, Thomas Chalumeau +1Fine-Grained Video UnderstandingSpatial Encoding

  34. RCGDet3D: Rethinking 4D Radar-Camera Fusion-based 3D Object Detection with Enhanced Radar Feature Encoding

    May 20, 2026Weiyi Xiong, Bing Zhu4D Radar3D Object Detection

  35. Sketch2MinSurf: Vision-Language Guided Generation of Editable Minimal Surfaces from Hand-Drawn Sketches

    May 20, 2026Wenda Wang, Anqi Liu, Junqi Yang +4SketchesSurface Representation

  36. Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models

    May 18, 2026Svetlana Orlova, Niccolò Cavagnero, Gijs DubbelmanVideo Foundation ModelsFrozen Vision-Language Models

  37. VAMP-Diff: VampPrior Latent Diffusion for Photoplethysmography Modeling

    May 17, 2026Fatemeh Ghasemi Balouei, Nathan Willemsen, Mahesh Banavar +1Remote PhotoplethysmographyIdentity-Conditioned Latent Diffusion Models

  38. Genetic algorithm vs. gradient descent for training a neural network architecture dedicated to low data regimes in small medical datasets

    May 13, 2026Amine Boukhari, Boglarka Ecsedi, Laszlo Papp +1Deep Learning ArchitecturesGradient Descent

  39. REFNet++: Multi-Task Efficient Fusion of Camera and Radar Sensor Data in Bird's-Eye Polar View

    May 12, 2026Kavin Chandrasekaran, Sorin Grigorescu, Gijs Dubbelman +1Multi-Sensor FusionBird'S-Eye View

  40. ChronoSC: Task-Oriented Semantic Communication via Temporal-to-Color Encoding

    May 11, 2026Phuc H. Nguyen, Trung T. Nguyen, Quy N. Duong +1Video CompressionSemantic Communications

  41. An Elastic Shape Variational Autoencoder for Skeleton Pose Trajectories

    May 10, 2026Arafat Rahman, Shashwat Kumar, Laura E. Barnes +1Conditional Variational AutoencoderSkeleton

  42. WavesFM: Hierarchical Representation Learning for Longitudinal Wearable Sensor Waveforms

    May 9, 2026Peng Cao, Zhijian Yang, Tennison Liu +17Wearable PhysiologyWaveforms

  43. MLCR: Multi-Level Cue Refinement for Long-Term Multimodal Action Quality Assessment

    May 9, 2026Qiqi Li, Pengfei Wang, Hongyu Chen +1Multimodal EvaluationSpatial Encoding

  44. Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

    May 8, 2026Peitao Han, Fei Cheng, Lis K. Pereira +2Fine-Grained Video UnderstandingSpatial Encoding

  45. Weather-Robust Scene Semantics with Vision-Aligned 4D Radar

    May 8, 2026Kali Hamilton, Christoffer HeckmanRadarFrozen Vision-Language Models

  46. AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation

    May 1, 2026Yuxin Lu, Jiayang Sun, Guibo Zhu +1TalkSpatial Encoding

  47. PEPS: Positional Encoding Projected Sampling -- Extended

    Apr 27, 2026Guillaume Perez, Janarbek Matai, Takahiro HaradaPositional EncodingNeural Representations

  48. HyperSpace: A Generalized Framework for Spatial Encoding in Hyperdimensional Representations

    Apr 16, 2026Shay Snyder, Andrew Capodieci, David Gorsich +1Holographic Reduced RepresentationsSpatial Encoding

  49. Towards Long-Form Spatio-Temporal Video Grounding

    Feb 26, 2026Xin Gu, Bing Fan, Jiali Yao +5Video Temporal GroundingSpatio-Temporal Attention

  50. PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation

    Feb 5, 2026Yushan Liu, Jingjing Fan, Shoujie Li +3Robotic ManipulationForesight

  51. Rethinking Zero-Shot Time Series Classification: From Task-specific Classifiers to In-Context Inference

    Jan 31, 2026Juntao Fang, Shifeng Xie, Shengbin Nie +7Time-Series ClassificationTimestep Embeddings

  52. Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding

    Jan 4, 2026Yixuan Lai, He Wang, Kun Zhou +1Long VideosSpatial Encoding

  53. Hi-DREAM: Brain-Inspired Hierarchical Diffusion for fMRI-to-Image Reconstruction via ROI Encoder and VisuAl Mapping

    Nov 14, 2025Guowei Zhang, Yun Zhao, Kai Sun +4Functional Magnetic Resonance ImagingNeural Reconstruction

  54. Efficient Traffic State Prediction With Dynamic Joint Spatio-Temporal Relation Inference

    Apr 10, 2025Zhifeng Hao, Kai Hu, Juncai Zhang +2Accurate Traffic ForecastingSpatial Encoding