Soft-Token Representations

Momentum

3 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 27

All topics
CardsList
  1. Voices as Handles: Reasoning about Speaker Identity with Frozen Text LLMs

    Sep 29, 2026Runqiu Xu, Zhisheng Zheng, David HarwathVoice AgentsSpeaker

  2. Prediction-Layer Branch Calibration for Multimodal Sentiment Analysis

    Sep 29, 2026Yulin Sun, Kele Xu, Yong DouMultimodal Sentiment AnalysisMultimodal Fusion

  3. CASS: Contribution-Aware Structured Sparsity for Model Merging

    Sep 28, 2026Yan Li, Guiping Cao, Meng Xu +5Continual Model MergingSoft-Token Representations

  4. SMAT: Simple and Efficient Merge-Aware Training

    Sep 27, 2026Yanggan Gu, Yuanyi Wang, Zhen Li +5Continual Model MergingSoft-Token Representations

  5. Can LLMs Use Relational Transformer Embeddings?

    Aug 31, 2026Francisco Galuppo Azevedo, Clarissa Lima LouresSoft-Token Representations

  6. MergeOver: Post-Training Token Merging for Recursive Vision Transformers

    Aug 13, 2026Junseo Kim, Uraz Odyurt, Amirreza YousefzadehSelf-Supervised Vision TransformersVision Transformer

  7. CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

    Aug 3, 2026Yu Chen, Xiaohong Li, Xiaole Wang +3Token CompressionVideo-Language Models

  8. AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

    Jul 17, 2026Zhenqi Jia, Yuan Zhao, Aruukhan +2Emotion RecognitionSoft-Token Representations

  9. Soft Token Alignment for Cross-Lingual Reasoning

    Jun 25, 2026Jiayi He, Jungsoo Park, Wei Xu +1Multilingual Language ModelsSoft-Token Representations

  10. Token-Operations-Oriented Inference Optimization Techniques for Large Models

    Jun 18, 2026Shiguo Lian, Kai Wang, Zhaoxiang Liu +22LLM Inference OptimizationSoft-Token Representations

  11. Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning

    Jun 10, 2026Zhirui Chen, Ziwei Chen, Ling ShaoMultimodal Large Language ModelsIn-Context Learning

  12. Leveraging Soft Distributions of SSL-Derived Discrete Speech Tokens for Downstream Inference

    Jun 5, 2026Kentaro Onda, Satoru Fukayama, Daisuke Saito +1Soft-Token RepresentationsAutomatic Speech Recognition

  13. Saliency-Aware Model Merging

    May 30, 2026Jungin Park, Jiyoung Lee, Kwanghoon SohnContinual Model MergingMulti--Task Learning

  14. AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers

    May 26, 2026Semi Lee, Hyejin Go, Hyesong ChoiSoft-Token RepresentationsVision Transformer

  15. Action-Prior Denoising for Smooth Real-Time Chunking

    May 25, 2026Dongyang Liu, Zhaowen Zheng, Yu Sun +3Action ChunksChunk

  16. Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies

    May 23, 2026Juan Ignacio Bustos Gorostegui, Maria Elena BuemiOpen-Vocabulary Action Recognition3D Hand

  17. DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers

    May 12, 2026Kaixuan He, Song Chen, Yi KangVision TransformerSoft-Token Representations

  18. Decoupled DiLoCo for Resilient Distributed Pre-training

    Apr 23, 2026Arthur Douillard, Keith Rush, Yani Donchev +14Distributed OptimizationCpu-Gpu Hybrid Designs

  19. Compressing Sequences in the Latent Embedding Space: KK-Token Merging for Large Language Models

    Apr 16, 2026Zihao Xu, John Harvill, Ziwei Fan +3Large Language Model CompressionTask-Aware Compression

  20. StructSAM: Structure- and Spectrum-Preserving Token Merging for Segment Anything Models

    Mar 7, 2026Duy M. H. Nguyen, Tuan A. Tran, Duong Nguyen +17Soft-Token RepresentationsSegment Anything Model

  21. AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware

    Feb 18, 2026David Smerkous, Zian Wang, Behzad Najafian3D Masked AutoencodersSelf-Supervised Vision Transformers

  22. FuseMamba-VD: Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection

    May 23, 2025Damith Chamalke Senadeera, Muhammad Awais, Shibo Li +2Fine-Grained Video UnderstandingViolence Detection