cs.CVSep 28, 2026

EvolvingAvatar: Interactive 3D Head Generation That Adapts as Conversations Unfold

Authors: Junjie Chen, Fei Wang, Kun Li, Yiqi Nie, Xun Yang, Yanbin Hao, Linfeng Zhang, Meng Wang

Organizations: Hefei University of Technology · EPIC Lab, Shanghai Jiao Tong University · Institute of Artificial Intelligence, Hefei Comprehensive National Science Center · United Arab Emirates University · Anhui University · University of Science and Technology of China · SAI, Shanghai Jiao Tong University

Abstract

Interactive 3D head generation requires coordinated speaking and listening motion that responds to an evolving conversation. Existing generators use incoming observations as context but keep their parameters fixed, leaving conversational patterns unused as a learning signal. We introduce EvolvingAvatar, a causal generator that uses test-time training to adapt to user face video and dyadic audio during interaction. Its dyadic context prediction objective provides a self-supervised learning signal from audiovisual context without target motion labels at test time. Persistent fast weights accumulate these updates within each conversation to guide motion generation, while transient jaw adaptation responds to current audiovisual context. Predicted speech activity controls how persistent adaptation guides motion. We also introduce InterHead-Bench, a unified 455.95-hour benchmark built from single-view and dual-view conversation videos. Experiments show improved conversational motion statistics over strong baselines. On the hardest out-of-distribution split, generation improves as conversations unfold, reducing mismatch with recorded user-avatar expression statistics by up to 11.1% from the first interval.

Figures & tables

Appendix figures & tables23 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents

    Apr 19, 2026Yu Zhang, Kaiyuan Shen, Yang LiAvatarsTurn-Taking

  2. MegaAvatar: Controllable Talking Avatar Generation

    Sep 30, 2026Junyao Gao, Sibo Liu, Weidong Zhang +2AvatarsHuman Motion Generation

  3. Conversational Human Audio-visual Talking Dialogue Generation

    Jul 2, 2026Junhao Song, Lluis Guasch, Xilin He +8Conversational DatasetsAudio-Video Generation