6 papers
Astrolabe: Spherical-Map Guidance Across Diffusion Pipelines for Full-Body Capture from Unconstrained Images
Shuliang Zhu, Qi Wang, Ryugo Morita +1
Full-body capture from unconstrained photographs requires global correspondence across arbitrary views, poses, crops, and occlusions. Yet pose, geometry, and foundation features es…
Few-step Generative Models as Lossy Compression
Fuma Kimishima, Jinjia Zhou
DiffC provides a principled way to reuse pre-trained diffusion models for lossy compression, but its encoding and decoding procedures remain slow because they require many discreti…
TKG-DM: Training-free Chroma Key Content Generation Diffusion Model
Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser +4
Diffusion models have enabled the generation of high-quality images with a strong focus on realism and textual fidelity. Yet, large-scale text-to-image models, such as Stable Diffu…
Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos
Riku Takahashi, Ryugo Morita, Jinjia Zhou
Talking head video compression has advanced with neural rendering and keypoint-based methods, but challenges remain, especially at low bit rates, including handling large head move…
Bidirectional Learned Facial Animation Codec for Low Bitrate Talking Head Videos
Riku Takahashi, Ryugo Morita, Fuma Kimishima +2
Existing deep facial animation coding techniques efficiently compress talking head videos by applying deep generative models. Instead of compressing the entire video sequence, thes…
GenAIReading: Augmenting Human Cognition with Interactive Digital Textbooks Using Large Language Models and Image Generation Models
Ryugo Morita, Ko Watanabe, Jinjia Zhou +2
Cognitive augmentation is a cornerstone in advancing education, particularly through personalized learning. However, personalizing extensive textual materials, such as narratives a…