5 papers
Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos
Riku Takahashi, Ryugo Morita, Jinjia Zhou
Talking head video compression has advanced with neural rendering and keypoint-based methods, but challenges remain, especially at low bit rates, including handling large head move…
Bidirectional Learned Facial Animation Codec for Low Bitrate Talking Head Videos
Riku Takahashi, Ryugo Morita, Fuma Kimishima +2
Existing deep facial animation coding techniques efficiently compress talking head videos by applying deep generative models. Instead of compressing the entire video sequence, thes…
GenAIReading: Augmenting Human Cognition with Interactive Digital Textbooks Using Large Language Models and Image Generation Models
Ryugo Morita, Ko Watanabe, Jinjia Zhou +2
Cognitive augmentation is a cornerstone in advancing education, particularly through personalized learning. However, personalizing extensive textual materials, such as narratives a…
TKG-DM: Training-free Chroma Key Content Generation Diffusion Model
Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser +4
Diffusion models have enabled the generation of high-quality images with a strong focus on realism and textual fidelity. Yet, large-scale text-to-image models, such as Stable Diffu…
Edge-based Denoising Image Compression
Ryugo Morita, Hitoshi Nishimura, Ko Watanabe +2
In recent years, deep learning-based image compression, particularly through generative models, has emerged as a pivotal area of research. Despite significant advancements, challen…