3 papers
cs.CV2026
Benchmarking Visual State Tracking in Multimodal Video Understanding
Sihyun Yu, Nanye Ma, Pinzhi Huang +8
Understanding a video requires more than recognizing isolated moments, as humans continuously track entities, states, and events over time. This capacity for visual state tracking…
cs.CV2026
Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance
June Suk Choi, Kyungmin Lee, Sihyun Yu +3
Recent text-to-video (T2V) models have demonstrated strong capabilities in producing high-quality, dynamic videos. To improve the visual controllability, recent works have consider…
cs.CV2025
DiffusionGuard: A Robust Defense Against Malicious Diffusion-based Image Editing
June Suk Choi, Kyungmin Lee, Jongheon Jeong +3
Recent advances in diffusion models have introduced a new era of text-guided image manipulation, enabling users to create realistic edited images with simple textual prompts. Howev…