16 papers
Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies
Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris
Visual reasoning matters for many computer vision tasks that go beyond surface-level object detection and classification. Despite progress in relational, symbolic, temporal, causal…
SEABAD: A Tropical Bird Activity Detection Dataset for Passive Acoustic Monitoring
Muhammad Mun'im Ahmad Zabidi, Mohd Yamani Idna Idris, Norisma Idris
Passive acoustic monitoring (PAM) enables large-scale biodiversity assessment, but continuous recording generates large amounts of non-informative audio, creating challenges for st…
ADS-POI: Agentic Spatiotemporal State Decomposition for Next Point-of-Interest Recommendation
Zhenyu Yu, Chunlei Meng, Yangchen Zeng +2
Next point-of-interest (POI) recommendation requires modeling user mobility as a spatiotemporal sequence, where different behavioral factors may evolve at different temporal and sp…
CaST-POI: Candidate-Conditioned Spatiotemporal Modeling for Next POI Recommendation
Zhenyu Yu, Chunlei Meng, Yangchen Zeng +2
Next Point-of-Interest (POI) recommendation plays a crucial role in location-based services by predicting users' future mobility patterns. Existing methods typically compute a sing…
DeCorStory: Gram-Schmidt Prompt Embedding Decorrelation for Consistent Storytelling
Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris
Maintaining visual and semantic consistency across frames is a key challenge in text-to-image storytelling. Existing training-free methods, such as One-Prompt-One-Story, concatenat…
StoryState: Agent-Based State Control for Consistent and Editable Storybooks
Ayushman Sarkar, Zhenyu Yu, Wei Tang +3
Large multimodal models have enabled one-click storybook generation, where users provide a short description and receive a multi-page illustrated story. However, the underlying sto…