1 paper
Fawad Javed Fateh, Umer Ahmed, Hamza Khan +2
We introduce TemporalVLM, a video large language model (video LLM) for temporal reasoning and fine-grained understanding in long videos. Our approach includes a visual encoder for…