Publications (11)
Modal-specific Pseudo Query Generation for Video Corpus Moment Retrieval
Minjoon Jung, Seongho Choi, Joochan Kim +2
Video corpus moment retrieval (VCMR) is the task to retrieve the most relevant video moment from a large video corpus using a natural language query. For narrative videos, e.g., dr…
Constructing Hierarchical Q&A Datasets for Video Story Understanding
Yu-Jung Heo, Kyoung-Woon On, Seongho Choi +5
Video understanding is emerging as a new paradigm for studying human-like AI. Question-and-Answering (Q&A) is used as a general benchmark to measure the level of intelligence for v…
Continual Vision-and-Language Navigation
Seongjun Jeong, Gi-Cheon Kang, Seongho Choi +2
Developing Vision-and-Language Navigation (VLN) agents typically assumes a \textit{train-once-deploy-once} strategy, which is unrealistic as deployed agents continually encounter n…
CogME: A Cognition-Inspired Multi-Dimensional Evaluation Metric for Story Understanding
Minjung Shin, Seongho Choi, Yu-Jung Heo +3
We introduce CogME, a cognition-inspired, multi-dimensional evaluation metric designed for AI models focusing on story understanding. CogME is a framework grounded in human thinkin…
DramaQA: Character-Centered Video Story Understanding with Hierarchical QA
Seongho Choi, Kyoung-Woon On, Yu-Jung Heo +4
Despite recent progress on computer vision and natural language processing, developing a machine that can understand video story is still hard to achieve due to the intrinsic diffi…
A.X K1 Technical Report
Sung Jun Cheon, Jaekyung Cho, Seongho Choi +57
We introduce A.X K1, a 519B-parameter Mixture-of-Experts (MoE) language model trained from scratch. Our design leverages scaling laws to optimize training configurations and vocabu…