3 papers
cs.CV2026
Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing
Gengtian Shi, Jinze Yu, Chenhao Wu +5
Video-text temporal localization requires precise alignment between natural language queries and corresponding video segments, a fundamental challenge in multimodal understanding.…
cs.GR2026
GenAI-DrawIO-Creator: A Framework for Automated Diagram Generation
Jinze Yu, Dayuan Jiang
Diagrams are crucial for communicating complex information, yet creating and modifying them remains a labor-intensive task. We present GenAI-DrawIO-Creator, a novel framework that…
cs.CL2025
STED and Consistency Scoring: A Framework for Evaluating LLM Structured Output Reliability
Guanghui Wang, Jinze Yu, Xing Zhang +5
Large Language Models (LLMs) are increasingly deployed for structured data generation, yet output consistency remains critical for production applications. We introduce a comprehen…