2 papers
cs.CV2026
Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation
Minggui He, Mingchen Dai, Jian Zhang +5
Vision-Language Models (VLMs) have shown promise in generating plotting code from chart images, yet achieving structural fidelity remains challenging. Existing approaches largely r…
cs.MM2024
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
Zixin Guo, Jian Zhang
Generating 3D human gestures and speech from a text script is critical for creating realistic talking avatars. One solution is to leverage separate pipelines for text-to-speech (TT…