6 citations
- Cornell UniversityUS3 papers
- Lawrence Berkeley National LaboratoryUS2 papers
- SLAC National Accelerator LaboratoryUS2 papers
- University of HoustonUS2 papers
- Argonne National LaboratoryUS1 paper
- Brookhaven National LaboratoryUS1 paper
- California Institute of TechnologyUS1 paper
- Canadian Institute for Advanced ResearchCA1 paper
- Columbia UniversityUS1 paper
- Consejo Superior de Investigaciones CientíficasES1 paper
- Fermi National Accelerator LaboratoryUS1 paper
- Fuzhou UniversityCN1 paper
Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026★ 1 cited
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
Yu Tian, Tianqi Shao, Tsukasa Demizu +2
Head pose estimation (HPE) requires a sophisticated understanding of 3D spatial relationships to generate precise yaw, pitch, and roll angles. Previous HPE models, primarily CNN-ba…
cs.CV2026★ 4 cited
Image-to-Image Translation with Diffusion Transformers and CLIP-Based Image Conditioning
Qiang Zhu, Kuan Lu, Menghao Huo +1
Image-to-image translation aims to learn a mapping between a source and a target domain, enabling tasks such as style transfer, appearance transformation, and domain adaptation. In…
cs.CV2026
HAAP: Vision-context Hierarchical Attention Autoregressive with Adaptive Permutation for Scene Text Recognition
Honghui Chen, Yuhang Qiu, Jiabao Wang +2
Scene Text Recognition (STR) is challenging in extracting effective character representations from visual data when text is unreadable. Permutation language modeling (PLM) is intro…