Publications (38)
Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation
Niantong Li, Guangzheng Hu, Weixu Qiao +35
Qwen-Image-Flash: Beyond Objective Design
Tianhe Wu, Kun Yan, Zikai Zhou +21
BECS: A Privacy-Preserving Computing Resource Sharing Mechanism for 6G Computing Power Network
Kun Yan, Wenping Ma, Shaohui Sun
An Efficient COarse-to-fiNE Alignment Framework @ Ego4D Natural Language Queries Challenge 2022
Zhijian Hou, Wanjun Zhong, Lei Ji +6
Galaxy Walker: Geometry-aware VLMs For Galaxy-scale Understanding
Tianyu Chen, Xingcheng Fu, Yisen Gao +5
Modeling Multi-modal Cross-interaction for Multi-label Few-shot Image Classification Based on Local Feature Selection
Kun Yan, Zied Bouraoui, Fangyun Wei +4
Two-shot Video Object Segmentation
Kun Yan, Xiao Li, Fangyun Wei +4
Aligning Visual Prototypes with BERT Embeddings for Few-Shot Learning
Kun Yan, Zied Bouraoui, Ping Wang +2
CETransformer: Casual Effect Estimation via Transformer Based Representation Learning
Zhenyu Guo, Shuai Zheng, Zhizhe Liu +2
IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models
Haonan Song, Qingchen Xie, Huan Zhu +12
Taming Teacher Forcing for Masked Autoregressive Video Generation
Deyu Zhou, Quan Sun, Yuang Peng +8
HORIZON: High-Resolution Semantically Controlled Panorama Synthesis
Kun Yan, Lei Ji, Chenfei Wu +4
Resolving Ambiguity in Gaze-Facilitated Visual Assistant Interaction Paradigm
Zeyu Wang, Baiyu Chen, Kun Yan +5
Inferring Prototypes for Multi-Label Few-Shot Image Classification with Word Vector Guided Attention
Kun Yan, Chenbin Zhang, Jun Hou +4
Qwen-Image-VAE-2.0 Technical Report
Zekai Zhang, Deqing Li, Kuan Cao +27
Spin-Valley-Mismatched Altermagnet for Giant Tunneling Magnetoresistance
Kun Yan, Yizhi Hu, Wei-Hua Xiao +3
Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model
Guoqing Ma, Haoyang Huang, Kun Yan +112
Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System
Jiazhao Zhang, Gengze Zhou, Hale Yin +32
Hypergraph Multi-modal Large Language Model: Exploiting EEG and Eye-tracking Modalities to Evaluate Heterogeneous Responses for Video Understanding
Minghui Wu, Chenxu Zhao, Anyang Su +8
Qwen-Image Technical Report
Chenfei Wu, Jiahao Li, Jingren Zhou +36
KU-DMIS-MSRA at RadSum23: Pre-trained Vision-Language Model for Radiology Report Summarization
Gangwoo Kim, Hajung Kim, Lei Ji +7
CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding
Zhijian Hou, Wanjun Zhong, Lei Ji +6
DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training
Xin Tan, Yuetao Chen, Yimin Jiang +6
Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
Zekai Zhang, Jiahao Li, Jie Zhang +18
Gate Decorator: Global Filter Pruning Method for Accelerating Deep Convolutional Neural Networks
Zhonghui You, Kun Yan, Jinmian Ye +2
Qwen-Image-2.0-RL Technical Report
Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25
Ultralow radiative heat flux by Anderson localization in quasiperiodic plasmonic chains
Yizhi Hu, Kun Yan, Wei-Hua Xiao +1
Qwen-Image-2.0 Technical Report
Bing Zhao, Chenfei Wu, Deqing Li +72
Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation
Jie Zhang, Xiaoyue Chen, Anzhe Chen +36
Angle-resolved polarized Raman spectroscopy for distinguishing stage-I graphite intercalation compounds with Thorium, Uranium and Plutonium
Kun Yan
Few-shot Image Classification with Multi-Facet Prototypes
Kun Yan, Zied Bouraoui, Ping Wang +2
Voila-A: Aligning Vision-Language Models with User's Gaze Attention
Kun Yan, Lei Ji, Zeyu Wang +3
The Milky Way Imaging Scroll Painting Survey: Data Release 1
Ji Yang, Qing-Zeng Yan, Yang Su +31
Unique electronic structure and the shape-change effect of stage-I graphite intercalation compounds with Thorium, Uranium and Plutonium
Kun Yan
G-VOILA: Gaze-Facilitated Information Querying in Daily Scenarios
Zeyu Wang, Yuanchun Shi, Yuntao Wang +6
GroundNLQ @ Ego4D Natural Language Queries Challenge 2023
Zhijian Hou, Lei Ji, Difei Gao +7
Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition
Shengming Yin, Zekai Zhang, Zecheng Tang +11
Magnetic phase transitions in the triangular-lattice spin-1 dimer compound K2Ni2(SeO3)3
Lei Yue, Ziyou Lu, Kun Yan +6