Publications (37)
ReflectionCoder: Learning from Reflection Sequence for Enhanced One-off Code Generation
Houxing Ren, Mingjie Zhan, Zhongyuan Wu +3
Step-Controlled DPO: Leveraging Stepwise Error for Enhanced Mathematical Reasoning
Zimu Lu, Aojun Zhou, Ke Wang +5
EdgeViTs: Competing Light-weight CNNs on Mobile Devices with Vision Transformers
Junting Pan, Adrian Bulat, Fuwen Tan +5
Masked Generative Transformer Is What You Need for Image Editing
Wei Chow, Linfeng Li, Xian Sun +14
Using evolutionary machine learning to characterize and optimize co-pyrolysis of biomass feedstocks and polymeric wastes
Hossein Shahbeik, Alireza Shafizadeh, Mohammad Hossein Nadian +7
VideoLLM: Modeling Video Sequence with Large Language Models
Guo Chen, Yin-Dong Zheng, Jiahao Wang +8
Personalize Segment Anything Model with One Shot
Renrui Zhang, Zhengkai Jiang, Ziyu Guo +6
MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical Code
Zimu Lu, Aojun Zhou, Ke Wang +5
SalGAN: Visual Saliency Prediction with Generative Adversarial Networks
Junting Pan, Cristian Canton Ferrer, Kevin McGuinness +4
Apple Intelligence Foundation Language Models: Tech Report 2025
Ethan Li, Anders Boesen Lindbo Larsen, Chen Zhang +395
TeacherLM: Teaching to Fish Rather Than Giving the Fish, Language Modeling Likewise
Nan He, Hanyu Lai, Chenyang Zhao +12
Unsupervised Bi-directional Flow-based Video Generation from one Snapshot
Lu Sheng, Junting Pan, Jiaming Guo +3
From Solver to Tutor: Evaluating the Pedagogical Intelligence of LLMs with KMP-Bench
Weikang Shi, Houxing Ren, Junting Pan +8
MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs
Zimu Lu, Aojun Zhou, Houxing Ren +5
1st place solution for AVA-Kinetics Crossover in AcitivityNet Challenge 2020
Siyu Chen, Junting Pan, Guanglu Song +6
Actor-Context-Actor Relation Network for Spatio-Temporal Action Localization
Junting Pan, Siyu Chen, Mike Zheng Shou +3
SpiritSight Agent: Advanced GUI Agent with One Look
Zhiyuan Huang, Ziming Cheng, Junting Pan +2
Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models
Junting Pan, Ziyi Lin, Yuying Ge +5
Alignment with Fill-In-the-Middle for Enhancing Code Generation
Houxing Ren, Zimu Lu, Weikang Shi +7
GroundingGPT:Language Enhanced Multi-modal Grounding Model
Zhaowei Li, Qi Xu, Dong Zhang +9
Probability-Consistent Preference Optimization for Enhanced LLM Reasoning
Yunqiao Yang, Houxing Ren, Zimu Lu +6
Video Generation from Single Semantic Label Map
Junting Pan, Chengyu Wang, Xu Jia +4
MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning
Ke Wang, Junting Pan, Linda Wei +8
ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning
Junting Pan, Ziyi Lin, Xiatian Zhu +2
Edit-Based Refinement for Parallel Masked Diffusion Language Models
Houxing Ren, Mingjie Zhan, Zimu Lu +5
Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset
Ke Wang, Junting Pan, Weikang Shi +3
JourneyDB: A Benchmark for Generative Image Understanding
Keqiang Sun, Junting Pan, Yuying Ge +11
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
Wei Chow, Linfeng Li, Lingdong Kong +13
End-to-end Convolutional Network for Saliency Prediction
Junting Pan, Xavier Giró-i-Nieto
SAM 2: Segment Anything in Images and Videos
Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu +15
Turning hazardous volatile matter compounds into fuel by catalytic steam reforming: An evolutionary machine learning approach
Alireza Shafizadeh, Hossein Shahbeik, Mohammad Hossein Nadian +7
Navi-plus: Managing Ambiguous GUI Navigation Tasks with Follow-up Questions
Ziming Cheng, Zhiyuan Huang, Junting Pan +2
InternVideo: General Video Foundation Models via Generative and Discriminative Learning
Yi Wang, Kunchang Li, Yizhuo Li +14
InternVideo-Ego4D: A Pack of Champion Solutions to Ego4D Challenges
Guo Chen, Sen Xing, Zhe Chen +18
Shallow and Deep Convolutional Networks for Saliency Prediction
Junting Pan, Kevin McGuinness, Elisa Sayrol +2
Online Detection of Action Start in Untrimmed, Streaming Videos
Zheng Shou, Junting Pan, Jonathan Chan +5
WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning
Zimu Lu, Houxing Ren, Yunqiao Yang +5