Publications (43)
SEA-Nav: Efficient Policy Learning for Safe and Agile Quadruped Navigation in Cluttered Environments
Shiyi Chen, Mingye Yang, Haiyan Mao +6
Recurrent Self-Supervised Video Denoising with Denser Receptive Field
Zichun Wang, Yulun Zhang, Debing Zhang +1
Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from Scratch
Xueru Wen, Jie Lou, Zichao Li +9
EasyQuant: Post-training Quantization via Scale Optimization
Di Wu, Qi Tang, Yongle Zhao +3
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
Yiwei Ma, Guohai Xu, Xiaoshuai Sun +4
Smooth Scaling Laws Hide Stepwise Token Learning
Pingjie Wang, Zechen Hu, Peiru Yang +2
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
Ziyang Chen, Xing Wu, Junlong Jia +4
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
Junlong Jia, Ziyang Chen, Xing Wu +5
NExtLong: Toward Effective Long-Context Training without Long Documents
Chaochen Gao, Xing Wu, Zijia Lin +2
Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning
Zichao Li, Jie Lou, Fangchen Dong +8
A Bilingual, OpenWorld Video Text Dataset and End-to-end Video Text Spotter with Transformer
Weijia Wu, Yuanqiang Cai, Debing Zhang +5
Flow-Anything: Learning Real-World Optical Flow Estimation from Large-Scale Single-view Images
Yingping Liang, Ying Fu, Yutao Hu +3
Put the Space of LoRA Initialization to the Extreme to Preserve Pre-trained Knowledge
Pengwei Tang, Xiaolin Hu, Yong Liu +4
David and Goliath: Small One-step Model Beats Large Diffusion with Score Post-training
Weijian Luo, Colin Zhang, Debing Zhang +1
Partial FC: Training 10 Million Identities on a Single Machine
Xiang An, Xuhan Zhu, Yang Xiao +7
dots.llm1 Technical Report
Bi Huo, Bin Tu, Cheng Qin +24
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
Huimu Yu, Xing Wu, Haotian Xu +2
Uni-Instruct: One-step Diffusion Model through Unified Diffusion Divergence Instruction
Yifei Wang, Weimin Bai, Colin Zhang +3
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
Xueru Wen, Jie Lou, Xinyu Lu +5
End-to-End Video Text Spotting with Transformer
Weijia Wu, Yuanqiang Cai, Chunhua Shen +4
SedarEval: Automated Evaluation using Self-Adaptive Rubrics
Zhiyuan Fan, Weinong Wang, Xing Wu +1
SigLoMa: Learning Open-World Quadrupedal Loco-Manipulation from Ego-Centric Vision
Shiyi Chen, Haiyi Liu, Mingye Yang +2
LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions
Chaochen Gao, Xing Wu, Zijia Lin +2
On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigation
Xueru Wen, Jie Lou, Xinyu Lu +8
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
Qianhao Yuan, Jie Lou, Zichao Li +6
AdaMuon: Adaptive Muon Optimizer
Chongjie Si, Debing Zhang, Wei Shen
The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward Models
Zichao Li, Xueru Wen, Jie Lou +5
EfficientCLIP: Efficient Cross-Modal Pre-training by Ensemble Confident Learning and Language Modeling
Jue Wang, Haofan Wang, Jincan Deng +2
Coupled Variational Reinforcement Learning for Language Model General Reasoning
Xueru Wen, Jie Lou, Yanjiang Liu +6
Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic
Xin Zheng, Jie Lou, Boxi Cao +7
SLR: Learning Quadruped Locomotion without Privileged Information
Shiyi Chen, Zeyu Wan, Shiyang Yan +5
One-shot Implicit Animatable Avatars with Model-based Priors
Yangyi Huang, Hongwei Yi, Weiyang Liu +6
MPI-Flow: Learning Realistic Optical Flow with Multiplane Images
Yingping Liang, Jiaming Liu, Debing Zhang +1
RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?
Haotian Xu, Xing Wu, Weinong Wang +11
LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
Junlong Jia, Xing Wu, Chaochen Gao +8
AutoShot: A Short Video Dataset and State-of-the-Art Shot Boundary Detection
Wentao Zhu, Yufang Huang, Xiufeng Xie +5
LP-SLAM: Language-Perceptive RGB-D SLAM system based on Large Language Model
Weiyi Zhang, Yushi Guo, Liting Niu +6
Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?
Xueru Wen, Jie Lou, Yaojie Lu +7
Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models
Junfeng Tian, Da Zheng, Yang Cheng +3
JTok: On Token Embedding as another Axis of Scaling Law via Joint Token Self-modulation
Yebin Yang, Huaijin Wu, Fu Guo +5
PretrainZero: Reinforcement Active Pretraining
Xingrun Xing, Zhiyuan Fan, Jie Lou +3
NITP: Next Implicit Token Prediction for LLM Pre-training
Xiangdong Zhang, Debing Zhang, Shaofeng Zhang +3
Dynamic Chunking for Diffusion Language Models
Yichen Zhu, Xiaoming Shi, Peng Zhao +3