Publications (51)
Adaptive Robust Estimator for Multi-Agent Reinforcement Learning
Zhongyi Li, Wan Tian, Jingyu Chen +8
LLMBoost: Make Large Language Models Stronger with Boosting
Zehao Chen, Tianxiang Ai, Yifei Li +11
LLM-Forest: Ensemble Learning of LLMs with Graph-Augmented Prompts for Data Imputation
Xinrui He, Yikun Ban, Jiaru Zou +3
MasFACT: Continual Multi-Agent Topology Learning via Geometry-Aware Posterior Transfer
Xuefei Wang, Jialu Wang, Fengbo Zhang +6
GCL-OT: Graph Contrastive Learning with Optimal Transport for Heterophilic Text-Attributed Graphs
Yating Ren, Yikun Ban, Huobin Tan
Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process
Zhijun Chen, Zeyu Ji, Qianren Mao +12
Neural Exploitation and Exploration of Contextual Bandits
Yikun Ban, Yuchen Yan, Arindam Banerjee +1
Generic Outlier Detection in Multi-Armed Bandit
Yikun Ban, Jingrui He
Counterfactual Credit Policy Optimization for Multi-Agent Collaboration
Zhongyi Li, Wan Tian, Jinju Chen +4
Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning
Jiaru Zou, Yikun Ban, Zihao Li +4
Local Clustering in Contextual Multi-Armed Bandits
Yikun Ban, Jingrui He
Policy Improvement Reinforcement Learning
Huaiyang Wang, Xiaojie Li, Xiaohan Wang +10
Can Graph Neural Networks Learn Language with Extremely Weak Text Supervision?
Zihao Li, Lecheng Zheng, Bowen Jin +5
Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation
Jianing Guo, Fangzheng Chen, Zihao Mao +12
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
Zixuan Huang, Yikun Ban, Lean Fu +4
Convolutional Neural Bandit for Visual-aware Recommendation
Yikun Ban, Jingrui He
T-POP: Test-Time Personalization with Online Preference Feedback
Zikun Qu, Min Zhang, Mingze Kong +7
Logic Query of Thoughts: Guiding Large Language Models to Answer Complex Logic Queries with Knowledge Graphs
Lihui Liu, Zihao Wang, Ruizhong Qiu +5
Improved Algorithms for Neural Active Learning
Yikun Ban, Yuheng Zhang, Hanghang Tong +2
No Place to Hide: Catching Fraudulent Entities in Tensors
Yikun Ban, Xin Liu, Yitao Duan +2
Coalesced TLB to Exploit Diverse Contiguity of Memory Mapping
Yikun Ban, Yuchen Zhou, Xu Cheng +1
DISCO: Comprehensive and Explainable Disinformation Detection
Dongqi Fu, Yikun Ban, Hanghang Tong +2
Multi-Objective Exploration and Preference Optimization via Mutual Information
Hongyan Xie, Yikun Ban, Ruiyu Fang +4
Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
Hongyan Xie, Yitong Yao, Yikun Ban +6
FedPOB: Sample-Efficient Federated Prompt Optimization via Bandits
Pingchen Lu, Zhi Hong, Zhiwei Shang +6
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
Li Wang, Xiaodong Lu, Xiaohan Wang +5
Neural Collaborative Filtering Bandits via Meta Learning
Yikun Ban, Yunzhe Qi, Tianxin Wei +1
Catching Loosely Synchronized Behavior in Face of Camouflage
Yikun Ban, Jiao Sun, Xin Liu
Neural Active Learning Beyond Bandits
Yikun Ban, Ishika Agarwal, Ziwei Wu +4
EE-Net: Exploitation-Exploration Neural Networks in Contextual Bandits
Yikun Ban, Yuchen Yan, Arindam Banerjee +1
Real-Time Aligned Reward Model beyond Semantics
Zixuan Huang, Xin Xia, Yuxi Ren +10
Harnessing Multiple Large Language Models: A Survey on LLM Ensemble
Zhijun Chen, Xiaodong Lu, Jingzheng Li +12
Contextual Bandits with Online Neural Regression
Rohan Deb, Yikun Ban, Shiliang Zuo +2
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
Zheng Dou, Zhao Zhang, Deqing Wang +2
Multi-facet Contextual Bandits: A Neural Network Perspective
Yikun Ban, Jingrui He, Curtiss B. Cook
Graph Neural Bandits
Yunzhe Qi, Yikun Ban, Jingrui He
Heterogeneous Agent Collaborative Reinforcement Learning
Zhixia Zhang, Zixuan Huang, Gongxun Li +10
On Finding Dense Subgraphs in Bipartite Graphs: Linear Algorithms
Yikun Ban
Federated Reasoning Distillation Framework with Model Learnability-Aware Data Allocation
Wei Guo, Siyuan Lu, Xiangdong Ran +8
Meta Clustering of Neural Bandits
Yikun Ban, Yunzhe Qi, Tianxin Wei +2
BadLink: Combining Graph and Information-Theoretical Features for Online Fraud Group Detection
Yikun Ban, Xin Liu, Tianyi Zhang +4
UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment
Hongyan Xie, Yikun Ban, Ruiyu Fang +6
Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
Zixuan Huang, Yang Zhou, Kaixuan Wang +7
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
Zehao Chen, Gongxun Li, Tianxiang Ai +9
Does Your Reasoning Model Implicitly Know When to Stop Thinking?
Zixuan Huang, Xin Xia, Yuxi Ren +11
Neural Bandit with Arm Group Graph
Yunzhe Qi, Yikun Ban, Jingrui He
Your Group-Relative Advantage Is Biased
Fengkai Yang, Zherui Chen, Xiaohan Wang +10
CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling
Dengcan Liu, Fengkai Yang, Xiaohan Wang +7
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
Xiaodong Lu, Xiaohan Wang, Jiajun Chai +7
PageRank Bandits for Link Prediction
Yikun Ban, Jiaru Zou, Zihao Li +5
Neural Contextual Bandits for Personalized Recommendation
Yikun Ban, Yunzhe Qi, Jingrui He