10 papers
Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection
Wenxuan Bao, Yanjun Zhao, Xiyuan Yang +1
Pretrained vision-language models such as CLIP exhibit strong zero-shot generalization but remain sensitive to distribution shifts. Test-time adaptation adapts models during infere…
PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs
Yanjun Zhao, Tianxin Wei, Jiaru Zou +7
Understanding scientific papers requires more than answering isolated questions or summarizing content. It involves an integrated reasoning process that grounds textual and visual…
Influence-Preserving Proxies for Gradient-Based Data Selection in LLM Fine-tuning
Sirui Chen, Yunzhe Qi, Mengting Ai +4
Supervised fine-tuning (SFT) relies critically on selecting training data that most benefits a model's downstream performance. Gradient-based data selection methods such as TracIn…
FeDecider: An LLM-Based Framework for Federated Cross-Domain Recommendation
Xinrui He, Ting-Wei Li, Tianxin Wei +5
Federated cross-domain recommendation (Federated CDR) aims to collaboratively learn personalized recommendation models across heterogeneous domains while preserving data privacy. R…
Agentic Reasoning for Large Language Models
Tianxin Wei, Ting-Wei Li, Zhining Liu +26
Reasoning is a fundamental cognitive process underlying inference, problem-solving, and decision-making. While large language models (LLMs) demonstrate strong reasoning capabilitie…
Subspace Alignment for Vision-Language Model Test-time Adaptation
Zhichen Zeng, Wenxuan Bao, Xiao Lin +8
Vision-language models (VLMs), despite their extraordinary zero-shot capabilities, are vulnerable to distribution shifts. Test-time adaptation (TTA) emerges as a predominant strate…