6 papers
Cat-DPO: Category-Adaptive Safety Alignment
Tiankai Yang, Yi Nian, Xinyuan Li +6
Aligning large language models with human preferences must balance two competing goals: responding helpfully to legitimate requests and reliably refusing harmful ones. Most prefere…
CoAct: Co-Active LLM Preference Learning with Human-AI Synergy
Ruiyao Xu, Mihir Parmar, Tiankai Yang +3
Learning from preference-based feedback has become an effective approach for aligning LLMs across diverse tasks. However, high-quality human-annotated preference data remains expen…
No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents
Tiankai Yang, Jiate Li, Yi Nian +5
LLM-based agents increasingly operate across repeated sessions, maintaining task states to ensure continuity. In many deployments, a single agent serves multiple users within a tea…
Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs
Wang Wei, Tiankai Yang, Hongjie Chen +4
Efficient use of large language models (LLMs) is critical for deployment at scale: without adaptive routing, systems either overpay for strong models or risk poor performance from…
StealthRank: LLM Ranking Manipulation via Stealthy Prompt Optimization
Yiming Tang, Yi Fan, Chenxiao Yu +3
The integration of large language models (LLMs) into information retrieval systems introduces new attack surfaces, particularly for adversarial ranking manipulations. We present $\…
Efficient Model Selection for Time Series Forecasting via LLMs
Wang Wei, Tiankai Yang, Hongjie Chen +4
Model selection is a critical step in time series forecasting, traditionally requiring extensive performance evaluations across various datasets. Meta-learning approaches aim to au…