3 papers
cs.CL2025
A Personalized Conversational Benchmark: Towards Simulating Personalized Conversations
Li Li, Peilin Cai, Ryan A. Rossi +21
We present PersonaConvBench, a large-scale benchmark for evaluating personalized reasoning and generation in multi-turn conversations with large language models (LLMs). Unlike exis…
cs.CV2025
Treble Counterfactual VLMs: A Causal Approach to Hallucination
Shawn Li, Jiashu Qu, Yuxiao Zhou +3
Vision-Language Models (VLMs) have advanced multi-modal tasks like image captioning, visual question answering, and reasoning. However, they often generate hallucinated outputs inc…
cs.CR2025
Secure On-Device Video OOD Detection Without Backpropagation
Shawn Li, Peilin Cai, Yuxiao Zhou +7
Out-of-Distribution (OOD) detection is critical for ensuring the reliability of machine learning models in safety-critical applications such as autonomous driving and medical diagn…