collaborators

5 papers

cs.CL2025

Characterizing Model Behavior Under Synthetic Data Training: An Empirical Study Across Scales and Mixing Ratios

Y. Du, G. Wu, G. Tang +2

Synthetic data generated by large language models has become integral to modern NLP training pipelines, from bootstrapping reasoning capabilities to augmenting instruction-followin…

cs.CL2025

Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow

Y. Du, C. Guo, W. Wang +1

Large Language Models (LLMs) face a fundamental challenge in deciding when to rely on rapid, intuitive responses versus engaging in slower, more deliberate reasoning. Inspired by D…

cs.SE2025

Automated Test Data Generation for Enterprise Protobuf Systems: A Metaclass-Enhanced Statistical Approach

Y. Du

Large-scale enterprise systems utilizing Protocol Buffers (protobuf) present significant challenges for performance testing, particularly when targeting intermediate business inter…

cs.IR2025

Semantic Certainty Assessment in Vector Retrieval Systems: A Novel Framework for Embedding Quality Evaluation

Y. Du

Vector retrieval systems exhibit significant performance variance across queries due to heterogeneous embedding quality. We propose a lightweight framework for predicting retrieval…

cs.CY2025

Mitigating Gambling-Like Risk-Taking Behaviors in Large Language Models: A Behavioral Economics Approach to AI Safety

Y. Du

Large Language Models (LLMs) exhibit systematic risk-taking behaviors analogous to those observed in gambling psychology, including overconfidence bias, loss-chasing tendencies, an…