3 papers
cs.CR2026
SLIM: Stealthy Low-Coverage Black-Box Watermarking via Latent-Space Confusion Zones
Hengyu Wu, Yang Cao
Training data is a critical and often proprietary asset in Large Language Model (LLM) development, motivating the use of data watermarking to embed model-transferable signals for u…
cs.LG2025
BigBang-Proton Technical Report: Next-Word-Prediction is Scientific Multitask Learner
Hengkui Wu, Liujiang Liu, Jihua He +23
We introduce BigBang-Proton, a unified sequence-based architecture for auto-regressive language modeling pretrained on cross-scale, cross-structure, cross-discipline real-world sci…
cs.LG2025
Membership Inference Attacks on Large-Scale Models: A Survey
Hengyu Wu, Yang Cao
As large-scale models such as Large Language Models (LLMs) and Large Multimodal Models (LMMs) see increasing deployment, their privacy risks remain underexplored. Membership Infere…