8 papers
A Large-Scale Comprehensive Measurement of AI-Generated Code in Real-World Repositories
Tianhao Mao, Dongfang Zhao, Haixu Tang +2
Large language models (LLMs) are rapidly transforming software engineering by enabling developers to generate code ranging from small snippets to entire projects. As AI-assisted co…
Can LLMs Predict Polymer Physics Just by Reading Synthesis and Processing Prose?
Yuchu Liu, Rui Zhu, Jingwei Xiong +1
Can large language models predict physical and mechanical polymer properties simply by reading unstructured scientific prose? Polymer performance is rarely determined by chemical s…
How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment
Rui Zhu, Weiheng Bai, Qiushi Wu +3
Reinforcement Learning (RL) has emerged as a crucial paradigm for unlocking the advanced reasoning capabilities of Large Language Models (LLMs), encompassing frameworks like RLHF a…
Hey, That's My Data! Token-Only Dataset Inference in Large Language Models
Chen Xiong, Zihao Wang, Rui Zhu +4
Large Language Models (LLMs) rely on massive training datasets, often including proprietary data, which raises concerns about unauthorized usage and copyright infringement. Existin…
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
Xurui Li, Kaisong Song, Rui Zhu +2
Large Language Models (LLMs) have developed rapidly in web services, delivering unprecedented capabilities while amplifying societal risks. Existing works tend to focus on either i…
Near-Lossless Model Compression Enables Longer Context Inference in DNA Large Language Models
Rui Zhu, Xiaopu Zhou, Haixu Tang +2
Trained on massive cross-species DNA corpora, DNA large language models (LLMs) learn the fundamental "grammar" and evolutionary patterns of genomic sequences. This makes them power…