3 papers
cs.IR2024
ScalingNote: Scaling up Retrievers with Large Language Models for Real-World Dense Retrieval
Suyuan Huang, Chao Zhang, Yuanyuan Wu +12
Dense retrieval in most industries employs dual-tower architectures to retrieve query-relevant documents. Due to online deployment requirements, existing real-world dense retrieval…
cs.CL2024
Hierarchical Skip Decoding for Efficient Autoregressive Text Generation
Yunqi Zhu, Xuebing Yang, Yuanyuan Wu +1
Autoregressive decoding strategy is a commonly used method for text generation tasks with pre-trained language models, while early-exiting is an effective approach to speedup the i…
cs.CL2023
Parameter-Efficient Fine-Tuning with Layer Pruning on Free-Text Sequence-to-Sequence Modeling
Yunqi Zhu, Xuebing Yang, Yuanyuan Wu +1
The increasing size of language models raises great research interests in parameter-efficient fine-tuning such as LoRA that freezes the pre-trained model, and injects small-scale t…