5 papers
AntMC: A Large Scale Dataset For Multi-Scenario Multi-Modal CTR Prediction
Zhaoxin Huan, Ke Ding, Ang Li +10
Click-through rate (CTR) prediction is a crucial issue in recommendation systems. There has been an emergence of various public CTR datasets. However, existing datasets primarily s…
Harnessing the Power of David against Goliath: Exploring Instruction Data Generation without Using Closed-Source Models
Yue Wang, Xinrui Wang, Juntao Li +5
Instruction tuning is instrumental in enabling Large Language Models~(LLMs) to follow user instructions to complete various open-domain tasks. The success of instruction tuning dep…
Pre-training with Aspect-Content Text Mutual Prediction for Multi-Aspect Dense Retrieval
Xiaojie Sun, Keping Bi, Jiafeng Guo +5
Grounded on pre-trained language models (PLMs), dense retrieval has been studied extensively on plain text. In contrast, there has been little research on retrieving data with mult…
Beyond Semantics: Learning a Behavior Augmented Relevance Model with Self-supervised Learning
Zeyuan Chen, Wei Chen, Jia Xu +2
Relevance modeling aims to locate desirable items for corresponding queries, which is crucial for search engines to ensure user experience. Although most conventional approaches ad…
VQGraph: Rethinking Graph Representation Space for Bridging GNNs and MLPs
Ling Yang, Ye Tian, Minkai Xu +7
GNN-to-MLP distillation aims to utilize knowledge distillation (KD) to learn computationally-efficient multi-layer perceptron (student MLP) on graph data by mimicking the output re…