#synthetic data generation
21 papers · 1 filter
Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training
Jiawen Tao, Miao Peng, Yaoming Li +7
The paper introduces a pipeline that creates synthetic textbooks by clustering source material, planning hierarchical tables of contents, and assembling sections into full books, s…
Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO
Xilin Jiang, Riki Shimizu, Sukru Samet Dindar +3
The paper presents Cocktail-Talker, a speech‑language model framework that lets a spoken assistant decide whether to respond, listen, or ignore in multi‑speaker, noisy social conve…
BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences
Ru Peng, Haokai Xu, Xijun Gu +11
BridgeAlign introduces a three-stage pipeline that creates and uses synthetic preference data to align large language models with nuanced quality judgments in humanities and social…
DoTime: A Synthetic Benchmark Generator for Interventional and Counterfactual Time Series
Dennis Thumm, Billy Tim Anthony, Ying Chen
The paper introduces DoTime, an open-source synthetic benchmark generator for multivariate temporal causal models that supports continuous-time interventions, counterfactual sampli…
ScratchSim: A Procedural Synthetic Data Pipeline for Surface Scratch Detection
Paul Julius Kühn, Paul Julius Kühn, Saptarshi Neil Sinha +4
The paper introduces ScratchSim, a procedural rendering pipeline that creates large synthetic datasets for training surface scratch detectors, and shows that models fine‑tuned from…
Long-Tailed 3D Point Cloud Dataset Distillation
Jiahao You, Xu Han, Jinfeng Xu +1
The paper introduces a method for distilling large 3D point‑cloud datasets into compact synthetic sets while explicitly handling long‑tailed class distributions, using adaptive syn…