#synthetic data generation

topicsynthetic data generation

21 papers · 1 filter

cs.AI2026

Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

Jiawen Tao, Miao Peng, Yaoming Li +7

The paper introduces a pipeline that creates synthetic textbooks by clustering source material, planning hierarchical tables of contents, and assembling sections into full books, s…

cs.SD2026

Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

Xilin Jiang, Riki Shimizu, Sukru Samet Dindar +3

The paper presents Cocktail-Talker, a speech‑language model framework that lets a spoken assistant decide whether to respond, listen, or ignore in multi‑speaker, noisy social conve…

cs.CL2026

BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

Ru Peng, Haokai Xu, Xijun Gu +11

BridgeAlign introduces a three-stage pipeline that creates and uses synthetic preference data to align large language models with nuanced quality judgments in humanities and social…

cs.LG2026

DoTime: A Synthetic Benchmark Generator for Interventional and Counterfactual Time Series

Dennis Thumm, Billy Tim Anthony, Ying Chen

The paper introduces DoTime, an open-source synthetic benchmark generator for multivariate temporal causal models that supports continuous-time interventions, counterfactual sampli…

cs.CV2026

ScratchSim: A Procedural Synthetic Data Pipeline for Surface Scratch Detection

Paul Julius Kühn, Paul Julius Kühn, Saptarshi Neil Sinha +4

The paper introduces ScratchSim, a procedural rendering pipeline that creates large synthetic datasets for training surface scratch detectors, and shows that models fine‑tuned from…

cs.CV2026

Long-Tailed 3D Point Cloud Dataset Distillation

Jiahao You, Xu Han, Jinfeng Xu +1

The paper introduces a method for distilling large 3D point‑cloud datasets into compact synthetic sets while explicitly handling long‑tailed class distributions, using adaptive syn…