#dataset construction

try —

7 papers match

cs.SE2026

Tangling Pull Requests: Curating a Commit Untangling Dataset from Merged PRs

Yuki Ueno, Profir-Petru Pârţachi, Takashi Kobayashi

The paper presents a method to automatically build a large dataset of tangled and untangled commits by extracting and filtering commits from merged pull requests, showing that this…

#commit untangling#pull requests#dataset construction#composite commits
cs.CV2026

Fully AI-Generated Image Detection: Definition, Recent Advances and Challenges

Qijie Xu, Can Wang, Jiawei Chen +2

The paper surveys methods for detecting fully AI‑generated images, focusing on how datasets are built and how detectors extract artifacts left by generative models.

#deepfake detection#generative models#image forensics#artifact extraction
cs.CL2026

JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes

Iman Johary, Guillaume Bied, Alexandru C. Mara +1

The paper introduces JobHop v2, a publicly released dataset of over 350 k career trajectories extracted from multilingual resumes using a reasoning‑controlled LLM pipeline, providi…

#career trajectory mining#resume parsing#dataset construction#occupational coding
cs.IR2026

iTIMO: An LLM-empowered Synthesis Dataset for Travel Itinerary Modification

Zhuoxuan Huang, Yunshan Ma, Hongyu Zhang +2

The paper defines the travel itinerary modification task and introduces iTIMO, a dataset created by using large language models to perturb real itineraries through replace, add, an…

#travel itinerary#modification#large language models#dataset construction
cs.CL2026

ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories

Siyuan Luo, Nairong Zheng, Lin Zhou +6

The paper introduces ISE, a three-stage pipeline for creating a large dataset of multi‑turn OS‑agent interactions that include structured intents, simulated dialogues, and real too…

#dialogue systems#tool-use agents#dataset construction#multi-turn interaction
cs.CV2026

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

Lin Peng, Cong Wan, Zeyu Guo +2

The paper introduces CoRe, a framework that improves vision-language models' ability to perform fine-grained cross‑image comparative reasoning by providing a large triplet‑based da…

#cross-image comparative reasoning#vision-language models#dataset construction#structured reward learning