2 papers
cs.CL2026
Can Structural Cues Save LLMs? Evaluating Language Models in Massive Document Streams
Yukyung Lee, Yebin Lim, Woojun Jung +2
Evaluating language models in streaming environments is critical, yet underexplored. Existing benchmarks either focus on single complex events or provide curated inputs for each qu…
cs.LG2025
Multi-level Diagnosis and Evaluation for Robust Tabular Feature Engineering with Large Language Models
Yebin Lim, Susik Yoon
Recent advancements in large language models (LLMs) have shown promise in feature engineering for tabular data, but concerns about their reliability persist, especially due to vari…