1 paper · 1 filter
Yukyung Lee, Yebin Lim, Woojun Jung +2
Evaluating language models in streaming environments is critical, yet underexplored. Existing benchmarks either focus on single complex events or provide curated inputs for each qu…