3 papers
cs.LG2026
From Small to Large: Generalization Bounds for Transformers on Variable-Size Inputs
Anastasiia Alokhina, Pan Li
Transformers exhibit a notable property of \emph{size generalization}, demonstrating an ability to extrapolate from smaller token sets to significantly longer ones. This behavior h…
cs.LG2025
Branching Strategies Based on Subgraph GNNs: A Study on Theoretical Promise versus Practical Reality
Junru Zhou, Yicheng Wang, Pan Li
Graph Neural Networks (GNNs) have emerged as a promising approach for ``learning to branch'' in Mixed-Integer Linear Programming (MILP). While standard Message-Passing GNNs (MPNNs)…
cs.AI2025
FEVO: Financial Knowledge Expansion and Reasoning Evolution for Large Language Models
Bo Pang, Yalu Ouyang, Hangfei Xu +6
Advancements in reasoning for large language models (LLMs) have lead to significant performance improvements for LLMs in various fields such as mathematics and programming. However…