2 papers
cs.LG2025
Enabling Fine-Grained Operating Points for Black-Box LLMs
Ege Beyazit, KL Navaneet, Prashant Mathur +3
Black-box Large Language Models (LLMs) provide practical and accessible alternatives to other machine learning methods, as they require minimal labeled data and machine learning ex…
cs.LG2025
Adjoint sharding for very long context training of state space models
Xingzi Xu, Amir Tavanaei, Kavosh Asadi +1
Despite very fast progress, efficiently training large language models (LLMs) in very long contexts remains challenging. Existing methods fall back to training LLMs with short cont…