Showing cs.LGShow all
3 papers · 1 filter
cs.LG2025
Practical Efficiency of Muon for Pretraining
Essential AI, :, Ishaan Shah +22
We demonstrate that Muon, the simplest instantiation of a second-order optimizer, explicitly expands the Pareto frontier over AdamW on the compute-time tradeoff. We find that Muon…
cs.LG2024★ 1 cited
CoDream: Exchanging dreams instead of models for federated aggregation with heterogeneous models
Abhishek Singh, Gauri Gupta, Ritvik Kapila +5
Federated Learning (FL) enables collaborative optimization of machine learning models across decentralized data by aggregating model parameters. Our approach extends this concept b…
cs.LG2023
Domain Generalization In Robust Invariant Representation
Gauri Gupta, Ritvik Kapila, Keshav Gupta +1
Unsupervised approaches for learning representations invariant to common transformations are used quite often for object recognition. Learning invariances makes models more robust…