Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
MixFormer: Linear Transformer with Mixture of Memory Experts
Yu Guo, Lei Duan
State Space Models (SSMs), as a mainstream research direction of linear Transformers, aim to achieve higher efficiency than standard Transformers in long-context modeling. However,…
cs.LG2023
mLoRA: Fine-Tuning LoRA Adapters via Highly-Efficient Pipeline Parallelism in Multiple GPUs
Zhengmao Ye, Dengchun Li, Zetao Hu +8
Transformer-based, pre-trained large language models (LLMs) have demonstrated outstanding performance across diverse domains, particularly in the emerging {\em pretrain-then-finetu…