1 paper · 1 filter
Weizhe Chen, Miao Zhang, Junpeng Jiang +3
Hybrid attention architectures are becoming an increasingly important paradigm for improving LLM inference efficiency while preserving model quality, making hybrid architecture des…