3 papers
cs.LG2026
PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation
Yuma Ichikawa, Naoya Takagi, Takumi Nakagawa +2
Transformers operate as horizontal token-by-token scanners; at each generation step, attending to an ever-growing sequence of token-level states. This access pattern increases pref…
cs.LG2025
More Than Bits: Multi-Envelope Double Binary Factorization for Extreme Quantization
Yuma Ichikawa, Yoshihiko Fujisawa, Yudai Fujimoto +2
For extreme low-bit quantization of large language models (LLMs), Double Binary Factorization (DBF) is attractive as it enables efficient inference without sacrificing accuracy. Ho…
stat.ML2025
LPCD: Unified Framework from Layer-Wise to Submodule Quantization
Yuma Ichikawa, Yudai Fujimoto, Akira Sakai
Post-training quantization (PTQ) aims to preserve model-level behavior; however, most methods focus on individual linear layers. Even recent extensions, such as QEP and LoaQ, which…