collaborators

12 papers

math.OC2026

Adaptive Schauder Stochastic Mirror Descent in Banach Spaces

Jinhui Bai, Shuai Lu, Lei Shi

In this paper, we extend stochastic mirror descent (SMD) to infinite-dimensional Banach spaces for solving a class of risk functional minimization problems, where stochastic gradie…

cs.DC2026

DGEMM with Ozaki Scheme I/II on FP4 Tensor Cores: A Base-13 E2M1 Limb Representation

Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino +1

This paper proposes a method and its implementation for emulating FP64 matrix multiplication (DGEMM) by constructing, on FP4 (E2M1; 2 exponent bits and 1 mantissa bit) Tensor Cores…

cs.LG2026

ATFlash: Per-RoPE-Wavelength Attention Windows for Compute/Memory-Efficient LLM Inference

Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino +1

The attention score with rotary position embeddings (RoPE) decomposes exactly into a sum over its 2D-rotation frequency pairs, and each pair's wavelength limits how far it can disc…

cs.LG2026

Formulation-Level Auto-Tuning for QUBO-Based Machine Learning: A Case Study Across Multiple Quantum-Inspired Annealers

Naoya Mizuki, Takahiro Katagiri, Daichi Mukunoki +1

This paper presents an Optuna-based formulation-level auto-tuning framework for support vector machines (SVMs) implemented on multiple quantum-inspired annealers. In an annealing-b…

cs.DC2026

LLM-Based Porting of Optimized C++ to CUDA Through Deoptimization and Reoptimization

Daichi Mukunoki, Ryo Mikasa, Shunichiro Hayashi +2

When porting high-performance computing (HPC) code from CPU to GPU, CPU-oriented optimizations may obstruct LLM-based CUDA translation. We design and evaluate a Deopt-Reopt workflo…

cs.SE2026

Layer-wise MoE Routing Locality under Shared-Prefix Code Generation: Token-Identity Decomposition and Compile-Equivalent Fork Redundancy

Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino +1

In LLM-based code generation, multiple code candidates are often generated in parallel from the same prompt -- for example, in best-of-N sampling or multi-candidate code completion…