NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (74)

math.NA2011

A Tuned and Scalable Fast Multipole Method as a Preeminent Algorithm for Exascale Systems

Rio Yokota, Lorena Barba

cs.LG2025

FedPM: Federated Learning Using Second-order Optimization with Preconditioned Mixing of Local Parameters

Hiro Ishii, Kenta Niwa, Hiroshi Sawada +3

cs.DC2024

DGEMM on Integer Matrix Multiplication Unit

Hiroyuki Ootomo, Katsuhisa Ozaki, Rio Yokota

cs.DC2014

Communication Complexity of the Fast Multipole Method and its Algebraic Variants

Rio Yokota, George Turkiyyah, David Keyes

cs.CV2022

Informative Sample-Aware Proxy for Deep Metric Learning

Aoyu Li, Ikuro Sato, Kohta Ishikawa +2

cs.LG2025

Improving LoRA with Variational Learning

Bai Cong, Nico Daheim, Yuesong Shen +3

math.NA2012

An FMM Based on Dual Tree Traversal for Many-core Architectures

Rio Yokota

math.NA2026

Proxy-surface-based fast direct solver for TE-mode scattering problems on distributed memory systems

Yasuhiro Matsumoto, Rio Yokota

cs.LG2026

Rewriting Pre-Training Data Boosts LLM Performance in Math and Code

Kazuki Fujii, Yukito Tajima, Sakae Mizuki +14

cs.CL2025

Drop-Upcycling: Training Sparse Mixture of Experts with Partial Re-initialization

Taishi Nakamura, Takuya Akiba, Kazuki Fujii +3

cs.DC2023

Reducing shared memory footprint to leverage high throughput on Tensor Cores and its flexible API extension library

Hiroyuki Ootomo, Rio Yokota

stat.ML2025

Variational Learning Finds Flatter Solutions at the Edge of Stability

Avrajit Ghosh, Bai Cong, Rio Yokota +5

cs.DC2023

Recovering single precision accuracy from Tensor Cores while surpassing the FP32 theoretical peak performance

Hiroyuki Ootomo, Rio Yokota

cs.LG2019

Large-Scale Distributed Second-Order Optimization Using Kronecker-Factored Approximate Curvature for Deep Convolutional Neural Networks

Kazuki Osawa, Yohei Tsuji, Yuichiro Ueno +3

cs.DC2014

A Performance Model for the Communication in Fast Multipole Methods on HPC Platforms

Huda Ibeid, Rio Yokota, David Keyes

cs.DC2014

Asynchronous Execution of the Fast Multipole Method Using Charm++

Mustafa AbdulJabbar, Rio Yokota, David Keyes

physics.comp-ph2010

Treecode and fast multipole method for N-body simulation with CUDA

Rio Yokota, Lorena Barba

cs.DC2023

Mixed-Precision Random Projection for RandNLA on Tensor Cores

Hiroyuki Ootomo, Rio Yokota

math.NA2012

Data-Driven Execution of Fast Multipole Methods

Hatem Ltaief, Rio Yokota

cs.LG2020

Scalable and Practical Natural Gradient for Large-Scale Deep Learning

Kazuki Osawa, Yohei Tsuji, Yuichiro Ueno +3

cs.CV2024

Formula-Supervised Visual-Geometric Pre-training

Ryosuke Yamada, Kensho Hara, Hirokatsu Kataoka +4

cs.CV2024

Scaling Backwards: Minimal Synthetic Pre-training?

Ryo Nakamura, Ryu Tadokoro, Ryosuke Yamada +6

cs.LG2023

ASDL: A Unified Interface for Gradient Preconditioning in PyTorch

Kazuki Osawa, Satoki Ishikawa, Rio Yokota +2

math.NA2016

Fast Multipole Preconditioners for Sparse Matrices Arising from Elliptic Equations

Huda Ibeid, Rio Yokota, Jennifer Pestana +1

cs.CV2026

PowerCLIP: Powerset Alignment for Contrastive Pre-Training

Masaki Kawamura, Nakamasa Inoue, Rintaro Yanagi +2

math.NA2023

$O(N)$ distributed direct factorization of structured dense matrices using runtime systems

Sameer Deshmukh, Qinxiang Ma, Rio Yokota +1

cond-mat.supr-con2021

Quantum Turbulence Coupled with Externally Driven Normal-Fluid Turbulence in Superfluid $^4$He

Satoshi Yui, Hiromichi Kobayashi, Makoto Tsubota +1

stat.ML2019

Practical Deep Learning with Bayesian Principles

Kazuki Osawa, Siddharth Swaroop, Anirudh Jain +4

cs.LG2026

Takeuchi's Information Criteria as Generalization Measures for DNNs Close to NTK Regime

Hiroki Naganuma, Taiji Suzuki, Rio Yokota +3

cs.CV2020

Epipolar-Guided Deep Object Matching for Scene Change Detection

Kento Doi, Ryuhei Hamaguchi, Shun Iwase +3

cs.CL2026

On the Optimal Reasoning Length for RL-Trained Language Models

Daisuke Nohara, Taishi Nakamura, Rio Yokota

cs.MS2019

Effect of Mixed Precision Computing on H-Matrix Vector Multiplication in BEM Analysis

Rise Ooi, Takeshi Iwashita, Takeshi Fukaya +2

cs.CV2025

On the Relationship Between Double Descent of CNNs and Shape/Texture Bias Under Learning Process

Shun Iwase, Shuya Takahashi, Nakamasa Inoue +3

quant-ph2023

Quantum Circuit Simulation by SGEMM Emulation on Tensor Cores and Automatic Precision Selection

Hiroyuki Ootomo, Hidetaka Manabe, Kenji Harada +1

cs.LG2022

OPIRL: Sample Efficient Off-Policy Inverse Reinforcement Learning via Distribution Matching

Hana Hoshino, Kei Ota, Asako Kanezaki +1

cs.PF2018

Extreme Scale FMM-Accelerated Boundary Integral Equation Solver for Wave Scattering

Mustafa Abduljabbar, Mohammed Al Farhan, Noha Al-Harthi +4

stat.CO2016

Multi-Level Restricted Maximum Likelihood Covariance Estimation and Kriging for Large Non-Gridded Spatial Datasets

Julio E. Castrillon-Candas, Marc G. Genton, Rio Yokota

cs.LG2025

Masked Gated Linear Unit

Yukito Tajima, Nakamasa Inoue, Yusuke Sekikawa +2

math.NA2022

Parallel QR Factorization of Block Low-Rank Matrices

M. Ridwan Apriansyah, Rio Yokota

cs.LG2025

Local Loss Optimization in the Infinite Width: Stable Parameterization of Predictive Coding Networks and Target Propagation

Satoki Ishikawa, Rio Yokota, Ryo Karakida

cs.PF2023

Cache Optimization and Performance Modeling of Batched, Small, and Rectangular Matrix Multiplication on Intel, AMD, and Fujitsu Processors

Sameer Deshmukh, Rio Yokota, George Bosilca

math.NA2023

Computing the k-th Eigenvalue of Symmetric $H^2$-Matrices

M. Ridwan Apriansyah, Rio Yokota

math.NA2016

A Matrix-free Preconditioner for the Helmholtz Equation based on the Fast Multipole Method

Huda Ibeid, Rio Yokota, David Keyes

cs.LG2024

Accelerating Large Language Model Training with 4D Parallelism and Memory Consumption Estimator

Kazuki Fujii, Kohei Watanabe, Rio Yokota

cs.CL2024

LLM-jp: A Cross-organizational Project for the Research and Development of Fully Open Japanese LLMs

LLM-jp, :, Akiko Aizawa +80

cs.DC2017

Communication Reducing Algorithms for Distributed Hierarchical N-Body Problems with Boundary Distributions

Mustafa Abduljabbar, George Markomanolis, Huda Ibeid +2

cs.CV2023

SegRCDB: Semantic Segmentation via Formula-Driven Supervised Learning

Risa Shinoda, Ryo Hayamizu, Kodai Nakashima +3

cs.CL2026

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

Le Bronnec Florian, Alexandre Verine, Rio Yokota +1

cs.LG2024

Variational Learning is Effective for Large Deep Networks

Yuesong Shen, Nico Daheim, Bai Cong +8

math.NA2016

Fast Multipole Method as a Matrix-Free Hierarchical Low-Rank Approximation

Rio Yokota, Huda Ibeid, David Keyes

cs.LG2026

Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks

Taishi Nakamura, Satoki Ishikawa, Masaki Kawamura +4

cs.CL2025

Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs

Koshiro Saito, Sakae Mizuki, Masanari Ohi +11

math.NA2012

FMM-based vortex method for simulation of isotropic turbulence on GPUs, compared with a spectral method

Rio Yokota, L. A. Barba

cs.CV2023

Pre-training Vision Transformers with Very Limited Synthesized Images

Ryo Nakamura, Hirokatsu Kataoka, Sora Takashima +3

cs.LG2025

NeurIPS 2023 Competition: Privacy Preserving Federated Learning Document VQA

Marlon Tobaben, Mohamed Ali Souibgui, Rubèn Tito +24

math.NA2011

Hierarchical N-body simulations with auto-tuning for heterogeneous systems

Rio Yokota, Lorena A. Barba

cs.CL2025

Building Instruction-Tuning Datasets from Human-Written Instructions with Open-Weight Large Language Models

Youmi Ma, Sakae Mizuki, Kazuki Fujii +12

cs.CV2023

Visual Atoms: Pre-training Vision Transformers with Sinusoidal Waves

Sora Takashima, Ryo Hayamizu, Nakamasa Inoue +2

cs.DC2025

Scaling Large-scale GNN Training to Thousands of Processors on CPU-based Supercomputers

Chen Zhuang, Lingqi Zhang, Du Wu +8

cs.CV2021

RePOSE: Fast 6D Object Pose Refinement via Deep Texture Rendering

Shun Iwase, Xingyu Liu, Rawal Khirodkar +2

cs.CL2024

Aurora-M: Open Source Continual Pre-training for Multilingual Language and Code

Taishi Nakamura, Mayank Mishra, Simone Tedeschi +42

cs.NE2026

Evolutionary Context Search for Automated Skill Acquisition

Qi Sun, Stefan Nielsen, Rio Yokota +1

cs.CL2024

Building a Large Japanese Web Corpus for Large Language Models

Naoaki Okazaki, Kakeru Hattori, Hirai Shota +7

cs.LG2024

Variational Low-Rank Adaptation Using IVON

Bai Cong, Nico Daheim, Yuesong Shen +4

math.NA2022

Scalable Linear Time Dense Direct Solver for 3-D Problems Without Trailing Sub-Matrix Dependencies

Qianxiang Ma, Sameer Deshmukh, Rio Yokota

cs.DC2025

An inherently parallel H2-ULV factorization for solving dense linear systems on GPUs

Qianxiang Ma, Rio Yokota

cs.CV2024

Rethinking Image Super-Resolution from Training Data Perspectives

Go Ohtani, Ryu Tadokoro, Ryosuke Yamada +7

cs.CV2025

Pre-training Vision Transformers with Formula-driven Supervised Learning

Hirokatsu Kataoka, Sora Takashima, Ryo Hayamizu +6

cs.CL2024

Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities

Kazuki Fujii, Taishi Nakamura, Mengsay Loem +7

cs.LG2025

Lion Cub: Minimizing Communication Overhead in Distributed Lion

Satoki Ishikawa, Tal Ben-Nun, Brian Van Essen +2

cs.MS2009

PetRBF--A parallel O(N) algorithm for radial basis function interpolation

Rio Yokota, L. A. Barba, Matthew G. Knepley

cs.LG2023

Empirical Study on Optimizer Selection for Out-of-Distribution Generalization

Hiroki Naganuma, Kartik Ahuja, Shiro Takagi +5

cs.LG2024

Balancing Speed and Stability: The Trade-offs of FP8 vs. BF16 Training in LLMs

Kazuki Fujii, Taishi Nakamura, Rio Yokota

cs.CE2011

Biomolecular electrostatics using a fast multipole BEM on up to 512 GPUs and a billion unknowns

Rio Yokota, Jaydeep P. Bardhan, Matthew G. Knepley +2