2 papers
cs.CV2025
Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion
DongHoon Lim, YoungChae Kim, Dong-Hyun Kim +2
Robust audio-visual speech recognition (AVSR) in noisy environments remains challenging, as existing systems struggle to estimate audio reliability and dynamically adjust modality…
cs.LG2025
IterL2Norm: Fast Iterative L2-Normalization
ChangMin Ye, Yonguk Sim, Youngchae Kim +2
Transformer-based large language models are a memory-bound model whose operation is based on a large amount of data that are marginally reused. Thus, the data movement between a ho…