3 papers
cs.CV2026
MedCAGD: Context-Aware Gated Decoder for Efficient Medical Image Segmentation
Saad Wazir, Patrick Dominique Vibild, Dinh Phu Tran +2
Medical image segmentation relies on the ability of encoder-decoder architectures to translate rich feature representations into accurate pixel-level predictions under challenging…
cs.CV2026
TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning
Seongah Kim, Dinh Phu Tran, Hyeontaek Hwang +3
Audio-visual understanding requires effective alignment between heterogeneous modalities, yet cross-modal correspondence remains challenging when temporally aligned audio and visua…
cs.LG2026
Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering
Dinh Phu Tran, Jihoon Jeong, Saad Wazir +4
We present a formal problem formulation for \textit{Reliable} Audio-Visual Question Answering (-AVQA), where we prefer abstention over answering incorrectly. While rec…