From the 1 of 11 linked papers with an AI index.
11 papers
Medical-Checklist: Assessing the Comprehension of Medical Images by Multimodal Models
Bannapol Limanond, Masanori Suganuma, Takayuki Okatani
This paper introduces a new benchmark test, Medical-Checklist, for assessing medical multimodal models. The recent advancements in multimodal models have demonstrated significant p…
Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images
Xiangyong Lu, Masanori Suganuma, Takayuki Okatani
The paper introduces Cascaded Multi-Scale Attention (CMSA), an attention module for CNN‑ViT hybrid networks that extracts and fuses multi‑scale features without downsampling, impro…
Inverting the Generation Process of Denoising Diffusion Implicit Models: Empirical Evaluation and a Novel Method
Yan Zeng, Masanori Suganuma, Takayuki Okatani
This paper studies the problem of inverting the DDIM image generation process to recover latent variables, particularly the initial noise map, from a generated image. Existing meth…
An Improved Method for Personalizing Diffusion Models
Yan Zeng, Masanori Suganuma, Takayuki Okatani
Diffusion models have demonstrated impressive image generation capabilities. Personalized approaches, such as textual inversion and Dreambooth, enhance model individualization usin…
Rethinking Open-Set Object Detection: Issues, a New Formulation, and Taxonomy
Yusuke Hosoya, Masanori Suganuma, Takayuki Okatani
Open-set object detection (OSOD), a task involving the detection of unknown objects while accurately detecting known objects, has recently gained attention. However, we identify a…
MS-DPPs: Multi-Source Determinantal Point Processes for Contextual Diversity Refinement of Composite Attributes in Text to Image Retrieval
Naoya Sogi, Takashi Shibata, Makoto Terao +2
Result diversification (RD) is a crucial technique in Text-to-Image Retrieval for enhancing the efficiency of a practical application. Conventional methods focus solely on increasi…