19 citations · 20 across the 8 of their papers we have counts for
10 papers
Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention
Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita +4
This paper proposes an improved structured pruning method for large language models (LLMs) that addresses key challenges in adapting Adaptive Feature Retention (AFR), an unstructur…
Bidirectional Action Sequence Learning for Long-term Action Anticipation with Large Language Models
Yuji Sato, Yasunori Ishii, Takayoshi Yamashita
Video-based long-term action anticipation is crucial for early risk detection in areas such as automated driving and robotics. Conventional approaches extract features from past ac…
VideoMultiAgents: A Multi-Agent Framework for Video Question Answering
Noriyuki Kugo, Xiang Li, Zixin Li +9
Video Question Answering (VQA) inherently relies on multimodal reasoning, integrating visual, temporal, and linguistic cues to achieve a deeper understanding of video content. Howe…
Panoramic Distortion-Aware Tokenization for Person Detection and Localization in Overhead Fisheye Images
Nobuhiko Wakai, Satoshi Sato, Yasunori Ishii +1
Person detection in overhead fisheye images is challenging due to person rotation and small persons. Prior work has mainly addressed person rotation, leaving the small-person probl…
hear-your-action: human action recognition by ultrasound active sensing
Risako Tanigawa, Yasunori Ishii
Action recognition is a key technology for many industrial applications. Methods using visual information such as images are very popular. However, privacy issues prevent widesprea…
Data Augmentation by Selecting Mixed Classes Considering Distance Between Classes
Shungo Fujii, Yasunori Ishii, Kazuki Kozuka +3
Data augmentation is an essential technique for improving recognition accuracy in object recognition using deep learning. Methods that generate mixed data from multiple data sets,…