papers
Publications (11)
cs.CV2024
Imagen 3
Imagen-Team-Google, :, Jason Baldridge +257
cs.CV2026
Robust Egocentric Visual Attention Prediction Through Language-guided Scene Context-aware Learning
Sungjune Park, Hongda Mao, Qingshuang Chen +2
cs.CV2026
Cross-View Yaw Estimation in Location Uncertainty with Line-Aligning Yaw Scoring
Taeho Kang, Nairan Zhang, Yelin Kim +2
cs.CL2025
Gemini: A Family of Highly Capable Multimodal Models
Gemini Team, Rohan Anil, Sebastian Borgeaud +1340
eess.AS2020
Speech Sentiment and Customer Satisfaction Estimation in Socialbot Conversations
Yelin Kim, Joshua Levy, Yang Liu
cs.CV2026
AsymLoc: Towards Asymmetric Feature Matching for Efficient Visual Localization
Mohammad Omama, Gabriele Berton, Eric Foxlin +1
cs.SE2026
The Conversations Beneath the Code: Triadic Data for Long-Horizon Software Engineering Agents
Yelin Kim
cs.CV2026
Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models
Paribesh Regmi, Qingshuang Chen, Chi Zhang +3
cs.SD2021
Acted vs. Improvised: Domain Adaptation for Elicitation Approaches in Audio-Visual Emotion Recognition
Haoqi Li, Yelin Kim, Cheng-Hao Kuo +1
cs.CL2024
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
Gemini Team, Petko Georgiev, Ving Ian Lei +1132
cs.CV2026
studentSplat: Your Student Model Learns Single-view 3D Gaussian Splatting
Yimu Pan, Hongda Mao, Qingshuang Chen +1