activity
20202025
most citedMulti-modal fusion with gating using audio, lexical and disfluency features for Alzheimer's Dementia recognition from spontaneous speech

82 citations · 85 across the 8 of their papers we have counts for

collaborators
Showing cs.CLShow all

7 papers · 1 filter

cs.CL2025

Optimizing Speech Language Models for Acoustic Consistency

Morteza Rohanian, Michael Krauthammer

We study speech language models that incorporate semantic initialization and planning losses to achieve robust and consistent generation. Our approach initializes speech tokens wit…

cs.CL2025

Towards Scalable and Cross-Lingual Specialist Language Models for Oncology

Morteza Rohanian, Tarun Mehra, Nicola Miglino +3

Clinical oncology generates vast, unstructured data that often contain inconsistencies, missing information, and ambiguities, making it difficult to extract reliable insights for d…

cs.CL20251 cited

Uncertainty Modeling in Multimodal Speech Analysis Across the Psychosis Spectrum

Morteza Rohanian, Roya M. Hüppi, Farhad Nooralahzadeh +8

Capturing subtle speech disruptions across the psychosis spectrum is challenging because of the inherent variability in speech patterns. This variability reflects individual differ…

cs.CL20231 cited

Radiology-Aware Model-Based Evaluation Metric for Report Generation

Amos Calamida, Farhad Nooralahzadeh, Morteza Rohanian +3

We propose a new automated evaluation metric for machine-generated radiology reports using the successful COMET architecture adapted for the radiology domain. We train and publish…

cs.CL20231 cited

Boosting Radiology Report Generation by Infusing Comparison Prior

Sanghwan Kim, Farhad Nooralahzadeh, Morteza Rohanian +5

Recent transformer-based models have made significant strides in generating radiology reports from chest X-ray images. However, a prominent challenge remains: these models often la…

cs.CL2021

Alzheimer's Dementia Recognition Using Acoustic, Lexical, Disfluency and Speech Pause Features Robust to Noisy Inputs

Morteza Rohanian, Julian Hough, Matthew Purver

We present two multimodal fusion-based deep learning models that consume ASR transcribed speech and acoustic data simultaneously to classify whether a speaker in a structured diagn…