4 papers
MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models
Yue Wu, Changyuan Wang, Zixuan Wang +2
Conventional Post-Training Quantization (PTQ) methods struggle with 4-bit Omni-modal Large Language Models (OLLMs) due to the extreme distribution heterogeneity and disparate outli…
Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning
Chongyang He, Rui Zhang, Zixuan Wang +1
Post-training Small Language Models (SLMs) for reasoning typically follows an SFT-then-RL pipeline, yet existing work rarely considers what data should be learned at each stage. We…
ReelWave: Multi-Agentic Movie Sound Generation through Multimodal LLM Conversation
Zixuan Wang, Chi-Keung Tang, Yu-Wing Tai
Current audio generation conditioned by text or video focuses on aligning audio with text/video modalities. Despite excellent alignment results, these multimodal frameworks still c…
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
Zixuan Wang, Chi-Keung Tang, Yu-Wing Tai
We introduce Audio-Agent, a multimodal framework for audio generation, editing and composition based on text or video inputs. Conventional approaches for text-to-audio (TTA) tasks…