Publications (141)
Modeling Unified Semantic Discourse Structure for High-quality Headline Generation
Minghui Xu, Hao Fei, Fei Li +4
Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image
Yu Zhao, Hao Fei, Xiangtai Li +6
Conversational Semantic Role Labeling with Predicate-Oriented Latent Graph
Hao Fei, Shengqiong Wu, Meishan Zhang +2
Mental World Modeling
Hao Fei, Yiran Zhao
The paper introduces Mental World Modeling (MWM), a framework that integrates agents' mental states (beliefs, desires, intentions) into world models, and presents a training‑free b…
When Disagreements Elicit Robustness: Investigating Self-Repair Capabilities under LLM Multi-Agent Disagreements
Tianjie Ju, Bowen Wang, Hao Fei +9
Reasoning Implicit Sentiment with Chain-of-Thought Prompting
Hao Fei, Bobo Li, Qian Liu +3
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
Zhiqi Ge, Juncheng Li, Xinglei Pang +7
End-to-end Semantic Role Labeling with Neural Transition-based Model
Hao Fei, Meishan Zhang, Bobo Li +1
Aristotle: Mastering Logical Reasoning with A Logic-Complete Decompose-Search-Resolve Framework
Jundong Xu, Hao Fei, Meng Luo +6
TKDP: Threefold Knowledge-enriched Deep Prompt Tuning for Few-shot Named Entity Recognition
Jiang Liu, Hao Fei, Fei Li +5
Efficient Physics Simulation for 3D Scenes via MLLM-Guided Gaussian Splatting
Haoyu Zhao, Hao Wang, Xingyue Zhao +4
Joint Alignment of Multi-Task Feature and Label Spaces for Emotion Cause Pair Extraction
Shunjie Chen, Xiaochuan Shi, Jingye Li +4
Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology
Siyuan Yan, Ming Hu, Yiwen Jiang +5
Audio-Visual Intelligence in Large Foundation Models
You Qin, Kai Liu, Shengqiong Wu +12
Unified Named Entity Recognition as Word-Word Relation Classification
Jingye Li, Hao Fei, Jiang Liu +5
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
Yongheng Zhang, Xu Liu, Ruihan Tao +4
DiaASQ : A Benchmark of Conversational Aspect-based Sentiment Quadruple Analysis
Bobo Li, Hao Fei, Fei Li +8
SpeechEE: A Novel Benchmark for Speech Event Extraction
Bin Wang, Meishan Zhang, Hao Fei +5
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
Shengqiong Wu, Hao Fei, Jingkang Yang +4
Information Screening whilst Exploiting! Multimodal Relation Extraction with Feature Denoising and Multimodal Topic Modeling
Shengqiong Wu, Hao Fei, Yixin Cao +2
DragNeXt: Rethinking Drag-Based Image Editing
Yuan Zhou, Junbao Zhou, Qingshan Xu +5
LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision
Jundong Xu, Hao Fei, Huichi Zhou +6
High-order Refining for End-to-end Chinese Semantic Role Labeling
Hao Fei, Yafeng Ren, Donghong Ji
Where, What, Why: Towards Explainable Driver Attention Prediction
Yuchen Zhou, Jiayu Tang, Xiaoyan Xiao +6
I3: Intent-Introspective Retrieval Conditioned on Instructions
Kaihang Pan, Juncheng Li, Wenjie Wang +7
OneEE: A One-Stage Framework for Fast Overlapping and Nested Event Extraction
Hu Cao, Jingye Li, Fangfang Su +6
SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models
You Qin, Linqing Wang, Hao Fei +4
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
Meishan Zhang, Hao Fei, Bin Wang +4
Orthogonal Spatial-temporal Distributional Transfer for 4D Generation
Wei Liu, Shengqiong Wu, Bobo Li +4
Unified Generative and Discriminative Training for Multi-modal Large Language Models
Wei Chow, Juncheng Li, Qifan Yu +7
Cross-lingual Semantic Role Labeling with Model Transfer
Hao Fei, Meishan Zhang, Fei Li +1
Grammar Induction from Visual, Speech and Text
Yu Zhao, Hao Fei, Shengqiong Wu +3
Nominal Compound Chain Extraction: A New Task for Semantic-enriched Lexical Chain
Bobo Li, Hao Fei, Yafeng Ren +1
ProtT3: Protein-to-Text Generation for Text-based Protein Understanding
Zhiyuan Liu, An Zhang, Hao Fei +4
Retrofitting Structure-aware Transformer Language Model for End Tasks
Hao Fei, Yafeng Ren, Donghong Ji
Code-MIE: A Code-style Model for Multimodal Information Extraction with Scene Graph and Entity Attribute Knowledge Enhancement
Jiang Liu, Ge Qiu, Hao Fei +5
Multi-Granular Multimodal Clue Fusion for Meme Understanding
Li Zheng, Hao Fei, Ting Dai +5
On the Adaptive Psychological Persuasion of Large Language Models
Tianjie Ju, Yujia Chen, Hao Fei +6
Revisiting Disentanglement and Fusion on Modality and Context in Conversational Multimodal Emotion Recognition
Bobo Li, Hao Fei, Lizi Liao +5
JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
Kai Liu, Jungang Li, Yuchong Sun +13
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
You Qin, Wei Ji, Xinze Lan +5
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
Pengxin Xu, Xincheng Lin, Luping Xiao +5
Entity-centered Cross-document Relation Extraction
Fengqi Wang, Fei Li, Hao Fei +6
Revisiting Conversation Discourse for Dialogue Disentanglement
Bobo Li, Hao Fei, Fei Li +5
UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark
Yanlin Li, Minghui Guo, Kaiwen Zhang +13
Constructing Holistic Spatio-Temporal Scene Graph for Video Semantic Role Labeling
Yu Zhao, Hao Fei, Yixin Cao +5
When Words Smile: Generating Diverse Emotional Facial Expressions from Text
Haidong Xu, Meishan Zhang, Hao Ju +4
A Survey of Ontology Expansion for Conversational Understanding
Jinggui Liang, Yuxia Wu, Yuan Fang +2
On the Robustness of Aspect-based Sentiment Analysis: Rethinking Model, Data, and Training
Hao Fei, Tat-Seng Chua, Chenliang Li +3
NUS-Emo at SemEval-2024 Task 3: Instruction-Tuning LLM for Multimodal Emotion-Cause Analysis in Conversations
Meng Luo, Han Zhang, Shengqiong Wu +3
A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models
Huiyao Chen, Meishan Zhang, Jing Li +4
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
Shengqiong Wu, Hao Fei, Liangming Pan +3
LayoutLLM-T2I: Eliciting Layout Guidance from LLM for Text-to-Image Generation
Leigang Qu, Shengqiong Wu, Hao Fei +2
Subband-based Generative Adversarial Network for Non-parallel Many-to-many Voice Conversion
Jian Ma, Zhedong Zheng, Hao Fei +3
Aggressive Language Detection with Joint Text Normalization via Adversarial Multi-task Learning
Shengqiong Wu, Hao Fei, Donghong Ji
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
Hao Fei, Shengqiong Wu, Wei Ji +4
XNLP: An Interactive Demonstration System for Universal Structured NLP
Hao Fei, Meishan Zhang, Min Zhang +1
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
Mingrui Wu, Xinyue Cai, Jiayi Ji +7
Constructing Code-mixed Universal Dependency Forest for Unbiased Cross-lingual Relation Extraction
Hao Fei, Meishan Zhang, Min Zhang +1
Uncertainty-o: One Model-agnostic Framework for Unveiling Uncertainty in Large Multimodal Models
Ruiyang Zhang, Hu Zhang, Hao Fei +1
FormFactory: An Interactive Benchmarking Suite for Multimodal Form-Filling Agents
Bobo Li, Yuheng Wang, Hao Fei +4
Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning
Meng Luo, Bobo Li, Shanqing Xu +8
Faithful Logical Reasoning via Symbolic Chain-of-Thought
Jundong Xu, Hao Fei, Liangming Pan +3
RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation
Changli Wu, Qi Chen, Jiayi Ji +7
On Path to Multimodal Generalist: General-Level and General-Bench
Hao Fei, Yuan Zhou, Juncheng Li +29
De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
Minghe Gao, Juncheng Li, Hao Fei +7
Effective Token Graph Modeling using a Novel Labeling Strategy for Structured Sentiment Analysis
Wenxuan Shi, Fei Li, Jingye Li +2
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
Shengqiong Wu, Bobo Li, Xinkai Wang +6
In-Context Learning for Few-Shot Nested Named Entity Recognition
Meishan Zhang, Bin Wang, Hao Fei +1
CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models
Zihui Cheng, Qiguang Chen, Jin Zhang +5
Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought
Tencent Hunyuan Team, Ao Liu, Botong Zhou +248
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
Zihui Cheng, Qiguang Chen, Xiao Xu +8
LasUIE: Unifying Information Extraction with Latent Adaptive Structure-aware Generative Language Model
Hao Fei, Shengqiong Wu, Jingye Li +6
Generating Visual Spatial Description via Holistic 3D Scene Understanding
Yu Zhao, Hao Fei, Wei Ji +4
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
Hao Fei, Shengqiong Wu, Hanwang Zhang +2
MD: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction
Jiang Liu, Bobo Li, Xinran Yang +5
NExT-GPT: Any-to-Any Multimodal LLM
Shengqiong Wu, Hao Fei, Leigang Qu +2
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
Jinlan Fu, Shenzhen Huangfu, Hao Fei +4
VEGAS: Towards Visually Explainable and Grounded Artificial Social Intelligence
Hao Li, Hao Fei, Zechao Hu +2
Mimic and Conquer: Heterogeneous Tree Structure Distillation for Syntactic NLP
Hao Fei, Yafeng Ren, Donghong Ji
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
Long Qian, Juncheng Li, Yu Wu +5
LEAF-Mamba: Local Emphatic and Adaptive Fusion State Space Model for RGB-D Salient Object Detection
Lanhu Wu, Zilin Gao, Hao Fei +2
SAMTok: Representing Any Mask with Two Words
Yikang Zhou, Tao Zhang, Dengxian Gong +13
Improving Expressive Power of Spectral Graph Neural Networks with Eigenvalue Correction
Kangkang Lu, Yanhua Yu, Hao Fei +6
A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
Shengqiong Wu, Weicai Ye, Yuanxing Zhang +7
Learn from Syntax: Improving Pair-wise Aspect and Opinion Terms Extractionwith Rich Syntactic Knowledge
Shengqiong Wu, Hao Fei, Yafeng Ren +2
Modeling Cross-vision Synergy for Unified Large Vision Model
Shengqiong Wu, Lanhu Wu, Mingyang Bao +5
Event Extraction in Large Language Model
Bobo Li, Xudong Han, Jiang Liu +11
Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
Bobo Li, Rui Wu, Zibo Ji +5
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
Haojian Huang, Haodong Chen, Shengqiong Wu +5
EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot
Hao Fei, Han Zhang, Bin Wang +3
VPGTrans: Transfer Visual Prompt Generator across LLMs
Ao Zhang, Hao Fei, Yuan Yao +4
What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration
Libo Qin, Qiguang Chen, Hao Fei +3
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
Kai Liu, Wei Li, Lai Chen +8
Reverse Multi-Choice Dialogue Commonsense Inference with Graph-of-Thought
Li Zheng, Hao Fei, Fei Li +4
MuSLR: Multimodal Symbolic Logical Reasoning
Jundong Xu, Hao Fei, Yuhui Zhang +8
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
Jintao Sun, Hao Fei, Zhedong Zheng +1
Cross-Lingual Semantic Role Labeling with High-Quality Translated Training Corpus
Hao Fei, Meishan Zhang, Donghong Ji
Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration
Kaihang Pan, Zhaoyu Fan, Juncheng Li +6
Towards One-to-Many Temporal Grounding
Qi Xu, Yue Tan, Shihao Chen +5