papers

Publications (141)

cs.CL2024

Modeling Unified Semantic Discourse Structure for High-quality Headline Generation

Minghui Xu, Hao Fei, Fei Li +4

cs.CV2025

Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image

Yu Zhao, Hao Fei, Xiangtai Li +6

cs.CL2022

Conversational Semantic Role Labeling with Predicate-Oriented Latent Graph

Hao Fei, Shengqiong Wu, Meishan Zhang +2

cs.CL2026

Mental World Modeling

Hao Fei, Yiran Zhao

The paper introduces Mental World Modeling (MWM), a framework that integrates agents' mental states (beliefs, desires, intentions) into world models, and presents a training‑free b…

#mental world modeling#world models#mental state representation#decision prediction
cs.CL2025

When Disagreements Elicit Robustness: Investigating Self-Repair Capabilities under LLM Multi-Agent Disagreements

Tianjie Ju, Bowen Wang, Hao Fei +9

cs.CL2023

Reasoning Implicit Sentiment with Chain-of-Thought Prompting

Hao Fei, Bobo Li, Qian Liu +3

cs.CV2025

Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining

Zhiqi Ge, Juncheng Li, Xinglei Pang +7

cs.CL2021

End-to-end Semantic Role Labeling with Neural Transition-based Model

Hao Fei, Meishan Zhang, Bobo Li +1

cs.CL2025

Aristotle: Mastering Logical Reasoning with A Logic-Complete Decompose-Search-Resolve Framework

Jundong Xu, Hao Fei, Meng Luo +6

cs.CL2023

TKDP: Threefold Knowledge-enriched Deep Prompt Tuning for Few-shot Named Entity Recognition

Jiang Liu, Hao Fei, Fei Li +5

cs.CV2025

Efficient Physics Simulation for 3D Scenes via MLLM-Guided Gaussian Splatting

Haoyu Zhao, Hao Wang, Xingyue Zhao +4

cs.CL2022

Joint Alignment of Multi-Task Feature and Label Spaces for Emotion Cause Pair Extraction

Shunjie Chen, Xiaochuan Shi, Jingye Li +4

cs.CV2025

Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology

Siyuan Yan, Ming Hu, Yiwen Jiang +5

cs.CV2026

Audio-Visual Intelligence in Large Foundation Models

You Qin, Kai Liu, Shengqiong Wu +12

cs.CL2021

Unified Named Entity Recognition as Word-Word Relation Classification

Jingye Li, Hao Fei, Jiang Liu +5

cs.CV2025

ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models

Yongheng Zhang, Xu Liu, Ruihan Tao +4

cs.CL2023

DiaASQ : A Benchmark of Conversational Aspect-based Sentiment Quadruple Analysis

Bobo Li, Hao Fei, Fei Li +8

cs.MM2024

SpeechEE: A Novel Benchmark for Speech Event Extraction

Bin Wang, Meishan Zhang, Hao Fei +5

cs.CV2025

Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene

Shengqiong Wu, Hao Fei, Jingkang Yang +4

cs.CV2023

Information Screening whilst Exploiting! Multimodal Relation Extraction with Feature Denoising and Multimodal Topic Modeling

Shengqiong Wu, Hao Fei, Yixin Cao +2

cs.CV2026

DragNeXt: Rethinking Drag-Based Image Editing

Yuan Zhou, Junbao Zhou, Qingshan Xu +5

cs.CL2026

LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision

Jundong Xu, Hao Fei, Huichi Zhou +6

cs.CL2020

High-order Refining for End-to-end Chinese Semantic Role Labeling

Hao Fei, Yafeng Ren, Donghong Ji

cs.CV2025

Where, What, Why: Towards Explainable Driver Attention Prediction

Yuchen Zhou, Jiayu Tang, Xiaoyan Xiao +6

cs.CL2024

I3: Intent-Introspective Retrieval Conditioned on Instructions

Kaihang Pan, Juncheng Li, Wenjie Wang +7

cs.CL2022

OneEE: A One-Stage Framework for Fast Overlapping and Nested Event Extraction

Hu Cao, Jingye Li, Fangfang Su +6

cs.LG2026

SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models

You Qin, Linqing Wang, Hao Fei +4

cs.MM2024

Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction

Meishan Zhang, Hao Fei, Bin Wang +4

cs.CV2026

Orthogonal Spatial-temporal Distributional Transfer for 4D Generation

Wei Liu, Shengqiong Wu, Bobo Li +4

cs.CV2024

Unified Generative and Discriminative Training for Multi-modal Large Language Models

Wei Chow, Juncheng Li, Qifan Yu +7

cs.CL2020

Cross-lingual Semantic Role Labeling with Model Transfer

Hao Fei, Meishan Zhang, Fei Li +1

cs.CL2025

Grammar Induction from Visual, Speech and Text

Yu Zhao, Hao Fei, Shengqiong Wu +3

cs.CL2020

Nominal Compound Chain Extraction: A New Task for Semantic-enriched Lexical Chain

Bobo Li, Hao Fei, Yafeng Ren +1

q-bio.QM2024

ProtT3: Protein-to-Text Generation for Text-based Protein Understanding

Zhiyuan Liu, An Zhang, Hao Fei +4

cs.CL2020

Retrofitting Structure-aware Transformer Language Model for End Tasks

Hao Fei, Yafeng Ren, Donghong Ji

cs.CL2026

Code-MIE: A Code-style Model for Multimodal Information Extraction with Scene Graph and Entity Attribute Knowledge Enhancement

Jiang Liu, Ge Qiu, Hao Fei +5

cs.CL2025

Multi-Granular Multimodal Clue Fusion for Meme Understanding

Li Zheng, Hao Fei, Ting Dai +5

cs.CL2025

On the Adaptive Psychological Persuasion of Large Language Models

Tianjie Ju, Yujia Chen, Hao Fei +6

cs.CL2023

Revisiting Disentanglement and Fusion on Modality and Context in Conversational Multimodal Emotion Recognition

Bobo Li, Hao Fei, Lizi Liao +5

cs.CV2026

JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation

Kai Liu, Jungang Li, Yuchong Sun +13

cs.CV2024

Grounding is All You Need? Dual Temporal Grounding for Video Dialog

You Qin, Wei Ji, Xinze Lan +5

cs.CV2026

SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding

Pengxin Xu, Xincheng Lin, Luping Xiao +5

cs.CL2022

Entity-centered Cross-document Relation Extraction

Fengqi Wang, Fei Li, Hao Fei +6

cs.CL2023

Revisiting Conversation Discourse for Dialogue Disentanglement

Bobo Li, Hao Fei, Fei Li +5

cs.CV2026

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

Yanlin Li, Minghui Guo, Kaiwen Zhang +13

cs.CV2023

Constructing Holistic Spatio-Temporal Scene Graph for Video Semantic Role Labeling

Yu Zhao, Hao Fei, Yixin Cao +5

cs.AI2025

When Words Smile: Generating Diverse Emotional Facial Expressions from Text

Haidong Xu, Meishan Zhang, Hao Ju +4

cs.CL2024

A Survey of Ontology Expansion for Conversational Understanding

Jinggui Liang, Yuxia Wu, Yuan Fang +2

cs.CL2023

On the Robustness of Aspect-based Sentiment Analysis: Rethinking Model, Data, and Training

Hao Fei, Tat-Seng Chua, Chenliang Li +3

cs.CL2024

NUS-Emo at SemEval-2024 Task 3: Instruction-Tuning LLM for Multimodal Emotion-Cause Analysis in Conversations

Meng Luo, Han Zhang, Shengqiong Wu +3

cs.CL2026

A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models

Huiyao Chen, Meishan Zhang, Jing Li +4

cs.CV2024

Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning

Shengqiong Wu, Hao Fei, Liangming Pan +3

cs.CV2023

LayoutLLM-T2I: Eliciting Layout Guidance from LLM for Text-to-Image Generation

Leigang Qu, Shengqiong Wu, Hao Fei +2

cs.SD2022

Subband-based Generative Adversarial Network for Non-parallel Many-to-many Voice Conversion

Jian Ma, Zhedong Zheng, Hao Fei +3

cs.CL2020

Aggressive Language Detection with Joint Text Normalization via Adversarial Multi-task Learning

Shengqiong Wu, Hao Fei, Donghong Ji

cs.AI2024

Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition

Hao Fei, Shengqiong Wu, Wei Ji +4

cs.CL2024

XNLP: An Interactive Demonstration System for Universal Structured NLP

Hao Fei, Meishan Zhang, Min Zhang +1

cs.CV2025

ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models

Mingrui Wu, Xinyue Cai, Jiayi Ji +7

cs.CL2023

Constructing Code-mixed Universal Dependency Forest for Unbiased Cross-lingual Relation Extraction

Hao Fei, Meishan Zhang, Min Zhang +1

cs.CV2025

Uncertainty-o: One Model-agnostic Framework for Unveiling Uncertainty in Large Multimodal Models

Ruiyang Zhang, Hu Zhang, Hao Fei +1

cs.CL2025

FormFactory: An Interactive Benchmarking Suite for Multimodal Form-Filling Agents

Bobo Li, Yuheng Wang, Hao Fei +4

cs.CV2026

Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning

Meng Luo, Bobo Li, Shanqing Xu +8

cs.CL2024

Faithful Logical Reasoning via Symbolic Chain-of-Thought

Jundong Xu, Hao Fei, Liangming Pan +3

cs.CV2024

RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation

Changli Wu, Qi Chen, Jiayi Ji +7

cs.CV2025

On Path to Multimodal Generalist: General-Level and General-Bench

Hao Fei, Yuan Zhou, Juncheng Li +29

cs.CV2024

De-fine: Decomposing and Refining Visual Programs with Auto-Feedback

Minghe Gao, Juncheng Li, Hao Fei +7

cs.CL2022

Effective Token Graph Modeling using a Novel Labeling Strategy for Structured Sentiment Analysis

Wenxuan Shi, Fei Li, Jingye Li +2

cs.CV2026

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

Shengqiong Wu, Bobo Li, Xinkai Wang +6

cs.CL2024

In-Context Learning for Few-Shot Nested Named Entity Recognition

Meishan Zhang, Bin Wang, Hao Fei +1

cs.CV2025

CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models

Zihui Cheng, Qiguang Chen, Jin Zhang +5

cs.CL2025

Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought

Tencent Hunyuan Team, Ao Liu, Botong Zhou +248

cs.CV2025

Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought

Zihui Cheng, Qiguang Chen, Xiao Xu +8

cs.CL2023

LasUIE: Unifying Information Extraction with Latent Adaptive Structure-aware Generative Language Model

Hao Fei, Shengqiong Wu, Jingye Li +6

cs.CV2023

Generating Visual Spatial Description via Holistic 3D Scene Understanding

Yu Zhao, Hao Fei, Wei Ji +4

cs.CV2024

Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing

Hao Fei, Shengqiong Wu, Hanwang Zhang +2

cs.CL2024

MD: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction

Jiang Liu, Bobo Li, Xinran Yang +5

cs.AI2024

NExT-GPT: Any-to-Any Multimodal LLM

Shengqiong Wu, Hao Fei, Leigang Qu +2

cs.CL2025

CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs

Jinlan Fu, Shenzhen Huangfu, Hao Fei +4

cs.AI2025

VEGAS: Towards Visually Explainable and Grounded Artificial Social Intelligence

Hao Li, Hao Fei, Zechao Hu +2

cs.CL2020

Mimic and Conquer: Heterogeneous Tree Structure Distillation for Syntactic NLP

Hao Fei, Yafeng Ren, Donghong Ji

cs.CV2024

Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning

Long Qian, Juncheng Li, Yu Wu +5

cs.CV2025

LEAF-Mamba: Local Emphatic and Adaptive Fusion State Space Model for RGB-D Salient Object Detection

Lanhu Wu, Zilin Gao, Hao Fei +2

cs.CV2026

SAMTok: Representing Any Mask with Two Words

Yikang Zhou, Tao Zhang, Dengxian Gong +13

cs.LG2025

Improving Expressive Power of Spectral Graph Neural Networks with Eigenvalue Correction

Kangkang Lu, Yanhua Yu, Hao Fei +6

cs.CV2025

A Reason-then-Describe Instruction Interpreter for Controllable Video Generation

Shengqiong Wu, Weicai Ye, Yuanxing Zhang +7

cs.CL2021

Learn from Syntax: Improving Pair-wise Aspect and Opinion Terms Extractionwith Rich Syntactic Knowledge

Shengqiong Wu, Hao Fei, Yafeng Ren +2

cs.CV2026

Modeling Cross-vision Synergy for Unified Large Vision Model

Shengqiong Wu, Lanhu Wu, Mingyang Bao +5

cs.CL2025

Event Extraction in Large Language Model

Bobo Li, Xudong Han, Jiang Liu +11

cs.CL2026

Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

Bobo Li, Rui Wu, Zibo Ji +5

cs.CV2025

VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models

Haojian Huang, Haodong Chen, Shengqiong Wu +5

cs.MM2024

EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot

Hao Fei, Han Zhang, Bin Wang +3

cs.CV2023

VPGTrans: Transfer Visual Prompt Generator across LLMs

Ao Zhang, Hao Fei, Yuan Yao +4

cs.CL2024

What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration

Libo Qin, Qiguang Chen, Hao Fei +3

cs.CV2026

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

Kai Liu, Wei Li, Lai Chen +8

cs.CL2023

Reverse Multi-Choice Dialogue Commonsense Inference with Graph-of-Thought

Li Zheng, Hao Fei, Fei Li +4

cs.CV2026

MuSLR: Multimodal Symbolic Logical Reasoning

Jundong Xu, Hao Fei, Yuhui Zhang +8

cs.CV2025

From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search

Jintao Sun, Hao Fei, Zhedong Zheng +1

cs.CL2020

Cross-Lingual Semantic Role Labeling with High-Quality Translated Training Corpus

Hao Fei, Meishan Zhang, Donghong Ji

cs.CV2024

Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration

Kaihang Pan, Zhaoyu Fan, Juncheng Li +6

cs.CV2026

Towards One-to-Many Temporal Grounding

Qi Xu, Yue Tan, Shihao Chen +5