Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs
Jinzhe Li, Gengxu Li, Jinnan Li +2
As Multimodal Large Language Models (MLLMs) evolve into sophisticated interactive assistants, their reliability depends not only on following instructions but also on validating th…
cs.AI2025
Refining Critical Thinking in LLM Code Generation: A Faulty Premise-based Evaluation Framework
Jialin Li, Jinzhe Li, Gengxu Li +2
With the advancement of code generation capabilities in large language models (LLMs), their reliance on input premises has intensified. When users provide inputs containing faulty…