2 papers
cs.CL2026
WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management
Yi Zhang, Hongyang Wang, Zheng Hao Leong +11
Large language models (LLMs) are increasingly used as technical assistants, but their competence in solid waste management (SWM) remains difficult to assess because existing benchm…
cs.AI2026
WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement
Ziliang Yang, Yi Zhang, Kaijun Lin +3
Large language models (LLMs) are increasingly considered for environmental enforcement, but their ability to produce traceable enforcement decisions remains unclear. We introduce W…