3 papers
cs.AI2026
TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering
Jinglai Zheng, Chuhan Qiao, Haiming Huang
Deploying LLMs as reasoning assistants in safety-critical aerospace engineering requires stricter evaluation criteria than general scientific benchmarks. In hypersonic thermal prot…
cs.AI2026
CADMAS-CTX: Contextual Capability Calibration for Multi-Agent Delegation
Chuhan Qiao
We revisit multi-agent delegation under a stronger and more realistic assumption: an agent's capability is not fixed at the skill level, but depends on task context. A coding agent…
cs.AI2026
Physics-Informed Causal MDPs for Sequential Constraint Repair in Engineering Simulation Pipelines
Chuhan Qiao
Off-policy learning in constrained MDPs with large binary state spaces faces a fundamental tension: causal identification of transition dynamics requires structural assumptions, wh…