Showing cs.CLShow all
3 papers · 1 filter
cs.CL2026
INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models
Changyu Chen, Chenwei Lin, Xian Xu
Large Language Models (LLMs) have shown strong potential in financial reasoning, but existing benchmarks often evaluate domain knowledge, numerical reasoning, long-context understa…
cs.CL2026
Probing Outcome-Level Resemblance and Mechanism-Level Alignment in LLM Risk Decisions: Evidence from the St. Petersburg Game
Chensong Huang, Changyu Chen, Chenwei Lin +3
LLMs can appear cautious in risk decision-making tasks, yet cautious-looking outputs do not necessarily indicate alignment with human decision-making mechanisms. We investigate thi…
cs.CL2024
Uncovering Safety Risks of Large Language Models through Concept Activation Vector
Zhihao Xu, Ruixuan Huang, Changyu Chen +1
Despite careful safety alignment, current large language models (LLMs) remain vulnerable to various attacks. To further unveil the safety risks of LLMs, we introduce a Safety Conce…