6 papers
DARC: Disagreement-Aware Alignment via Risk-Constrained Decoding
Mingxi Zou, Jiaxiang Chen, Junfan Li +4
Preference-based alignment methods (e.g., RLHF, DPO) typically optimize a single scalar objective, implicitly averaging over heterogeneous human preferences. In practice, systemati…
Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory
Mingxi Zou, Zhihan Guo, Langzhang Liang +6
Long-horizon language agents must operate under limited runtime memory, yet existing memory mechanisms often organize experience around descriptive criteria such as relevance, sali…
Guideline Forest: Retrieval-Augmented Reasoning with Branching Experience-Induced Guidelines
Jiaxiang Chen, Zhuo Wang, Mingxi Zou +2
Retrieval-augmented generation (RAG) has been widely adopted to ground large language models (LLMs) in external knowledge, yet it remains largely underexplored for improving reason…
FinEvo: From Isolated Backtests to Ecological Market Games for Multi-Agent Financial Strategy Evolution
Mingxi Zou, Jiaxiang Chen, Aotian Luo +4
Conventional financial strategy evaluation relies on isolated backtests in static environments. Such evaluations assess each policy independently, overlook correlations and interac…
FinHEAR: Human Expertise and Adaptive Risk-Aware Temporal Reasoning for Financial Decision-Making
Jiaxiang Chen, Mingxi Zou, Zhuo Wang +4
Financial decision-making presents unique challenges for language models, demanding temporal reasoning, adaptive risk assessment, and responsiveness to dynamic events. While large…
From Implicit Exploration to Structured Reasoning: Leveraging Guideline and Refinement for LLMs
Jiaxiang Chen, Zhuo Wang, Mingxi Zou +4
Large language models (LLMs) have advanced general-purpose reasoning, showing strong performance across diverse tasks. However, existing methods often rely on implicit exploration,…