Publications (70)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
Shuxun Wang, Qingyu Yin, Chak Tou Leong +2
Fact Check: Analyzing Financial Events from Multilingual News Sources
Linyi Yang, Tin Lok James Ng, Barry Smyth +1
ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning
Shulin Huang, Linyi Yang, Yan Song +9
A Rationale-centric Counterfactual Data Augmentation Method for Cross-Document Event Coreference Resolution
Bowen Ding, Qingkai Min, Shengkun Ma +3
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
Jun Wang, Meng Fang, Ziyu Wan +10
Learning to Generalize for Cross-domain QA
Yingjie Niu, Linyi Yang, Ruihai Dong +1
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
Kaijie Zhu, Jindong Wang, Jiaheng Zhou +8
Measuring Consistency in Text-based Financial Forecasting Models
Linyi Yang, Yingpeng Ma, Yue Zhang
Detoxifying Large Language Models via Knowledge Editing
Mengru Wang, Ningyu Zhang, Ziwen Xu +7
Towards Fine-grained Causal Reasoning and QA
Linyi Yang, Zhen Wang, Yuxiang Wu +2
Anchored Supervised Fine-Tuning
He Zhu, Junyou Su, Peng Lai +4
AMA: Adaptive Memory via Multi-Agent Collaboration
Weiquan Huang, Zixuan Wang, Hehai Lin +6
StatefulDiscovery: Evidence-Calibrated Claim Formation in Open-Ended Scientific Discovery
Jiayao Chen, Shi Liu, Linyi Yang
MCEval: A Dynamic Framework for Fair Multilingual Cultural Evaluation of LLMs
Shulin Huang, Linyi Yang, Yue Zhang
Exploring the Efficacy of Automatically Generated Counterfactuals for Sentiment Analysis
Linyi Yang, Jiazheng Li, Pádraig Cunningham +3
ReviewGuard: Aligning LLM-Assisted Peer Review with Long-Term Scientific Impact
Abdur Rasool, Xiaohui Huang, Yanqing Hu +1
Out-of-Distribution Generalization in Text Classification: Past, Present, and Future
Linyi Yang, Yaoxiao Song, Xuan Ren +6
Constrain Alignment with Sparse Autoencoders
Qingyu Yin, Chak Tou Leong, Minjun Zhu +7
How Likely Do LLMs with CoT Mimic Human Reasoning?
Guangsheng Bao, Hongbo Zhang, Cunxiang Wang +2
Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
Yuan Xin, Dingfan Chen, Linyi Yang +2
The $L_q$-weighted dual programming of the linear Chebyshev approximation and an interior-point method
Linyi Yang, Lei-Hong Zhang, Ya-Nan Zhang
A Survey on Evaluation of Large Language Models
Yupeng Chang, Xu Wang, Jindong Wang +13
Personality Alignment of Large Language Models
Minjun Zhu, Yixuan Weng, Linyi Yang +1
GLUE-X: Evaluating Natural Language Understanding Models from an Out-of-distribution Generalization Perspective
Linyi Yang, Shuibai Zhang, Libo Qin +6
MemPot: Defending Against Memory Extraction Attack with Optimized Honeypots
Yuhao Wang, Shengfang Zhai, Guanghao Jin +3
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
Qiujie Xie, Qingqiu Li, Zhuohao Yu +3
Generating Plausible Counterfactual Explanations for Deep Transformers in Financial Text Classification
Linyi Yang, Eoin M. Kenny, Tin Lok James Ng +3
FactMix: Using a Few Labeled In-domain Examples to Generalize to Cross-domain Named Entity Recognition
Linyi Yang, Lifan Yuan, Leyang Cui +2
Human-in-the-loop Robotic Grasping using BERT Scene Representation
Yaoxian Song, Penglei Sun, Pengfei Fang +3
Probing the "Psyche'' of Large Reasoning Models: Understanding Through a Human Lens
Yuxiang Chen, Zuohan Wu, Ziwei Wang +6
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
Hongbo Zhang, Han Cui, Guangsheng Bao +3
CAP: Data Contamination Detection via Consistency Amplification
Yi Zhao, Jing Li, Linyi Yang
Deep Research Agents: A Systematic Examination And Roadmap
Yuxuan Huang, Yihang Chen, Haozheng Zhang +10
Challenges for Open-domain Targeted Sentiment Analysis
Yun Luo, Hongjie Cai, Linyi Yang +3
A Rationale-Centric Framework for Human-in-the-loop Machine Learning
Jinghui Lu, Linyi Yang, Brian Mac Namee +1
CreativeBench: Benchmarking and Enhancing Machine Creativity via Self-Evolving Challenges
Zi-Han Wang, Lam Nguyen, Zhengyang Zhao +4
Masked conditional variational autoencoders for chromosome straightening
Jingxiong Li, Sunyi Zheng, Zhongyi Shui +9
MAGE: Machine-generated Text Detection in the Wild
Yafu Li, Qintong Li, Leyang Cui +6
Notes2Skills: From Lab Notebooks to Certainty-Aware Scientific Agent Skills
Shi Liu, Jiayao Chen, Chengwei Qin +3
DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process
Minjun Zhu, Yixuan Weng, Linyi Yang +1
Pre-Training a Graph Recurrent Network for Language Representation
Yile Wang, Linyi Yang, Zhiyang Teng +2
Human Simulacra: Benchmarking the Personification of Large Language Models
Qiuejie Xie, Qiming Feng, Tianqi Zhang +7
A convex dual problem for the rational minimax approximation and Lawson's iteration
Lei-Hong Zhang, Linyi Yang, Wei Hong Yang +1
Interactive Learning for LLM Reasoning
Hehai Lin, Shilei Cao, Sudong Wang +5
CycleResearcher: Improving Automated Research via Automated Review
Yixuan Weng, Minjun Zhu, Guangsheng Bao +4
Causal Sufficiency and Necessity Improves Chain-of-Thought Reasoning
Xiangning Yu, Zhuohan Wang, Linyi Yang +5
PreAct-Bench: Benchmarking Predictive Monitoring in LLMs
Hainiu Xu, Italo Luis da Silva, Jiangnan Ye +7
Multivariate confluent Vandermonde with G-Arnoldi and applications
Lei-Hong Zhang, Ya-Nan Zhang, Linyi Yang +1
PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization
Yidong Wang, Zhuohao Yu, Zhengran Zeng +10
How Far Are AI Scientists from Changing the World?
Qiujie Xie, Yixuan Weng, Minjun Zhu +9
On the Robustness of ChatGPT: An Adversarial and Out-of-distribution Perspective
Jindong Wang, Xixu Hu, Wenxin Hou +10
AI Scientists Fail Without Strong Implementation Capability
Minjun Zhu, Qiujie Xie, Yixuan Weng +4
See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm
Haoyu Zhao, Weizhong Ding, Yuhao Yang +4
League: Leaderboard Generation on Demand
Jian Wu, Jiayu Zhang, Dongyuan Li +5
Locking Down the Finetuned LLMs Safety
Minjun Zhu, Linyi Yang, Yifan Wei +2
GenDec: A robust generative Question-decomposition method for Multi-hop reasoning
Jian Wu, Linyi Yang, Yuliang Ji +3
USB: A Unified Semi-supervised Learning Benchmark for Classification
Yidong Wang, Hao Chen, Yue Fan +19
Explainable Text-Driven Neural Network for Stock Prediction
Linyi Yang, Zheng Zhang, Su Xiong +4
ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents
Linyi Yang, Yixuan Weng
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
Qingyu Yin, Chak Tou Leong, Linyi Yang +7
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
Huichi Zhou, Yihang Chen, Siyuan Guo +8
Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature
Guangsheng Bao, Yanbin Zhao, Zhiyang Teng +2
Supervised Knowledge Makes Large Language Models Better In-context Learners
Linyi Yang, Shuibai Zhang, Zhuohao Yu +8
Exploiting Rich Textual User-Product Context for Improving Sentiment Analysis
Chenyang Lyu, Linyi Yang, Yue Zhang +2
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
Ziyu Wan, Yunxiang Li, Xiaoyu Wen +8
SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts
Yuan Xin, Yixuan Weng, Minjun Zhu +5
NumHTML: Numeric-Oriented Hierarchical Transformer Model for Multi-task Financial Forecasting
Linyi Yang, Jiazheng Li, Ruihai Dong +2
CulturePark: Boosting Cross-cultural Understanding in Large Language Models
Cheng Li, Damien Teney, Linyi Yang +3
Survey on Factuality in Large Language Models: Knowledge, Retrieval and Domain-Specificity
Cunxiang Wang, Xiaoze Liu, Yuanhao Yue +13
Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark
Jian Wu, Linyi Yang, Zhen Wang +2