NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (60)

cs.CV2026

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

Dujun Nie, Fengjiao Chen, Qi Lv +4

cs.MM2025

LongCat-Flash-Omni Technical Report

Meituan LongCat Team, Bairui Wang, Bayan +129

cs.CL2025

Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack

Peng Ding, Jun Kuang, Wen Sun +5

cs.AI2025

Understanding and Optimizing Agentic Workflows via Shapley value

Yingxuan Yang, Bo Huang, Siyuan Qi +14

cs.CV2025

Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content

Zicheng Zhang, Tengchuan Kou, Shushi Wang +9

cs.AI2026

AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents

Zhengkang Guo, Yiyang Li, Lin Qiu +7

cs.CL2025

UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models

Chen Chen, ZeYang Hu, Fengjiao Chen +6

cs.SE2026

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle

Hao Guan, Lingyue Fu, Shao Zhang +8

cs.CV2025

I2CR: Intra- and Inter-modal Collaborative Reflections for Multimodal Entity Linking

Ziyan Liu, Junwen Li, Kaiwen Li +6

cs.CV2023

Exchanging-based Multimodal Fusion with Transformer

Renyu Zhu, Chengcheng Han, Yong Qian +5

cs.SE2026

CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks

Lingyue Fu, Hao Guan, Bolun Zhang +10

cs.CL2026

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

Jiaming Wang, Zhe Tang, Zehao Jin +5

cs.AI2026

LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning

Jianing Wang, Jianfei Zhang, Qi Guo +24

cs.CV2025

EvalTalker: Learning to Evaluate Real-Portrait-Driven Multi-Subject Talking Humans

Yingjie Zhou, Xilei Zhu, Siyu Ren +11

cs.CL2025

Why Not Act on What You Know? Unleashing Safety Potential of LLMs via Self-Aware Guard Enhancement

Peng Ding, Jun Kuang, Zongyu Wang +4

cs.CL2025

KG-o1: Enhancing Multi-hop Question Answering in Large Language Models via Knowledge Graph Integration

Nan Wang, Yongqi Fan, yansha zhu +6

cs.AI2026

CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments

Lingyue Fu, Xin Ding, Linyue Pan +9

cs.SD2025

Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese

Xihuai Wang, Ziyi Zhao, Siyu Ren +9

cs.LG2024

Length Desensitization in Direct Preference Optimization

Wei Liu, Yang Bai, Chengcheng Han +5

cs.CV2026

LongCat-Next: Lexicalizing Modalities as Discrete Tokens

Meituan LongCat Team, Bin Xiao, Chao Wang +86

cs.IR2023

Adap-$τ$: Adaptively Modulating Embedding Magnitude for Recommendation

Jiawei Chen, Junkang Wu, Jiancan Wu +3

cs.IR2018

Collaborative Filtering with Graph-based Implicit Feedback

Minzhe Niu, Weinan Zhang, Yanru Qu +4

cs.AI2025

Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration

Shao Zhang, Xihuai Wang, Wenhao Zhang +10

cs.AI2026

DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

Jingxuan Han, Wei Liu, Mingyang Zhu +8

cs.CL2025

MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models

Siyu Yan, Long Zeng, Xuecheng Wu +6

cs.SE2026

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

Lingyue Fu, Bolun Zhang, Hao Guan +7

cs.CV2026

Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content

Shushi Wang, Zicheng Zhang, Chunyi Li +7

cs.CL2025

Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability

Jiaming wang, Yunke Zhao, Peng Ding +8

cs.CL2026

AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations

Cheng Jiayang, Dongyu Ru, Lin Qiu +4

cs.AI2025

OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics

Yaoming Zhu, Junxin Wang, Yiyang Li +8

cs.CV2026

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

Kaining Ying, Hengrui Hu, Siyu Ren +6

cs.AI2025

Introducing LongCat-Flash-Thinking: A Technical Report

Meituan LongCat Team, Anchun Gui, Bei Li +122

cs.LG2023

FFHR: Fully and Flexible Hyperbolic Representation for Knowledge Graph Completion

Wentao Shi, Junkang Wu, Xuezhi Cao +4

cs.AI2026

SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems

Linyue Pan, Yaoming Zhu, Lin Qiu +2

cs.CV2025

HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs

Zijian Zhang, Xuecheng Wu, Danlei Huang +3

cs.CV2025

TokenFocus-VQA: Enhancing Text-to-Image Alignment with Position-Aware Focus and Multi-Perspective Aggregations on LVLMs

Zijian Zhang, Xuhui Zheng, Xuecheng Wu +2

cs.LG2026

ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents

Xingjian Wu, Xuhang Zhu, Xingchen Liu +6

The paper introduces ClawTrack, a benchmark that evaluates both the final outcomes and the step-by-step reasoning processes of LLM-based autonomous agents across multiple dimension…

#large language models#autonomous agents#benchmarking#process evaluation
cs.IR2021

Popularity Bias Is Not Always Evil: Disentangling Benign and Harmful Bias for Recommendation

Zihao Zhao, Jiawei Chen, Sheng Zhou +4

cs.LG2025

Instance-level Randomization: Toward More Stable LLM Evaluations

Yiyang Li, Yonghuang Wu, Ying Luo +5

cs.CL2023

Entity-Aspect-Opinion-Sentiment Quadruple Extraction for Fine-grained Sentiment Analysis

Dan Ma, Jun Xu, Zongyu Wang +2

cs.CL2024

A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily

Peng Ding, Jun Kuang, Dan Ma +4

cs.CL2026

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

Wenxuan Jiang, Zining Fan, Zijian Zhang +6

cs.AI2026

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

Zhongyuan Peng, Dan Huang, Chuyu Zhang +8

cs.CV2024

Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs

Peng Ding, Jingyu Wu, Jun Kuang +6

cs.LG2026

Contrastive Reinforced Policy Optimization via Privileged Self-Distillation

Xingjian Wu, Junlin Liu, Xingchen Liu +6

The paper introduces Contrastive Reinforced Policy Optimization (CRPO), a method that frames on‑policy self‑distillation for large language models as a contrastive learning problem…

#reinforcement learning#self-distillation#contrastive learning#large language models
cs.SE2026

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

Xin Wang, Liangtai Sun, Yaoming Zhu +8

cs.CL2026

ATLAS: All-round Testing of Long-context Abilities across Scales

Deli Huang, Cunguang Wang, Hongyin Tang +15

cs.CL2026

General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks

Junlin Liu, Shengnan An, Shuang Zhou +10

cs.CL2026

TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learning

Wenxuan Jiang, Yuxin Zuo, Zijian Zhang +8

cs.AI2026

LongCat-Flash-Thinking-2601 Technical Report

Meituan LongCat Team, Anchun Gui, Bei Li +162

cs.AI2025

Making Mathematical Reasoning Adaptive

Zhejian Lai, Xiang Geng, Zhijun Wang +7

cs.CL2025

UniHetero: Could Generation Enhance Understanding for Vision-Language-Model at Large Data Scale?

Fengjiao Chen, Minhao Jing, Weitao Lu +3

cs.AI2025

R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?

Yi Lu, Jianing Wang, Linsen Guo +7

cs.AI2021

DisenKGAT: Knowledge Graph Embedding with Disentangled Graph Attention Network

Junkang Wu, Wentao Shi, Xuezhi Cao +5

cs.CL2023

Meta-Learning Triplet Network with Adaptive Margins for Few-Shot Named Entity Recognition

Chengcheng Han, Renyu Zhu, Jun Kuang +5

cs.CL2025

LongCat-Flash Technical Report

Meituan LongCat Team, Bayan, Bei Li +179

cs.CL2025

AMO-Bench: Large Language Models Still Struggle in High School Math Competitions

Shengnan An, Xunliang Cai, Xuezhi Cao +8

cs.SI2015

Revealing Multiple Layers of Hidden Community Structure in Networks

Kun He, Sucheta Soundarajan, Xuezhi Cao +2

cs.CV2025

NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment

Shuhao Han, Haotian Fan, Fangyuan Kong +112

cs.CR2018

A Machine Learning Approach To Prevent Malicious Calls Over Telephony Networks

Huichen Li, Xiaojun Xu, Chang Liu +6