NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (65)

cs.CL2024

Efficient Continual Pre-training by Mitigating the Stability Gap

Yiduo Guo, Jie Fu, Huishuai Zhang +2

cs.CV2023

CoVLM: Composing Visual Entities and Relationships in Large Language Models Via Communicative Decoding

Junyan Li, Delin Chen, Yining Hong +4

cs.LG2019

Ordered Memory

Yikang Shen, Shawn Tan, Arian Hosseini +3

cs.CL2017

Self-organized Hierarchical Softmax

Yikang Shen, Shawn Tan, Chrisopher Pal +1

cs.LG2023

Hyper-Decision Transformer for Efficient Online Policy Adaptation

Mengdi Xu, Yuchen Lu, Yikang Shen +3

cs.AR2024

LaMAGIC: Language-Model-based Topology Generation for Analog Integrated Circuits

Chen-Chia Chang, Yikang Shen, Shaoze Fan +5

cs.AI2026

Finding the Minimal Parameter Budget for Implicit Reasoning: A Data Complexity Driven Scaling Law for Language Models

Xinyi Wang, Shawn Tan, Shenbo Xu +4

cs.CL2023

GraphText: Graph Reasoning in Text Space

Jianan Zhao, Le Zhuo, Yikang Shen +5

cs.CV2022

Mod-Squad: Designing Mixture of Experts As Modular Multi-Task Learners

Zitian Chen, Yikang Shen, Mingyu Ding +4

cs.LG2023

Planning with Large Language Models for Code Generation

Shun Zhang, Zhenfang Chen, Yikang Shen +3

cs.CL2018

Neural Language Modeling by Jointly Learning Syntax and Lexicon

Yikang Shen, Zhouhan Lin, Chin-Wei Huang +1

cs.LG2024

Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models

Bowen Pan, Yikang Shen, Haokun Liu +5

cs.CL2023

Transformer-Patcher: One Mistake worth One Neuron

Zeyu Huang, Yikang Shen, Xiaofeng Zhang +3

cs.CV2025

TextPSG: Panoptic Scene Graph Generation from Textual Descriptions

Chengyang Zhao, Yikang Shen, Zhenfang Chen +2

cs.DC2025

The infrastructure powering IBM's Gen AI model development

Talia Gershon, Seetharami Seelam, Brian Belgodere +143

cs.CL2019

Investigating Biases in Textual Entailment Datasets

Shawn Tan, Yikang Shen, Chin-wei Huang +1

cs.CL2018

Generating Contradictory, Neutral, and Entailing Sentences

Yikang Shen, Shawn Tan, Chin-Wei Huang +1

cs.CL2025

Synthetic Data RL: Task Definition Is All You Need

Yiduo Guo, Zhen Guo, Chuanwei Huang +5

cs.CL2024

Structured Code Representations Enable Data-Efficient Adaptation of Code Language Models

Mayank Agarwal, Yikang Shen, Bailin Wang +2

cs.CV2023

Aligning Large Multimodal Models with Factually Augmented RLHF

Zhiqing Sun, Sheng Shen, Shengcao Cao +9

cs.LG2025

Parallelizing Linear Transformers with the Delta Rule over Sequence Length

Songlin Yang, Bailin Wang, Yu Zhang +2

cs.LG2025

Compressed Decentralized Momentum Stochastic Gradient Methods for Nonconvex Optimization

Wei Liu, Anweshit Panda, Ujwal Pandey +6

cs.CV2023

An Efficient General-Purpose Modular Vision Model via Multi-Task Heterogeneous Training

Zitian Chen, Mingyu Ding, Yikang Shen +4

cs.LG2025

FlashFormer: Whole-Model Kernels for Efficient Low-Batch Inference

Aniruddha Nrusimha, William Brandon, Mayank Mishra +4

cs.GT2023

The Consensus Game: Language Model Generation via Equilibrium Search

Athul Paul Jacob, Yikang Shen, Gabriele Farina +1

cs.LG2024

Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision

Zhiqing Sun, Longhui Yu, Yikang Shen +4

cs.LG2025

LaMAGIC2: Advanced Circuit Formulations for Language Model-Based Analog Topology Generation

Chen-Chia Chang, Wan-Hsuan Lin, Yikang Shen +2

econ.TH2024

Getting the Agent to Wait

Maryam Saeedi, Yikang Shen, Ali Shourideh

cs.CL2019

Ordered Neurons: Integrating Tree Structures into Recurrent Neural Networks

Yikang Shen, Shawn Tan, Alessandro Sordoni +1

cs.AI2024

Scaling Granite Code Models to 128K Context

Matt Stallone, Vaibhav Saxena, Leonid Karlinsky +19

cs.CV2023

Visual Dependency Transformers: Dependency Tree Emerges from Reversed Attention

Mingyu Ding, Yikang Shen, Lijie Fan +5

cs.CL2020

Exploiting Syntactic Structure for Better Language Modeling: A Syntactic Distance Approach

Wenyu Du, Zhouhan Lin, Yikang Shen +3

cs.CL2021

StructFormer: Joint Unsupervised Induction of Dependency and Constituency Structure from Masked Language Modeling

Yikang Shen, Yi Tay, Che Zheng +3

cs.CL2024

Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler

Yikang Shen, Matthew Stallone, Mayank Mishra +6

cs.CL2018

Straight to the Tree: Constituency Parsing with Neural Syntactic Distance

Yikang Shen, Zhouhan Lin, Athul Paul Jacob +3

cs.CL2021

Explicitly Modeling Syntax in Language Models with Incremental Parsing and a Dynamic Oracle

Yikang Shen, Shawn Tan, Alessandro Sordoni +2

cs.CL2026

PaTH Attention: Position Encoding via Accumulating Householder Transformations

Songlin Yang, Yikang Shen, Kaiyue Wen +5

cs.LG2021

Learning Task Decomposition with Ordered Memory Policy Network

Yuchen Lu, Yikang Shen, Siyuan Zhou +3

cs.LG2024

Scattered Mixture-of-Experts Implementation

Shawn Tan, Yikang Shen, Rameswar Panda +1

cs.CL2024

JetMoE: Reaching Llama2 Performance with 0.1M Dollars

Yikang Shen, Zhen Guo, Tianle Cai +1

cs.LG2026

EXPLORE: Exploration with Guided Search for Analog Topology Generation using Language Models

Guanglei Zhou, Chen-Chia Chang, Yikang Shen +5

The paper introduces EXPLORE, a framework that combines transformer-based language model decoding with simulator-guided Monte Carlo Tree Search to improve the generation of analog…

#analog circuit design#topology generation#language models#monte carlo tree search
cs.LG2022

Prompting Decision Transformer for Few-Shot Policy Generalization

Mengdi Xu, Yikang Shen, Shun Zhang +4

cs.AR2026

DISCA: A Digital In-memory Stochastic Computing Architecture Using A Compressed Bent-Pyramid Format

Shady Agwa, Yikang Shen, Shiwei Wang +1

cs.LG2025

Scaling Stick-Breaking Attention: An Efficient Implementation and In-depth Study

Shawn Tan, Songlin Yang, Aaron Courville +2

cs.CL2023

Sparse Universal Transformer

Shawn Tan, Yikang Shen, Zhenfang Chen +2

cs.CL2025

API Pack: A Massive Multi-Programming Language Dataset for API Call Generation

Zhen Guo, Adriana Meza Soria, Wei Sun +2

cs.CL2020

Recursive Top-Down Production for Sentence Generation with Latent Trees

Shawn Tan, Yikang Shen, Timothy J. O'Donnell +2

cs.CL2016

Word Embedding based Correlation Model for Question/Answer Matching

Yikang Shen, Wenge Rong, Nan Jiang +3

cs.RO2023

Adaptive Online Replanning with Diffusion Models

Siyuan Zhou, Yilun Du, Shun Zhang +5

cs.CL2024

Stacking Your Transformers: A Closer Look at Model Growth for Efficient LLM Pre-Training

Wenyu Du, Tongxu Luo, Zihan Qiu +5

cs.CL2023

ModuleFormer: Modularity Emerges from Mixture-of-Experts

Yikang Shen, Zheyu Zhang, Tianyou Cao +3

cs.CV2023

See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning

Zhenfang Chen, Qinhong Zhou, Yikang Shen +3

cs.LG2022

Syntactic Inductive Biases for Deep Learning Methods

Yikang Shen

cs.CV2024

FlexAttention for Efficient High-Resolution Vision-Language Models

Junyan Li, Delin Chen, Tianle Cai +5

cs.AI2024

Granite Code Models: A Family of Open Foundation Models for Code Intelligence

Mayank Mishra, Matt Stallone, Gaoyuan Zhang +43

cs.CL2023

Autonomous Tree-search Ability of Large Language Models

Zheyu Zhang, Zhuorui Ye, Yikang Shen +1

cs.CL2022

Mixture of Attention Heads: Selecting Attention Heads Per Token

Xiaofeng Zhang, Yikang Shen, Zeyu Huang +3

cs.CL2024

Octo-planner: On-device Language Model for Planner-Action Agents

Wei Chen, Zhiyuan Li, Zhen Guo +1

cs.LG2024

Gated Linear Attention Transformers with Hardware-Efficient Training

Songlin Yang, Bailin Wang, Yikang Shen +2

cs.LG2024

Diversity Measurement and Subset Selection for Instruction Tuning Datasets

Peiqi Wang, Yikang Shen, Zhen Guo +4

cs.LG2024

Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble

Shun Zhang, Zhenfang Chen, Sunli Chen +3

cs.LG2023

Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision

Zhiqing Sun, Yikang Shen, Qinhong Zhou +5

cs.CL2024

SALMON: Self-Alignment with Instructable Reward Models

Zhiqing Sun, Yikang Shen, Hongxin Zhang +5

cs.CL2019

BanditSum: Extractive Summarization as a Contextual Bandit

Yue Dong, Yikang Shen, Eric Crawford +2

cs.LG2020

Long Range Arena: A Benchmark for Efficient Transformers

Yi Tay, Mostafa Dehghani, Samira Abnar +7