3 papers
cs.LG2024
Hyperband-based Bayesian Optimization for Black-box Prompt Selection
Lennart Schneider, Martin Wistuba, Aaron Klein +3
Optimal prompt selection is crucial for maximizing large language model (LLM) performance on downstream tasks, especially in black-box settings where models are only accessible via…
cs.LG2024
Structural Pruning of Pre-trained Language Models via Neural Architecture Search
Aaron Klein, Jacek Golebiowski, Xingchen Ma +2
Pre-trained language models (PLM), for example BERT or RoBERTa, mark the state-of-the-art for natural language understanding task when fine-tuned on labeled data. However, their la…
cs.CL2023
Geographical Erasure in Language Generation
Pola Schwöbel, Jacek Golebiowski, Michele Donini +2
Large language models (LLMs) encode vast amounts of world knowledge. However, since these models are trained on large swaths of internet data, they are at risk of inordinately capt…