1 paper · 1 filter
Bohdan Turbal, Blossom Metevier, Max Springer +1
Adversarial attacks on large language models have limited practical impact despite extensive research. Optimization-based attacks such as Greedy Coordinate Gradient (GCG) (Zou et a…