2 papers
cs.CR2025
Broken-Token: Filtering Obfuscated Prompts by Counting Characters-Per-Token
Shaked Zychlinski, Yuval Kainan
Large Language Models (LLMs) are susceptible to jailbreak attacks where malicious prompts are disguised using ciphers and character-level encodings to bypass safety guardrails. Whi…
cs.AI2025
Do Stop Me Now: Detecting Boilerplate Responses with a Single Iteration
Yuval Kainan, Shaked Zychlinski
Large Language Models (LLMs) often expend significant computational resources generating boilerplate responses, such as refusals, simple acknowledgements and casual greetings, whic…