How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense
arXiv:2610.11005v1 Announce Type: new Abstract: Safety-aligned language models often refuse a harmful request stated directly but answer the same request inside a role-play or narrative wrapper. We measure this vulnerability across languages and registers: attack success on Qwen3-1.7B is already 89…
Read the full story at arXiv cs.AI ↗
Timeline · 1 report
- 2026-10-09 04:00 · arXiv cs.AI
How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense