Multilingual Safety Signals Are Multi-Layered: Filtering Safety-Degrading Data for Safer LLMs
arXiv:2609.22144v1 Announce Type: new Abstract: Preserving safety alignment during large language models fine-tuning is critical, however, recent studies have demonstrated that even benign fine-tuning data may contain safety-degrading samples that silently undermine safety alignment. Existing appro…
Read the full story at arXiv cs.CL ↗
Timeline · 1 report
- 2026-09-22 04:00 · arXiv cs.CL
Multilingual Safety Signals Are Multi-Layered: Filtering Safety-Degrading Data for Safer LLMs