Unitary's unbiased-toxic-roberta Fixes the Bias Flaw Killing AI Moderation
A RoBERTa classifier from Unitary scores comments across seven toxicity and identity-attack labels while actively minimizing demographic bias during training.
Read the full story at AlphaSignal ↗
Timeline · 1 report
- 2026-10-01 09:25 · AlphaSignal
Unitary's unbiased-toxic-roberta Fixes the Bias Flaw Killing AI Moderation