Tokka-Bench: Evaluating Tokenizers Across 100 Natural and 20 Programming Languages
arXiv:2610.08794v1 Announce Type: new Abstract: Large language models rely on subword tokenizers whose quality varies across languages, yet no standardized multi-metric framework exists for broad comparative evaluation. We introduce Tokka-Bench, an open-source framework that evaluates tokenizers on…
Read the full story at arXiv cs.CL ↗
Timeline · 1 report
- 2026-10-08 04:00 · arXiv cs.CL
Tokka-Bench: Evaluating Tokenizers Across 100 Natural and 20 Programming Languages