Can we please have some error bars?
I am sure this gripe has been raised many times before, but every time a new model is released it seems like it's routinely only a few percentage points higher than previous models on benchmarks. How do we know this is even a "real" difference and not just within the window of measurement error or…
Read the full story at r/LocalLLaMA ↗
Timeline · 1 report
- 2026-10-06 16:10 · r/LocalLLaMA
Can we please have some error bars?