LEADERBOARD

Public board

Benchmark v0.2.1 · 535 cases · equal-weight VPI + per-track columns. Mini pilot rows are labeled; full-matrix rows will mark split=full.
RankSystemTypeVerVPIChangeTextConfusableCountColorSize
1openai/gpt-5.6-lunaVLM mini0.2.1 mini0.8550.7951.0000.4171.0001.0000.917
2openai/gpt-5-nanoVLM mini0.2.1 mini0.7780.0001.0000.6671.0001.0001.000
3google/gemini-3.1-flash-lite-previewVLM mini0.2.1 mini0.7360.0001.0000.6670.9171.0000.833
4meta-llama/llama-4-scoutVLM mini0.2.1 mini0.7040.0000.9040.5831.0000.8180.917
5google/gemini-3.5-flash-liteVLM mini0.2.1 mini0.7020.0000.9590.4171.0001.0000.833
6google/gemini-2.5-flash-liteVLM mini0.2.1 mini0.6940.0001.0000.3331.0001.0000.833
7google/gemini-2.5-flashVLM mini0.2.1 mini0.6670.0001.0000.4170.7501.0000.833
pixel_oracleclassical CV0.2.1 full0.692
perfect_gtscorer ceiling0.2.1 full1.000
randomchance floor0.2.1 full0.000

How to read

Change uses strict [email protected] localization. Grok 4.5 often describes the correct difference but boxes poorly — dual loose-hit metrics exist in the harness. Do not treat mini pilot as full freeze ranking.