PipelineScore
Live Leaderboard

13 models compared.

Best run per model. Click any column to re-rank, filter by provider, re-weight for your use case, and pick two rows to go head-to-head.

Weighting
13 models · sorted by Balanced composite (high → low) · pick any two rows to compare
#vsModelPipelineScore Tier
1openai/gpt-oss-20blocal
93.2
TRUNK
2gpt-oss:latestlocal
91.6
TRUNK
3qwen3.6-35b-a3blocal
87.5
MAINLINE
4qwen3-coder:30blocal
86.6
MAINLINE
5qwen3.8:27blocal
86.2
MAINLINE
6qwen3.8-27b@iq3_xxslocal
84.2
MAINLINE
7mlx-community/Qwen3.6-35B-A3B-4bitlocal
83.7
MAINLINE
8/home/thomaskyn/models/Qwen3.6-35B-A3B/Qwen3.6-35B-A3B-UD-IQ3_S.gguflocal
80.9
MAINLINE
9gemma4:12b-it-qat_gpulocal
80.9
MAINLINE
10qwen/qwen3.6-35b-a3blocal
79.3
MAINLINE
11qwen2.5-coder:7blocal
77.7
MAINLINE
12/home/thomaskyn/models/Qwen3.5-4b/Qwen3.5-4B-Q4_K_M.gguflocal
57.8
TAP
13/home/thomaskyn/models/Qwen3.5-9b/Qwen3.5-9B-Q4_K_M.gguflocal
50.5
TAP
vs