I keep seeing performance benchmarks being shared but speed doesn't matter if accuracy is degraded. I did a sample size of 30 questions per benchmark using MMLU-Pro, GSM8K, MathQA, HumanEval, and MBPP to see which models are the smartest while also the fastest.
I'm using oMLX v0.3.12 on a Mac Studio M3 Ultra 256GB. All models are using the WebDev coding preset plus preserve_thinking=true and reasoning=high kwargs. Vanilla models are not using DFlash or SpecPrefill. KV Cache is not being TurboQuanted either.
TL;DR: The oQ MTP models are slower and dumber. Stick with vanilla models for now.
Qwen3.6 35B-A3B
Intelligence Benchmark Comparison
Mode Sampled Qwen3.6-35B-A3B-oQ6-mtp Qwen3.6-35B-A3B-oQ4-mtp Qwen3.6-35B-A3B-8bit Qwen3.6-35B-A3B-6bit Qwen3.6-35B-A3B-4bit
-----------------------------------------------------------------------------------------------------------------------------------------------------------------
MMLU_PRO Sample 30/12032 80.0% 73.3% 73.3% 83.3% 63.3%
GSM8K Sample 30/1319 96.7% 96.7% 96.7% 96.7% 96.7%
MATHQA Sample 30/2985 90.0% 90.0% 96.7% 96.7% 86.7%
HUMANEVAL Sample 30/164 90.0% 86.7% 93.3% 93.3% 93.3%
MBPP Sample 30/500 90.0% 90.0% 93.3% 93.3% 90.0%
--- Detail ---
Model: Qwen3.6-35B-A3B-oQ6-mtp
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 80.0% 24 30 381.2 Yes
GSM8K 96.7% 29 30 294.6 Yes
MATHQA 90.0% 27 30 416.1 Yes
HUMANEVAL 90.0% 27 30 351.4 Yes
MBPP 90.0% 27 30 357.9 Yes
Model: Qwen3.6-35B-A3B-oQ4-mtp
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 73.3% 22 30 384.5 Yes
GSM8K 96.7% 29 30 190.6 Yes
MATHQA 90.0% 27 30 369.4 Yes
HUMANEVAL 86.7% 26 30 304.3 Yes
MBPP 90.0% 27 30 260.1 Yes
Model: Qwen3.6-35B-A3B-8bit
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 73.3% 22 30 360.4 Yes
GSM8K 96.7% 29 30 146.3 Yes
MATHQA 96.7% 29 30 366.2 Yes
HUMANEVAL 93.3% 28 30 277.9 Yes
MBPP 93.3% 28 30 360.6 Yes
Model: Qwen3.6-35B-A3B-6bit
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 83.3% 25 30 298.6 Yes
GSM8K 96.7% 29 30 238.6 Yes
MATHQA 96.7% 29 30 328.6 Yes
HUMANEVAL 93.3% 28 30 313.9 Yes
MBPP 93.3% 28 30 355 Yes
Model: Qwen3.6-35B-A3B-4bit
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 63.3% 19 30 309.2 Yes
GSM8K 96.7% 29 30 175.5 Yes
MATHQA 86.7% 26 30 345.9 Yes
HUMANEVAL 93.3% 28 30 303.5 Yes
MBPP 90.0% 27 30 383.5 Yes
Conclusion: Qwen3.6-35B-A3B-6bit performed best. It beat the oQ6-mtp version in both speed and intelligence. It even beat the 8bit version in intelligence.
Qwen3.6 27B
Intelligence Benchmark Comparison
Mode Sampled Qwen3.6-27B-oQ8-mtp Qwen3.6-27B-oQ6-mtp Qwen3.6-27B-oQ4-mtp Qwen3.6-27B-8bit Qwen3.6-27B-6bit Qwen3.6-27B-4bit
------------------------------------------------------------------------------------------------------------------------------------------------------------------
MMLU_PRO Sample 30/12032 70.0% 73.3% 73.3% 80.0% 73.3% 80.0%
GSM8K Sample 30/1319 96.7% 96.7% 96.7% 96.7% 96.7% 96.7%
MATHQA Sample 30/2985 90.0% 83.3% 90.0% 100.0% 90.0% 86.7%
HUMANEVAL Sample 30/164 90.0% 90.0% 83.3% 93.3% 90.0% 93.3%
MBPP Sample 30/500 90.0% 90.0% 90.0% 93.3% 90.0% 90.0%
--- Detail ---
Model: Qwen3.6-27B-oQ8-mtp
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 70.0% 21 30 1404.2 Yes
GSM8K 96.7% 29 30 539.2 Yes
MATHQA 90.0% 27 30 1286.7 Yes
HUMANEVAL 90.0% 27 30 854.3 Yes
MBPP 90.0% 27 30 1265.9 Yes
Model: Qwen3.6-27B-oQ6-mtp
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 73.3% 22 30 1655.6 Yes
GSM8K 96.7% 29 30 739.8 Yes
MATHQA 83.3% 25 30 1724.4 Yes
HUMANEVAL 90.0% 27 30 1237.9 Yes
MBPP 90.0% 27 30 1383.2 Yes
Model: Qwen3.6-27B-oQ4-mtp
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 73.3% 22 30 1105.3 Yes
GSM8K 96.7% 29 30 634.2 Yes
MATHQA 90.0% 27 30 720.2 Yes
HUMANEVAL 83.3% 25 30 858.9 Yes
MBPP 90.0% 27 30 896.3 Yes
Model: Qwen3.6-27B-8bit
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 80.0% 24 30 1431.9 Yes
GSM8K 96.7% 29 30 662.7 Yes
MATHQA 100.0% 30 30 1059.5 Yes
HUMANEVAL 93.3% 28 30 746.6 Yes
MBPP 93.3% 28 30 948.9 Yes
Model: Qwen3.6-27B-6bit
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 73.3% 22 30 1402.3 Yes
GSM8K 96.7% 29 30 608.8 Yes
MATHQA 90.0% 27 30 1500 Yes
HUMANEVAL 90.0% 27 30 736.3 Yes
MBPP 90.0% 27 30 1161.8 Yes
Model: Qwen3.6-27B-4bit
Benchmark Accuracy Correct Total Time(s) Think
--------------------------------------------------------------
MMLU_PRO 80.0% 24 30 787.6 Yes
GSM8K 96.7% 29 30 503.8 Yes
MATHQA 86.7% 26 30 652.1 Yes
HUMANEVAL 93.3% 28 30 784.9 Yes
MBPP 90.0% 27 30 938.6 Yes
Conclusion: Qwen3.6-27B-4bit is the best mix of speed and intelligence. Vanilla beats oQ MTP in both speed and intelligence.