Independent analysis of AI. Compare models by intelligence, speed, and price.
| Select | Model ↕ | Creator ↕ | Context Window ↕ | Intelligence ↓ⓘ | Price ($/M) ↕ⓘ | Speed (Tokens/s) ↕ | Latency (First Chunk s) ↕ | End-to-End Response (s) ↕ |
|---|---|---|---|---|---|---|---|---|
Claude Opus 5.5 (max with fallback) claude-opus-5-5-max-with-fallback | 1M | 58.00 | $5.98/M | — | — | — | ||
Claude Opus 5.5 (xhigh with fallback) claude-opus-5-5-xhigh-with-fallback | 1M | 56.00 | $3.46/M | 91 tok/s | 137.63 s | 143.10 s | ||
Claude Opus 5.5 (high with fallback) claude-opus-5-5-high-with-fallback | 1M | 54.00 | $1.82/M | 84 tok/s | 28.34 s | 34.27 s | ||
Claude Fable 5.1 (max with fallback) claude-fable-5-1-max-with-fallback | 1M | 53.00 | $7.63/M | 69 tok/s | 246.00 s | 253.22 s | ||
Claude Fable 5.1 (xhigh with fallback) claude-fable-5-1-xhigh-with-fallback | 1M | 53.00 | $5.98/M | 66 tok/s | 122.00 s | 129.61 s | ||
GPT-6 Astra (max) gpt-6-astra-max | 1M | 53.00 | $3.26/M | 58 tok/s | 332.03 s | 340.62 s | ||
GPT-6 Astra (xhigh) gpt-6-astra-xhigh | 1M | 52.00 | $2.31/M | 58 tok/s | 108.27 s | 116.94 s | ||
Claude Opus 5.5 (medium with fallback) claude-opus-5-5-medium-with-fallback | 1M | 51.00 | $1.34/M | 83 tok/s | 12.73 s | 18.78 s | ||
Claude Fable 5.1 (high with fallback) claude-fable-5-1-high-with-fallback | 1M | 51.00 | $3.91/M | 59 tok/s | 12.40 s | 20.90 s | ||
GPT-6 Astra (high) gpt-6-astra-high | 1M | 51.00 | $1.73/M | 57 tok/s | 36.80 s | 45.54 s | ||
GPT-6 Astra (medium) gpt-6-astra-medium | 1M | 50.00 | $1.54/M | 55 tok/s | 5.50 s | 14.54 s | ||
Claude Fable 5.1 (medium with fallback) claude-fable-5-1-medium-with-fallback | 1M | 49.00 | $2.98/M | 59 tok/s | 7.84 s | 16.38 s | ||
Muse Spark 1.3 (max) muse-spark-1-3-max | 1M | 48.00 | $1.60/M | 214 tok/s | 24.72 s | 36.38 s | ||
GPT-6 Sol (max) gpt-6-sol-max | 872k | 48.00 | $1.06/M | 85 tok/s | 162.55 s | 168.47 s | ||
Claude Fable 5.1 (low with fallback) claude-fable-5-1-low-with-fallback | 1M | 47.00 | $2.37/M | 59 tok/s | 7.34 s | 15.79 s | ||
Grok 4.7 (xhigh) grok-4-7-xhigh | SpaceXAI | 500k | 46.00 | $3.74/M | 49 tok/s | 2.41 s | 12.65 s | |
Grok 4.7 (high) grok-4-7-high | SpaceXAI | 500k | 46.00 | $2.73/M | 65 tok/s | 1.77 s | 9.48 s | |
MiMo-V2.6-Pro mimo-v2-6-pro | Xiaomi | 1M | 46.00 | $0.13/M | 45 tok/s | 3.38 s | 59.36 s | |
GPT-6 Astra (low) gpt-6-astra-low | 1M | 46.00 | $0.82/M | 55 tok/s | 3.07 s | 12.15 s | ||
Qwen3.8 Max (0902) qwen3-8-max-0902 | 984k | 45.00 | $5.41/M | 40 tok/s | 3.01 s | 65.99 s | ||
Muse Spark 1.3 (xhigh) muse-spark-1-3-xhigh | 1M | 45.00 | $1.37/M | 232 tok/s | 21.81 s | 32.59 s | ||
GLM-5.3 (max) glm-5-3-max | Z AI | 1M | 45.00 | $2.01/M | 71 tok/s | 3.30 s | 38.29 s | |
Grok 4.6 (high) grok-4-6-high | SpaceXAI | 500k | 44.00 | $1.86/M | 66 tok/s | 39.41 s | 46.99 s | |
Grok 4.6 (xhigh) grok-4-6-xhigh | SpaceXAI | 500k | 44.00 | $2.32/M | 72 tok/s | 37.01 s | 43.96 s | |
GPT-6 Sol (xhigh) gpt-6-sol-xhigh | 872k | 44.00 | $0.53/M | 85 tok/s | 31.71 s | 37.59 s | ||
Step 5 Preview step-5-preview | StepFun | 1M | 44.00 | $0.72/M | 77 tok/s | 3.00 s | 35.55 s | |
Kimi K3 (max) kimi-k3-max | Kimi | 1.1M | 44.00 | $2.00/M | 35 tok/s | 4.18 s | 75.37 s | |
Grok 4.6 (medium) grok-4-6-medium | SpaceXAI | 500k | 43.00 | $1.50/M | 68 tok/s | 22.33 s | 29.65 s | |
GPT-6 Sol (high) gpt-6-sol-high | 872k | 43.00 | $0.37/M | 83 tok/s | 9.21 s | 15.22 s | ||
Claude Opus 5.5 (low with fallback) claude-opus-5-5-low-with-fallback | 1M | 42.00 | $0.55/M | 85 tok/s | 5.60 s | 11.47 s | ||
GPT-5.6 Terra (max) gpt-5-6-terra-max | 1M | 42.00 | $1.40/M | 100 tok/s | 166.45 s | 171.47 s | ||
GLM-5.3-Flash glm-5-3-flash | Z AI | 1M | 42.00 | $0.25/M | 44 tok/s | 3.39 s | 60.43 s | |
Gemini 3.8 Flash (high) gemini-3-8-flash-high | 1M | 41.00 | $1.24/M | 330 tok/s | 22.57 s | 24.09 s | ||
Qwen3.8 2.4T A95B qwen3-8-2-4t-a95b | 984k | 40.00 | $2.16/M | 40 tok/s | 2.73 s | 65.80 s | ||
Qwen3.8-Flash-Next qwen3-8-flash-next | 256k | 40.00 | $0.37/M | 55 tok/s | 2.78 s | 48.26 s | ||
GPT-6 Sol (medium) gpt-6-sol-medium | 872k | 40.00 | $0.25/M | — | — | — | ||
Gemini 3.8 Flash (medium) gemini-3-8-flash-medium | 1M | 40.00 | $0.93/M | — | — | — | ||
DeepSeek V4.1 Flash (max) deepseek-v4-1-flash-max | 1M | 39.00 | $0.27/M | 237 tok/s | 0.99 s | 11.54 s | ||
Claude Sonnet 5 (max) claude-sonnet-5-max | 1M | 38.00 | $5.09/M | 80 tok/s | 140.85 s | 147.09 s | ||
GPT-5.6 Terra (xhigh) gpt-5-6-terra-xhigh | 1M | 38.00 | $0.63/M | 82 tok/s | 28.30 s | 34.40 s | ||
GPT-6 Luna (max) gpt-6-luna-max | 1M | 37.00 | $0.07/M | 144 tok/s | 122.30 s | 125.78 s | ||
DeepSeek V4 Pro 0813 (max) deepseek-v4-pro-0813-max | 1M | 36.00 | $0.67/M | 90 tok/s | 1.69 s | 29.33 s | ||
Grok 4.6 (low) grok-4-6-low | SpaceXAI | 500k | 35.00 | $0.48/M | 57 tok/s | 6.99 s | 15.70 s | |
DeepSeek V4 Flash Vision (max) deepseek-v4-flash-vision-max | 1M | 35.00 | $0.31/M | 220 tok/s | 0.89 s | 12.27 s | ||
Kimi K3 (low) kimi-k3-low | Kimi | 1.1M | 34.00 | — | 38 tok/s | 3.70 s | 69.51 s | |
Claude Sonnet 5 (xhigh) claude-sonnet-5-xhigh | 1M | 34.00 | $2.87/M | 74 tok/s | 15.50 s | 22.27 s | ||
GLM-5.3 (low) glm-5-3-low | Z AI | 1M | 34.00 | $0.85/M | 85 tok/s | 2.78 s | 32.10 s | |
GPT-5.6 Terra (high) gpt-5-6-terra-high | 1M | 34.00 | $0.34/M | 83 tok/s | 3.36 s | 9.40 s | ||
GPT-6 Sol (low) gpt-6-sol-low | 872k | 34.00 | $0.13/M | 82 tok/s | 1.98 s | 8.08 s | ||
GPT-6 Luna (xhigh) gpt-6-luna-xhigh | 1M | 34.00 | $0.04/M | 137 tok/s | 18.38 s | 22.04 s | ||
Qwen3.8 27B (xhigh) qwen3-8-27b-xhigh | 256k | 34.00 | $1.01/M | 44 tok/s | 3.90 s | 60.90 s | ||
Motif 3 motif-3 | Motif Technologies | 262k | 34.00 | — | — | — | — | |
Gemini 3.8 Flash (low) gemini-3-8-flash-low | 1M | 33.00 | — | — | — | — | ||
GPT-5.3 Codex (xhigh) gpt-5-3-codex-xhigh | 400k | 33.00 | — | 120 tok/s | 71.64 s | 75.80 s | ||
Motif 3 (Beta) motif-3-beta | Motif Technologies | 262k | 32.00 | — | — | — | — | |
GPT-6 Luna (high) gpt-6-luna-high | 1M | 32.00 | $0.03/M | 135 tok/s | 7.03 s | 10.75 s | ||
Claude Sonnet 5 (high) claude-sonnet-5-high | 1M | 32.00 | $1.79/M | 70 tok/s | 6.92 s | 14.01 s | ||
K2 Horizon 375B A23B k2-horizon-375b-a23b | Institute of Foundation Models | 524k | 31.00 | — | — | — | — | |
GPT-5.6 Terra (medium) gpt-5-6-terra-medium | 1M | 30.00 | $0.18/M | 83 tok/s | 2.14 s | 8.15 s | ||
Gemini 3.1 Pro Preview gemini-3-1-pro-preview | 1M | 30.00 | $0.67/M | 120 tok/s | 27.65 s | 31.81 s | ||
GPT-6 Luna (medium) gpt-6-luna-medium | 1M | 29.00 | $0.02/M | — | — | — | ||
MiniMax-M3 minimax-m3 | MiniMax | 1M | 29.00 | $0.51/M | 184 tok/s | 1.01 s | 14.64 s | |
Nex-N2-Pro nex-n2-pro | Nex AGI | 262k | 28.00 | — | — | — | — | |
Solar Pro 4 solar-pro-4 | Upstage | 512k | 28.00 | — | 91 tok/s | 1.91 s | 29.48 s | |
GPT-6 Sol (Non-reasoning) gpt-6-sol-non-reasoning | 872k | 28.00 | $0.33/M | 76 tok/s | 1.13 s | 7.73 s | ||
Claude Sonnet 5 (medium) claude-sonnet-5-medium | 1M | 28.00 | $1.00/M | 70 tok/s | 2.90 s | 10.00 s | ||
Inkling Small inkling-small | Thinking Machines | 1M | 28.00 | — | 208 tok/s | 2.59 s | 14.63 s | |
Qwen3.8 27B (medium) qwen3-8-27b-medium | 256k | 28.00 | $1.13/M | 53 tok/s | 3.79 s | 50.82 s | ||
GPT-5.6 Terra (low) gpt-5-6-terra-low | 1M | 27.00 | $0.14/M | 85 tok/s | 1.70 s | 7.59 s | ||
JT-4.1 Flash 236B A21B jt-4-1-flash-236b-a21b | China Mobile | 256k | 27.00 | — | — | — | — | |
Quasar 438B (max) quasar-438b-max | Multiverse Computing | 1M | 27.00 | $2.02/M | 153 tok/s | 1.14 s | 17.46 s | |
Apodex 1.1 apodex-1-1 | Apodex | 256k | 26.00 | $0.46/M | — | — | — | |
Qwen3.8 27B (low) qwen3-8-27b-low | 256k | 26.00 | $1.05/M | 53 tok/s | 3.81 s | 50.87 s | ||
GPT-5.5 Instant (June 2026) gpt-5-5-instant-june-2026 | 400k | 26.00 | $0.69/M | 156 tok/s | 1.00 s | 17.06 s | ||
MiMo-V2.5-Pro mimo-v2-5-pro | Xiaomi | 1M | 26.00 | $0.05/M | 45 tok/s | 4.49 s | 59.57 s | |
Kimi K2.7 Code kimi-k2-7-code | Kimi | 256k | 26.00 | $0.54/M | 68 tok/s | 2.95 s | 43.23 s | |
K2 Horizon MoVA 36B A4B k2-horizon-mova-36b-a4b | Institute of Foundation Models | 524k | 25.00 | — | — | — | — | |
Hy3 hy3 | Tencent | 256k | 25.00 | $0.07/M | 90 tok/s | 2.99 s | 30.87 s | |
MiMo-V2.5 mimo-v2-5 | Xiaomi | 1M | 25.00 | — | 48 tok/s | 5.65 s | 58.16 s | |
Qwen3.7 Plus qwen3-7-plus | 1M | 25.00 | $0.30/M | 73 tok/s | 2.23 s | 36.27 s | ||
Inkling inkling | Thinking Machines | 1M | 25.00 | $0.61/M | 167 tok/s | 1.87 s | 16.83 s | |
Ling 3.0 Flash ling-3-0-flash | InclusionAI | 262k | 25.00 | — | 363 tok/s | 2.57 s | 9.46 s | |
Solar Open2 250B solar-open2-250b | Upstage | 1.1M | 25.00 | — | — | — | — | |
DeepSeek V4.1 Flash (Non-reasoning) deepseek-v4-1-flash-non-reasoning | 1M | 25.00 | $0.15/M | 274 tok/s | 1.19 s | 3.01 s | ||
Ling-3.0-flash-VL ling-3-0-flash-vl | InclusionAI | 262k | 25.00 | — | 146 tok/s | 1.80 s | 18.87 s | |
Claude Sonnet 5 (low) claude-sonnet-5-low | 1M | 24.00 | $0.51/M | 65 tok/s | 1.56 s | 9.29 s | ||
Claude Sonnet 5 (Non-reasoning) claude-sonnet-5-non-reasoning | 1M | 23.00 | — | 65 tok/s | 1.69 s | 9.36 s | ||
Nemotron 3 Ultra nemotron-3-ultra | NVIDIA | 262k | 23.00 | $0.55/M | 157 tok/s | 1.58 s | 19.31 s | |
A.X-K2 a-x-k2 | SK Telecom | 262k | 23.00 | — | — | — | — | |
Ling-3.0-flash-Fin ling-3-0-flash-fin | InclusionAI | 262k | 23.00 | — | 159 tok/s | 1.71 s | 17.39 s | |
MiMo-V2-Flash (Feb 2026) mimo-v2-flash-feb-2026 | Xiaomi | 256k | 22.00 | — | — | — | — | |
Gemini 3.5 Flash-Lite gemini-3-5-flash-lite | 1M | 22.00 | $0.12/M | 349 tok/s | 9.13 s | 10.57 s | ||
G9v3-39A5B g9v3-39a5b | AI9Stars | 131k | 22.00 | — | — | — | — | |
KAT-Coder-Pro V2 kat-coder-pro-v2 | KwaiKAT | 256k | 22.00 | — | — | — | — | |
Qwen3.5 397B A17B (Non-reasoning) qwen3-5-397b-a17b-non-reasoning | 262k | 21.00 | — | 87 tok/s | 2.21 s | 7.95 s | ||
GPT-6 Luna (low) gpt-6-luna-low | 1M | 21.00 | $0.00/M | 127 tok/s | 2.12 s | 6.06 s | ||
GPT-5.6 Terra (Non-reasoning) gpt-5-6-terra-non-reasoning | 1M | 21.00 | $0.14/M | 85 tok/s | 0.91 s | 6.79 s | ||
K2 Horizon 7B k2-horizon-7b | Institute of Foundation Models | 524k | 21.00 | — | — | — | — | |
Qwen3.5 Omni Plus qwen3-5-omni-plus | 256k | 20.00 | — | 107 tok/s | 2.11 s | 6.79 s | ||
o3 o3 | 200k | 20.00 | — | 119 tok/s | 6.11 s | 10.33 s | ||
Qwen3.8 27B qwen3-8-27b | 256k | 20.00 | $2.49/M | 52 tok/s | 3.83 s | 13.39 s | ||
K-EXAONE 2.0 k-exaone-2-0 | LG AI Research | 262k | 20.00 | — | — | — | — | |
Step 3.7 Flash step-3-7-flash | StepFun | 262k | 19.00 | — | 193 tok/s | 2.51 s | 15.46 s | |
LongCat 2.0 longcat-2-0 | LongCat | 1M | 19.00 | $0.06/M | — | — | — | |
Gemma 4 31B gemma-4-31b | 256k | 19.00 | — | 35 tok/s | 1.02 s | 64.42 s | ||
JT-35B-Flash jt-35b-flash | China Mobile | 256k | 19.00 | — | — | — | — | |
Qwen3.5 397B A17B qwen3-5-397b-a17b | 262k | 18.00 | $0.47/M | 91 tok/s | 2.20 s | 42.62 s | ||
MiMo-V2.5-Pro (Non-reasoning) mimo-v2-5-pro-non-reasoning | Xiaomi | 1M | 18.00 | — | 36 tok/s | 2.95 s | 16.96 s | |
GPT-6 Luna (Non-reasoning) gpt-6-luna-non-reasoning | 1M | 18.00 | $0.01/M | 123 tok/s | 0.89 s | 4.95 s | ||
Qwen3.6 35B A3B qwen3-6-35b-a3b | 262k | 18.00 | $0.48/M | 128 tok/s | 2.08 s | 48.18 s | ||
Qwen3.5 122B A10B (Non-reasoning) qwen3-5-122b-a10b-non-reasoning | 262k | 18.00 | — | 142 tok/s | 2.40 s | 5.93 s | ||
Muse Glimmer (high) muse-glimmer-high | 131k | 17.00 | $0.06/M | 106 tok/s | 1.14 s | 24.77 s | ||
Doubao Seed Code doubao-seed-code | ByteDance Seed | 256k | 17.00 | — | — | — | — | |
Claude 4.5 Haiku claude-4-5-haiku | 200k | 17.00 | $0.21/M | 85 tok/s | 16.72 s | 22.61 s | ||
Gemma 4 26B A4B gemma-4-26b-a4b | 256k | 17.00 | — | — | — | — | ||
Ring-2.6-1T ring-2-6-1t | InclusionAI | 262k | 17.00 | $0.29/M | 123 tok/s | 4.12 s | 24.40 s | |
K2 Horizon 3.7B k2-horizon-3-7b | Institute of Foundation Models | 524k | 16.00 | — | — | — | — | |
Qwen3.5 122B A10B qwen3-5-122b-a10b | 262k | 16.00 | $0.32/M | 132 tok/s | 2.32 s | 21.24 s | ||
Claude 4.5 Haiku (Non-reasoning) claude-4-5-haiku-non-reasoning | 200k | 15.00 | — | 81 tok/s | 0.68 s | 6.84 s | ||
Ling 3.0 Tiny ling-3-0-tiny | InclusionAI | 262k | 15.00 | — | 26 tok/s | 2.67 s | 97.50 s | |
Qwen3.6 35B A3B (Non-reasoning) qwen3-6-35b-a3b-non-reasoning | 262k | 15.00 | — | 142 tok/s | 2.15 s | 5.67 s | ||
Granite 4.2 30B granite-4-2-30b | IBM | 131k | 15.00 | — | 75 tok/s | 0.86 s | 34.10 s | |
ERNIE 5.0 Thinking Preview ernie-5-0-thinking-preview | Baidu | 128k | 14.00 | — | — | — | — | |
Mistral Medium 3.5 mistral-medium-3-5 | 256k | 14.00 | $0.44/M | 150 tok/s | 2.36 s | 19.00 s | ||
Gemma 4 12B gemma-4-12b | 256k | 14.00 | — | 114 tok/s | 2.44 s | 24.44 s | ||
Nova 2.0 Pro Preview (medium) nova-2-0-pro-preview-medium | Amazon | 256k | 14.00 | — | 116 tok/s | 13.06 s | 34.56 s | |
Gemma 4 31B (Non-reasoning) gemma-4-31b-non-reasoning | 256k | 14.00 | — | 59 tok/s | 1.95 s | 10.42 s | ||
Qwen3.5 9B qwen3-5-9b | 262k | 14.00 | — | 58 tok/s | 1.33 s | 44.23 s | ||
Nova 2.0 Omni (medium) nova-2-0-omni-medium | Amazon | 1M | 14.00 | — | — | — | — | |
Apriel-v1.6-15B-Thinker apriel-v1-6-15b-thinker | ServiceNow | 128k | 13.00 | — | — | — | — | |
Nova 2.0 Lite (high) nova-2-0-lite-high | Amazon | 1M | 13.00 | — | 166 tok/s | 13.91 s | 28.99 s | |
Qwen3.5 9B (Non-reasoning) qwen3-5-9b-non-reasoning | 262k | 13.00 | — | 88 tok/s | 0.77 s | 6.48 s | ||
EXAONE 4.5 33B exaone-4-5-33b | LG AI Research | 262k | 13.00 | — | — | — | — | |
Command A+ command-a | 192k | 13.00 | $0.00/M | 163 tok/s | 0.42 s | 15.75 s | ||
Gemma 4 26B A4B (Non-reasoning) gemma-4-26b-a4b-non-reasoning | 256k | 13.00 | — | 105 tok/s | 1.09 s | 5.86 s | ||
Qwen3.5 4B qwen3-5-4b | 262k | 13.00 | — | 26 tok/s | 0.70 s | 97.72 s | ||
Nemotron 3.5 Lightning nemotron-3-5-lightning | NVIDIA | 1M | 13.00 | $0.10/M | 278 tok/s | 0.59 s | 9.60 s | |
Nemotron 3 Super nemotron-3-super | NVIDIA | 1M | 13.00 | $1.64/M | 169 tok/s | 1.45 s | 16.28 s | |
Nova 2.0 Pro Preview (low) nova-2-0-pro-preview-low | Amazon | 256k | 13.00 | — | 111 tok/s | 10.36 s | 32.82 s | |
Nova 2.0 Lite (medium) nova-2-0-lite-medium | Amazon | 1M | 12.00 | — | 162 tok/s | 14.12 s | 29.56 s | |
Qwen3.5 Omni Flash qwen3-5-omni-flash | 256k | 12.00 | — | 260 tok/s | 1.91 s | 3.84 s | ||
MiniCPM5-2B minicpm5-2b | OpenBMB | 131k | 12.00 | — | — | — | — | |
Mercury 2.5 mercury-2-5 | Inception | 260k | 12.00 | $0.06/M | 843 tok/s | 3.06 s | 3.65 s | |
JT-MINI jt-mini | China Mobile | 128k | 12.00 | — | — | — | — | |
Magistral Medium 1.2 magistral-medium-1-2 | 128k | 12.00 | — | — | — | — | ||
Nova 2.0 Lite (low) nova-2-0-lite-low | Amazon | 1M | 12.00 | — | 168 tok/s | 7.59 s | 22.52 s | |
HyperNova 60B 2605 (high) hypernova-60b-2605-high | Multiverse Computing | 131k | 12.00 | — | — | — | — | |
Nemotron Cascade 2 30B A3B nemotron-cascade-2-30b-a3b | NVIDIA | 1M | 12.00 | — | — | — | — | |
gpt-oss-120b (high) gpt-oss-120b-high | 131k | 12.00 | $0.11/M | 181 tok/s | 0.86 s | 14.71 s | ||
K2 Think V2 k2-think-v2 | Institute of Foundation Models | 262k | 11.00 | — | — | — | — | |
LongCat Flash Lite longcat-flash-lite | LongCat | 256k | 11.00 | — | — | — | — | |
HyperCLOVA X SEED Think (32B) hyperclova-x-seed-think-32b | Naver | 128k | 11.00 | — | — | — | — | |
Mistral Small 4 mistral-small-4 | 256k | 11.00 | $0.02/M | 167 tok/s | 0.77 s | 15.76 s | ||
Qwen3 Next 80B A3B (Reasoning) qwen3-next-80b-a3b-reasoning | 262k | 11.00 | — | 182 tok/s | 2.31 s | 16.06 s | ||
Nova 2.0 Omni (low) nova-2-0-omni-low | Amazon | 1M | 11.00 | — | — | — | — | |
Granite 4.2 8B granite-4-2-8b | IBM | 131k | 11.00 | $0.02/M | 79 tok/s | 0.80 s | 32.57 s | |
Mi:dm K 2.5 Pro mi-dm-k-2-5-pro | Korea Telecom | 128k | 11.00 | — | — | — | — | |
G9v3-3B g9v3-3b | AI9Stars | 131k | 11.00 | — | — | — | — | |
Trinity Large Thinking trinity-large-thinking | Arcee AI | 512k | 11.00 | — | 322 tok/s | 1.36 s | 9.13 s | |
Qwen3.5 4B (Non-reasoning) qwen3-5-4b-non-reasoning | 262k | 11.00 | — | 24 tok/s | 0.93 s | 22.10 s | ||
INTELLECT-3 intellect-3 | Prime Intellect | 131k | 11.00 | — | — | — | — | |
Solar Open 100B solar-open-100b | Upstage | 128k | 10.00 | — | — | — | — | |
Nemotron 3 Nano Omni 30B A3B nemotron-3-nano-omni-30b-a3b | NVIDIA | 256k | 10.00 | — | 267 tok/s | 0.48 s | 9.84 s | |
gpt-oss-120b (low) gpt-oss-120b-low | 131k | 10.00 | — | 185 tok/s | 0.85 s | 14.39 s | ||
Llama 4 Maverick llama-4-maverick | 1M | 10.00 | — | 116 tok/s | 0.92 s | 5.24 s | ||
Nova 2.0 Pro Preview (Non-reasoning) nova-2-0-pro-preview-non-reasoning | Amazon | 256k | 10.00 | — | 97 tok/s | 1.03 s | 6.19 s | |
gpt-oss-20b (low) gpt-oss-20b-low | 131k | 10.00 | — | 205 tok/s | 1.07 s | 13.28 s | ||
North Mini Code north-mini-code | 256k | 10.00 | $0.00/M | 83 tok/s | 0.39 s | 30.35 s | ||
K2-V2 (high) k2-v2-high | Institute of Foundation Models | 512k | 10.00 | — | — | — | — | |
Qwen3 Next 80B A3B qwen3-next-80b-a3b | 262k | 10.00 | — | 165 tok/s | 2.15 s | 5.18 s | ||
DiffusionGemma 26B A4B diffusiongemma-26b-a4b | 256k | 10.00 | — | — | — | — | ||
Gemma 4 12B (Non-reasoning) gemma-4-12b-non-reasoning | 262k | 9.00 | — | 122 tok/s | 2.45 s | 6.55 s | ||
Mistral Large 3 mistral-large-3 | 256k | 9.00 | $0.05/M | 77 tok/s | 1.09 s | 7.54 s | ||
Qwen3 Coder Next qwen3-coder-next | 256k | 9.00 | $0.55/M | 126 tok/s | 1.28 s | 5.26 s | ||
Motif-2-12.7B motif-2-12-7b | Motif Technologies | 128k | 9.00 | — | — | — | — | |
Nova Premier nova-premier | Amazon | 1M | 9.00 | — | — | — | — | |
Granite 4.2 3B granite-4-2-3b | IBM | 131k | 9.00 | $0.01/M | 215 tok/s | 0.50 s | 12.12 s | |
K2-V2 (medium) k2-v2-medium | Institute of Foundation Models | 512k | 9.00 | — | — | — | — | |
Mistral Small 4 (Non-reasoning) mistral-small-4-non-reasoning | 256k | 9.00 | — | 149 tok/s | 0.76 s | 4.12 s | ||
Tri-21B-Think tri-21b-think | Trillion Labs | 32k | 9.00 | — | — | — | — | |
gpt-oss-20b (high) gpt-oss-20b-high | 131k | 9.00 | $0.01/M | 159 tok/s | 0.80 s | 16.48 s | ||
Gemma 4 E4B gemma-4-e4b | 128k | 9.00 | — | 50 tok/s | 0.86 s | 51.34 s | ||
Nemotron 3 Nano nemotron-3-nano | NVIDIA | 1M | 9.00 | $0.02/M | 210 tok/s | 1.07 s | 12.98 s | |
MiniCPM5-1B minicpm5-1b | OpenBMB | 128k | 9.00 | — | — | — | — | |
Sarvam 105B (high) sarvam-105b-high | Sarvam | 128k | 9.00 | — | — | — | — | |
Nova 2.0 Lite (Non-reasoning) nova-2-0-lite-non-reasoning | Amazon | 1M | 9.00 | — | 165 tok/s | 1.09 s | 4.13 s | |
MiniCPM5-1B (Non-reasoning) minicpm5-1b-non-reasoning | OpenBMB | 128k | 9.00 | — | — | — | — | |
Magistral Small 1.2 magistral-small-1-2 | 128k | 9.00 | — | — | — | — | ||
Nanbeige4.1-3B nanbeige4-1-3b | Nanbeige | 256k | 8.00 | — | — | — | — | |
LFM2.5-2.6B lfm2-5-2-6b | Liquid AI | 128k | 8.00 | — | — | — | — | |
EXAONE 4.0 32B exaone-4-0-32b | LG AI Research | 131k | 8.00 | — | — | — | — | |
Nova 2.0 Omni (Non-reasoning) nova-2-0-omni-non-reasoning | Amazon | 1M | 8.00 | — | — | — | — | |
Llama 4 Scout llama-4-scout | 10M | 8.00 | — | 99 tok/s | 0.85 s | 5.89 s | ||
Hermes 4 70B hermes-4-70b | Nous Research | 128k | 8.00 | — | — | — | — | |
Falcon-H1R-7B falcon-h1r-7b | TII UAE | 256k | 8.00 | — | — | — | — | |
Gemma 4 E2B gemma-4-e2b | 128k | 8.00 | — | — | — | — | ||
Qwen3 Omni 30B A3B (Reasoning) qwen3-omni-30b-a3b-reasoning | 66k | 8.00 | — | 102 tok/s | 1.90 s | 26.48 s | ||
Step3 VL 10B step3-vl-10b | StepFun | 66k | 8.00 | — | — | — | — | |
Llama 3.3 70B llama-3-3-70b | 128k | 8.00 | — | 86 tok/s | 1.68 s | 7.52 s | ||
Llama Nemotron Ultra llama-nemotron-ultra | NVIDIA | 128k | 8.00 | — | — | — | — | |
ERNIE 4.5 300B A47B ernie-4-5-300b-a47b | Baidu | 131k | 8.00 | — | — | — | — | |
Hermes 4 405B hermes-4-405b | Nous Research | 128k | 7.00 | — | 43 tok/s | 2.36 s | 61.08 s | |
NVIDIA Nemotron Nano 12B v2 VL nvidia-nemotron-nano-12b-v2-vl | NVIDIA | 128k | 7.00 | — | — | — | — | |
Gemma 4 E4B (Non-reasoning) gemma-4-e4b-non-reasoning | 128k | 7.00 | — | 46 tok/s | 0.83 s | 11.62 s | ||
NVIDIA Nemotron Nano 9B V2 nvidia-nemotron-nano-9b-v2 | NVIDIA | 131k | 7.00 | — | 115 tok/s | 5.08 s | 26.82 s | |
Hermes 4 405B (Non-reasoning) hermes-4-405b-non-reasoning | Nous Research | 128k | 7.00 | — | 43 tok/s | 2.31 s | 13.94 s | |
Nemotron 3 Nano 4B nemotron-3-nano-4b | NVIDIA | 262k | 7.00 | — | — | — | — | |
K2-V2 (low) k2-v2-low | Institute of Foundation Models | 512k | 7.00 | — | — | — | — | |
Kimi Linear 48B A3B Instruct kimi-linear-48b-a3b-instruct | Kimi | 1M | 7.00 | — | — | — | — | |
Llama 3.1 405B llama-3-1-405b | 128k | 7.00 | — | — | — | — | ||
LFM2.5-8B-A1B lfm2-5-8b-a1b | Liquid AI | 33k | 7.00 | — | — | — | — | |
Ring-flash-2.0 ring-flash-2-0 | InclusionAI | 128k | 7.00 | — | — | — | — | |
Olmo 3.1 32B Think olmo-3-1-32b-think | Allen Institute for AI | 66k | 7.00 | — | — | — | — | |
Command A command-a | 256k | 7.00 | — | 53 tok/s | 1.87 s | 11.27 s | ||
Qwen3.5 2B qwen3-5-2b | 262k | 7.00 | — | — | — | — | ||
Nemotron 3 Nano (Non-reasoning) nemotron-3-nano-non-reasoning | NVIDIA | 1M | 7.00 | — | 250 tok/s | 0.82 s | 2.83 s | |
NVIDIA Nemotron Nano 9B V2 (Non-reasoning) nvidia-nemotron-nano-9b-v2-non-reasoning | NVIDIA | 131k | 7.00 | — | 157 tok/s | 3.02 s | 6.20 s | |
Hermes 4 70B (Non-reasoning) hermes-4-70b-non-reasoning | Nous Research | 128k | 7.00 | — | — | — | — | |
Sarvam 30B (high) sarvam-30b-high | Sarvam | 66k | 7.00 | — | — | — | — | |
Olmo 3.1 32B Instruct olmo-3-1-32b-instruct | Allen Institute for AI | 66k | 6.00 | — | — | — | — | |
Gemma 4 E2B (Non-reasoning) gemma-4-e2b-non-reasoning | 128k | 6.00 | — | — | — | — | ||
R1 1776 r1-1776 | 128k | 6.00 | — | — | — | — | ||
Llama 3.2 90B (Vision) llama-3-2-90b-vision | 128k | 6.00 | — | — | — | — | ||
Celeris-1 celeris-1 | Celeris | 131k | 6.00 | $0.05/M | 1,628 tok/s | 0.59 s | 0.90 s | |
Phi-4 Mini phi-4-mini | Microsoft | 128k | 6.00 | — | 45 tok/s | 0.83 s | 11.90 s | |
EXAONE 4.0 32B (Non-reasoning) exaone-4-0-32b-non-reasoning | LG AI Research | 131k | 6.00 | — | — | — | — | |
Qwen3.5 2B (Non-reasoning) qwen3-5-2b-non-reasoning | 262k | 6.00 | — | — | — | — | ||
Qwen3.5 0.8B qwen3-5-0-8b | 262k | 6.00 | — | — | — | — | ||
DeepHermes 3 - Mistral 24B deephermes-3-mistral-24b | Nous Research | 32k | 6.00 | — | — | — | — | |
Jamba 1.7 Large jamba-1-7-large | AI21 Labs | 256k | 6.00 | — | — | — | — | |
Granite 4.0 H Small granite-4-0-h-small | IBM | 128k | 6.00 | — | 13 tok/s | 37.82 s | 75.26 s | |
Ministral 3 14B ministral-3-14b | 256k | 6.00 | $0.02/M | 89 tok/s | 0.90 s | 6.52 s | ||
Qwen3 Omni 30B A3B qwen3-omni-30b-a3b | 66k | 6.00 | — | 96 tok/s | 1.85 s | 7.07 s | ||
LFM2 24B A2B lfm2-24b-a2b | Liquid AI | 33k | 6.00 | — | — | — | — | |
Phi-4 phi-4 | Microsoft | 16k | 6.00 | — | 34 tok/s | 2.46 s | 17.00 s | |
Nova Micro nova-micro | Amazon | 130k | 6.00 | — | 266 tok/s | 0.83 s | 2.71 s | |
NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) nvidia-nemotron-nano-12b-v2-vl-non-reasoning | NVIDIA | 128k | 6.00 | — | 206 tok/s | 1.18 s | 3.61 s | |
Phi-4 Multimodal phi-4-multimodal | Microsoft | 128k | 6.00 | — | 17 tok/s | 0.81 s | 29.89 s | |
MiniCPM-V 4.6 1.3B minicpm-v-4-6-1-3b | OpenBMB | 262k | 6.00 | — | — | — | — | |
Jamba Reasoning 3B jamba-reasoning-3b | AI21 Labs | 262k | 6.00 | — | — | — | — | |
Reka Flash 3 reka-flash-3 | Reka AI | 128k | 6.00 | — | — | — | — | |
Olmo 3 7B Think olmo-3-7b-think | Allen Institute for AI | 66k | 6.00 | — | — | — | — | |
Molmo 7B-D molmo-7b-d | Allen Institute for AI | 4k | 6.00 | — | — | — | — | |
Ministral 3 8B ministral-3-8b | 256k | 5.00 | $0.01/M | 96 tok/s | 0.77 s | 5.95 s | ||
Llama 3.2 11B (Vision) llama-3-2-11b-vision | 128k | 5.00 | — | 20 tok/s | 1.98 s | 26.81 s | ||
Qwen3.5 0.8B (Non-reasoning) qwen3-5-0-8b-non-reasoning | 262k | 5.00 | — | — | — | — | ||
Exaone 4.0 1.2B exaone-4-0-1-2b | LG AI Research | 64k | 5.00 | — | — | — | — | |
Olmo 3 7B olmo-3-7b | Allen Institute for AI | 66k | 5.00 | — | — | — | — | |
Exaone 4.0 1.2B (Non-reasoning) exaone-4-0-1-2b-non-reasoning | LG AI Research | 64k | 5.00 | — | — | — | — | |
LFM2.5-1.2B-Thinking lfm2-5-1-2b-thinking | Liquid AI | 32k | 5.00 | — | — | — | — | |
Jamba 1.7 Mini jamba-1-7-mini | AI21 Labs | 258k | 5.00 | — | — | — | — | |
LFM2.5-1.2B-Instruct lfm2-5-1-2b-instruct | Liquid AI | 32k | 5.00 | — | — | — | — | |
Granite 4.0 H 1B granite-4-0-h-1b | IBM | 128k | 5.00 | — | — | — | — | |
Gemma 3 270M gemma-3-270m | 32k | 5.00 | — | — | — | — | ||
Apertus 70B Instruct apertus-70b-instruct | Swiss AI Initiative | 66k | 5.00 | — | — | — | — | |
Granite 4.0 Micro granite-4-0-micro | IBM | 128k | 5.00 | — | — | — | — | |
DeepHermes 3 - Llama-3.1 8B deephermes-3-llama-3-1-8b | Nous Research | 128k | 5.00 | — | — | — | — | |
Molmo2-8B molmo2-8b | Allen Institute for AI | 37k | 5.00 | — | — | — | — | |
Ministral 3 3B ministral-3-3b | 256k | 5.00 | $0.01/M | 210 tok/s | 0.75 s | 3.13 s | ||
LFM2.5-VL-1.6B lfm2-5-vl-1-6b | Liquid AI | 32k | 5.00 | — | — | — | — | |
Granite 4.0 350M granite-4-0-350m | IBM | 33k | 5.00 | — | — | — | — | |
Tiny Aya Global tiny-aya-global | 8k | 5.00 | — | — | — | — | ||
Apertus 8B Instruct apertus-8b-instruct | Swiss AI Initiative | 66k | 5.00 | — | — | — | — | |
Granite 4.0 H 350M granite-4-0-h-350m | IBM | 33k | 5.00 | — | — | — | — | |
K2 Horizon 0.9B k2-horizon-0-9b | Institute of Foundation Models | 131k | 3.00 | — | — | — | — | |
EXAONE 4.5 33B (Non-reasoning) exaone-4-5-33b-non-reasoning | LG AI Research | 262k | — | — | — | — | — | |
Gemini 3 Deep Think gemini-3-deep-think | 128k | — | — | — | — | — | ||
GPT-5.5 Pro (xhigh) gpt-5-5-pro-xhigh | 922k | — | — | — | — | — | ||
Cogito v2.1 cogito-v2-1 | Deep Cogito | 128k | — | — | — | — | — |