AI Models Leaderboard

Independent analysis of AI. Compare models by intelligence, speed, and price.

/
Filters:
SelectModel ↕Creator ↕Context Window ↕Intelligence ↓ⓘPrice ($/M) ↕ⓘSpeed (Tokens/s) ↕Latency (First Chunk s) ↕End-to-End Response (s) ↕
Claude Opus 5 (max)
claude-opus-5-max
Anthropic
1M61.00$2.03/M54 tok/s50.61 s59.92 s
Claude Opus 5 (xhigh)
claude-opus-5-xhigh
Anthropic
1M60.00$1.56/M51 tok/s39.35 s49.16 s
Claude Fable 5 (with fallback)
claude-fable-5-with-fallback
Anthropic
1M60.00$2.75/M73 tok/s123.99 s130.83 s
GPT-5.6 Sol (max)
gpt-5-6-sol-max
OpenAI
1M59.00$1.54/M71 tok/s143.85 s150.94 s
Claude Opus 5 (high)
claude-opus-5-high
Anthropic
1M59.00$1.06/M50 tok/s13.61 s23.62 s
GPT-5.6 Sol (xhigh)
gpt-5-6-sol-xhigh
OpenAI
1M58.00$0.94/M69 tok/s33.92 s41.22 s
Kimi K3
kimi-k3
Kimi
1.1M57.00$0.72/M32 tok/s4.44 s81.51 s
Claude Opus 5 (medium)
claude-opus-5-medium
Anthropic
1M56.00$0.62/M47 tok/s5.78 s16.35 s
GPT-5.6 Sol (high)
gpt-5-6-sol-high
OpenAI
1M56.00$0.62/M68 tok/s11.58 s18.95 s
GPT-5.6 Terra (max)
gpt-5-6-terra-max
OpenAI
1M55.00$0.78/M139 tok/s163.13 s166.73 s
Grok 4.5 (high)
grok-4-5-high
SpaceXAI
500k54.00$0.35/M52 tok/s8.10 s17.71 s
GPT-5.6 Sol (medium)
gpt-5-6-sol-medium
OpenAI
1M54.00$0.41/M71 tok/s4.13 s11.19 s
Claude Sonnet 5 (max)
claude-sonnet-5-max
Anthropic
1M53.00$1.53/M75 tok/s148.26 s154.94 s
GPT-5.6 Terra (xhigh)
gpt-5-6-terra-xhigh
OpenAI
1M52.00$0.45/M125 tok/s12.60 s16.61 s
GPT-5.6 Luna (max)
gpt-5-6-luna-max
OpenAI
1M51.00$0.29/M197 tok/s124.31 s126.85 s
GLM-5.2 (max)
glm-5-2-max
Z AI
1M51.00$0.27/M198 tok/s1.36 s13.98 s
Muse Spark 1.1 (xhigh)
muse-spark-1-1-xhigh
Meta
1.1M51.00$0.26/M129 tok/s1.67 s21.01 s
Claude Opus 5 (low)
claude-opus-5-low
Anthropic
1M51.00$0.36/M48 tok/s3.03 s13.47 s
Gemini 3.5 Flash
gemini-3-5-flash
Google
1M50.00$0.59/M195 tok/s22.56 s25.13 s
Gemini 3.6 Flash
gemini-3-6-flash
Google
1M50.00$0.50/M236 tok/s14.79 s16.91 s
GPT-5.6 Sol (low)
gpt-5-6-sol-low
OpenAI
1M49.00$0.24/M66 tok/s3.48 s11.10 s
GPT-5.6 Luna (xhigh)
gpt-5-6-luna-xhigh
OpenAI
1M49.00$0.19/M189 tok/s37.54 s40.19 s
GPT-5.6 Terra (high)
gpt-5-6-terra-high
OpenAI
1M49.00$0.32/M113 tok/s1.97 s6.41 s
Gemini 3.1 Pro Preview
gemini-3-1-pro-preview
Google
1M46.00$0.29/M121 tok/s33.70 s37.82 s
GPT-5.6 Luna (high)
gpt-5-6-luna-high
OpenAI
1M46.00$0.13/M203 tok/s7.33 s9.80 s
Qwen3.7 Max
qwen3-7-max
Alibaba
1M46.00$1.03/M202 tok/s2.56 s16.94 s
GPT-5.6 Terra (medium)
gpt-5-6-terra-medium
OpenAI
1M46.00$0.17/M117 tok/s1.54 s5.82 s
Gemini 3.5 Flash (medium)
gemini-3-5-flash-medium
Google
1M45.00—187 tok/s17.96 s20.63 s
MiniMax-M3
minimax-m3
MiniMax
1M44.00$0.12/M83 tok/s1.46 s31.57 s
DeepSeek V4 Pro (max)
deepseek-v4-pro-max
DeepSeek
1M44.00$0.04/M73 tok/s1.53 s68.12 s
GPT-5.3 Codex (xhigh)
gpt-5-3-codex-xhigh
OpenAI
400k44.00—123 tok/s67.98 s72.03 s
Motif 3 (Beta)
motif-3-beta
Motif Technologies
262k44.00————
DeepSeek V4 Pro (high)
deepseek-v4-pro-high
DeepSeek
1M43.00$0.04/M72 tok/s1.57 s36.18 s
Muse Spark
muse-spark
Meta
262k43.00————
MiMo-V2.5-Pro
mimo-v2-5-pro
Xiaomi
1M42.00$0.04/M64 tok/s3.20 s42.34 s
Kimi K2.7 Code
kimi-k2-7-code
Kimi
256k42.00$0.20/M39 tok/s2.93 s73.40 s
Claude Sonnet 5 (Non-reasoning)
claude-sonnet-5-non-reasoning
Anthropic
1M42.00$0.37/M62 tok/s1.22 s9.34 s
Hy3
hy3
Tencent
256k41.00$0.03/M62 tok/s2.64 s43.14 s
GPT-5.6 Sol (Non-reasoning)
gpt-5-6-sol-non-reasoning
OpenAI
1M41.00$0.26/M67 tok/s0.97 s8.45 s
Nex-N2-Pro
nex-n2-pro
Nex AGI
262k41.00—131 tok/s1.77 s20.86 s
Inkling
inkling
Thinking Machines
1M41.00—83 tok/s1.76 s31.74 s
GPT-5.6 Terra (low)
gpt-5-6-terra-low
OpenAI
1M40.00$0.15/M124 tok/s1.29 s5.32 s
DeepSeek V4 Flash (max)
deepseek-v4-flash-max
DeepSeek
1M40.00$0.02/M117 tok/s1.26 s53.58 s
Qwen3.6 Plus
qwen3-6-plus
Alibaba
1M40.00$0.31/M53 tok/s2.51 s116.45 s
Qwen3.7 Plus
qwen3-7-plus
Alibaba
1M39.00$0.21/M53 tok/s2.85 s50.06 s
JT-4.1 Flash 236B A21B
jt-4-1-flash-236b-a21b
China Mobile
256k39.00————
Agnes 2.5 Pro Alpha
agnes-2-5-pro-alpha
Sapiens AI
1M39.00—95 tok/s1.66 s27.88 s
GPT-5.6 Luna (medium)
gpt-5-6-luna-medium
OpenAI
1M38.00$0.07/M194 tok/s1.99 s4.57 s
Nemotron 3 Ultra
nemotron-3-ultra
NVIDIA
262k38.00$0.38/M187 tok/s1.16 s16.03 s
DeepSeek V4 Flash (high)
deepseek-v4-flash-high
DeepSeek
1M37.00$0.05/M———
MiMo-V2.5
mimo-v2-5
Xiaomi
1M37.00$0.01/M75 tok/s3.63 s36.75 s
Qwen3.6 27B
qwen3-6-27b
Alibaba
262k37.00$0.27/M56 tok/s3.66 s114.75 s
Gemini 3.5 Flash-Lite
gemini-3-5-flash-lite
Google
1M36.00$0.09/M409 tok/s7.79 s9.01 s
MiMo-V2-Omni-0327
mimo-v2-omni-0327
Xiaomi
256k36.00————
Grok 4.3 (medium)
grok-4-3-medium
SpaceXAI
1M36.00—112 tok/s10.86 s15.31 s
Grok 4.3 (low)
grok-4-3-low
SpaceXAI
1M35.00—106 tok/s5.65 s10.36 s
MiMo-V2-Omni
mimo-v2-omni
Xiaomi
256k35.00————
Gemini 3.5 Flash (minimal)
gemini-3-5-flash-minimal
Google
1M35.00—149 tok/s0.94 s4.29 s
Kimi K2.6
kimi-k2-6
Kimi
256k35.00—37 tok/s2.90 s16.43 s
Claude Sonnet 4.6 (Non-reasoning, Low Effort)
claude-sonnet-4-6-non-reasoning-low-effort
Anthropic
1M34.00—42 tok/s1.26 s13.04 s
GLM-5.2
glm-5-2
Z AI
1M34.00—87 tok/s1.55 s7.30 s
GPT-5.6 Terra (Non-reasoning)
gpt-5-6-terra-non-reasoning
OpenAI
1M34.00$0.17/M125 tok/s0.72 s4.72 s
KAT-Coder-Pro V2
kat-coder-pro-v2
KwaiKAT
256k34.00—105 tok/s1.47 s6.23 s
Qwen3.5 397B A17B
qwen3-5-397b-a17b
Alibaba
262k34.00$0.33/M73 tok/s2.31 s52.69 s
Hy3-preview
hy3-preview
Tencent
256k34.00—155 tok/s3.27 s19.40 s
LongCat 2.0
longcat-2-0
LongCat
1M33.00$0.11/M41 tok/s2.72 s63.50 s
GPT-5.6 Luna (low)
gpt-5-6-luna-low
OpenAI
1M33.00$0.06/M179 tok/s1.54 s4.33 s
MiMo-V2-Flash (Feb 2026)
mimo-v2-flash-feb-2026
Xiaomi
256k33.00————
Qwen3.5 122B A10B
qwen3-5-122b-a10b
Alibaba
262k32.00$0.24/M133 tok/s2.32 s21.09 s
Qwen3.5 397B A17B
qwen3-5-397b-a17b
Alibaba
262k32.00—70 tok/s2.27 s9.43 s
Qwen3.6 35B A3B
qwen3-6-35b-a3b
Alibaba
262k32.00$0.18/M151 tok/s2.24 s41.29 s
DeepSeek V4 Pro
deepseek-v4-pro
DeepSeek
1M31.00—71 tok/s1.57 s8.59 s
Qwen3.5 Omni Plus
qwen3-5-omni-plus
Alibaba
256k31.00—53 tok/s2.41 s11.87 s
Ring-2.6-1T
ring-2-6-1t
InclusionAI
262k31.00$0.35/M120 tok/s3.21 s23.97 s
Qwen3.6 27B
qwen3-6-27b
Alibaba
262k30.00$0.36/M56 tok/s3.65 s12.64 s
o3
o3
OpenAI
200k30.00—128 tok/s5.73 s9.64 s
Step 3.7 Flash
step-3-7-flash
StepFun
262k30.00$0.09/M400 tok/s0.92 s7.17 s
Mistral Medium 3.5
mistral-medium-3-5
Mistral
256k30.00$0.56/M75 tok/s1.95 s35.33 s
Claude 4.5 Haiku
claude-4-5-haiku
Anthropic
200k30.00$0.24/M100 tok/s14.57 s19.57 s
Gemma 4 31B
gemma-4-31b
Google
256k29.00$0.00/M35 tok/s1.12 s65.11 s
GPT-5.5 Instant (June 2026)
gpt-5-5-instant-june-2026
OpenAI
400k29.00$0.54/M———
DeepSeek V4 Flash
deepseek-v4-flash
DeepSeek
1M29.00—113 tok/s1.19 s5.62 s
JT-35B-Flash
jt-35b-flash
China Mobile
256k28.00————
KAT-Coder-Pro V1
kat-coder-pro-v1
KwaiKAT
256k28.00————
MiMo-V2.5-Pro
mimo-v2-5-pro
Xiaomi
1M28.00—62 tok/s2.58 s10.62 s
Qwen3.5 122B A10B
qwen3-5-122b-a10b
Alibaba
262k28.00$0.18/M150 tok/s2.35 s5.68 s
GPT-5.6 Luna (Non-reasoning)
gpt-5-6-luna-non-reasoning
OpenAI
1M27.00$0.08/M180 tok/s0.73 s3.51 s
Hy3-preview
hy3-preview
Tencent
256k26.00—164 tok/s3.16 s6.21 s
Ling-2.6-1T
ling-2-6-1t
InclusionAI
262k26.00————
Doubao Seed Code
doubao-seed-code
ByteDance Seed
256k26.00————
Gemini 2.5 Pro
gemini-2-5-pro
Google
1M26.00$0.20/M144 tok/s22.27 s25.75 s
Gemma 4 26B A4B
gemma-4-26b-a4b
Google
256k26.00$0.04/M———
NVIDIA Nemotron 3 Super
nvidia-nemotron-3-super
NVIDIA
1M25.00$0.20/M153 tok/s1.70 s18.08 s
Gemini 3.1 Flash-Lite
gemini-3-1-flash-lite
Google
1M25.00$0.04/M331 tok/s5.85 s7.36 s
Grok 4.3 (Non-reasoning)
grok-4-3-non-reasoning
SpaceXAI
1M25.00$0.29/M110 tok/s0.75 s5.30 s
MiMo-V2-Flash
mimo-v2-flash
Xiaomi
256k25.00————
Qwen3.6 35B A3B
qwen3-6-35b-a3b
Alibaba
262k24.00$0.60/M173 tok/s2.26 s5.15 s
Qwen3.5 35B A3B
qwen3-5-35b-a3b
Alibaba
262k24.00$0.23/M157 tok/s2.29 s5.48 s
gpt-oss-120b (high)
gpt-oss-120b-high
OpenAI
131k24.00$0.06/M261 tok/s0.82 s10.40 s
Claude 4.5 Haiku
claude-4-5-haiku
Anthropic
200k24.00—91 tok/s1.06 s6.53 s
Command A+
command-a
Cohere
192k23.00$0.00/M200 tok/s0.41 s12.94 s
K-EXAONE
k-exaone
LG AI Research
256k22.00————
ERNIE 5.0 Thinking Preview
ernie-5-0-thinking-preview
Baidu
128k22.00————
Gemma 4 12B
gemma-4-12b
Google
256k22.00$0.07/M45 tok/s2.56 s58.68 s
Gemma 4 31B
gemma-4-31b
Google
256k22.00$0.03/M73 tok/s2.57 s9.42 s
Nova 2.0 Pro Preview (medium)
nova-2-0-pro-preview-medium
Amazon
256k22.00$0.17/M116 tok/s13.34 s34.91 s
Qwen3.5 9B
qwen3-5-9b
Alibaba
262k21.00$0.22/M83 tok/s1.60 s31.89 s
Mercury 2
mercury-2
Inception
128k21.00$0.08/M978 tok/s3.34 s3.85 s
Qwen3 Coder Next
qwen3-coder-next
Alibaba
256k21.00$0.33/M134 tok/s1.37 s5.10 s
Nova 2.0 Omni (medium)
nova-2-0-omni-medium
Amazon
1M21.00————
Apriel-v1.6-15B-Thinker
apriel-v1-6-15b-thinker
ServiceNow
128k21.00————
Qwen3.5 9B
qwen3-5-9b
Alibaba
262k20.00————
EXAONE 4.5 33B
exaone-4-5-33b
LG AI Research
262k20.00————
Gemma 4 26B A4B
gemma-4-26b-a4b
Google
256k20.00—52 tok/s1.26 s10.79 s
Qwen3.5 4B
qwen3-5-4b
Alibaba
262k20.00—19 tok/s0.76 s132.97 s
North Mini Code
north-mini-code
Cohere
256k20.00$0.00/M37 tok/s0.51 s68.13 s
Nova 2.0 Pro Preview (low)
nova-2-0-pro-preview-low
Amazon
256k20.00$0.21/M116 tok/s9.19 s30.68 s
Mistral Small 4
mistral-small-4
Mistral
256k20.00$0.10/M145 tok/s0.75 s17.94 s
Devstral 2
devstral-2
Mistral
256k19.00$0.00/M48 tok/s1.21 s11.55 s
Nova 2.0 Lite (medium)
nova-2-0-lite-medium
Amazon
1M19.00—138 tok/s16.37 s34.54 s
Qwen3.5 Omni Flash
qwen3-5-omni-flash
Alibaba
256k19.00—236 tok/s1.86 s3.97 s
JT-MINI
jt-mini
China Mobile
128k19.00————
Nova 2.0 Lite (high)
nova-2-0-lite-high
Amazon
1M18.00$0.25/M128 tok/s20.95 s40.55 s
Trinity Large Thinking
trinity-large-thinking
Arcee AI
512k18.00$0.15/M174 tok/s0.95 s15.34 s
Magistral Medium 1.2
magistral-medium-1-2
Mistral
128k18.00$0.75/M45 tok/s1.74 s56.80 s
Nova 2.0 Lite (low)
nova-2-0-lite-low
Amazon
1M18.00—152 tok/s9.28 s25.76 s
HyperNova 60B 2605
hypernova-60b-2605
Multiverse Computing
131k18.00$0.02/M356 tok/s0.89 s7.92 s
Nemotron Cascade 2 30B A3B
nemotron-cascade-2-30b-a3b
NVIDIA
1M18.00————
Devstral Small 2
devstral-small-2
Mistral
256k17.00$0.00/M54 tok/s1.25 s10.53 s
K2 Think V2
k2-think-v2
MBZUAI Institute of Foundation Models
262k17.00————
LongCat Flash Lite
longcat-flash-lite
LongCat
256k17.00————
HyperCLOVA X SEED Think (32B)
hyperclova-x-seed-think-32b
Naver
128k17.00————
K-EXAONE
k-exaone
LG AI Research
256k17.00————
Qwen3 Next 80B A3B
qwen3-next-80b-a3b
Alibaba
262k17.00$0.17/M207 tok/s2.25 s14.33 s
Nova 2.0 Omni (low)
nova-2-0-omni-low
Amazon
1M17.00————
Mi:dm K 2.5 Pro
mi-dm-k-2-5-pro
Korea Telecom
128k16.00————
G9v3-3B
g9v3-3b
AI9Stars
131k16.00$0.00/M———
Qwen3.5 4B
qwen3-5-4b
Alibaba
262k16.00—24 tok/s0.76 s21.65 s
Mistral Large 3
mistral-large-3
Mistral
256k16.00$0.06/M46 tok/s1.11 s11.90 s
INTELLECT-3
intellect-3
Prime Intellect
131k16.00————
Solar Open 100B
solar-open-100b
Upstage
128k15.00————
Nemotron 3 Nano Omni 30B A3B Reasoning
nemotron-3-nano-omni-30b-a3b-reasoning
NVIDIA
256k15.00—319 tok/s0.96 s8.80 s
gpt-oss-120b (low)
gpt-oss-120b-low
OpenAI
131k15.00$0.02/M286 tok/s0.86 s9.58 s
gpt-oss-20b (high)
gpt-oss-20b-high
OpenAI
131k15.00$0.02/M189 tok/s0.81 s14.06 s
Nova 2.0 Pro Preview
nova-2-0-pro-preview
Amazon
256k14.00$0.25/M92 tok/s1.04 s6.48 s
gpt-oss-20b (low)
gpt-oss-20b-low
OpenAI
131k14.00—196 tok/s0.86 s13.63 s
Llama 4 Maverick
llama-4-maverick
Meta
1M14.00$0.03/M104 tok/s0.94 s5.74 s
K2-V2 (high)
k2-v2-high
MBZUAI Institute of Foundation Models
512k14.00————
NVIDIA Nemotron 3 Nano
nvidia-nemotron-3-nano
NVIDIA
1M14.00$0.02/M201 tok/s1.18 s13.59 s
Solar Pro 3
solar-pro-3
Upstage
128k14.00$0.11/M107 tok/s2.29 s25.57 s
Ling 2.6 Flash
ling-2-6-flash
InclusionAI
262k14.00—116 tok/s1.12 s5.45 s
Qwen3 Next 80B A3B
qwen3-next-80b-a3b
Alibaba
262k14.00—181 tok/s2.17 s4.93 s
DiffusionGemma 26B A4B
diffusiongemma-26b-a4b
Google
256k13.00————
Gemma 4 12B (Non-reasoning)
gemma-4-12b-non-reasoning
Google
262k13.00—34 tok/s2.53 s17.08 s
Motif-2-12.7B
motif-2-12-7b
Motif Technologies
128k13.00————
Nova Premier
nova-premier
Amazon
1M13.00—33 tok/s2.87 s18.13 s
K2-V2 (medium)
k2-v2-medium
MBZUAI Institute of Foundation Models
512k12.00————
Llama Nemotron Super 49B v1.5
llama-nemotron-super-49b-v1-5
NVIDIA
128k12.00—77 tok/s5.95 s38.27 s
Mistral Small 4
mistral-small-4
Mistral
256k12.00—147 tok/s0.70 s4.10 s
Tri-21B-Think
tri-21b-think
Trillion Labs
32k12.00————
MiniCPM5-1B
minicpm5-1b
OpenBMB
128k12.00————
Sarvam 105B (high)
sarvam-105b-high
Sarvam
128k12.00————
Gemma 4 E4B
gemma-4-e4b
Google
128k12.00—90 tok/s0.79 s28.52 s
Nova 2.0 Lite
nova-2-0-lite
Amazon
1M12.00—139 tok/s1.12 s4.72 s
MiniCPM5-1B
minicpm5-1b
OpenBMB
128k12.00————
Magistral Small 1.2
magistral-small-1-2
Mistral
128k11.00$0.25/M88 tok/s0.94 s29.32 s
Nanbeige4.1-3B
nanbeige4-1-3b
Nanbeige
256k11.00————
Ministral 3 14B
ministral-3-14b
Mistral
256k11.00$0.15/M76 tok/s0.84 s7.44 s
EXAONE 4.0 32B
exaone-4-0-32b
LG AI Research
131k11.00————
Nova 2.0 Omni
nova-2-0-omni
Amazon
1M11.00————
Llama 4 Scout
llama-4-scout
Meta
10M10.00$0.01/M84 tok/s0.78 s6.73 s
Hermes 4 70B
hermes-4-70b
Nous Research
128k10.00—90 tok/s1.35 s29.14 s
Falcon-H1R-7B
falcon-h1r-7b
TII UAE
256k10.00————
Qwen3 Omni 30B A3B
qwen3-omni-30b-a3b
Alibaba
66k10.00—99 tok/s1.94 s27.15 s
Step3 VL 10B
step3-vl-10b
StepFun
66k9.00————
Gemma 4 E2B
gemma-4-e2b
Google
128k9.00————
Llama 3.3 70B
llama-3-3-70b
Meta
128k9.00$0.08/M83 tok/s1.65 s7.70 s
Llama Nemotron Ultra
llama-nemotron-ultra
NVIDIA
128k9.00—53 tok/s2.31 s49.84 s
ERNIE 4.5 300B A47B
ernie-4-5-300b-a47b
Baidu
131k9.00————
Hermes 4 405B
hermes-4-405b
Nous Research
128k9.00—37 tok/s2.40 s70.51 s
NVIDIA Nemotron Nano 12B v2 VL
nvidia-nemotron-nano-12b-v2-vl
NVIDIA
128k9.00—79 tok/s8.49 s40.06 s
Ministral 3 8B
ministral-3-8b
Mistral
256k9.00$0.18/M118 tok/s0.73 s4.97 s
Gemma 4 E4B
gemma-4-e4b
Google
128k9.00—92 tok/s0.76 s6.19 s
Granite 4.1 30B
granite-4-1-30b
IBM
131k9.00————
NVIDIA Nemotron Nano 9B V2
nvidia-nemotron-nano-9b-v2
NVIDIA
131k9.00—107 tok/s4.58 s27.94 s
Hermes 4 405B
hermes-4-405b
Nous Research
128k9.00—37 tok/s2.38 s15.85 s
NVIDIA Nemotron 3 Nano 4B
nvidia-nemotron-3-nano-4b
NVIDIA
262k9.00————
Llama Nemotron Super 49B v1.5
llama-nemotron-super-49b-v1-5
NVIDIA
128k9.00—67 tok/s4.54 s11.96 s
K2-V2 (low)
k2-v2-low
MBZUAI Institute of Foundation Models
512k9.00————
Kimi Linear 48B A3B Instruct
kimi-linear-48b-a3b-instruct
Kimi
1M9.00————
Llama 3.1 405B
llama-3-1-405b
Meta
128k9.00————
LFM2.5-8B-A1B
lfm2-5-8b-a1b
Liquid AI
33k8.00—339 tok/s1.96 s9.34 s
Ring-flash-2.0
ring-flash-2-0
InclusionAI
128k8.00————
Olmo 3.1 32B Think
olmo-3-1-32b-think
Allen Institute for AI
66k8.00————
Command A
command-a
Cohere
256k8.00—60 tok/s1.88 s10.17 s
Llama 3.1 Nemotron 70B
llama-3-1-nemotron-70b
NVIDIA
128k8.00—73 tok/s6.46 s13.27 s
NVIDIA Nemotron 3 Nano
nvidia-nemotron-3-nano
NVIDIA
1M7.00—115 tok/s0.91 s5.25 s
NVIDIA Nemotron Nano 9B V2
nvidia-nemotron-nano-9b-v2
NVIDIA
131k7.00—162 tok/s1.60 s4.69 s
Qwen3.5 2B
qwen3-5-2b
Alibaba
262k7.00————
Hermes 4 70B
hermes-4-70b
Nous Research
128k7.00—95 tok/s1.34 s6.62 s
Granite 4.1 8B
granite-4-1-8b
IBM
131k7.00—98 tok/s0.79 s5.87 s
Sarvam 30B (high)
sarvam-30b-high
Sarvam
66k7.00————
Olmo 3.1 32B Instruct
olmo-3-1-32b-instruct
Allen Institute for AI
66k6.00————
Gemma 4 E2B
gemma-4-e2b
Google
128k6.00————
R1 1776
r1-1776
Perplexity
128k6.00————
Ministral 3 3B
ministral-3-3b
Mistral
256k6.00$0.13/M253 tok/s0.61 s2.59 s
Llama 3.2 90B (Vision)
llama-3-2-90b-vision
Meta
128k6.00————
Phi-4 Mini
phi-4-mini
Microsoft
128k6.00$0.00/M45 tok/s0.83 s11.89 s
EXAONE 4.0 32B
exaone-4-0-32b
LG AI Research
131k6.00————
Qwen3.5 2B
qwen3-5-2b
Alibaba
262k6.00————
Qwen3.5 0.8B
qwen3-5-0-8b
Alibaba
262k5.00————
DeepHermes 3 - Mistral 24B
deephermes-3-mistral-24b
Nous Research
32k5.00————
Jamba 1.7 Large
jamba-1-7-large
AI21 Labs
256k5.00—55 tok/s1.42 s10.54 s
Granite 4.0 H Small
granite-4-0-h-small
IBM
128k5.00—365 tok/s10.23 s11.60 s
Qwen3 Omni 30B A3B
qwen3-omni-30b-a3b
Alibaba
66k5.00—95 tok/s1.89 s7.17 s
LFM2 24B A2B
lfm2-24b-a2b
Liquid AI
33k5.00————
Phi-4
phi-4
Microsoft
16k5.00—29 tok/s4.01 s21.17 s
Nova Micro
nova-micro
Amazon
130k5.00—268 tok/s0.96 s2.83 s
Granite 4.1 3B
granite-4-1-3b
IBM
131k5.00————
NVIDIA Nemotron Nano 12B v2 VL
nvidia-nemotron-nano-12b-v2-vl
NVIDIA
128k5.00—165 tok/s2.43 s5.47 s
Phi-4 Multimodal
phi-4-multimodal
Microsoft
128k5.00—18 tok/s0.81 s29.15 s
MiniCPM-V 4.6 1.3B
minicpm-v-4-6-1-3b
OpenBMB
262k4.00————
Jamba Reasoning 3B
jamba-reasoning-3b
AI21 Labs
262k4.00————
Reka Flash 3
reka-flash-3
Reka AI
128k4.00————
Olmo 3 7B Think
olmo-3-7b-think
Allen Institute for AI
66k4.00————
Molmo 7B-D
molmo-7b-d
Allen Institute for AI
4k4.00————
Ling-mini-2.0
ling-mini-2-0
InclusionAI
131k4.00————
Llama 3.2 11B (Vision)
llama-3-2-11b-vision
Meta
128k3.00—5 tok/s5.64 s103.98 s
Qwen3.5 0.8B
qwen3-5-0-8b
Alibaba
262k3.00————
Exaone 4.0 1.2B
exaone-4-0-1-2b
LG AI Research
64k3.00————
Olmo 3 7B
olmo-3-7b
Allen Institute for AI
66k3.00————
Exaone 4.0 1.2B
exaone-4-0-1-2b
LG AI Research
64k3.00————
LFM2.5-1.2B-Thinking
lfm2-5-1-2b-thinking
Liquid AI
32k3.00————
Jamba 1.7 Mini
jamba-1-7-mini
AI21 Labs
258k3.00————
LFM2 2.6B
lfm2-2-6b
Liquid AI
33k3.00————
LFM2.5-1.2B-Instruct
lfm2-5-1-2b-instruct
Liquid AI
32k3.00————
Granite 4.0 H 1B
granite-4-0-h-1b
IBM
128k3.00————
Gemma 3 270M
gemma-3-270m
Google
32k2.00————
Apertus 70B Instruct
apertus-70b-instruct
Swiss AI Initiative
66k2.00————
Granite 4.0 Micro
granite-4-0-micro
IBM
128k2.00————
DeepHermes 3 - Llama-3.1 8B
deephermes-3-llama-3-1-8b
Nous Research
128k2.00————
Granite 4.0 1B
granite-4-0-1b
IBM
128k2.00————
Molmo2-8B
molmo2-8b
Allen Institute for AI
37k2.00————
LFM2 8B A1B
lfm2-8b-a1b
Liquid AI
33k2.00————
LFM2.5-VL-1.6B
lfm2-5-vl-1-6b
Liquid AI
32k1.00—410 tok/s1.62 s2.84 s
Granite 4.0 350M
granite-4-0-350m
IBM
33k1.00————
Tiny Aya Global
tiny-aya-global
Cohere
8k1.00————
Apertus 8B Instruct
apertus-8b-instruct
Swiss AI Initiative
66k1.00————
Granite 4.0 H 350M
granite-4-0-h-350m
IBM
33k1.00————
Claude Sonnet 5 (low)
claude-sonnet-5-low
Anthropic
1M——58 tok/s1.94 s10.63 s
EXAONE 4.5 33B
exaone-4-5-33b
LG AI Research
262k—————
Claude Sonnet 5 (xhigh)
claude-sonnet-5-xhigh
Anthropic
1M——69 tok/s24.31 s31.57 s
Gemini 3 Deep Think
gemini-3-deep-think
Google
128k—————
Claude Sonnet 5 (high)
claude-sonnet-5-high
Anthropic
1M——59 tok/s6.99 s15.44 s
Mi:dm K 2.5 Pro Preview
mi-dm-k-2-5-pro-preview
Korea Telecom
128k—————
GPT-5.5 Pro (xhigh)
gpt-5-5-pro-xhigh
OpenAI
922k—————
Cogito v2.1
cogito-v2-1
Deep Cogito
128k—————
Claude Sonnet 5 (medium)
claude-sonnet-5-medium
Anthropic
1M——59 tok/s2.32 s10.86 s