AI Models Leaderboard

Independent analysis of AI. Compare models by intelligence, speed, and price.

/
Filters:
SelectModel ↕Creator ↕Context Window ↕Intelligence ↓ⓘPrice ($/M) ↕ⓘSpeed (Tokens/s) ↕Latency (First Chunk s) ↕End-to-End Response (s) ↕
Claude Opus 5.5 (max with fallback)
claude-opus-5-5-max-with-fallback
Anthropic
1M58.00$5.98/M———
Claude Opus 5.5 (xhigh with fallback)
claude-opus-5-5-xhigh-with-fallback
Anthropic
1M56.00$3.46/M91 tok/s137.63 s143.10 s
Claude Opus 5.5 (high with fallback)
claude-opus-5-5-high-with-fallback
Anthropic
1M54.00$1.82/M84 tok/s28.34 s34.27 s
Claude Fable 5.1 (max with fallback)
claude-fable-5-1-max-with-fallback
Anthropic
1M53.00$7.63/M69 tok/s246.00 s253.22 s
Claude Fable 5.1 (xhigh with fallback)
claude-fable-5-1-xhigh-with-fallback
Anthropic
1M53.00$5.98/M66 tok/s122.00 s129.61 s
GPT-6 Astra (max)
gpt-6-astra-max
OpenAI
1M53.00$3.26/M58 tok/s332.03 s340.62 s
GPT-6 Astra (xhigh)
gpt-6-astra-xhigh
OpenAI
1M52.00$2.31/M58 tok/s108.27 s116.94 s
Claude Opus 5.5 (medium with fallback)
claude-opus-5-5-medium-with-fallback
Anthropic
1M51.00$1.34/M83 tok/s12.73 s18.78 s
Claude Fable 5.1 (high with fallback)
claude-fable-5-1-high-with-fallback
Anthropic
1M51.00$3.91/M59 tok/s12.40 s20.90 s
GPT-6 Astra (high)
gpt-6-astra-high
OpenAI
1M51.00$1.73/M57 tok/s36.80 s45.54 s
GPT-6 Astra (medium)
gpt-6-astra-medium
OpenAI
1M50.00$1.54/M55 tok/s5.50 s14.54 s
Claude Fable 5.1 (medium with fallback)
claude-fable-5-1-medium-with-fallback
Anthropic
1M49.00$2.98/M59 tok/s7.84 s16.38 s
Muse Spark 1.3 (max)
muse-spark-1-3-max
Meta
1M48.00$1.60/M214 tok/s24.72 s36.38 s
GPT-6 Sol (max)
gpt-6-sol-max
OpenAI
872k48.00$1.06/M85 tok/s162.55 s168.47 s
Claude Fable 5.1 (low with fallback)
claude-fable-5-1-low-with-fallback
Anthropic
1M47.00$2.37/M59 tok/s7.34 s15.79 s
Grok 4.7 (xhigh)
grok-4-7-xhigh
SpaceXAI
500k46.00$3.74/M49 tok/s2.41 s12.65 s
Grok 4.7 (high)
grok-4-7-high
SpaceXAI
500k46.00$2.73/M65 tok/s1.77 s9.48 s
MiMo-V2.6-Pro
mimo-v2-6-pro
Xiaomi
1M46.00$0.13/M45 tok/s3.38 s59.36 s
GPT-6 Astra (low)
gpt-6-astra-low
OpenAI
1M46.00$0.82/M55 tok/s3.07 s12.15 s
Qwen3.8 Max (0902)
qwen3-8-max-0902
Alibaba
984k45.00$5.41/M40 tok/s3.01 s65.99 s
Muse Spark 1.3 (xhigh)
muse-spark-1-3-xhigh
Meta
1M45.00$1.37/M232 tok/s21.81 s32.59 s
GLM-5.3 (max)
glm-5-3-max
Z AI
1M45.00$2.01/M71 tok/s3.30 s38.29 s
Grok 4.6 (high)
grok-4-6-high
SpaceXAI
500k44.00$1.86/M66 tok/s39.41 s46.99 s
Grok 4.6 (xhigh)
grok-4-6-xhigh
SpaceXAI
500k44.00$2.32/M72 tok/s37.01 s43.96 s
GPT-6 Sol (xhigh)
gpt-6-sol-xhigh
OpenAI
872k44.00$0.53/M85 tok/s31.71 s37.59 s
Step 5 Preview
step-5-preview
StepFun
1M44.00$0.72/M77 tok/s3.00 s35.55 s
Kimi K3 (max)
kimi-k3-max
Kimi
1.1M44.00$2.00/M35 tok/s4.18 s75.37 s
Grok 4.6 (medium)
grok-4-6-medium
SpaceXAI
500k43.00$1.50/M68 tok/s22.33 s29.65 s
GPT-6 Sol (high)
gpt-6-sol-high
OpenAI
872k43.00$0.37/M83 tok/s9.21 s15.22 s
Claude Opus 5.5 (low with fallback)
claude-opus-5-5-low-with-fallback
Anthropic
1M42.00$0.55/M85 tok/s5.60 s11.47 s
GPT-5.6 Terra (max)
gpt-5-6-terra-max
OpenAI
1M42.00$1.40/M100 tok/s166.45 s171.47 s
GLM-5.3-Flash
glm-5-3-flash
Z AI
1M42.00$0.25/M44 tok/s3.39 s60.43 s
Gemini 3.8 Flash (high)
gemini-3-8-flash-high
Google
1M41.00$1.24/M330 tok/s22.57 s24.09 s
Qwen3.8 2.4T A95B
qwen3-8-2-4t-a95b
Alibaba
984k40.00$2.16/M40 tok/s2.73 s65.80 s
Qwen3.8-Flash-Next
qwen3-8-flash-next
Alibaba
256k40.00$0.37/M55 tok/s2.78 s48.26 s
GPT-6 Sol (medium)
gpt-6-sol-medium
OpenAI
872k40.00$0.25/M———
Gemini 3.8 Flash (medium)
gemini-3-8-flash-medium
Google
1M40.00$0.93/M———
DeepSeek V4.1 Flash (max)
deepseek-v4-1-flash-max
DeepSeek
1M39.00$0.27/M237 tok/s0.99 s11.54 s
Claude Sonnet 5 (max)
claude-sonnet-5-max
Anthropic
1M38.00$5.09/M80 tok/s140.85 s147.09 s
GPT-5.6 Terra (xhigh)
gpt-5-6-terra-xhigh
OpenAI
1M38.00$0.63/M82 tok/s28.30 s34.40 s
GPT-6 Luna (max)
gpt-6-luna-max
OpenAI
1M37.00$0.07/M144 tok/s122.30 s125.78 s
DeepSeek V4 Pro 0813 (max)
deepseek-v4-pro-0813-max
DeepSeek
1M36.00$0.67/M90 tok/s1.69 s29.33 s
Grok 4.6 (low)
grok-4-6-low
SpaceXAI
500k35.00$0.48/M57 tok/s6.99 s15.70 s
DeepSeek V4 Flash Vision (max)
deepseek-v4-flash-vision-max
DeepSeek
1M35.00$0.31/M220 tok/s0.89 s12.27 s
Kimi K3 (low)
kimi-k3-low
Kimi
1.1M34.00—38 tok/s3.70 s69.51 s
Claude Sonnet 5 (xhigh)
claude-sonnet-5-xhigh
Anthropic
1M34.00$2.87/M74 tok/s15.50 s22.27 s
GLM-5.3 (low)
glm-5-3-low
Z AI
1M34.00$0.85/M85 tok/s2.78 s32.10 s
GPT-5.6 Terra (high)
gpt-5-6-terra-high
OpenAI
1M34.00$0.34/M83 tok/s3.36 s9.40 s
GPT-6 Sol (low)
gpt-6-sol-low
OpenAI
872k34.00$0.13/M82 tok/s1.98 s8.08 s
GPT-6 Luna (xhigh)
gpt-6-luna-xhigh
OpenAI
1M34.00$0.04/M137 tok/s18.38 s22.04 s
Qwen3.8 27B (xhigh)
qwen3-8-27b-xhigh
Alibaba
256k34.00$1.01/M44 tok/s3.90 s60.90 s
Motif 3
motif-3
Motif Technologies
262k34.00————
Gemini 3.8 Flash (low)
gemini-3-8-flash-low
Google
1M33.00————
GPT-5.3 Codex (xhigh)
gpt-5-3-codex-xhigh
OpenAI
400k33.00—120 tok/s71.64 s75.80 s
Motif 3 (Beta)
motif-3-beta
Motif Technologies
262k32.00————
GPT-6 Luna (high)
gpt-6-luna-high
OpenAI
1M32.00$0.03/M135 tok/s7.03 s10.75 s
Claude Sonnet 5 (high)
claude-sonnet-5-high
Anthropic
1M32.00$1.79/M70 tok/s6.92 s14.01 s
K2 Horizon 375B A23B
k2-horizon-375b-a23b
Institute of Foundation Models
524k31.00————
GPT-5.6 Terra (medium)
gpt-5-6-terra-medium
OpenAI
1M30.00$0.18/M83 tok/s2.14 s8.15 s
Gemini 3.1 Pro Preview
gemini-3-1-pro-preview
Google
1M30.00$0.67/M120 tok/s27.65 s31.81 s
GPT-6 Luna (medium)
gpt-6-luna-medium
OpenAI
1M29.00$0.02/M———
MiniMax-M3
minimax-m3
MiniMax
1M29.00$0.51/M184 tok/s1.01 s14.64 s
Nex-N2-Pro
nex-n2-pro
Nex AGI
262k28.00————
Solar Pro 4
solar-pro-4
Upstage
512k28.00—91 tok/s1.91 s29.48 s
GPT-6 Sol (Non-reasoning)
gpt-6-sol-non-reasoning
OpenAI
872k28.00$0.33/M76 tok/s1.13 s7.73 s
Claude Sonnet 5 (medium)
claude-sonnet-5-medium
Anthropic
1M28.00$1.00/M70 tok/s2.90 s10.00 s
Inkling Small
inkling-small
Thinking Machines
1M28.00—208 tok/s2.59 s14.63 s
Qwen3.8 27B (medium)
qwen3-8-27b-medium
Alibaba
256k28.00$1.13/M53 tok/s3.79 s50.82 s
GPT-5.6 Terra (low)
gpt-5-6-terra-low
OpenAI
1M27.00$0.14/M85 tok/s1.70 s7.59 s
JT-4.1 Flash 236B A21B
jt-4-1-flash-236b-a21b
China Mobile
256k27.00————
Quasar 438B (max)
quasar-438b-max
Multiverse Computing
1M27.00$2.02/M153 tok/s1.14 s17.46 s
Apodex 1.1
apodex-1-1
Apodex
256k26.00$0.46/M———
Qwen3.8 27B (low)
qwen3-8-27b-low
Alibaba
256k26.00$1.05/M53 tok/s3.81 s50.87 s
GPT-5.5 Instant (June 2026)
gpt-5-5-instant-june-2026
OpenAI
400k26.00$0.69/M156 tok/s1.00 s17.06 s
MiMo-V2.5-Pro
mimo-v2-5-pro
Xiaomi
1M26.00$0.05/M45 tok/s4.49 s59.57 s
Kimi K2.7 Code
kimi-k2-7-code
Kimi
256k26.00$0.54/M68 tok/s2.95 s43.23 s
K2 Horizon MoVA 36B A4B
k2-horizon-mova-36b-a4b
Institute of Foundation Models
524k25.00————
Hy3
hy3
Tencent
256k25.00$0.07/M90 tok/s2.99 s30.87 s
MiMo-V2.5
mimo-v2-5
Xiaomi
1M25.00—48 tok/s5.65 s58.16 s
Qwen3.7 Plus
qwen3-7-plus
Alibaba
1M25.00$0.30/M73 tok/s2.23 s36.27 s
Inkling
inkling
Thinking Machines
1M25.00$0.61/M167 tok/s1.87 s16.83 s
Ling 3.0 Flash
ling-3-0-flash
InclusionAI
262k25.00—363 tok/s2.57 s9.46 s
Solar Open2 250B
solar-open2-250b
Upstage
1.1M25.00————
DeepSeek V4.1 Flash (Non-reasoning)
deepseek-v4-1-flash-non-reasoning
DeepSeek
1M25.00$0.15/M274 tok/s1.19 s3.01 s
Ling-3.0-flash-VL
ling-3-0-flash-vl
InclusionAI
262k25.00—146 tok/s1.80 s18.87 s
Claude Sonnet 5 (low)
claude-sonnet-5-low
Anthropic
1M24.00$0.51/M65 tok/s1.56 s9.29 s
Claude Sonnet 5 (Non-reasoning)
claude-sonnet-5-non-reasoning
Anthropic
1M23.00—65 tok/s1.69 s9.36 s
Nemotron 3 Ultra
nemotron-3-ultra
NVIDIA
262k23.00$0.55/M157 tok/s1.58 s19.31 s
A.X-K2
a-x-k2
SK Telecom
262k23.00————
Ling-3.0-flash-Fin
ling-3-0-flash-fin
InclusionAI
262k23.00—159 tok/s1.71 s17.39 s
MiMo-V2-Flash (Feb 2026)
mimo-v2-flash-feb-2026
Xiaomi
256k22.00————
Gemini 3.5 Flash-Lite
gemini-3-5-flash-lite
Google
1M22.00$0.12/M349 tok/s9.13 s10.57 s
G9v3-39A5B
g9v3-39a5b
AI9Stars
131k22.00————
KAT-Coder-Pro V2
kat-coder-pro-v2
KwaiKAT
256k22.00————
Qwen3.5 397B A17B (Non-reasoning)
qwen3-5-397b-a17b-non-reasoning
Alibaba
262k21.00—87 tok/s2.21 s7.95 s
GPT-6 Luna (low)
gpt-6-luna-low
OpenAI
1M21.00$0.00/M127 tok/s2.12 s6.06 s
GPT-5.6 Terra (Non-reasoning)
gpt-5-6-terra-non-reasoning
OpenAI
1M21.00$0.14/M85 tok/s0.91 s6.79 s
K2 Horizon 7B
k2-horizon-7b
Institute of Foundation Models
524k21.00————
Qwen3.5 Omni Plus
qwen3-5-omni-plus
Alibaba
256k20.00—107 tok/s2.11 s6.79 s
o3
o3
OpenAI
200k20.00—119 tok/s6.11 s10.33 s
Qwen3.8 27B
qwen3-8-27b
Alibaba
256k20.00$2.49/M52 tok/s3.83 s13.39 s
K-EXAONE 2.0
k-exaone-2-0
LG AI Research
262k20.00————
Step 3.7 Flash
step-3-7-flash
StepFun
262k19.00—193 tok/s2.51 s15.46 s
LongCat 2.0
longcat-2-0
LongCat
1M19.00$0.06/M———
Gemma 4 31B
gemma-4-31b
Google
256k19.00—35 tok/s1.02 s64.42 s
JT-35B-Flash
jt-35b-flash
China Mobile
256k19.00————
Qwen3.5 397B A17B
qwen3-5-397b-a17b
Alibaba
262k18.00$0.47/M91 tok/s2.20 s42.62 s
MiMo-V2.5-Pro (Non-reasoning)
mimo-v2-5-pro-non-reasoning
Xiaomi
1M18.00—36 tok/s2.95 s16.96 s
GPT-6 Luna (Non-reasoning)
gpt-6-luna-non-reasoning
OpenAI
1M18.00$0.01/M123 tok/s0.89 s4.95 s
Qwen3.6 35B A3B
qwen3-6-35b-a3b
Alibaba
262k18.00$0.48/M128 tok/s2.08 s48.18 s
Qwen3.5 122B A10B (Non-reasoning)
qwen3-5-122b-a10b-non-reasoning
Alibaba
262k18.00—142 tok/s2.40 s5.93 s
Muse Glimmer (high)
muse-glimmer-high
Meta
131k17.00$0.06/M106 tok/s1.14 s24.77 s
Doubao Seed Code
doubao-seed-code
ByteDance Seed
256k17.00————
Claude 4.5 Haiku
claude-4-5-haiku
Anthropic
200k17.00$0.21/M85 tok/s16.72 s22.61 s
Gemma 4 26B A4B
gemma-4-26b-a4b
Google
256k17.00————
Ring-2.6-1T
ring-2-6-1t
InclusionAI
262k17.00$0.29/M123 tok/s4.12 s24.40 s
K2 Horizon 3.7B
k2-horizon-3-7b
Institute of Foundation Models
524k16.00————
Qwen3.5 122B A10B
qwen3-5-122b-a10b
Alibaba
262k16.00$0.32/M132 tok/s2.32 s21.24 s
Claude 4.5 Haiku (Non-reasoning)
claude-4-5-haiku-non-reasoning
Anthropic
200k15.00—81 tok/s0.68 s6.84 s
Ling 3.0 Tiny
ling-3-0-tiny
InclusionAI
262k15.00—26 tok/s2.67 s97.50 s
Qwen3.6 35B A3B (Non-reasoning)
qwen3-6-35b-a3b-non-reasoning
Alibaba
262k15.00—142 tok/s2.15 s5.67 s
Granite 4.2 30B
granite-4-2-30b
IBM
131k15.00—75 tok/s0.86 s34.10 s
ERNIE 5.0 Thinking Preview
ernie-5-0-thinking-preview
Baidu
128k14.00————
Mistral Medium 3.5
mistral-medium-3-5
Mistral
256k14.00$0.44/M150 tok/s2.36 s19.00 s
Gemma 4 12B
gemma-4-12b
Google
256k14.00—114 tok/s2.44 s24.44 s
Nova 2.0 Pro Preview (medium)
nova-2-0-pro-preview-medium
Amazon
256k14.00—116 tok/s13.06 s34.56 s
Gemma 4 31B (Non-reasoning)
gemma-4-31b-non-reasoning
Google
256k14.00—59 tok/s1.95 s10.42 s
Qwen3.5 9B
qwen3-5-9b
Alibaba
262k14.00—58 tok/s1.33 s44.23 s
Nova 2.0 Omni (medium)
nova-2-0-omni-medium
Amazon
1M14.00————
Apriel-v1.6-15B-Thinker
apriel-v1-6-15b-thinker
ServiceNow
128k13.00————
Nova 2.0 Lite (high)
nova-2-0-lite-high
Amazon
1M13.00—166 tok/s13.91 s28.99 s
Qwen3.5 9B (Non-reasoning)
qwen3-5-9b-non-reasoning
Alibaba
262k13.00—88 tok/s0.77 s6.48 s
EXAONE 4.5 33B
exaone-4-5-33b
LG AI Research
262k13.00————
Command A+
command-a
Cohere
192k13.00$0.00/M163 tok/s0.42 s15.75 s
Gemma 4 26B A4B (Non-reasoning)
gemma-4-26b-a4b-non-reasoning
Google
256k13.00—105 tok/s1.09 s5.86 s
Qwen3.5 4B
qwen3-5-4b
Alibaba
262k13.00—26 tok/s0.70 s97.72 s
Nemotron 3.5 Lightning
nemotron-3-5-lightning
NVIDIA
1M13.00$0.10/M278 tok/s0.59 s9.60 s
Nemotron 3 Super
nemotron-3-super
NVIDIA
1M13.00$1.64/M169 tok/s1.45 s16.28 s
Nova 2.0 Pro Preview (low)
nova-2-0-pro-preview-low
Amazon
256k13.00—111 tok/s10.36 s32.82 s
Nova 2.0 Lite (medium)
nova-2-0-lite-medium
Amazon
1M12.00—162 tok/s14.12 s29.56 s
Qwen3.5 Omni Flash
qwen3-5-omni-flash
Alibaba
256k12.00—260 tok/s1.91 s3.84 s
MiniCPM5-2B
minicpm5-2b
OpenBMB
131k12.00————
Mercury 2.5
mercury-2-5
Inception
260k12.00$0.06/M843 tok/s3.06 s3.65 s
JT-MINI
jt-mini
China Mobile
128k12.00————
Magistral Medium 1.2
magistral-medium-1-2
Mistral
128k12.00————
Nova 2.0 Lite (low)
nova-2-0-lite-low
Amazon
1M12.00—168 tok/s7.59 s22.52 s
HyperNova 60B 2605 (high)
hypernova-60b-2605-high
Multiverse Computing
131k12.00————
Nemotron Cascade 2 30B A3B
nemotron-cascade-2-30b-a3b
NVIDIA
1M12.00————
gpt-oss-120b (high)
gpt-oss-120b-high
OpenAI
131k12.00$0.11/M181 tok/s0.86 s14.71 s
K2 Think V2
k2-think-v2
Institute of Foundation Models
262k11.00————
LongCat Flash Lite
longcat-flash-lite
LongCat
256k11.00————
HyperCLOVA X SEED Think (32B)
hyperclova-x-seed-think-32b
Naver
128k11.00————
Mistral Small 4
mistral-small-4
Mistral
256k11.00$0.02/M167 tok/s0.77 s15.76 s
Qwen3 Next 80B A3B (Reasoning)
qwen3-next-80b-a3b-reasoning
Alibaba
262k11.00—182 tok/s2.31 s16.06 s
Nova 2.0 Omni (low)
nova-2-0-omni-low
Amazon
1M11.00————
Granite 4.2 8B
granite-4-2-8b
IBM
131k11.00$0.02/M79 tok/s0.80 s32.57 s
Mi:dm K 2.5 Pro
mi-dm-k-2-5-pro
Korea Telecom
128k11.00————
G9v3-3B
g9v3-3b
AI9Stars
131k11.00————
Trinity Large Thinking
trinity-large-thinking
Arcee AI
512k11.00—322 tok/s1.36 s9.13 s
Qwen3.5 4B (Non-reasoning)
qwen3-5-4b-non-reasoning
Alibaba
262k11.00—24 tok/s0.93 s22.10 s
INTELLECT-3
intellect-3
Prime Intellect
131k11.00————
Solar Open 100B
solar-open-100b
Upstage
128k10.00————
Nemotron 3 Nano Omni 30B A3B
nemotron-3-nano-omni-30b-a3b
NVIDIA
256k10.00—267 tok/s0.48 s9.84 s
gpt-oss-120b (low)
gpt-oss-120b-low
OpenAI
131k10.00—185 tok/s0.85 s14.39 s
Llama 4 Maverick
llama-4-maverick
Meta
1M10.00—116 tok/s0.92 s5.24 s
Nova 2.0 Pro Preview (Non-reasoning)
nova-2-0-pro-preview-non-reasoning
Amazon
256k10.00—97 tok/s1.03 s6.19 s
gpt-oss-20b (low)
gpt-oss-20b-low
OpenAI
131k10.00—205 tok/s1.07 s13.28 s
North Mini Code
north-mini-code
Cohere
256k10.00$0.00/M83 tok/s0.39 s30.35 s
K2-V2 (high)
k2-v2-high
Institute of Foundation Models
512k10.00————
Qwen3 Next 80B A3B
qwen3-next-80b-a3b
Alibaba
262k10.00—165 tok/s2.15 s5.18 s
DiffusionGemma 26B A4B
diffusiongemma-26b-a4b
Google
256k10.00————
Gemma 4 12B (Non-reasoning)
gemma-4-12b-non-reasoning
Google
262k9.00—122 tok/s2.45 s6.55 s
Mistral Large 3
mistral-large-3
Mistral
256k9.00$0.05/M77 tok/s1.09 s7.54 s
Qwen3 Coder Next
qwen3-coder-next
Alibaba
256k9.00$0.55/M126 tok/s1.28 s5.26 s
Motif-2-12.7B
motif-2-12-7b
Motif Technologies
128k9.00————
Nova Premier
nova-premier
Amazon
1M9.00————
Granite 4.2 3B
granite-4-2-3b
IBM
131k9.00$0.01/M215 tok/s0.50 s12.12 s
K2-V2 (medium)
k2-v2-medium
Institute of Foundation Models
512k9.00————
Mistral Small 4 (Non-reasoning)
mistral-small-4-non-reasoning
Mistral
256k9.00—149 tok/s0.76 s4.12 s
Tri-21B-Think
tri-21b-think
Trillion Labs
32k9.00————
gpt-oss-20b (high)
gpt-oss-20b-high
OpenAI
131k9.00$0.01/M159 tok/s0.80 s16.48 s
Gemma 4 E4B
gemma-4-e4b
Google
128k9.00—50 tok/s0.86 s51.34 s
Nemotron 3 Nano
nemotron-3-nano
NVIDIA
1M9.00$0.02/M210 tok/s1.07 s12.98 s
MiniCPM5-1B
minicpm5-1b
OpenBMB
128k9.00————
Sarvam 105B (high)
sarvam-105b-high
Sarvam
128k9.00————
Nova 2.0 Lite (Non-reasoning)
nova-2-0-lite-non-reasoning
Amazon
1M9.00—165 tok/s1.09 s4.13 s
MiniCPM5-1B (Non-reasoning)
minicpm5-1b-non-reasoning
OpenBMB
128k9.00————
Magistral Small 1.2
magistral-small-1-2
Mistral
128k9.00————
Nanbeige4.1-3B
nanbeige4-1-3b
Nanbeige
256k8.00————
LFM2.5-2.6B
lfm2-5-2-6b
Liquid AI
128k8.00————
EXAONE 4.0 32B
exaone-4-0-32b
LG AI Research
131k8.00————
Nova 2.0 Omni (Non-reasoning)
nova-2-0-omni-non-reasoning
Amazon
1M8.00————
Llama 4 Scout
llama-4-scout
Meta
10M8.00—99 tok/s0.85 s5.89 s
Hermes 4 70B
hermes-4-70b
Nous Research
128k8.00————
Falcon-H1R-7B
falcon-h1r-7b
TII UAE
256k8.00————
Gemma 4 E2B
gemma-4-e2b
Google
128k8.00————
Qwen3 Omni 30B A3B (Reasoning)
qwen3-omni-30b-a3b-reasoning
Alibaba
66k8.00—102 tok/s1.90 s26.48 s
Step3 VL 10B
step3-vl-10b
StepFun
66k8.00————
Llama 3.3 70B
llama-3-3-70b
Meta
128k8.00—86 tok/s1.68 s7.52 s
Llama Nemotron Ultra
llama-nemotron-ultra
NVIDIA
128k8.00————
ERNIE 4.5 300B A47B
ernie-4-5-300b-a47b
Baidu
131k8.00————
Hermes 4 405B
hermes-4-405b
Nous Research
128k7.00—43 tok/s2.36 s61.08 s
NVIDIA Nemotron Nano 12B v2 VL
nvidia-nemotron-nano-12b-v2-vl
NVIDIA
128k7.00————
Gemma 4 E4B (Non-reasoning)
gemma-4-e4b-non-reasoning
Google
128k7.00—46 tok/s0.83 s11.62 s
NVIDIA Nemotron Nano 9B V2
nvidia-nemotron-nano-9b-v2
NVIDIA
131k7.00—115 tok/s5.08 s26.82 s
Hermes 4 405B (Non-reasoning)
hermes-4-405b-non-reasoning
Nous Research
128k7.00—43 tok/s2.31 s13.94 s
Nemotron 3 Nano 4B
nemotron-3-nano-4b
NVIDIA
262k7.00————
K2-V2 (low)
k2-v2-low
Institute of Foundation Models
512k7.00————
Kimi Linear 48B A3B Instruct
kimi-linear-48b-a3b-instruct
Kimi
1M7.00————
Llama 3.1 405B
llama-3-1-405b
Meta
128k7.00————
LFM2.5-8B-A1B
lfm2-5-8b-a1b
Liquid AI
33k7.00————
Ring-flash-2.0
ring-flash-2-0
InclusionAI
128k7.00————
Olmo 3.1 32B Think
olmo-3-1-32b-think
Allen Institute for AI
66k7.00————
Command A
command-a
Cohere
256k7.00—53 tok/s1.87 s11.27 s
Qwen3.5 2B
qwen3-5-2b
Alibaba
262k7.00————
Nemotron 3 Nano (Non-reasoning)
nemotron-3-nano-non-reasoning
NVIDIA
1M7.00—250 tok/s0.82 s2.83 s
NVIDIA Nemotron Nano 9B V2 (Non-reasoning)
nvidia-nemotron-nano-9b-v2-non-reasoning
NVIDIA
131k7.00—157 tok/s3.02 s6.20 s
Hermes 4 70B (Non-reasoning)
hermes-4-70b-non-reasoning
Nous Research
128k7.00————
Sarvam 30B (high)
sarvam-30b-high
Sarvam
66k7.00————
Olmo 3.1 32B Instruct
olmo-3-1-32b-instruct
Allen Institute for AI
66k6.00————
Gemma 4 E2B (Non-reasoning)
gemma-4-e2b-non-reasoning
Google
128k6.00————
R1 1776
r1-1776
Perplexity
128k6.00————
Llama 3.2 90B (Vision)
llama-3-2-90b-vision
Meta
128k6.00————
Celeris-1
celeris-1
Celeris
131k6.00$0.05/M1,628 tok/s0.59 s0.90 s
Phi-4 Mini
phi-4-mini
Microsoft
128k6.00—45 tok/s0.83 s11.90 s
EXAONE 4.0 32B (Non-reasoning)
exaone-4-0-32b-non-reasoning
LG AI Research
131k6.00————
Qwen3.5 2B (Non-reasoning)
qwen3-5-2b-non-reasoning
Alibaba
262k6.00————
Qwen3.5 0.8B
qwen3-5-0-8b
Alibaba
262k6.00————
DeepHermes 3 - Mistral 24B
deephermes-3-mistral-24b
Nous Research
32k6.00————
Jamba 1.7 Large
jamba-1-7-large
AI21 Labs
256k6.00————
Granite 4.0 H Small
granite-4-0-h-small
IBM
128k6.00—13 tok/s37.82 s75.26 s
Ministral 3 14B
ministral-3-14b
Mistral
256k6.00$0.02/M89 tok/s0.90 s6.52 s
Qwen3 Omni 30B A3B
qwen3-omni-30b-a3b
Alibaba
66k6.00—96 tok/s1.85 s7.07 s
LFM2 24B A2B
lfm2-24b-a2b
Liquid AI
33k6.00————
Phi-4
phi-4
Microsoft
16k6.00—34 tok/s2.46 s17.00 s
Nova Micro
nova-micro
Amazon
130k6.00—266 tok/s0.83 s2.71 s
NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)
nvidia-nemotron-nano-12b-v2-vl-non-reasoning
NVIDIA
128k6.00—206 tok/s1.18 s3.61 s
Phi-4 Multimodal
phi-4-multimodal
Microsoft
128k6.00—17 tok/s0.81 s29.89 s
MiniCPM-V 4.6 1.3B
minicpm-v-4-6-1-3b
OpenBMB
262k6.00————
Jamba Reasoning 3B
jamba-reasoning-3b
AI21 Labs
262k6.00————
Reka Flash 3
reka-flash-3
Reka AI
128k6.00————
Olmo 3 7B Think
olmo-3-7b-think
Allen Institute for AI
66k6.00————
Molmo 7B-D
molmo-7b-d
Allen Institute for AI
4k6.00————
Ministral 3 8B
ministral-3-8b
Mistral
256k5.00$0.01/M96 tok/s0.77 s5.95 s
Llama 3.2 11B (Vision)
llama-3-2-11b-vision
Meta
128k5.00—20 tok/s1.98 s26.81 s
Qwen3.5 0.8B (Non-reasoning)
qwen3-5-0-8b-non-reasoning
Alibaba
262k5.00————
Exaone 4.0 1.2B
exaone-4-0-1-2b
LG AI Research
64k5.00————
Olmo 3 7B
olmo-3-7b
Allen Institute for AI
66k5.00————
Exaone 4.0 1.2B (Non-reasoning)
exaone-4-0-1-2b-non-reasoning
LG AI Research
64k5.00————
LFM2.5-1.2B-Thinking
lfm2-5-1-2b-thinking
Liquid AI
32k5.00————
Jamba 1.7 Mini
jamba-1-7-mini
AI21 Labs
258k5.00————
LFM2.5-1.2B-Instruct
lfm2-5-1-2b-instruct
Liquid AI
32k5.00————
Granite 4.0 H 1B
granite-4-0-h-1b
IBM
128k5.00————
Gemma 3 270M
gemma-3-270m
Google
32k5.00————
Apertus 70B Instruct
apertus-70b-instruct
Swiss AI Initiative
66k5.00————
Granite 4.0 Micro
granite-4-0-micro
IBM
128k5.00————
DeepHermes 3 - Llama-3.1 8B
deephermes-3-llama-3-1-8b
Nous Research
128k5.00————
Molmo2-8B
molmo2-8b
Allen Institute for AI
37k5.00————
Ministral 3 3B
ministral-3-3b
Mistral
256k5.00$0.01/M210 tok/s0.75 s3.13 s
LFM2.5-VL-1.6B
lfm2-5-vl-1-6b
Liquid AI
32k5.00————
Granite 4.0 350M
granite-4-0-350m
IBM
33k5.00————
Tiny Aya Global
tiny-aya-global
Cohere
8k5.00————
Apertus 8B Instruct
apertus-8b-instruct
Swiss AI Initiative
66k5.00————
Granite 4.0 H 350M
granite-4-0-h-350m
IBM
33k5.00————
K2 Horizon 0.9B
k2-horizon-0-9b
Institute of Foundation Models
131k3.00————
EXAONE 4.5 33B (Non-reasoning)
exaone-4-5-33b-non-reasoning
LG AI Research
262k—————
Gemini 3 Deep Think
gemini-3-deep-think
Google
128k—————
GPT-5.5 Pro (xhigh)
gpt-5-5-pro-xhigh
OpenAI
922k—————
Cogito v2.1
cogito-v2-1
Deep Cogito
128k—————