Fireworks AI Pricing
Fireworks AI charges between $0.0010 and $8.00 per 1 million output tokens, depending on the model. Accounts Fireworks Models Flux 1 Dev Controlnet Union is the cheapest at $0.0010/1M output and $0.0010/1M input; Kimi K2.7 Code Fast is the most expensive at $8.00/1M output. The largest context window is 1.0M tokens (Accounts Fireworks Models DeepSeek V4 Flash). Prices are USD, current as of July 20, 2026.
Last updated · synced weekly from the upstream model catalog
Cheapest input
$0.0010/1M
Accounts Fireworks Models Flux 1 Dev Controlnet Union
Cheapest output
$0.0010/1M
Accounts Fireworks Models Flux 1 Dev Controlnet Union
Longest context
1.0M
Accounts Fireworks Models DeepSeek V4 Flash
Models priced
279
Avg $1.15/1M output
Pricing by model
All prices in USD per 1 million tokens. Showing 80 of 279 priced models, cheapest first.
| Model | Input / 1M | Output / 1M | Context |
|---|---|---|---|
| Accounts Fireworks Models Flux 1 Dev Controlnet Union | $0.0010 | $0.0010 | 4K |
| Accounts Fireworks Models Codegemma 2B | $0.100 | $0.100 | 8K |
| Accounts Fireworks Models Cogito V1 Preview Llama 3B | $0.100 | $0.100 | 131K |
| Accounts Fireworks Models DeepSeek Coder 1B Base | $0.100 | $0.100 | 16K |
| Accounts Fireworks Models DeepSeek R1 Distill Qwen 1p5b | $0.100 | $0.100 | 131K |
| Accounts Fireworks Models Ernie 4p5 21B A3b Pt | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Ernie 4p5 300B A47b Pt | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Flux 1 Dev | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Flux 1 Schnell | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Gemma 2B It | $0.100 | $0.100 | 8K |
| Accounts Fireworks Models Llama Guard 3 1B | $0.100 | $0.100 | 131K |
| Accounts Fireworks Models Llama V2 70B | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Llama V3p1 405B Instruct Long | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Llama V3p1 70B Instruct 1B | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Llama V3p1 8B Instruct | $0.100 | $0.100 | 16K |
| Accounts Fireworks Models Llama V3p2 1B | $0.100 | $0.100 | 131K |
| Accounts Fireworks Models Llama V3p2 1B Instruct | $0.100 | $0.100 | 16K |
| Accounts Fireworks Models Llama V3p2 3B | $0.100 | $0.100 | 131K |
| Accounts Fireworks Models Llama V3p2 3B Instruct | $0.100 | $0.100 | 16K |
| Accounts Fireworks Models Minimax M1 80K | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Ministral 3 3B Instruct 2512 | $0.100 | $0.100 | 256K |
| Accounts Fireworks Models Nemotron Nano V2 12B VL | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Phi 2 3B | $0.100 | $0.100 | 2K |
| Accounts Fireworks Models Phi 3 Mini 128K Instruct | $0.100 | $0.100 | 131K |
| Accounts Fireworks Models Qwen2 VL 2B Instruct | $0.100 | $0.100 | 33K |
| Accounts Fireworks Models Qwen2p5 0p5b Instruct | $0.100 | $0.100 | 33K |
| Accounts Fireworks Models Qwen2p5 1p5b Instruct | $0.100 | $0.100 | 33K |
| Accounts Fireworks Models Qwen2p5 Coder 0p5b | $0.100 | $0.100 | 33K |
| Accounts Fireworks Models Qwen2p5 Coder 0p5b Instruct | $0.100 | $0.100 | 33K |
| Accounts Fireworks Models Qwen2p5 Coder 1p5b | $0.100 | $0.100 | 33K |
| Accounts Fireworks Models Qwen2p5 Coder 1p5b Instruct | $0.100 | $0.100 | 33K |
| Accounts Fireworks Models Qwen2p5 Coder 3B | $0.100 | $0.100 | 33K |
| Accounts Fireworks Models Qwen2p5 Coder 3B Instruct | $0.100 | $0.100 | 33K |
| Accounts Fireworks Models Qwen3 0p6b | $0.100 | $0.100 | 41K |
| Accounts Fireworks Models Qwen3 1p7b | $0.100 | $0.100 | 131K |
| Accounts Fireworks Models Qwen3 1p7b Fp8 Draft | $0.100 | $0.100 | 262K |
| Accounts Fireworks Models Qwen3 1p7b Fp8 Draft 131072 | $0.100 | $0.100 | 131K |
| Accounts Fireworks Models Qwen3 1p7b Fp8 Draft 40960 | $0.100 | $0.100 | 41K |
| Accounts Fireworks Models Stablecode 3B | $0.100 | $0.100 | 4K |
| Accounts Fireworks Models Starcoder2 3B | $0.100 | $0.100 | 16K |
| Accounts Fireworks Models Chronos Hermes 13B | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models Code Llama 13B | $0.200 | $0.200 | 16K |
| Accounts Fireworks Models Code Llama 13B Instruct | $0.200 | $0.200 | 16K |
| Accounts Fireworks Models Code Llama 13B Python | $0.200 | $0.200 | 16K |
| Accounts Fireworks Models Code Llama 7B | $0.200 | $0.200 | 16K |
| Accounts Fireworks Models Code Llama 7B Instruct | $0.200 | $0.200 | 16K |
| Accounts Fireworks Models Code Llama 7B Python | $0.200 | $0.200 | 16K |
| Accounts Fireworks Models Code Qwen 1p5 7B | $0.200 | $0.200 | 66K |
| Accounts Fireworks Models Codegemma 7B | $0.200 | $0.200 | 8K |
| Accounts Fireworks Models Cogito V1 Preview Llama 8B | $0.200 | $0.200 | 131K |
| Accounts Fireworks Models Cogito V1 Preview Qwen 14B | $0.200 | $0.200 | 131K |
| Accounts Fireworks Models DeepSeek Coder 7B Base | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models DeepSeek Coder 7B Base V1p5 | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models DeepSeek Coder 7B Instruct V1p5 | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models DeepSeek R1 0528 Distill Qwen3 8B | $0.200 | $0.200 | 131K |
| Accounts Fireworks Models DeepSeek R1 Distill Llama 8B | $0.200 | $0.200 | 131K |
| Accounts Fireworks Models DeepSeek R1 Distill Qwen 14B | $0.200 | $0.200 | 131K |
| Accounts Fireworks Models DeepSeek R1 Distill Qwen 7B | $0.200 | $0.200 | 131K |
| Accounts Fireworks Models Dobby Mini Unhinged Plus Llama 3.1 8B | $0.200 | $0.200 | 131K |
| Accounts Fireworks Models Firellava 13B | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models Firesearch Ocr | $0.200 | $0.200 | 8K |
| Accounts Fireworks Models Gemma 7B | $0.200 | $0.200 | 8K |
| Accounts Fireworks Models Gemma 7B It | $0.200 | $0.200 | 8K |
| Accounts Fireworks Models Gemma2 9B It | $0.200 | $0.200 | 8K |
| Accounts Fireworks Models Hermes 2 Pro Mistral 7B | $0.200 | $0.200 | 33K |
| Accounts Fireworks Models Internvl3 8B | $0.200 | $0.200 | 16K |
| Accounts Fireworks Models Llama Guard 2 8B | $0.200 | $0.200 | 8K |
| Accounts Fireworks Models Llama Guard 3 8B | $0.200 | $0.200 | 131K |
| Accounts Fireworks Models Llama V2 13B | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models Llama V2 13B Chat | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models Llama V2 7B | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models Llama V2 7B Chat | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models Llama V3 8B | $0.200 | $0.200 | 8K |
| Accounts Fireworks Models Llama V3 8B Instruct Hf | $0.200 | $0.200 | 8K |
| Accounts Fireworks Models Llama V3p2 11B Vision Instruct | $0.200 | $0.200 | 16K |
| Accounts Fireworks Models Llamaguard 7B | $0.200 | $0.200 | 4K |
| Accounts Fireworks Models Ministral 3 14B Instruct 2512 | $0.200 | $0.200 | 256K |
| Accounts Fireworks Models Ministral 3 8B Instruct 2512 | $0.200 | $0.200 | 256K |
| Accounts Fireworks Models Mistral 7B | $0.200 | $0.200 | 33K |
| Glm 5p1 Fast | $2.80 | $8.80 | 203K |
Frequently asked questions
How much does Fireworks AI cost per 1M tokens?
Fireworks AI pricing ranges from $0.0010 to $8.00 per 1 million output tokens across 279 models. Input tokens are cheaper than output on every model. Rates current as of July 20, 2026.
What is the cheapest Fireworks AI model?
Accounts Fireworks Models Flux 1 Dev Controlnet Union is the cheapest Fireworks AI model on both axes — $0.0010 per 1M input tokens and $0.0010 per 1M output. It is the right default for high-volume, low-complexity work such as classification, extraction and routing.
What is the largest Fireworks AI context window?
Accounts Fireworks Models DeepSeek V4 Flash has the largest context window in the Fireworks AI catalog at 1.0M input tokens, with up to 384K output tokens per response.
Does Fireworks AI support prompt caching?
Yes. GPT OSS 120B reads cached input at $0.015 per 1M tokens, against $0.150 per 1M uncached. Caching pays off when a long system prompt or document is reused across many requests.
Which Fireworks AI models support reasoning or vision?
The Fireworks AI catalog includes 16 reasoning models, 6 vision models, 16 with tool calling. Reasoning models bill their internal thinking as output tokens, so they cost more per visible response than the headline rate suggests.
How do I calculate my actual Fireworks AI bill?
Multiply your input tokens by the input rate and your output tokens by the output rate, both per million, then add retries and any conversation history resent on each turn. Calcaas does this against your real usage pattern and shows the margin left at your price point.
Other providers
What will this actually cost you?
Per-token rates only tell you half the story. Calcaas multiplies them by your real usage — prompt size, response length, retries and conversation history — then shows the margin left at your price point.
Open the free cost calculator