DeepSeek V4 Flash 0731

Fireworks
Model weights

DeepSeek's V4 Flash (July 31 build): fast, low-cost reasoning with a 1M-token context.

Modalities
IntextOuttext
Input / output
$0.22 / $0.66USD per 1M tokens
Context
1M
Providers
14 live

Playground

Preparing playground

Providers

primary——
fallback2.3s100%
fallback4.3s100%
emergency1.9s100%
emergency——
emergency7.8s100%
emergency——
emergency——
emergency——
emergency——
emergency——
emergency——
emergency——
emergency——

Performance

Request success
100%
Time to first token
2.9s
Generation speed
161.6tok/s

Response latency estimates

Time to first token

Generation speed · tok/s

Request success

Text-model timing and speed, plus API request success. Daily latency percentiles are estimates. Your request logs

Compare providers

Generation speed by provider · tok/s

P50 latency estimates by provider

Time to first token by provider

Request success by provider

API

POST/api/v1/chat/completionsOpenAI-compatible
deepseek-v4-flash-0731
curl https://www.ninjachat.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $NINJACHAT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-0731",
    "messages": [{ "role": "user", "content": "Hello!" }],
    "stream": true
  }'
messagestemperaturemax_completion_tokenstop_pstopfrequency_penaltypresence_penaltyseedstreamuserroutingtoolstool_choiceresponse_formatreasoningreasoning_effort

Pricing

Input
$0.22/M tokens
Cached input
$0.007/M tokens
Output
$0.66/M tokens

Published USD rates. Actual cost depends on input, output, cache usage and request options.