Qwen's 122B/10B-active multimodal MoE, balancing stronger quality with efficient inference.
Qwen's compact multimodal reasoning model on a cost-efficient DeepInfra rail with ultra-fast Groq failover.
| Provider | Role | Context | Price · in / out | p50 | p95 | Uptime |
|---|---|---|---|---|---|---|
| ddeepinfraNo trainingNo training on your data | Primary | 131K | $0.75 / $3.84/MToksame price, any rail | 4.5s | 4.5s | 100% |
| ggroqNo trainingNo training on your data. Zero-retention available | Fallback | 131K | 197ms | 197ms | 100% |
Collecting — charts appear after two days.
curl https://www.ninjachat.ai/api/v1/chat/completions \
-H "Authorization: Bearer $NINJACHAT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-3.6-27b",
"messages": [{ "role": "user", "content": "Hello!" }],
"stream": true
}'Qwen's compact multimodal reasoning model on a cost-efficient DeepInfra rail with ultra-fast Groq failover.
Qwen 3.6 27B costs $0.75/M input tokens and $3.84/M output tokens.
Qwen 3.6 27B accepts text and image and returns text.
POST /api/v1/chat/completions with `"model": "qwen-3.6-27b"`.
Qwen 3.5 122B A10B, Qwen 3.5 27B, Qwen 3.5 397B A17B, Qwen 3.6 35B A3B, Qwen 3.7 Plus, Qwen 3.8 2.4T A95B, Qwen 3.8 27B, Qwen 3.8 Max, Qwen3 Next 80B A3B, QwQ 32B.
routing.strategyproviders.onlyproviders.excludeproviders.ordermax_cost_usddata_policydocs →Qwen's 397B/17B-active multimodal flagship with broad multilingual, coding, and agentic capability.
Qwen's sparse 35B/3B-active multimodal model for efficient coding and agents.
Qwen's fast multimodal flagship for agent loops, coding, and tool use.