Chaque comparaison de modèles que vous lisez est soit un tableau de benchmarks que personne ne peut reproduire, soit un avis impressionniste sur deux modèles que l'auteur appréciait déjà. Alors le 2 septembre 2026, nous avons fait la version ennuyeuse : les mêmes trois prompts, envoyés une fois chacun à douze modèles actuels via notre propre API, chronométrés sur le stream et facturés au tarif qu'une clé NinjaChat paie réellement. Rien de ce qui suit n'a été modifié, trié sur le volet ou relancé pour paraître plus flatteur.
La version courte. Les douze ont écrit une fonction de fusion d'intervalles correcte dont les tests passent. GPT-5.6 Terra a été le modèle le plus rapide au premier token en moyenne, et le codeur le plus rapide de l'ensemble, en moins de trois secondes. GPT-5.6 Luna et gpt-oss-120b sont ex æquo sur le coût le plus bas, à environ un dixième de centime pour les trois réponses. Les deux réponses individuelles les plus chères de la journée ont été le conseil aux fondateurs de Kimi K3, qui a raisonné pendant 1 034 tokens et pris 27 secondes, et le code de Claude Opus 5, qui est aussi le code le plus complet écrit par qui que ce soit. Entre les deux, les différences intéressantes ne concernent pas du tout la correction. Elles portent sur la durée de réflexion de chaque modèle avant de répondre, sur l'hôte qui le sert, et sur le coût de tout cela.
Comment nous avons mesuré
- Date et lieu : 2 septembre 2026, un après-midi, un ordinateur portable sur une connexion domestique aux États-Unis.
- Acheminement : chaque requête est passée par l'API NinjaChat,
POST /api/v1/chat/completions, avec une clé playground ordinaire. La latence affichée inclut notre routage, le fournisseur que nous avons choisi, et le temps propre à ce fournisseur. La colonne Servi par identifie ce fournisseur pour chaque réponse. - Modèles : Claude Opus 5, GPT-5.5, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Kimi K3, Gemini 3.7 Flash, GLM-5.2, GLM-4.7, MiniMax M3, gpt-oss-120b et Qwen 3.8 Flash.
- Paramètres : température 0,7, plafond de 2 500 tokens en sortie, streaming activé avec remontée d'utilisation, tous les autres paramètres laissés aux valeurs par défaut du modèle. La plupart de ces modèles raisonnent par défaut, et notre API rapporte les tokens de raisonnement séparément des tokens visibles en sortie ; les deux colonnes figurent donc dans chaque tableau. Deux hôtes, DeepInfra pour GLM-4.7 et Fireworks pour GLM-5.2, intègrent le raisonnement dans le comptage de sortie ; ces lignes affichent donc un grand nombre de tokens en sortie et un zéro dans la colonne raisonnement.
- Chronométrage : le temps au premier token est celui auquel le premier caractère visible de la réponse est arrivé, après tout raisonnement masqué. Le temps total correspond à la fermeture du stream. Les requêtes ont été exécutées une par une, jamais en parallèle, après une requête d'échauffement pour chaque modèle, de sorte qu'aucun chiffre ci-dessous n'inclut un démarrage à froid de notre côté.
- Coût : le montant que notre API a déclaré facturer pour cette requête, au dix-millième de dollar près. Rien n'est estimé à partir d'une grille tarifaire.
- Un seul passage par cellule. Pas de nouvelle tentative, pas de meilleur score sur trois. Un second passage ne reproduira pas ces chiffres à la décimale près. Il devrait reproduire le classement.
Les trois prompts ont été copiés mot pour mot depuis les sections Exemples de réponses des pages de nos modèles, de sorte que ce que vous voyez ici correspond exactement à la tâche présentée sur ces pages :
- « Écris une fonction Python qui fusionne des intervalles qui se chevauchent, ainsi que trois courts tests. Garde l'ensemble de la réponse en dessous de 40 lignes de code. »
- « En environ 120 mots, dis à un fondateur en phase initiale quand choisir un monolithe plutôt que des microservices, et quel est le seul signal indiquant qu'il est temps de séparer. »
- « Réécris cette phrase de trois manières, chacune dans un registre clairement différent (simple, ludique, corporate) : "Notre application facilite la gestion du budget." Étiquette chacune. »
Prompt 1 : fusionner des intervalles qui se chevauchent
Trié par temps total. Chaque réponse ci-dessous a passé ses propres tests lorsque nous avons exécuté le code.
| Modèle | Servi par | Temps au premier token | Temps total | Tokens en sortie | Tokens de raisonnement | Facturé pour cette réponse |
|---|---|---|---|---|---|---|
| GPT-5.6 Terra | OpenAI | 1,5 s | 2,9 s | 184 | 0 | 0,0023 $ |
| Gemini 3.7 Flash | 2,8 s | 3,3 s | 232 | 445 | 0,0052 $ | |
| MiniMax M3 | Fireworks | 3,3 s | 4,9 s | 285 | 271 | 0,0008 $ |
| gpt-oss-120b | Fireworks | 4,4 s | 6,3 s | 280 | 434 | 0,0006 $ |
| GPT-5.6 Luna | OpenAI | 5,9 s | 7,2 s | 171 | 374 | 0,0007 $ |
| Claude Opus 5 | Anthropic | 3,7 s | 8,6 s | 621 | 89 | 0,0180 $ |
| Qwen 3.8 Flash | Novita | 8,1 s | 9,1 s | 175 | 757 | 0,0005 $ |
| GPT-5.6 Sol | OpenAI | 8,8 s | 10,7 s | 194 | 26 | 0,0046 $ |
| GLM-5.2 | Fireworks | 12,9 s | 14,6 s | 989 | 0 | 0,0045 $ |
| Kimi K3 | Fireworks | 16,5 s | 21,7 s | 309 | 771 | 0,0166 $ |
| GPT-5.5 | OpenAI | 9,5 s | 29,4 s | 196 | 60 | 0,0079 $ |
| GLM-4.7 | DeepInfra | 60,6 s | 67,1 s | 1363 | 0 | 0,0031 $ |
Douze sur douze en correction, ce qui confirme que c'est un problème résolu pour tout modèle actuel. Les différences tiennent au style, à la façon dont chaque modèle dépense ses tokens, et dans un cas à ce que le mot « test » signifie.
La réponse la plus concise est venue de GLM-4.7 : quatorze lignes, aucun commentaire, pas de vérification séparée pour un tableau vide car la boucle le gère.
def merge_intervals(intervals):
intervals.sort(key=lambda x: x[0])
merged = []
for start, end in intervals:
if not merged or start > merged[-1][1]:
merged.append([start, end])
else:
merged[-1][1] = max(merged[-1][1], end)
return merged
Claude Opus 5 a fait le contraire. Il a écrit la seule version avec une docstring, trois fonctions de test nommées couvrant une liste vide, un élément unique, des intervalles contigus, non triés et imbriqués, ainsi qu'une note expliquant que les intervalles contigus fusionnent parce que la comparaison est fermée, avec le changement d'un caractère si l'on veut une sémantique semi-ouverte. C'est aussi la réponse la plus susceptible d'avoir agacé un lecteur strict : le bloc de code fait exactement 40 lignes, alors que le prompt en demandait moins de 40. Kimi K3 a écrit la version la plus soignée après Opus 5 : une fonction de test avec trois cas commentés et une entrée non triée et imbriquée.
La famille GPT a produit quasi la même fonction quatre fois. Terra l'a fait en 2,9 secondes sans token de raisonnement et sans docstring — la réponse la plus rapide du prompt. Sol a ajouté une docstring et retourné des tuples. Luna a raisonné 374 tokens pour aboutir à la réponse GPT la plus courte. GPT-5.5 a écrit la même fonction que Sol, puis son stream a calé : premier token à 9,5 secondes, dernier token à 29,4, pour 196 tokens en sortie. C'est le genre d'événement sur un seul passage qu'un second passage ne reproduirait probablement pas, et c'est exactement pourquoi nous le disons.
MiniMax M3 est la ligne à lire deux fois. Ses trois « tests » sont des instructions print avec la valeur attendue en commentaire à côté, donc ils ne peuvent pas échouer. Le code est correct, et nous l'avons exécuté, mais le modèle a répondu à une question différente de celle posée. Quatre modèles — Gemini 3.7 Flash, GLM-4.7, MiniMax M3 et Qwen 3.8 Flash — trient la liste de l'appelant en place, ce qui est acceptable pour un extrait de code et constitue un bug dans une bibliothèque.
Les lignes lentes sont des lignes d'hôte. GLM-4.7, servi par DeepInfra, a mis une bonne minute avant son premier caractère ; l'hôte comptabilise le raisonnement dans les 1 363 tokens de sortie qu'il a rapportés. Kimi K3 sur Fireworks a raisonné pendant 771 tokens et pris 22 secondes.
Verdict : Terra pour une fonction de ce type. Opus 5 si vous voulez la réponse qui vous apprend quelque chose, en acceptant les 40 lignes.
Prompt 2 : monolithe ou microservices
| Modèle | Servi par | Temps au premier token | Temps total | Tokens en sortie | Tokens de raisonnement | Facturé pour cette réponse |
|---|---|---|---|---|---|---|
| MiniMax M3 | Fireworks | 2,5 s | 4,0 s | 177 | 76 | 0,0004 $ |
| GPT-5.6 Luna | OpenAI | 2,6 s | 4,4 s | 165 | 75 | 0,0003 $ |
| GPT-5.6 Terra | OpenAI | 2,4 s | 4,6 s | 167 | 0 | 0,0021 $ |
| Gemini 3.7 Flash | 4,3 s | 4,6 s | 160 | 901 | 0,0081 $ | |
| GPT-5.5 | OpenAI | 2,7 s | 5,0 s | 163 | 31 | 0,0061 $ |
| gpt-oss-120b | Fireworks | 5,5 s | 6,5 s | 180 | 70 | 0,0003 $ |
| Claude Opus 5 | Anthropic | 2,7 s | 7,5 s | 332 | 23 | 0,0092 $ |
| GPT-5.6 Sol | OpenAI | 7,0 s | 10,0 s | 164 | 238 | 0,0082 $ |
| GLM-5.2 | Fireworks | 15,0 s | 16,5 s | 1259 | 0 | 0,0057 $ |
| Kimi K3 | Fireworks | 23,8 s | 26,9 s | 170 | 1034 | 0,0185 $ |
| Qwen 3.8 Flash | Novita | 29,9 s | 30,9 s | 162 | 3810 | 0,0019 $ |
| GLM-4.7 | DeepInfra | 78,9 s | 86,2 s | 1063 | 0 | 0,0024 $ |
Chaque modèle a donné le même conseil principal : commencer par un monolithe, ce qui est effectivement le bon conseil. La vraie question portait sur la seconde partie : nommer le seul signal indiquant qu'il est temps de séparer. Les réponses se sont réparties en deux camps.
Le camp organisationnel a dit que le signal, c'est les gens. Kimi K3 : « les équipes ne peuvent plus déployer de manière indépendante », avec un avertissement que séparer au mauvais endroit donne « un monolithe distribué : toute la douleur opérationnelle, aucune des indépendances. » Gemini 3.7 Flash a parlé de « goulot d'étranglement organisationnel » et ajouté : « les microservices sont un outil pour faire évoluer les organisations humaines et la vélocité de déploiement, pas les bases de code en phase initiale. » GLM-5.2 a parlé de « contention de déploiement ». GLM-4.7 a évoqué une « friction organisationnelle » et proposé un test : si plus personne ne peut comprendre l'ensemble du système, vous avez dépassé les limites du monolithe.
Le camp des goulots d'étranglement a dit que le signal, c'est une partie spécifique du système. Claude Opus 5 l'a rendu concret : « un transcodeur vidéo gourmand en CPU qui affame votre API », et a conclu avec la meilleure phrase de la journée : « Tout le reste — "c'est le bazar", "Netflix le fait" — n'est pas un signal. » GPT-5.6 Sol : « séparez quand une partie bien définie du produit doit régulièrement être déployée ou mise à l'échelle indépendamment, et que le monolithe l'empêche de façon mesurable », puis « extrayez uniquement cette frontière, donnez-lui une interface claire et un propriétaire, et laissez tout le reste ensemble. » Luna a ajouté la phrase que les autres ont oubliée : extrayez-la, « mesurez l'amélioration », et arrêtez-vous là. MiniMax M3 a exprimé la même idée en moins de mots avec une formule mémorable : « Séparer prématurément tue plus de startups que le mauvais code. »
Le tableau révèle ce que la prose dissimule. Opus 5 a atteint 162 mots pour une cible de 120 — la réponse la plus longue du prompt. Qwen 3.8 Flash a raisonné pendant 3 810 tokens, plus de vingt fois ce qu'il a écrit, et a mis 31 secondes pour dire quelque chose de sensé. Sol a raisonné 238 tokens, pris dix secondes, et a été facturé près de quatre fois le coût de la réponse de Terra, pour un paragraphe meilleur d'une phrase.
Verdict : Opus 5 si vous voulez la réponse que vous transmettriez à un fondateur. GPT-5.5 ou Terra pour le meilleur paragraphe par seconde. MiniMax M3 si ce qui compte, c'est que ça a coûté quatre centièmes de centime.
Prompt 3 : trois registres
| Modèle | Servi par | Temps au premier token | Temps total | Tokens en sortie | Tokens de raisonnement | Facturé pour cette réponse |
|---|---|---|---|---|---|---|
| gpt-oss-120b | Fireworks | 1,6 s | 1,8 s | 62 | 41 | 0,0002 $ |
| GPT-5.6 Luna | OpenAI | 1,6 s | 2,1 s | 44 | 0 | 0,0001 $ |
| GPT-5.6 Sol | OpenAI | 2,2 s | 3,2 s | 47 | 0 | 0,0011 $ |
| GPT-5.6 Terra | OpenAI | 2,4 s | 3,3 s | 54 | 0 | 0,0008 $ |
| GPT-5.5 | OpenAI | 2,2 s | 3,4 s | 47 | 0 | 0,0016 $ |
| MiniMax M3 | Fireworks | 3,0 s | 3,4 s | 55 | 191 | 0,0004 $ |
| Gemini 3.7 Flash | 3,3 s | 3,4 s | 57 | 429 | 0,0037 $ | |
| Claude Opus 5 | Anthropic | 2,8 s | 3,9 s | 101 | 28 | 0,0035 $ |
| Qwen 3.8 Flash | Novita | 6,3 s | 6,7 s | 44 | 48 | 0,0001 $ |
| Kimi K3 | Fireworks | 9,2 s | 10,2 s | 69 | 413 | 0,0076 $ |
| GLM-5.2 | Fireworks | 10,8 s | 11,3 s | 747 | 0 | 0,0034 $ |
| GLM-4.7 | DeepInfra | 68,6 s | 69,7 s | 1049 | 0 | 0,0024 $ |
C'est le prompt qui révèle la lecture en diagonale. gpt-oss-120b et Qwen 3.8 Flash ont tous deux retourné la phrase originale, inchangée, comme version « simple ». C'est une interprétation défendable du mot simple et une ratée évidente du mot réécrire. gpt-oss-120b le fait à chaque passage de ce test que nous avons effectué ; c'est donc une habitude, pas un accident.
Deux modèles ont écrit une version ludique avec une vraie voix. Kimi K3 : « Le budget ? Simple comme bonjour. Notre application fait le calcul à votre place ! » Claude Opus 5 : « Gérer son budget, c'était une corvée — maintenant, c'est juste un tap, un glissement, et c'est plié. » Opus 5 a aussi écrit la seule version corporate avec une affirmation concrète, « réduisant la gestion financière à quelques minutes par mois », là où tous les autres se sont réfugiés dans l'abstraction. Sept modèles sur douze ont utilisé « un jeu d'enfant » quelque part, et onze sur douze ont employé « simplifie » dans la version corporate. La version corporate de Gemini, « optimisation budgétaire fluide et clarté fiscale », est celle à montrer à votre équipe marketing en guise d'avertissement.
L'histoire du coût est la vraie leçon ici. GLM-4.7 a mis 70 secondes pour produire 32 mots, parce que son hôte a rapporté 1 049 tokens en sortie pour cela, dont la plupart correspondent à un raisonnement qu'il n'itemise pas. Luna et Qwen 3.8 Flash ont chacun accompli la tâche pour un centième de centime, Luna en deux secondes. Si votre produit réécrit des phrases à grande échelle, c'est une décision de coût, pas de qualité — à moins que vous ne vouliez spécifiquement la voix d'Opus 5 ou de Kimi.
Verdict : Opus 5 ou Kimi K3 pour un texte qu'un humain lira, Luna pour un texte qu'un pipeline lira.
La journée entière en un seul tableau
Ce que chaque modèle a coûté pour les trois réponses, du moins cher au plus cher, avec le fournisseur qui l'a servi et le tarif affiché pour chaque modèle sur l'API NinjaChat au 2 septembre 2026.
| Modèle | Facturé pour les trois réponses | Temps moyen au premier token | Réponse la plus lente | Servi par | Prix entrée / sortie par million de tokens |
|---|---|---|---|---|---|
| GPT-5.6 Luna | 0,0011 $ | 3,4 s | 7,2 s | OpenAI | 0,2 $ / 1,2 $ |
| gpt-oss-120b | 0,0011 $ | 3,8 s | 6,5 s | Fireworks | 0,35 $ / 0,75 $ |
| MiniMax M3 | 0,0016 $ | 2,9 s | 4,9 s | Fireworks | 0,3 $ / 1,2 $ |
| Qwen 3.8 Flash | 0,0025 $ | 14,8 s | 30,9 s | Novita | 0,15 $ / 0,47 $ |
| GPT-5.6 Terra | 0,0052 $ | 2,1 s | 4,6 s | OpenAI | 2 $ / 12 $ |
| GLM-4.7 | 0,0079 $ | 69,4 s | 86,2 s | DeepInfra | 0,6 $ / 2,2 $ |
| GLM-5.2 | 0,0136 $ | 12,9 s | 16,5 s | Fireworks | 1,4 $ / 4,4 $ |
| GPT-5.6 Sol | 0,0139 $ | 6,0 s | 10,7 s | OpenAI | 4 $ / 20 $ |
| GPT-5.5 | 0,0156 $ | 4,8 s | 29,4 s | OpenAI | 5 $ / 30 $ |
| Gemini 3.7 Flash | 0,0170 $ | 3,5 s | 4,6 s | 1,5 $ / 7,5 $ | |
| Claude Opus 5 | 0,0307 $ | 3,1 s | 8,6 s | Anthropic | 5 $ / 25 $ |
| Kimi K3 | 0,0427 $ | 16,5 s | 26,9 s | Fireworks | 3 $ / 15 $ |
Trois schémas se dégagent.
Le raisonnement est le coût caché. Kimi K3 est tarifé en dessous des trois modèles frontier et s'est révélé le modèle le plus cher de la journée, parce qu'il a raisonné pendant 400 à 1 000 tokens sur chaque prompt, y compris la réécriture. Gemini 3.7 Flash a coûté plus que GPT-5.5 pour la même raison. La réponse la plus chère de Sol n'était pas la plus longue — c'était celle sur laquelle il a réfléchi. Si vous n'avez pas besoin de chaîne de pensée pour une tâche, choisissez un modèle qui ne le fait pas par défaut, ou réduisez l'effort de raisonnement là où l'API le permet.
Pas cher, c'est maintenant vraiment bon. Luna, gpt-oss-120b et MiniMax M3 ont écrit du code correct, des conseils sensés et du texte utilisable pour entre un dixième et un sixième de centime chacun, les trois prompts inclus. Il y a deux ans, ce niveau de modèle aurait échoué au prompt de codage.
L'hôte fait partie de la latence. GLM-4.7 est un modèle rapide sur le papier et s'est révélé l'élément le plus lent du test, parce que l'hôte qui le servait cet après-midi-là mettait une minute à démarrer chaque réponse. Kimi K3 et GLM-5.2 sur Fireworks étaient rapides une fois qu'ils commençaient à écrire, et lents avant. Les modèles OpenAI, Google et Anthropic répondent directement depuis leurs labs. C'est pourquoi notre API affiche la disponibilité et la latence par fournisseur, et non par modèle, et pourquoi la colonne Servi par figure dans chaque tableau ci-dessus.
Quel modèle pour quoi
- Vous voulez la meilleure réponse et le coût est secondaire : Claude Opus 5. Code le plus complet, la réponse aux fondateurs que vous transmettriez réellement, la seule réécriture avec une affirmation concrète, et 3 secondes au premier token en moyenne.
- Vous voulez une qualité frontier à un prix intermédiaire : GPT-5.6 Terra. Le plus rapide au premier token de tout l'ensemble, pas de raisonnement sauf si la question l'exige, moins de la moitié de la facture de Sol sur la journée.
- Vous voulez le modèle OpenAI le plus capable sans considération de prix : GPT-5.5, mais notez son plafond de sortie à 32 K tokens avant de l'utiliser pour de longues générations.
- Vous exploitez un pipeline à haut volume : GPT-5.6 Luna ou MiniMax M3. Un dixième à un sixième de centime pour tout l'exercice, tout sous cinq secondes sur les deux prompts en prose.
- Vous voulez un grand modèle open-weight avec un long contexte : Kimi K3 pour l'écriture, GLM-5.2 pour le prix, et prévoyez du temps de raisonnement pour les deux.
- Vous voulez du texte que des gens liront : Opus 5, puis Kimi K3. Évitez les deux modèles qui ont retourné la phrase originale.
Reproduisez-le vous-même
Chaque modèle ci-dessus n'est qu'une chaîne model sur l'API NinjaChat, compatible OpenAI. Un compte vérifié par téléphone démarre avec un solde initial de 0,50 $, sans carte bancaire jusqu'à la première recharge. Remplacez l'identifiant et relancez n'importe quel prompt de cet article. La réponse indique ce qui vous a été facturé et quel fournisseur vous a servi.
curl https://www.ninjachat.ai/api/v1/chat/completions \
-H "Authorization: Bearer $NINJACHAT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-terra",
"messages": [{"role": "user", "content": "In about 120 words, tell a first-time founder when to choose a monolith over microservices, and the one signal that means it is time to split."}],
"max_tokens": 2500,
"temperature": 0.7,
"stream": true,
"stream_options": {"include_usage": true}
}'
import time
from openai import OpenAI
client = OpenAI(base_url="https://www.ninjachat.ai/api/v1", api_key="YOUR_KEY")
for model in ["claude-opus-5", "gpt-5.6-terra", "minimax-m3"]:
t0 = time.perf_counter()
first = None
stream = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": "Rewrite three ways (plain, playful, executive): Our app makes budgeting easy."}],
max_tokens=2500,
temperature=0.7,
stream=True,
stream_options={"include_usage": True},
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content and first is None:
first = time.perf_counter() - t0
if chunk.usage:
print(model, "reasoning tokens:", chunk.usage.completion_tokens_details.reasoning_tokens)
print(model, "first token", round(first, 2), "s, total", round(time.perf_counter() - t0, 2), "s")
Les tarifs en temps réel pour chaque modèle, sans clé requise, sont disponibles sur GET https://www.ninjachat.ai/api/v1/models. Le côté grand public, c'est les mêmes modèles dans une fenêtre de chat : choisissez-en un sur /models avec un forfait payant.
Questions fréquentes
Quel modèle IA a été le plus rapide dans ce test ? GPT-5.6 Terra : 2,1 secondes au premier token en moyenne, et la réponse complète la plus rapide sur le prompt de codage en 2,9 secondes. MiniMax M3 et Claude Opus 5 suivent, tous deux autour de trois secondes au premier token en moyenne.
Quel modèle IA a été le moins cher ? GPT-5.6 Luna et gpt-oss-120b sont ex æquo à environ un dixième de centime pour les trois réponses, selon la facturation de l'API NinjaChat au 2 septembre 2026. MiniMax M3 était juste derrière.
Un modèle a-t-il échoué la tâche de codage ? Non. Les douze ont produit une fonction de fusion dont les tests passent. Claude Opus 5 a atteint exactement la limite de 40 lignes, MiniMax M3 a affiché ses résultats au lieu de les asserter, et quatre modèles trient la liste de l'appelant en place — ce qui vaut la peine de savoir si vous copiez le code dans une bibliothèque.
Pourquoi GLM-4.7 et Kimi K3 sont-ils si lents dans les tableaux ? Raisonnement et hébergement, combinés. Les deux réfléchissent longuement avant d'écrire, et l'hôte qui a servi GLM-4.7 cet après-midi-là mettait environ une minute à démarrer chaque réponse et intégrait le raisonnement dans le comptage de sortie. Sur un autre hôte, ou avec l'effort de raisonnement réduit, les deux se retrouveraient en milieu de tableau.
Pourquoi le même modèle coûte-t-il des montants différents selon les prompts ? Parce que les tokens de raisonnement sont facturés comme de la sortie. GPT-5.6 Sol a dépensé 26 tokens de raisonnement sur le prompt de codage et 238 sur le prompt des fondateurs, donc la réponse aux fondateurs a coûté presque deux fois le prix de la réponse de code malgré sa plus courte longueur.
Puis-je reproduire cela ? Oui. Les trois prompts sont imprimés ci-dessus mot pour mot, les paramètres sont listés dans la section Comment nous avons mesuré, et l'extrait Python chronomètre n'importe quel modèle de la même façon que nous l'avons fait et affiche ses tokens de raisonnement. Attendez-vous à ce que les chiffres absolus varient entre les passages et que le classement se maintienne.
