NinjaChat LogoNinjaChat Logo
ModelosPreciosHerramientasBlog
Panel
ModelosPreciosHerramientasBlogIniciar sesiónDownload on the App Store
Imagen de portada de Ejecutamos los mismos 3 prompts en 12 modelos de IA (septiembre de 2026): respuestas sin editar, latencia y precio

Ejecutamos los mismos 3 prompts en 12 modelos de IA (septiembre de 2026): respuestas sin editar, latencia y precio

Claude Opus 5, GPT-5.5, los tres tamaños de GPT-5.6, Kimi K3, Gemini 3.7 Flash, GLM-5.2, GLM-4.7, MiniMax M3, gpt-oss-120b y Qwen 3.8 Flash, enfrentados a una tarea de programación, una pregunta de fundador y una reescritura a través de la API de NinjaChat. Cada respuesta sin editar, cada respuesta cronometrada, cada solicitud facturada al precio que tú pagarías.

Avatar de Siddharth DuggalSiddharth Duggal·4 de septiembre de 2026

En esta página

  • Cómo medimos
  • Prompt 1: fusionar interva...
  • Prompt 2: monolito o micro...
  • Prompt 3: tres tonos
  • Todo el día en una tabla
  • Qué modelo para qué
  • Ejecútalo tú mismo
  • Preguntas frecuentes

Cada comparación de modelos que lees es o bien una tabla de benchmarks que nadie puede reproducir o bien una reseña a ojo de los dos modelos que el autor ya prefería. Así que el 2 de septiembre de 2026 hicimos la versión aburrida: los mismos tres prompts, enviados una vez cada uno a doce modelos actuales a través de nuestra propia API, cronometrados durante el streaming y facturados al precio que paga realmente una clave de NinjaChat. Nada de lo que figura a continuación ha sido editado, seleccionado a conveniencia ni repetido para quedar mejor.

La versión corta. Los doce escribieron una función correcta de fusión de intervalos cuyos propios tests pasan. GPT-5.6 Terra fue el modelo más rápido en tiempo al primer token de media, y el que escribió código más rápido en términos absolutos, en menos de tres segundos. GPT-5.6 Luna y gpt-oss-120b empataron como los más baratos, con aproximadamente una décima de centavo por las tres respuestas. Las dos respuestas individuales más caras del día fueron el consejo a fundadores de Kimi K3, que razonó durante 1.034 tokens y tardó 27 segundos, y el código de Claude Opus 5, que es también el más exhaustivo que escribió alguien. En el medio, las diferencias interesantes no tenían nada que ver con la corrección. Tenían que ver con cuánto tiempo piensa cada modelo antes de hablar, qué proveedor lo sirve, y cuánto cuestan ambas cosas.

Cómo medimos

  • Fecha y lugar: 2 de septiembre de 2026, una tarde, un portátil con conexión doméstica en EE. UU.
  • Ruta: cada solicitud fue a la API de NinjaChat, POST /api/v1/chat/completions, con una clave de playground normal. La latencia que ves incluye nuestro enrutamiento, el proveedor que elegimos y el tiempo propio del proveedor. La columna Servido por nombra ese proveedor para cada respuesta.
  • Modelos: Claude Opus 5, GPT-5.5, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Kimi K3, Gemini 3.7 Flash, GLM-5.2, GLM-4.7, MiniMax M3, gpt-oss-120b y Qwen 3.8 Flash.
  • Configuración: temperatura 0,7, límite de salida de 2.500 tokens, streaming activado con reporte de uso, el resto de parámetros en los valores predeterminados del modelo. La mayoría de estos modelos razonan por defecto, y nuestra API reporta los tokens de razonamiento por separado de la salida visible, por lo que ambas columnas aparecen en cada tabla. Dos proveedores, DeepInfra para GLM-4.7 y Fireworks para GLM-5.2, reportan el razonamiento dentro del recuento de salida, así que esas filas muestran un número de salida grande y un cero en la columna de razonamiento.
  • Cronometrado: el tiempo al primer token es cuando llegó el primer carácter visible de la respuesta, tras cualquier razonamiento oculto. El tiempo total es hasta que el stream se cerró. Las solicitudes se ejecutaron de una en una, nunca en paralelo, tras una solicitud de calentamiento a cada modelo para que nada de lo siguiente incluya un arranque en frío de nuestra parte.
  • Coste: el importe que nuestra API reportó facturar por esa solicitud, a la diezmilésima de dólar. Nada está estimado a partir de una lista de precios.
  • Una ejecución por celda. Sin reintentos, sin mejor de tres. Una segunda ejecución no reproducirá estos números hasta el decimal. Debería reproducir el ranking.

Los tres prompts se copiaron textualmente de las secciones de Resultados Reales de nuestras páginas de modelos, así que lo que ves aquí es la misma tarea que muestran esas páginas:

  1. «Escribe una función en Python que fusione intervalos solapados, más tres tests cortos. Mantén toda la respuesta por debajo de 40 líneas de código.»
  2. «En unas 120 palabras, explica a un fundador novel cuándo elegir un monolito sobre microservicios, y la única señal que indica que es hora de separar.»
  3. «Reescribe esta frase de tres maneras, cada una en un tono claramente diferente (llano, lúdico, ejecutivo): "Nuestra app hace que presupuestar sea fácil." Etiqueta cada una.»

Prompt 1: fusionar intervalos solapados

Ordenado por tiempo total. Cada respuesta a continuación superó sus propios tests cuando ejecutamos el código.

ModeloServido porTiempo al primer tokenTiempo totalTokens de salidaTokens de razonamientoFacturado por esta respuesta
GPT-5.6 TerraOpenAI1,5 s2,9 s1840$0,0023
Gemini 3.7 FlashGoogle2,8 s3,3 s232445$0,0052
MiniMax M3Fireworks3,3 s4,9 s285271$0,0008
gpt-oss-120bFireworks4,4 s6,3 s280434$0,0006
GPT-5.6 LunaOpenAI5,9 s7,2 s171374$0,0007
Claude Opus 5Anthropic3,7 s8,6 s62189$0,0180
Qwen 3.8 FlashNovita8,1 s9,1 s175757$0,0005
GPT-5.6 SolOpenAI8,8 s10,7 s19426$0,0046
GLM-5.2Fireworks12,9 s14,6 s9890$0,0045
Kimi K3Fireworks16,5 s21,7 s309771$0,0166
GPT-5.5OpenAI9,5 s29,4 s19660$0,0079
GLM-4.7DeepInfra60,6 s67,1 s13630$0,0031

Doce de doce en corrección, lo que indica que esto es un problema resuelto para cualquier modelo actual. Las diferencias están en el estilo, en cómo gasta tokens cada modelo, y en un caso en lo que significa «test».

La respuesta más concisa vino de GLM-4.7: catorce líneas, sin comentarios, sin comprobación separada de entrada vacía porque el bucle ya la gestiona.

def merge_intervals(intervals):
    intervals.sort(key=lambda x: x[0])
    merged = []
    for start, end in intervals:
        if not merged or start > merged[-1][1]:
            merged.append([start, end])
        else:
            merged[-1][1] = max(merged[-1][1], end)
    return merged

Claude Opus 5 fue en la dirección contraria. Escribió la única versión con docstring, tres funciones de test con nombre que cubren entrada vacía, individual, tocándose, desordenada y anidada, y una nota explicando que los intervalos que se tocan se fusionan porque la comparación es cerrada, con el cambio de un carácter si se quiere semántica semiabierta. También es la respuesta que más probablemente habría irritado a un lector estricto: el bloque de código tiene exactamente 40 líneas, en contra de un prompt que pedía menos de 40. Kimi K3 escribió la siguiente versión más cuidadosa: una función de test con tres casos comentados y una entrada desordenada y anidada.

La familia GPT produjo casi la misma función cuatro veces. Terra lo hizo en 2,9 segundos sin tokens de razonamiento ni docstring, la respuesta más rápida del prompt. Sol añadió un docstring y devolvió tuplas. Luna razonó durante 374 tokens para llegar a la respuesta GPT más corta. GPT-5.5 escribió la misma función que Sol, y luego su stream se detuvo: primer token a los 9,5 segundos, último token a los 29,4, para 196 tokens de salida. Ese es el tipo de evento en una sola ejecución que una segunda ejecución probablemente no repetiría, y exactamente por eso lo decimos.

MiniMax M3 es la fila que hay que leer dos veces. Sus tres «tests» son sentencias print con el valor esperado en un comentario al lado, así que no pueden fallar. El código es correcto, y lo ejecutamos, pero el modelo respondió una pregunta diferente a la que se le hizo. Cuatro modelos —Gemini 3.7 Flash, GLM-4.7, MiniMax M3 y Qwen 3.8 Flash— ordenan la lista del llamador en su lugar, lo cual está bien para un fragmento y es un bug en una biblioteca.

Las filas lentas son filas de proveedor. GLM-4.7, servido por DeepInfra, tardó un minuto completo en su primer carácter; el proveedor cuenta su razonamiento dentro de los 1.363 tokens de salida que reportó. Kimi K3 en Fireworks razonó durante 771 tokens y tardó 22 segundos.

Veredicto: Terra para una función así. Opus 5 si quieres la respuesta que te enseña algo, y aceptas las 40 líneas.

Prompt 2: monolito o microservicios

ModeloServido porTiempo al primer tokenTiempo totalTokens de salidaTokens de razonamientoFacturado por esta respuesta
MiniMax M3Fireworks2,5 s4,0 s17776$0,0004
GPT-5.6 LunaOpenAI2,6 s4,4 s16575$0,0003
GPT-5.6 TerraOpenAI2,4 s4,6 s1670$0,0021
Gemini 3.7 FlashGoogle4,3 s4,6 s160901$0,0081
GPT-5.5OpenAI2,7 s5,0 s16331$0,0061
gpt-oss-120bFireworks5,5 s6,5 s18070$0,0003
Claude Opus 5Anthropic2,7 s7,5 s33223$0,0092
GPT-5.6 SolOpenAI7,0 s10,0 s164238$0,0082
GLM-5.2Fireworks15,0 s16,5 s12590$0,0057
Kimi K3Fireworks23,8 s26,9 s1701034$0,0185
Qwen 3.8 FlashNovita29,9 s30,9 s1623810$0,0019
GLM-4.7DeepInfra78,9 s86,2 s10630$0,0024

Todos los modelos dieron el mismo consejo principal: empieza con un monolito, que es el consejo principal correcto. La pregunta era realmente sobre la segunda parte: nombra la única señal que indica que es hora de separar. Las respuestas se dividieron en dos campos.

El campo organizacional dijo que la señal son las personas. Kimi K3: «los equipos ya no pueden desplegar de forma independiente», con una advertencia de que separar a lo largo de las costuras equivocadas produce «un monolito distribuido: todo el dolor operativo, ninguna de la independencia». Gemini 3.7 Flash lo llamó «cuello de botella organizacional» y añadió la frase «los microservicios son una herramienta para escalar organizaciones humanas y la velocidad de despliegue, no bases de código en etapa temprana». GLM-5.2 lo llamó «contención de despliegue». GLM-4.7 dijo «fricción organizacional» y ofreció una prueba: si ya ninguna persona puede entender todo el sistema, has superado el monolito.

El campo del cuello de botella dijo que la señal es una parte específica del sistema. Claude Opus 5 lo hizo concreto: «un transcodificador de vídeo con uso intensivo de CPU que ahoga tu API», y cerró con la mejor frase del día: «Todo lo demás —"se siente desordenado", "Netflix lo hace"— no es una señal.» GPT-5.6 Sol: «separa cuando una parte bien definida del producto necesite repetidamente ser desplegada o escalada de forma independiente, y el monolito lo impida de forma medible», y luego «extrae solo ese límite, dale una interfaz y un propietario claros, y deja todo lo demás junto». Luna añadió la frase que los demás olvidaron: extráela, «mide la mejora» y detente ahí. MiniMax M3 llegó a la misma idea con menos palabras y una línea memorable: «La separación prematura mata más startups que el código malo.»

La tabla añade lo que la prosa oculta. Opus 5 llegó a 162 palabras contra un objetivo de 120, la respuesta más larga del prompt. Qwen 3.8 Flash razonó durante 3.810 tokens, más de veinte veces lo que escribió, y tardó 31 segundos en decir algo sensato. Sol razonó durante 238 tokens, tardó diez segundos y se le facturó casi cuatro veces lo que costó la respuesta de Terra, por un párrafo que es mejor en una frase.

Veredicto: Opus 5 si quieres la respuesta que reenviarías a un fundador. GPT-5.5 o Terra para el mejor párrafo por segundo. MiniMax M3 si lo que importa es que esto costó cuatro centésimas de centavo.

Prompt 3: tres tonos

ModeloServido porTiempo al primer tokenTiempo totalTokens de salidaTokens de razonamientoFacturado por esta respuesta
gpt-oss-120bFireworks1,6 s1,8 s6241$0,0002
GPT-5.6 LunaOpenAI1,6 s2,1 s440$0,0001
GPT-5.6 SolOpenAI2,2 s3,2 s470$0,0011
GPT-5.6 TerraOpenAI2,4 s3,3 s540$0,0008
GPT-5.5OpenAI2,2 s3,4 s470$0,0016
MiniMax M3Fireworks3,0 s3,4 s55191$0,0004
Gemini 3.7 FlashGoogle3,3 s3,4 s57429$0,0037
Claude Opus 5Anthropic2,8 s3,9 s10128$0,0035
Qwen 3.8 FlashNovita6,3 s6,7 s4448$0,0001
Kimi K3Fireworks9,2 s10,2 s69413$0,0076
GLM-5.2Fireworks10,8 s11,3 s7470$0,0034
GLM-4.7DeepInfra68,6 s69,7 s10490$0,0024

Este es el prompt que expone la lectura descuidada. gpt-oss-120b y Qwen 3.8 Flash devolvieron la frase original, sin cambios, como su versión «llana». Es una interpretación defendible de la palabra llano y un error evidente de la palabra reescribe. gpt-oss-120b lo ha hecho en cada ejecución de esta prueba que hemos realizado, así que es un hábito, no un fallo puntual.

Dos modelos escribieron una línea lúdica con voz propia. Kimi K3: «¿Presupuestar? Pan comido. ¡Nuestra app hace los cálculos para que tú no tengas que hacerlos!» Claude Opus 5: «Antes, hacer un presupuesto era una tarea pesada; ahora es básicamente un toque, un deslizamiento y listo.» Opus 5 también escribió la única línea ejecutiva con una afirmación concreta: «reduciendo la gestión financiera a unos pocos minutos al mes», mientras que todos los demás recurrieron a abstracciones. Siete de doce usaron «un soplo de aire fresco» o equivalente en algún lugar, y once de doce usaron «optimiza» en la línea ejecutiva. La versión ejecutiva de Gemini, «optimización presupuestaria fluida y claridad fiscal», es la que deberías mostrarle a tu equipo de marketing como advertencia.

La historia del coste es la verdadera. GLM-4.7 tardó 70 segundos en producir 32 palabras, porque su proveedor reportó 1.049 tokens de salida para ellas, en su mayoría razonamiento que no detalla. Luna y Qwen 3.8 Flash hicieron el trabajo por una centésima de centavo cada uno, Luna en dos segundos. Si tu producto reescribe frases a escala, esto es una decisión de coste, no de calidad, a menos que quieras específicamente la voz de Opus 5 o de Kimi.

Veredicto: Opus 5 o Kimi K3 para texto que leerá un humano, Luna para texto que leerá un pipeline.

Todo el día en una tabla

Lo que se le facturó a cada modelo por las tres respuestas, del más barato al más caro, con el proveedor que lo sirvió y el precio de lista al que factura cada modelo en la API de NinjaChat a fecha del 2 de septiembre de 2026.

ModeloFacturado por las tres respuestasTiempo medio al primer tokenRespuesta más lentaServido porPrecio de entrada / salida por 1M de tokens
GPT-5.6 Luna$0,00113,4 s7,2 sOpenAI$0,2 / $1,2
gpt-oss-120b$0,00113,8 s6,5 sFireworks$0,35 / $0,75
MiniMax M3$0,00162,9 s4,9 sFireworks$0,3 / $1,2
Qwen 3.8 Flash$0,002514,8 s30,9 sNovita$0,15 / $0,47
GPT-5.6 Terra$0,00522,1 s4,6 sOpenAI$2 / $12
GLM-4.7$0,007969,4 s86,2 sDeepInfra$0,6 / $2,2
GLM-5.2$0,013612,9 s16,5 sFireworks$1,4 / $4,4
GPT-5.6 Sol$0,01396,0 s10,7 sOpenAI$4 / $20
GPT-5.5$0,01564,8 s29,4 sOpenAI$5 / $30
Gemini 3.7 Flash$0,01703,5 s4,6 sGoogle$1,5 / $7,5
Claude Opus 5$0,03073,1 s8,6 sAnthropic$5 / $25
Kimi K3$0,042716,5 s26,9 sFireworks$3 / $15

De ella se desprenden tres patrones.

El razonamiento es el precio oculto. Kimi K3 está por debajo de los tres modelos de frontera en precio de lista y acabó siendo el modelo más caro del día, porque razonó entre 400 y 1.000 tokens en cada prompt, incluida la reescritura. Gemini 3.7 Flash costó más que GPT-5.5 por la misma razón. La respuesta más cara de Sol no fue la más larga, sino aquella en la que más pensó. Si no necesitas cadena de pensamiento para una tarea, elige un modelo que no lo haga por defecto, o reduce el esfuerzo de razonamiento donde la API lo permita.

Lo barato ahora es genuinamente bueno. Luna, gpt-oss-120b y MiniMax M3 escribieron código correcto, consejos sensatos y texto usable por entre una décima y una sexta parte de centavo cada uno, los tres prompts incluidos. Hace dos años, ese nivel de modelo habría fallado en el prompt de programación.

El proveedor forma parte de la latencia. GLM-4.7 es un modelo rápido sobre el papel y fue la cosa más lenta de la prueba, porque el proveedor que lo sirvió tardó un minuto en arrancar cada respuesta. Kimi K3 y GLM-5.2 en Fireworks fueron rápidos una vez que empezaron a escribir y lentos antes. Los modelos de OpenAI, Google y Anthropic respondieron directamente desde los laboratorios. Por eso nuestra API muestra el tiempo de actividad y la latencia por proveedor, no por modelo, y por eso la columna Servido por aparece en cada tabla de arriba.

Qué modelo para qué

  • Quieres la mejor respuesta y el coste es secundario: Claude Opus 5. El código más exhaustivo, la respuesta al fundador que realmente reenviarías, la única reescritura con una afirmación concreta, y 3 segundos al primer token de media.
  • Quieres calidad de frontera a un precio intermedio: GPT-5.6 Terra. El más rápido al primer token de todo el conjunto, sin razonamiento a menos que la pregunta lo necesite, menos de la mitad de la factura de Sol en el día.
  • Quieres el modelo OpenAI más capaz sin importar el precio: GPT-5.5, pero ten en cuenta su límite de salida de 32K antes de apuntarlo a generaciones largas.
  • Estás ejecutando un pipeline de alto volumen: GPT-5.6 Luna o MiniMax M3. Una décima a una sexta parte de centavo por todo el ejercicio, todo en menos de cinco segundos en los dos prompts de prosa.
  • Quieres un modelo de gran peso abierto con un contexto largo: Kimi K3 para la escritura, GLM-5.2 para el precio, y presupuesta tiempo de razonamiento en ambos.
  • Quieres texto que la gente leerá: Opus 5, luego Kimi K3. Descarta los dos modelos que devolvieron la frase original.

Ejecútalo tú mismo

Cada modelo de arriba está a una cadena model de distancia en la API de NinjaChat, que es compatible con OpenAI. Una cuenta verificada por teléfono empieza con un saldo inicial de 0,50 $, sin tarjeta hasta que recargues. Cambia el id y vuelve a ejecutar cualquier prompt de esta entrada. La respuesta reporta lo que se te facturó y qué proveedor te sirvió.

curl https://www.ninjachat.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $NINJACHAT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-terra",
    "messages": [{"role": "user", "content": "In about 120 words, tell a first-time founder when to choose a monolith over microservices, and the one signal that means it is time to split."}],
    "max_tokens": 2500,
    "temperature": 0.7,
    "stream": true,
    "stream_options": {"include_usage": true}
  }'
import time
from openai import OpenAI

client = OpenAI(base_url="https://www.ninjachat.ai/api/v1", api_key="YOUR_KEY")

for model in ["claude-opus-5", "gpt-5.6-terra", "minimax-m3"]:
    t0 = time.perf_counter()
    first = None
    stream = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": "Rewrite three ways (plain, playful, executive): Our app makes budgeting easy."}],
        max_tokens=2500,
        temperature=0.7,
        stream=True,
        stream_options={"include_usage": True},
    )
    for chunk in stream:
        if chunk.choices and chunk.choices[0].delta.content and first is None:
            first = time.perf_counter() - t0
        if chunk.usage:
            print(model, "reasoning tokens:", chunk.usage.completion_tokens_details.reasoning_tokens)
    print(model, "first token", round(first, 2), "s, total", round(time.perf_counter() - t0, 2), "s")

Los precios en tiempo real de cada modelo, sin necesidad de clave, están en GET https://www.ninjachat.ai/api/v1/models. El lado de consumo son los mismos modelos en una ventana de chat: elige cualquiera en /models con un plan de pago.

Preguntas frecuentes

¿Qué modelo de IA fue el más rápido en esta prueba? GPT-5.6 Terra: 2,1 segundos al primer token de media, y la respuesta completa más rápida en el prompt de programación con 2,9 segundos. MiniMax M3 y Claude Opus 5 fueron los siguientes, ambos alrededor de tres segundos al primer token de media.

¿Qué modelo de IA fue el más barato? GPT-5.6 Luna y gpt-oss-120b empataron con aproximadamente una décima de centavo por las tres respuestas según la facturación de la API de NinjaChat el 2 de septiembre de 2026. MiniMax M3 quedó justo detrás.

¿Algún modelo falló en la tarea de programación? No. Los doce produjeron una función de fusión cuyos propios tests pasan. Claude Opus 5 alcanzó el límite de 40 líneas exactamente, MiniMax M3 imprimió sus resultados en lugar de afirmarlos, y cuatro modelos ordenan la lista del llamador en su lugar, lo cual conviene saber si copias el código en una biblioteca.

¿Por qué GLM-4.7 y Kimi K3 son tan lentos en las tablas? Razonamiento y alojamiento, combinados. Ambos piensan extensamente antes de escribir, y el proveedor que sirvió a GLM-4.7 esa tarde tardó aproximadamente un minuto en arrancar cada respuesta y reportó el razonamiento dentro del recuento de salida. Con un proveedor diferente, o con el esfuerzo de razonamiento reducido, ambos quedarían en la mitad de la tabla.

¿Por qué el mismo modelo cuesta importes diferentes en distintos prompts? Porque los tokens de razonamiento se facturan como salida. GPT-5.6 Sol gastó 26 tokens de razonamiento en el prompt de código y 238 en el prompt al fundador, así que la respuesta al fundador costó casi el doble que la de código a pesar de ser más corta.

¿Puedo reproducir esto? Sí. Los tres prompts están impresos arriba literalmente, la configuración aparece en el apartado Cómo medimos, y el fragmento de Python cronometra cualquier modelo de la misma manera que nosotros lo hicimos e imprime sus tokens de razonamiento. Espera que los números absolutos varíen entre ejecuciones y que el ranking se mantenga.

NinjaChatNinjaChat

Todos los modelos de IA. Un solo lugar.

App para iPhoneProbar en la web
NinjaChat LogoNinjaChat Logo

Todos los modelos de IA en un solo lugar.

Descargar en el App Store

Producto

  • Panel
  • Precios
  • Herramientas de IA Gratuitas
  • Programa de Afiliados
  • App de iOS

Desarrolladores

  • API
  • Modelos de API
  • Ninja Router
  • MCP / Agents
  • Documentación de API
  • Status
  • Changelog

Modelos

  • Model Council
  • Gemini 2.5 Flash
  • Gemini 2.5 Pro
  • Gemini 3 Flash Preview
  • Gemini 3.1 Pro Preview
  • Modelos de chat
  • Generadores de Imágenes con IA
  • Generadores de Video con IA
  • Ver Todos los Modelos

Empresa

  • Blog
  • Comunidad
  • Empleos
  • Soporte
  • Política de Privacidad
  • Términos de Servicio
  • Safety Protocol
  • Do Not Sell or Share My Personal Information
Idioma

Copyright © 2026 NinjaChat AI. Producto de Bloon Todos los derechos reservados.