NinjaChat LogoNinjaChat Logo
ModelHargaAlatBlog
Dasbor
ModelHargaAlatBlogMasukDownload on the App Store
Gambar sampul Kami Menjalankan 3 Prompt yang Sama pada 12 Model AI (September 2026): Jawaban Tanpa Editan, Latensi, Harga

Kami Menjalankan 3 Prompt yang Sama pada 12 Model AI (September 2026): Jawaban Tanpa Editan, Latensi, Harga

Claude Opus 5, GPT-5.5, tiga ukuran GPT-5.6, Kimi K3, Gemini 3.7 Flash, GLM-5.2, GLM-4.7, MiniMax M3, gpt-oss-120b, dan Qwen 3.8 Flash, diberikan satu tugas coding, satu pertanyaan founder, dan satu penulisan ulang melalui API NinjaChat. Setiap jawaban tidak diedit, setiap respons diukur waktunya, setiap permintaan ditagih sesuai harga yang akan Anda bayar.

Avatar Siddharth DuggalSiddharth Duggal·4 September 2026

Di halaman ini

  • Cara kami mengukur
  • Prompt 1: menggabungkan in...
  • Prompt 2: monolith atau mi...
  • Prompt 3: tiga nada
  • Seluruh hari dalam satu ta...
  • Model mana untuk apa
  • Jalankan sendiri
  • Pertanyaan yang sering dia...

Setiap perbandingan model yang kamu baca entah berupa tabel benchmark yang tidak bisa direproduksi siapapun, atau ulasan berbasis selera dari dua model yang memang sudah disukai penulisnya. Maka pada 2 September 2026, kami melakukan versi yang membosankan: tiga prompt yang sama, masing-masing dikirimkan sekali ke dua belas model terkini melalui API kami sendiri, diukur waktunya pada stream, dan ditagih sesuai harga yang dibayar key NinjaChat sungguhan. Tidak ada yang diedit, dipilih-pilih, atau dijalankan ulang agar terlihat lebih baik di bawah ini.

Versi singkatnya. Semua dua belas menulis fungsi penggabungan interval yang benar dan tesnya sendiri lulus. GPT-5.6 Terra adalah model tercepat ke token pertama rata-rata, sekaligus coder tercepat secara keseluruhan, di bawah tiga detik. GPT-5.6 Luna dan gpt-oss-120b seri sebagai yang termurah, sekitar sepersepuluh sen untuk ketiga jawaban. Dua jawaban tersendiri termahal hari itu adalah saran pendiri dari Kimi K3, yang berpenalaran selama 1.034 token dan memakan waktu 27 detik, serta kode Claude Opus 5, yang juga merupakan kode paling menyeluruh yang ditulis siapapun. Di antara keduanya, perbedaan yang menarik sama sekali bukan soal kebenaran. Melainkan soal seberapa lama setiap model berpikir sebelum berbicara, host mana yang melayaninnya, dan berapa biaya keduanya untukmu.

Cara kami mengukur

  • Tanggal dan tempat: 2 September 2026, satu sore, satu laptop dengan koneksi rumah di AS.
  • Rute: setiap permintaan dikirim ke NinjaChat API, POST /api/v1/chat/completions, dengan key playground biasa. Latensi yang kamu lihat mencakup routing kami, provider yang kami pilih, dan waktu provider itu sendiri. Kolom Served by menyebutkan provider tersebut untuk setiap jawaban.
  • Model: Claude Opus 5, GPT-5.5, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Kimi K3, Gemini 3.7 Flash, GLM-5.2, GLM-4.7, MiniMax M3, gpt-oss-120b dan Qwen 3.8 Flash.
  • Pengaturan: temperature 0,7, batas output 2.500 token, streaming aktif dengan pelaporan penggunaan, semua parameter lain dibiarkan sesuai default model. Sebagian besar model ini berpenalaran secara default, dan API kami melaporkan reasoning token secara terpisah dari output yang terlihat, sehingga kedua kolom ada di setiap tabel. Dua host, DeepInfra untuk GLM-4.7 dan Fireworks untuk GLM-5.2, melaporkan penalaran di dalam jumlah output, sehingga baris tersebut menunjukkan angka output besar dan nol di kolom penalaran.
  • Waktu: time to first token adalah saat karakter pertama yang terlihat dari jawaban tiba, setelah penalaran tersembunyi apapun. Total time adalah hingga stream ditutup. Permintaan berjalan satu per satu, tidak pernah paralel, setelah permintaan warm-up ke setiap model sehingga tidak ada yang di bawah ini mencakup cold start di sisi kami.
  • Biaya: jumlah yang dilaporkan API kami sebagai tagihan untuk permintaan tersebut, hingga sepersepuluh ribu dolar. Tidak ada yang diperkirakan dari daftar harga.
  • Satu kali jalan per sel. Tidak ada percobaan ulang, tidak ada terbaik dari tiga. Kali kedua tidak akan mereproduksi angka-angka ini secara desimal. Seharusnya mereproduksi peringkatnya.

Ketiga prompt disalin verbatim dari bagian Real Outputs di halaman model kami, sehingga apa yang kamu lihat di sini adalah tugas yang sama yang ditampilkan halaman-halaman tersebut:

  1. "Tulis fungsi Python yang menggabungkan interval yang tumpang tindih, ditambah tiga tes singkat. Buat seluruh jawaban kurang dari 40 baris kode."
  2. "Dalam sekitar 120 kata, ceritakan kepada pendiri pertama kali kapan harus memilih monolith daripada microservices, dan satu sinyal yang berarti sudah waktunya memisahkan."
  3. "Tulis ulang kalimat ini dengan tiga cara, masing-masing dalam nada yang jelas berbeda (polos, playful, eksekutif): 'Our app makes budgeting easy.' Beri label masing-masing."

Prompt 1: menggabungkan interval yang tumpang tindih

Diurutkan berdasarkan total waktu. Setiap jawaban di bawah ini lulus tesnya sendiri ketika kami menjalankan kodenya.

ModelServed byTime to first tokenTotal timeOutput tokensReasoning tokensBilled for this answer
GPT-5.6 TerraOpenAI1,5 d2,9 d1840$0,0023
Gemini 3.7 FlashGoogle2,8 d3,3 d232445$0,0052
MiniMax M3Fireworks3,3 d4,9 d285271$0,0008
gpt-oss-120bFireworks4,4 d6,3 d280434$0,0006
GPT-5.6 LunaOpenAI5,9 d7,2 d171374$0,0007
Claude Opus 5Anthropic3,7 d8,6 d62189$0,0180
Qwen 3.8 FlashNovita8,1 d9,1 d175757$0,0005
GPT-5.6 SolOpenAI8,8 d10,7 d19426$0,0046
GLM-5.2Fireworks12,9 d14,6 d9890$0,0045
Kimi K3Fireworks16,5 d21,7 d309771$0,0166
GPT-5.5OpenAI9,5 d29,4 d19660$0,0079
GLM-4.7DeepInfra60,6 d67,1 d13630$0,0031

Dua belas dari dua belas benar, yang menunjukkan bahwa ini adalah masalah yang sudah terpecahkan untuk semua model terkini. Perbedaannya ada pada selera, cara model menghabiskan token, dan dalam satu kasus pada apa arti "tes".

Jawaban paling ringkas datang dari GLM-4.7: empat belas baris, tanpa komentar, tanpa pengecekan input kosong terpisah karena loop sudah menanganinya.

def merge_intervals(intervals):
    intervals.sort(key=lambda x: x[0])
    merged = []
    for start, end in intervals:
        if not merged or start > merged[-1][1]:
            merged.append([start, end])
        else:
            merged[-1][1] = max(merged[-1][1], end)
    return merged

Claude Opus 5 melakukan sebaliknya. Ia menulis satu-satunya versi dengan docstring, tiga fungsi tes bernama yang mencakup input kosong, tunggal, bersinggungan, tidak terurut, dan bersarang, serta catatan yang menjelaskan bahwa interval yang bersinggungan digabung karena perbandingannya bersifat tertutup, dengan perubahan satu karakter jika kamu menginginkan semantik setengah terbuka. Ini juga jawaban yang paling mungkin membuat pembaca ketat kesal: blok kode tepat 40 baris, terhadap prompt yang meminta kurang dari 40. Kimi K3 menulis versi paling hati-hati berikutnya, satu fungsi tes dengan tiga kasus yang diberi komentar dan input tidak terurut serta bersarang.

Keluarga GPT menghasilkan hampir fungsi yang sama empat kali. Terra melakukannya dalam 2,9 detik tanpa reasoning token dan tanpa docstring, jawaban tercepat dari prompt ini. Sol menambahkan docstring dan mengembalikan tuple. Luna berpenalaran selama 374 token menuju jawaban GPT terpendek. GPT-5.5 menulis fungsi yang sama dengan Sol, lalu streamnya terhenti: token pertama pada 9,5 detik, token terakhir pada 29,4 detik, untuk 196 token output. Ini adalah jenis kejadian satu kali jalan yang kemungkinan besar tidak akan terulang pada percobaan kedua, dan itulah tepatnya mengapa kami mengatakannya.

MiniMax M3 adalah baris yang perlu dibaca dua kali. Tiga "tes"-nya adalah pernyataan print dengan nilai yang diharapkan dalam komentar di sampingnya, sehingga tidak bisa gagal. Kodenya benar, dan kami menjalankannya, tetapi model menjawab pertanyaan yang berbeda dari yang ditanyakan. Empat model, Gemini 3.7 Flash, GLM-4.7, MiniMax M3, dan Qwen 3.8 Flash, mengurutkan list pemanggil secara in-place, yang tidak masalah untuk sebuah cuplikan tetapi menjadi bug dalam sebuah library.

Baris yang lambat adalah baris host. GLM-4.7, dilayani oleh DeepInfra, membutuhkan waktu semenit penuh untuk karakter pertamanya; host menghitung penalannya di dalam 1.363 output token yang dilaporkannya. Kimi K3 di Fireworks berpenalaran selama 771 token dan membutuhkan 22 detik.

Verdict: Terra untuk fungsi seperti ini. Opus 5 jika kamu ingin jawaban yang mengajarkanmu sesuatu, dan menerima 40 baris tersebut.

Prompt 2: monolith atau microservices

ModelServed byTime to first tokenTotal timeOutput tokensReasoning tokensBilled for this answer
MiniMax M3Fireworks2,5 d4,0 d17776$0,0004
GPT-5.6 LunaOpenAI2,6 d4,4 d16575$0,0003
GPT-5.6 TerraOpenAI2,4 d4,6 d1670$0,0021
Gemini 3.7 FlashGoogle4,3 d4,6 d160901$0,0081
GPT-5.5OpenAI2,7 d5,0 d16331$0,0061
gpt-oss-120bFireworks5,5 d6,5 d18070$0,0003
Claude Opus 5Anthropic2,7 d7,5 d33223$0,0092
GPT-5.6 SolOpenAI7,0 d10,0 d164238$0,0082
GLM-5.2Fireworks15,0 d16,5 d12590$0,0057
Kimi K3Fireworks23,8 d26,9 d1701034$0,0185
Qwen 3.8 FlashNovita29,9 d30,9 d1623810$0,0019
GLM-4.7DeepInfra78,9 d86,2 d10630$0,0024

Setiap model memberikan saran utama yang sama, mulai dengan monolith, yang merupakan saran utama yang benar. Pertanyaannya sebenarnya tentang babak kedua: sebutkan satu sinyal yang berarti sudah waktunya memisahkan. Jawabannya terbagi menjadi dua kubu.

Kubu organisasional mengatakan sinyalnya adalah orang. Kimi K3: "tim tidak lagi bisa melakukan deploy secara independen," dengan peringatan bahwa memisahkan sepanjang jahitan yang salah akan menghasilkan "distributed monolith: semua rasa sakit operasional, tanpa independensi apapun." Gemini 3.7 Flash menyebutnya "organizational bottlenecking" dan menambahkan kalimat "microservices adalah alat untuk menskalakan organisasi manusia dan kecepatan deployment, bukan codebase tahap awal." GLM-5.2 menyebutnya "deployment contention." GLM-4.7 mengatakan "organizational friction," dan menawarkan tes: jika tidak ada satu orang pun yang dapat memahami seluruh sistem lagi, kamu sudah melampaui monolith.

Kubu bottleneck mengatakan sinyalnya adalah satu bagian sistem yang spesifik. Claude Opus 5 membuatnya konkret, "video transcoder yang berat CPU membuat API kamu kelaparan," dan menutup dengan kalimat terbaik hari itu: "Segalanya yang lain — 'rasanya berantakan,' 'Netflix melakukannya' — bukan sinyal." GPT-5.6 Sol: "pisahkan ketika satu bagian produk yang terdefinisi dengan baik secara berulang perlu di-deploy atau diskalakan secara independen, dan monolith menghalanginya secara terukur," lalu "ekstrak hanya batas itu, beri interface dan pemilik yang jelas, dan biarkan segalanya yang lain bersama." Luna menambahkan kalimat yang dilupakan yang lain: ekstrak, "ukur peningkatannya," dan berhenti di sana. MiniMax M3 menyampaikan ide yang sama dengan lebih sedikit kata dan satu kalimat berkesan: "Pemisahan prematur membunuh lebih banyak startup daripada kode yang buruk."

Tabel menambahkan apa yang disembunyikan prosa. Opus 5 mencapai 162 kata terhadap target 120 kata, jawaban terpanjang dari prompt ini. Qwen 3.8 Flash berpenalaran selama 3.810 token, lebih dari dua puluh kali apa yang ditulisnya, dan membutuhkan 31 detik untuk mengatakan sesuatu yang masuk akal. Sol berpenalaran selama 238 token, membutuhkan sepuluh detik dan ditagih hampir empat kali lipat biaya jawaban Terra, untuk satu paragraf yang lebih baik satu kalimat.

Verdict: Opus 5 jika kamu ingin jawaban yang akan kamu teruskan ke seorang pendiri. GPT-5.5 atau Terra untuk paragraf terbaik per detik. MiniMax M3 jika intinya adalah bahwa ini berharga empat perseratus sen.

Prompt 3: tiga nada

ModelServed byTime to first tokenTotal timeOutput tokensReasoning tokensBilled for this answer
gpt-oss-120bFireworks1,6 d1,8 d6241$0,0002
GPT-5.6 LunaOpenAI1,6 d2,1 d440$0,0001
GPT-5.6 SolOpenAI2,2 d3,2 d470$0,0011
GPT-5.6 TerraOpenAI2,4 d3,3 d540$0,0008
GPT-5.5OpenAI2,2 d3,4 d470$0,0016
MiniMax M3Fireworks3,0 d3,4 d55191$0,0004
Gemini 3.7 FlashGoogle3,3 d3,4 d57429$0,0037
Claude Opus 5Anthropic2,8 d3,9 d10128$0,0035
Qwen 3.8 FlashNovita6,3 d6,7 d4448$0,0001
Kimi K3Fireworks9,2 d10,2 d69413$0,0076
GLM-5.2Fireworks10,8 d11,3 d7470$0,0034
GLM-4.7DeepInfra68,6 d69,7 d10490$0,0024

Ini adalah prompt yang mengungkap pembacaan yang malas. gpt-oss-120b dan Qwen 3.8 Flash keduanya mengembalikan kalimat asli, tidak berubah, sebagai versi "polos" mereka. Itu adalah pembacaan kata polos yang bisa dipertahankan dan melewatkan kata tulis ulang secara jelas. gpt-oss-120b telah melakukannya di setiap pengujian ini yang kami lakukan, jadi ini adalah kebiasaan, bukan kebetulan.

Dua model menulis kalimat playful dengan suara yang sesungguhnya. Kimi K3: "Budgeting? Piece of cake. Our app does the number-crunching so you don't have to!" Claude Opus 5: "Budgeting used to be a chore — now it's basically a tap, a swipe, and you're done." Opus 5 juga menulis satu-satunya kalimat eksekutif dengan klaim konkret di dalamnya, "reducing financial admin to a few minutes a month," di mana semua orang lain meraih abstraksi. Tujuh dari dua belas menggunakan "a breeze" di suatu tempat, dan sebelas dari dua belas menggunakan "streamlines" di kalimat eksekutif. Versi eksekutif Gemini, "seamless budget optimization and fiscal clarity," adalah yang perlu kamu tunjukkan ke tim pemasaranmu sebagai peringatan.

Kisah biaya adalah yang sesungguhnya di sini. GLM-4.7 membutuhkan 70 detik untuk menghasilkan 32 kata, karena hostnya melaporkan 1.049 output token untuk itu, sebagian besar adalah penalaran yang tidak diperincikannya. Luna dan Qwen 3.8 Flash masing-masing menyelesaikan pekerjaan dengan seperseratus sen, Luna dalam dua detik. Jika produkmu menulis ulang kalimat dalam skala besar, ini adalah keputusan biaya, bukan kualitas, kecuali kamu secara khusus menginginkan suara Opus 5 atau Kimi.

Verdict: Opus 5 atau Kimi K3 untuk teks yang akan dibaca manusia, Luna untuk teks yang akan dibaca pipeline.

Seluruh hari dalam satu tabel

Apa yang ditagih setiap model untuk ketiga jawaban, termurah terlebih dahulu, dengan provider yang melayaninnya dan harga daftar yang ditagih setiap model di API NinjaChat per 2 September 2026.

ModelBilled for all three answersMean time to first tokenSlowest answerServed byInput / output price per 1M tokens
GPT-5.6 Luna$0,00113,4 d7,2 dOpenAI$0,2 / $1,2
gpt-oss-120b$0,00113,8 d6,5 dFireworks$0,35 / $0,75
MiniMax M3$0,00162,9 d4,9 dFireworks$0,3 / $1,2
Qwen 3.8 Flash$0,002514,8 d30,9 dNovita$0,15 / $0,47
GPT-5.6 Terra$0,00522,1 d4,6 dOpenAI$2 / $12
GLM-4.7$0,007969,4 d86,2 dDeepInfra$0,6 / $2,2
GLM-5.2$0,013612,9 d16,5 dFireworks$1,4 / $4,4
GPT-5.6 Sol$0,01396,0 d10,7 dOpenAI$4 / $20
GPT-5.5$0,01564,8 d29,4 dOpenAI$5 / $30
Gemini 3.7 Flash$0,01703,5 d4,6 dGoogle$1,5 / $7,5
Claude Opus 5$0,03073,1 d8,6 dAnthropic$5 / $25
Kimi K3$0,042716,5 d26,9 dFireworks$3 / $15

Tiga pola terlihat jelas.

Penalaran adalah harga tersembunyi. Kimi K3 terdaftar di bawah tiga model frontier dan berakhir sebagai model paling mahal hari itu, karena ia berpenalaran selama 400 hingga 1.000 token di setiap prompt, termasuk prompt penulisan ulang. Gemini 3.7 Flash biayanya lebih dari GPT-5.5 karena alasan yang sama. Jawaban termahal Sol bukan yang terpanjang, melainkan yang paling banyak dipikirkannya. Jika kamu tidak membutuhkan chain-of-thought untuk suatu tugas, pilih model yang tidak melakukannya secara default, atau kurangi upaya penalaran di mana API memungkinkannya.

Murah kini benar-benar bagus. Luna, gpt-oss-120b, dan MiniMax M3 menulis kode yang benar, saran yang masuk akal, dan teks yang bisa digunakan dengan biaya antara sepersepuluh hingga seperenam sen semuanya, ketiga prompt termasuk. Dua tahun lalu tingkatan model itu akan gagal pada prompt coding.

Host adalah bagian dari latensi. GLM-4.7 adalah model yang cepat di atas kertas dan menjadi yang paling lambat dalam pengujian, karena host yang melayaninnya membutuhkan waktu semenit untuk memulai setiap jawaban. Kimi K3 dan GLM-5.2 di Fireworks cepat setelah mulai menulis dan lambat sebelumnya. Model OpenAI, Google, dan Anthropic menjawab langsung dari lab. Itulah mengapa API kami menampilkan uptime dan latensi per provider, bukan per model, dan mengapa kolom Served by ada di setiap tabel di atas.

Model mana untuk apa

  • Kamu ingin jawaban terbaik dan biaya bukan prioritas: Claude Opus 5. Kode paling menyeluruh, jawaban pendiri yang benar-benar akan kamu teruskan, satu-satunya penulisan ulang dengan klaim konkret, dan rata-rata 3 detik ke token pertama.
  • Kamu ingin kualitas frontier dengan harga menengah: GPT-5.6 Terra. Tercepat ke token pertama dalam keseluruhan set, tidak berpenalaran kecuali pertanyaannya membutuhkan, kurang dari setengah tagihan Sol pada hari itu.
  • Kamu ingin model OpenAI paling mampu tanpa memperhatikan harga: GPT-5.5, tetapi perhatikan batas output 32K sebelum kamu mengarahkannya ke generasi panjang.
  • Kamu menjalankan pipeline volume tinggi: GPT-5.6 Luna atau MiniMax M3. Sepersepuluh hingga seperenam sen untuk seluruh latihan, semuanya di bawah lima detik pada dua prompt prosa.
  • Kamu ingin model open-weight besar dengan konteks panjang: Kimi K3 untuk penulisan, GLM-5.2 untuk harga, dan anggarkan waktu penalaran untuk keduanya.
  • Kamu ingin teks yang akan dibaca orang: Opus 5, lalu Kimi K3. Lewati dua model yang mengembalikan kalimat asli.

Jalankan sendiri

Setiap model di atas hanya selisih satu string model di NinjaChat API, yang kompatibel dengan OpenAI. Akun yang terverifikasi nomor telepon mendapat saldo awal $0,50, tanpa kartu kredit sampai kamu mengisi ulang. Ganti id-nya dan jalankan ulang prompt apapun dalam posting ini. Responnya melaporkan apa yang ditagihkan dan provider mana yang melayaninmu.

curl https://www.ninjachat.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $NINJACHAT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-terra",
    "messages": [{"role": "user", "content": "In about 120 words, tell a first-time founder when to choose a monolith over microservices, and the one signal that means it is time to split."}],
    "max_tokens": 2500,
    "temperature": 0.7,
    "stream": true,
    "stream_options": {"include_usage": true}
  }'
import time
from openai import OpenAI

client = OpenAI(base_url="https://www.ninjachat.ai/api/v1", api_key="YOUR_KEY")

for model in ["claude-opus-5", "gpt-5.6-terra", "minimax-m3"]:
    t0 = time.perf_counter()
    first = None
    stream = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": "Rewrite three ways (plain, playful, executive): Our app makes budgeting easy."}],
        max_tokens=2500,
        temperature=0.7,
        stream=True,
        stream_options={"include_usage": True},
    )
    for chunk in stream:
        if chunk.choices and chunk.choices[0].delta.content and first is None:
            first = time.perf_counter() - t0
        if chunk.usage:
            print(model, "reasoning tokens:", chunk.usage.completion_tokens_details.reasoning_tokens)
    print(model, "first token", round(first, 2), "s, total", round(time.perf_counter() - t0, 2), "s")

Harga langsung untuk setiap model, tanpa key, tersedia di GET https://www.ninjachat.ai/api/v1/models. Sisi konsumen adalah model-model yang sama dalam jendela chat: pilih salah satunya di /models dengan paket berbayar.

Pertanyaan yang sering diajukan

Model AI mana yang tercepat dalam pengujian ini? GPT-5.6 Terra: rata-rata 2,1 detik ke token pertama, dan jawaban lengkap tercepat pada prompt coding dalam 2,9 detik. MiniMax M3 dan Claude Opus 5 berada di urutan berikutnya, keduanya sekitar tiga detik ke token pertama rata-rata.

Model AI mana yang termurah? GPT-5.6 Luna dan gpt-oss-120b seri sekitar sepersepuluh sen untuk ketiga jawaban sebagaimana ditagih oleh NinjaChat API pada 2 September 2026. MiniMax M3 sedikit di belakang.

Apakah ada model yang salah dalam tugas coding? Tidak. Semua dua belas menghasilkan fungsi penggabungan yang tesnya sendiri lulus. Claude Opus 5 tepat mencapai batas 40 baris, MiniMax M3 mencetak hasilnya alih-alih mengassertnya, dan empat model mengurutkan list pemanggil secara in-place, yang perlu kamu ketahui jika kamu menyalin kode tersebut ke dalam library.

Mengapa GLM-4.7 dan Kimi K3 sangat lambat dalam tabel? Penalaran dan hosting, bertumpuk. Keduanya berpikir panjang sebelum menulis, dan host yang melayani GLM-4.7 sore itu membutuhkan sekitar satu menit untuk memulai setiap jawaban dan melaporkan penalaran di dalam jumlah output. Pada host yang berbeda, atau dengan upaya penalaran yang dikurangi, keduanya mendarat di tengah tabel.

Mengapa model yang sama biayanya berbeda pada prompt yang berbeda? Karena reasoning token ditagih sebagai output. GPT-5.6 Sol menghabiskan 26 reasoning token pada prompt kode dan 238 pada prompt pendiri, sehingga jawaban pendiri biayanya hampir dua kali lipat jawaban kode meskipun lebih pendek.

Bisakah saya mereproduksi ini? Ya. Ketiga prompt tercetak di atas secara verbatim, pengaturannya tercantum di bawah Cara kami mengukur, dan cuplikan Python mengatur waktu model apapun dengan cara yang sama seperti yang kami lakukan dan mencetak reasoning token-nya. Harapkan angka absolutnya bergeser antar percobaan dan peringkatnya bertahan.

NinjaChatNinjaChat

Setiap model AI. Satu tempat.

Aplikasi iPhoneCoba di web
NinjaChat LogoNinjaChat Logo

Setiap model AI dalam satu tempat.

Unduh di App Store

Produk

  • Dasbor
  • Harga
  • Alat AI Gratis
  • Program Afiliasi
  • Aplikasi iOS

Pengembang

  • API
  • Model API
  • Ninja Router
  • MCP / Agents
  • Dokumentasi API
  • Status
  • Changelog

Model

  • Model Council
  • Gemini 2.5 Flash
  • Gemini 2.5 Pro
  • Gemini 3 Flash Preview
  • Gemini 3.1 Pro Preview
  • Model chat
  • Generator Gambar AI
  • Generator Video AI
  • Lihat Semua Model

Perusahaan

  • Blog
  • Komunitas
  • Karier
  • Dukungan
  • Kebijakan Privasi
  • Ketentuan Layanan
  • Safety Protocol
  • Do Not Sell or Share My Personal Information
Bahasa

Hak Cipta © 2026 NinjaChat AI. Produk dari Bloon Semua Hak Dilindungi.