NinjaChat LogoNinjaChat Logo
ModellePreiseToolsBlog
Dashboard
ModellePreiseToolsBlogAnmeldenDownload on the App Store
Wir haben dieselben 3 Prompts auf 12 KI-Modellen getestet (September 2026): Ungekürzte Antworten, Latenz, Preis Titelbild

Wir haben dieselben 3 Prompts auf 12 KI-Modellen getestet (September 2026): Ungekürzte Antworten, Latenz, Preis

Claude Opus 5, GPT-5.5, die drei GPT-5.6-Größen, Kimi K3, Gemini 3.7 Flash, GLM-5.2, GLM-4.7, MiniMax M3, gpt-oss-120b und Qwen 3.8 Flash – jeweils mit einer Coding-Aufgabe, einer Gründerfrage und einem Rewrite über die NinjaChat-API. Jede Antwort unbearbeitet, jede Reaktionszeit gemessen, jede Anfrage zum tatsächlichen Preis abgerechnet.

Siddharth Duggal AvatarSiddharth Duggal·4. September 2026

Auf dieser Seite

  • Wie wir gemessen haben
  • Prompt 1: Überlappende Int...
  • Prompt 2: Monolith oder Mi...
  • Prompt 3: Drei Tonalitäten
  • Der gesamte Tag in einer T...
  • Welches Modell wofür
  • Selbst ausprobieren
  • Häufig gestellte Fragen

Jede Modellvergleichsstudie, die man liest, ist entweder eine Benchmark-Tabelle, die niemand reproduzieren kann, oder eine Rezension auf Basis des Bauchgefühls von zwei Modellen, die der Autor ohnehin schon mochte. Also haben wir am 2. September 2026 die langweilige Variante gemacht: dieselben drei Prompts, je einmal an zwölf aktuelle Modelle gesendet, über unsere eigene API, mit Zeitmessung des Streams und Abrechnung zum Preis, den ein NinjaChat-Schlüssel tatsächlich zahlt. Nichts im Folgenden wurde bearbeitet, selektiv ausgewählt oder erneut ausgeführt, damit es besser aussieht.

Die Kurzfassung: Alle zwölf haben eine korrekte Interval-Merge-Funktion geschrieben, deren eigene Tests bestehen. GPT-5.6 Terra war das Modell mit der schnellsten Zeit bis zum ersten Token im Durchschnitt und insgesamt das schnellste Modell beim Programmieren – unter drei Sekunden. GPT-5.6 Luna und gpt-oss-120b teilten sich den günstigsten Preis mit jeweils etwa einem Zehntel Cent für alle drei Antworten. Die zwei teuersten Einzelantworten des Tages waren Kimi K3s Gründerberatung, die 1.034 Reasoning-Token umfasste und 27 Sekunden dauerte, sowie Claude Opus 5's Code, der auch der gründlichste Code ist, den irgendjemand geschrieben hat. Dazwischen lagen die interessanten Unterschiede – und die hatten überhaupt nichts mit Korrektheit zu tun. Sie betrafen die Frage, wie lange jedes Modell nachdenkt, bevor es antwortet, welcher Host es bereitgestellt hat und was beides kostet.

Wie wir gemessen haben

  • Datum und Ort: 2. September 2026, ein Nachmittag, ein Laptop mit einer Heimverbindung in den USA.
  • Route: Jede Anfrage ging an die NinjaChat-API, POST /api/v1/chat/completions, mit einem normalen Playground-Schlüssel. Die Latenz, die Sie sehen, beinhaltet unser Routing, den von uns gewählten Anbieter und die eigene Verarbeitungszeit des Anbieters. Die Spalte „Bereitgestellt von" nennt diesen Anbieter für jede Antwort.
  • Modelle: Claude Opus 5, GPT-5.5, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Kimi K3, Gemini 3.7 Flash, GLM-5.2, GLM-4.7, MiniMax M3, gpt-oss-120b und Qwen 3.8 Flash.
  • Einstellungen: Temperatur 0,7, eine Ausgabeobergrenze von 2.500 Token, Streaming aktiviert mit Nutzungsberichte, alle anderen Parameter auf den Standardwerten des jeweiligen Modells belassen. Die meisten dieser Modelle denken standardmäßig nach, und unsere API meldet Reasoning-Token getrennt von der sichtbaren Ausgabe, sodass beide Spalten in jeder Tabelle enthalten sind. Zwei Hosts – DeepInfra für GLM-4.7 und Fireworks für GLM-5.2 – zählen das Reasoning in der Ausgabe mit, weshalb diese Zeilen eine hohe Ausgabenzahl und eine Null in der Reasoning-Spalte anzeigen.
  • Zeitmessung: Die Zeit bis zum ersten Token ist der Moment, wenn das erste sichtbare Zeichen der Antwort eintrifft, nach einem eventuellen verdeckten Denkprozess. Die Gesamtzeit läuft bis zum Schließen des Streams. Anfragen wurden einzeln nacheinander ausgeführt, nie parallel, nach einer Aufwärmanfrage an jedes Modell, sodass nichts im Folgenden einen Kaltstart auf unserer Seite einschließt.
  • Kosten: Der Betrag, den unsere API für diese Anfrage als Abrechnung gemeldet hat, auf den Zehntausenstel Dollar genau. Nichts wurde aus einer Preisliste geschätzt.
  • Ein Durchlauf pro Zelle. Keine Wiederholungen, kein Beste-aus-drei. Ein zweiter Durchlauf wird diese Zahlen nicht auf die Kommastelle genau reproduzieren. Die Rangfolge sollte sich jedoch reproduzieren lassen.

Die drei Prompts wurden wortgetreu von den Modellseiten unserer Website kopiert, sodass Sie hier dieselbe Aufgabe sehen, die auf diesen Seiten gezeigt wird:

  1. „Schreibe eine Python-Funktion, die überlappende Intervalle zusammenführt, plus drei kurze Tests. Halte die gesamte Antwort unter 40 Codezeilen."
  2. „Erkläre in etwa 120 Wörtern einem Erstgründer, wann er sich für einen Monolithen statt Microservices entscheiden sollte, und nenne das eine Signal, das bedeutet, dass es Zeit ist, aufzuteilen."
  3. „Schreibe diesen Satz auf drei Arten um, jeweils in einem klar unterschiedlichen Ton (sachlich, verspielt, Führungsebene): ‚Our app makes budgeting easy.' Beschrifte jeden."

Prompt 1: Überlappende Intervalle zusammenführen

Sortiert nach Gesamtzeit. Jede Antwort unten hat ihre eigenen Tests bestanden, als wir den Code ausgeführt haben.

ModellBereitgestellt vonZeit bis zum ersten TokenGesamtzeitAusgabe-TokenReasoning-TokenAbgerechnet für diese Antwort
GPT-5.6 TerraOpenAI1,5 s2,9 s1840$0,0023
Gemini 3.7 FlashGoogle2,8 s3,3 s232445$0,0052
MiniMax M3Fireworks3,3 s4,9 s285271$0,0008
gpt-oss-120bFireworks4,4 s6,3 s280434$0,0006
GPT-5.6 LunaOpenAI5,9 s7,2 s171374$0,0007
Claude Opus 5Anthropic3,7 s8,6 s62189$0,0180
Qwen 3.8 FlashNovita8,1 s9,1 s175757$0,0005
GPT-5.6 SolOpenAI8,8 s10,7 s19426$0,0046
GLM-5.2Fireworks12,9 s14,6 s9890$0,0045
Kimi K3Fireworks16,5 s21,7 s309771$0,0166
GPT-5.5OpenAI9,5 s29,4 s19660$0,0079
GLM-4.7DeepInfra60,6 s67,1 s13630$0,0031

Zwölf von zwölf auf Korrektheit – was zeigt, dass dies für alles Aktuelle ein gelöstes Problem ist. Die Unterschiede liegen im Stil, darin, wie das Modell Token einsetzt, und in einem Fall darin, was „Test" bedeutet.

Die kompakteste Antwort kam von GLM-4.7: vierzehn Zeilen, kein Kommentar, keine separate Leerfeld-Prüfung, weil die Schleife sie abdeckt.

def merge_intervals(intervals):
    intervals.sort(key=lambda x: x[0])
    merged = []
    for start, end in intervals:
        if not merged or start > merged[-1][1]:
            merged.append([start, end])
        else:
            merged[-1][1] = max(merged[-1][1], end)
    return merged

Claude Opus 5 ging den anderen Weg. Es schrieb die einzige Version mit einem Docstring, drei benannten Testfunktionen, die leere, einzelne, angrenzende, unsortierte und verschachtelte Eingaben abdecken, sowie eine Erläuterung, dass sich angrenzende Intervalle zusammenführen, weil der Vergleich geschlossen ist, mit der einen Zeichenänderung, falls man halboffene Semantik bevorzugt. Es ist auch die Antwort, die einen strengen Leser am ehesten geärgert haben dürfte: Der Codeblock hat genau 40 Zeilen, obwohl der Prompt „unter 40" verlangte. Kimi K3 schrieb die zweitvorsichtigste Version: eine Testfunktion mit drei kommentierten Fällen und unsortierter, verschachtelter Eingabe.

Die GPT-Familie produzierte viermal nahezu dieselbe Funktion. Terra erledigte es in 2,9 Sekunden ohne Reasoning-Token und ohne Docstring – die schnellste Antwort des Prompts. Sol fügte einen Docstring hinzu und gab Tupel zurück. Luna dachte 374 Reasoning-Token lang nach, bevor es zur kürzesten GPT-Antwort kam. GPT-5.5 schrieb dieselbe Funktion wie Sol, dann stockte der Stream: Erstes Token nach 9,5 Sekunden, letztes Token nach 29,4 Sekunden, für 196 Ausgabe-Token. Das ist die Art von Einzelfallereignis, das ein zweiter Durchlauf wahrscheinlich nicht wiederholen würde – und genau deshalb sagen wir es.

MiniMax M3 ist die Zeile, die man zweimal lesen sollte. Seine drei „Tests" sind Print-Anweisungen mit dem erwarteten Wert als Kommentar daneben, die also nicht fehlschlagen können. Der Code ist korrekt, und wir haben ihn ausgeführt, aber das Modell hat eine andere Frage beantwortet als die gestellte. Vier Modelle – Gemini 3.7 Flash, GLM-4.7, MiniMax M3 und Qwen 3.8 Flash – sortieren die Liste des Aufrufers direkt, was für ein Snippet in Ordnung und in einer Bibliothek ein Fehler ist.

Die langsamen Zeilen sind Host-Zeilen. GLM-4.7, bereitgestellt von DeepInfra, brauchte eine volle Minute bis zum ersten Zeichen; der Host zählt sein Reasoning in den gemeldeten 1.363 Ausgabe-Token mit. Kimi K3 auf Fireworks dachte 771 Token lang nach und brauchte 22 Sekunden.

Fazit: Terra für eine Funktion wie diese. Opus 5, wenn man die Antwort will, die einem etwas beibringt – und die 40 Zeilen akzeptiert.

Prompt 2: Monolith oder Microservices

ModellBereitgestellt vonZeit bis zum ersten TokenGesamtzeitAusgabe-TokenReasoning-TokenAbgerechnet für diese Antwort
MiniMax M3Fireworks2,5 s4,0 s17776$0,0004
GPT-5.6 LunaOpenAI2,6 s4,4 s16575$0,0003
GPT-5.6 TerraOpenAI2,4 s4,6 s1670$0,0021
Gemini 3.7 FlashGoogle4,3 s4,6 s160901$0,0081
GPT-5.5OpenAI2,7 s5,0 s16331$0,0061
gpt-oss-120bFireworks5,5 s6,5 s18070$0,0003
Claude Opus 5Anthropic2,7 s7,5 s33223$0,0092
GPT-5.6 SolOpenAI7,0 s10,0 s164238$0,0082
GLM-5.2Fireworks15,0 s16,5 s12590$0,0057
Kimi K3Fireworks23,8 s26,9 s1701034$0,0185
Qwen 3.8 FlashNovita29,9 s30,9 s1623810$0,0019
GLM-4.7DeepInfra78,9 s86,2 s10630$0,0024

Jedes Modell gab denselben Hauptratschlag: Mit einem Monolithen anfangen – was der richtige Hauptratschlag ist. Die eigentliche Frage war die zweite Hälfte: Nenne das eine Signal, das bedeutet, dass es Zeit ist, aufzuteilen. Die Antworten fielen in zwei Lager.

Das Organisationslager sagte, das Signal sind Menschen. Kimi K3: „Teams können nicht mehr unabhängig deployen", mit einer Warnung, dass eine Aufteilung entlang der falschen Grenzen einen „verteilten Monolithen" erzeugt: „aller Betriebsschmerz, keine der Unabhängigkeit." Gemini 3.7 Flash nannte es „organisatorische Engpässe" und fügte hinzu: „Microservices sind ein Werkzeug, um menschliche Organisationen und Deployment-Geschwindigkeit zu skalieren, keine Frühphasen-Codebases." GLM-5.2 nannte es „Deployment-Konflikte". GLM-4.7 sprach von „organisatorischer Reibung" und bot einen Test an: Wenn kein Einzelner das gesamte System mehr überblicken kann, hat man den Monolithen entwachsen.

Das Engpass-Lager sagte, das Signal ist ein spezifischer Teil des Systems. Claude Opus 5 machte es konkret: „ein CPU-hungriger Video-Transcoder, der die API aushungert", und schloss mit dem besten Satz des Tages: „Alles andere – ‚es fühlt sich chaotisch an', ‚Netflix macht es so' – ist kein Signal." GPT-5.6 Sol: „Aufteilen, wenn ein klar definierter Teil des Produkts wiederholt unabhängig deployt oder skaliert werden muss und der Monolith das messbar verhindert", dann: „Nur diese Grenze extrahieren, ihr eine klare Schnittstelle und einen Eigentümer geben, alles andere zusammenlassen." Luna fügte den Satz hinzu, den die anderen vergessen haben: Extrahieren, „die Verbesserung messen", und dort aufhören. MiniMax M3 brachte dieselbe Idee in weniger Worten und mit einer einprägsamen Zeile: „Zu frühes Aufteilen tötet mehr Startups als schlechter Code."

Die Tabelle fügt hinzu, was die Prosa verbirgt. Opus 5 lief auf 162 Wörter gegen ein Ziel von 120 – die längste Antwort des Prompts. Qwen 3.8 Flash dachte 3.810 Reasoning-Token lang nach – mehr als das Zwanzigfache dessen, was es schrieb – und brauchte 31 Sekunden für eine vernünftige Aussage. Sol dachte 238 Token lang nach, brauchte zehn Sekunden und wurde mit fast dem Vierfachen von Terras Antwortkosten abgerechnet, für einen Absatz, der um einen Satz besser ist.

Fazit: Opus 5, wenn man die Antwort will, die man einem Gründer weiterleiten würde. GPT-5.5 oder Terra für den besten Absatz pro Sekunde. MiniMax M3, wenn es darum geht, dass das vier Hundertstel Cent gekostet hat.

Prompt 3: Drei Tonalitäten

ModellBereitgestellt vonZeit bis zum ersten TokenGesamtzeitAusgabe-TokenReasoning-TokenAbgerechnet für diese Antwort
gpt-oss-120bFireworks1,6 s1,8 s6241$0,0002
GPT-5.6 LunaOpenAI1,6 s2,1 s440$0,0001
GPT-5.6 SolOpenAI2,2 s3,2 s470$0,0011
GPT-5.6 TerraOpenAI2,4 s3,3 s540$0,0008
GPT-5.5OpenAI2,2 s3,4 s470$0,0016
MiniMax M3Fireworks3,0 s3,4 s55191$0,0004
Gemini 3.7 FlashGoogle3,3 s3,4 s57429$0,0037
Claude Opus 5Anthropic2,8 s3,9 s10128$0,0035
Qwen 3.8 FlashNovita6,3 s6,7 s4448$0,0001
Kimi K3Fireworks9,2 s10,2 s69413$0,0076
GLM-5.2Fireworks10,8 s11,3 s7470$0,0034
GLM-4.7DeepInfra68,6 s69,7 s10490$0,0024

Dies ist der Prompt, der oberflächliches Lesen entlarvt. gpt-oss-120b und Qwen 3.8 Flash gaben beide den Originalsatz unverändert als ihre „sachliche" Version zurück. Das ist eine vertretbare Auslegung des Wortes „sachlich" und ein offensichtliches Verfehlen des Wortes „umschreiben". gpt-oss-120b hat dies bei jedem Durchlauf dieses Tests gemacht, den wir durchgeführt haben – es ist also eine Gewohnheit, kein Ausrutscher.

Zwei Modelle schrieben eine verspielte Zeile mit echter Stimme. Kimi K3: „Budgeting? Piece of cake. Our app does the number-crunching so you don't have to!" Claude Opus 5: „Budgeting used to be a chore — now it's basically a tap, a swipe, and you're done." Opus 5 schrieb auch die einzige Führungsebenen-Zeile mit einer konkreten Aussage: „reducing financial admin to a few minutes a month" – während alle anderen zu Abstraktionen griffen. Sieben von zwölf verwendeten irgendwo „a breeze", und elf von zwölf verwendeten „streamlines" in der Führungsebenen-Zeile. Geminis Führungsebenen-Version, „seamless budget optimization and fiscal clarity", ist die, die man seinem Marketingteam als Warnung zeigen sollte.

Die Kostenstory ist die eigentlich interessante. GLM-4.7 brauchte 70 Sekunden, um 32 Wörter zu produzieren, weil sein Host 1.049 Ausgabe-Token meldete, von denen der Großteil auf nicht aufgeschlüsseltes Reasoning entfiel. Luna und Qwen 3.8 Flash erledigten die Aufgabe je für einen Hundertstel Cent, Luna in zwei Sekunden. Wenn das eigene Produkt Sätze in großem Maßstab umschreibt, ist das eine Kostenentscheidung, keine Qualitätsentscheidung – es sei denn, man will ausdrücklich die Stimme von Opus 5 oder Kimi.

Fazit: Opus 5 oder Kimi K3 für Texte, die Menschen lesen werden. Luna für Texte, die eine Pipeline lesen wird.

Der gesamte Tag in einer Tabelle

Was jedem Modell für alle drei Antworten abgerechnet wurde, günstigste zuerst, mit dem Anbieter, der es bereitstellte, und dem Listenpreis, den jedes Modell über die NinjaChat-API ab dem 2. September 2026 berechnet.

ModellAbgerechnet für alle drei AntwortenMittlere Zeit bis zum ersten TokenLangsamste AntwortBereitgestellt vonEingabe- / Ausgabepreis pro 1M Token
GPT-5.6 Luna$0,00113,4 s7,2 sOpenAI$0,2 / $1,2
gpt-oss-120b$0,00113,8 s6,5 sFireworks$0,35 / $0,75
MiniMax M3$0,00162,9 s4,9 sFireworks$0,3 / $1,2
Qwen 3.8 Flash$0,002514,8 s30,9 sNovita$0,15 / $0,47
GPT-5.6 Terra$0,00522,1 s4,6 sOpenAI$2 / $12
GLM-4.7$0,007969,4 s86,2 sDeepInfra$0,6 / $2,2
GLM-5.2$0,013612,9 s16,5 sFireworks$1,4 / $4,4
GPT-5.6 Sol$0,01396,0 s10,7 sOpenAI$4 / $20
GPT-5.5$0,01564,8 s29,4 sOpenAI$5 / $30
Gemini 3.7 Flash$0,01703,5 s4,6 sGoogle$1,5 / $7,5
Claude Opus 5$0,03073,1 s8,6 sAnthropic$5 / $25
Kimi K3$0,042716,5 s26,9 sFireworks$3 / $15

Drei Muster werden deutlich.

Reasoning ist der versteckte Preis. Kimi K3 liegt preislich unter den drei Frontier-Modellen und war dennoch das teuerste Modell des Tages, weil es bei jedem Prompt zwischen 400 und 1.000 Token lang nachgedacht hat – einschließlich des Umschreibens. Gemini 3.7 Flash kostete aus demselben Grund mehr als GPT-5.5. Sols teuerste Antwort war nicht die längste, sondern die, über die es am längsten nachgedacht hat. Wer für eine Aufgabe keine Kette von Gedankenschritten braucht, sollte ein Modell wählen, das das nicht standardmäßig tut – oder den Reasoning-Aufwand dort reduzieren, wo die API es erlaubt.

Günstig ist jetzt wirklich gut. Luna, gpt-oss-120b und MiniMax M3 schrieben korrekten Code, vernünftige Ratschläge und brauchbaren Text für zusammen zwischen einem Zehntel und einem Sechstel Cent – alle drei Prompts inbegriffen. Vor zwei Jahren hätte dieses Preissegment beim Coding-Prompt versagt.

Der Host ist Teil der Latenz. GLM-4.7 ist auf dem Papier ein schnelles Modell und war im Test das langsamste, weil der Host, der es bereitstellte, eine Minute brauchte, um jede Antwort zu beginnen. Kimi K3 und GLM-5.2 auf Fireworks waren schnell, sobald sie zu schreiben begannen, und langsam davor. Die OpenAI-, Google- und Anthropic-Modelle wurden direkt von den Labors bereitgestellt. Deshalb zeigt unsere API Verfügbarkeit und Latenz pro Anbieter, nicht pro Modell – und deshalb steht die Spalte „Bereitgestellt von" in jeder Tabelle oben.

Welches Modell wofür

  • Die beste Antwort gewünscht, Kosten sind zweitrangig: Claude Opus 5. Gründlichster Code, die Gründer-Antwort, die man tatsächlich weiterleiten würde, die einzige Umschreibung mit einer konkreten Aussage, und im Durchschnitt 3 Sekunden bis zum ersten Token.
  • Frontier-Qualität zu einem mittleren Preis gewünscht: GPT-5.6 Terra. Schnellste Zeit bis zum ersten Token im gesamten Test, kein Reasoning, sofern die Frage es nicht erfordert, weniger als die Hälfte von Sols Tagesabrechnung.
  • Das leistungsfähigste OpenAI-Modell unabhängig vom Preis gewünscht: GPT-5.5, aber die 32K-Ausgabeobergrenze beachten, bevor man es für lange Generierungen einsetzt.
  • Eine Pipeline mit hohem Volumen betrieben: GPT-5.6 Luna oder MiniMax M3. Ein Zehntel bis ein Sechstel Cent für die gesamte Übung, alles unter fünf Sekunden bei den beiden Prosa-Prompts.
  • Ein großes Open-Weight-Modell mit langem Kontext gewünscht: Kimi K3 für das Schreiben, GLM-5.2 für den Preis, und bei beiden Reasoning-Zeit einplanen.
  • Texte gewünscht, die Menschen lesen werden: Opus 5, dann Kimi K3. Die zwei Modelle überspringen, die den Originalsatz zurückgaben.

Selbst ausprobieren

Jedes Modell oben ist über die NinjaChat-API mit einer einzigen model-Zeichenkette erreichbar – OpenAI-kompatibel. Ein telefonverifiziertes Konto startet mit 0,50 $ Startguthaben, eine Kreditkarte ist erst zum Aufladen nötig. Einfach die ID austauschen und jeden Prompt aus diesem Beitrag erneut ausführen. Die Antwort meldet, was abgerechnet wurde und welcher Anbieter bereitgestellt hat.

curl https://www.ninjachat.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $NINJACHAT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-terra",
    "messages": [{"role": "user", "content": "In about 120 words, tell a first-time founder when to choose a monolith over microservices, and the one signal that means it is time to split."}],
    "max_tokens": 2500,
    "temperature": 0.7,
    "stream": true,
    "stream_options": {"include_usage": true}
  }'
import time
from openai import OpenAI

client = OpenAI(base_url="https://www.ninjachat.ai/api/v1", api_key="YOUR_KEY")

for model in ["claude-opus-5", "gpt-5.6-terra", "minimax-m3"]:
    t0 = time.perf_counter()
    first = None
    stream = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": "Rewrite three ways (plain, playful, executive): Our app makes budgeting easy."}],
        max_tokens=2500,
        temperature=0.7,
        stream=True,
        stream_options={"include_usage": True},
    )
    for chunk in stream:
        if chunk.choices and chunk.choices[0].delta.content and first is None:
            first = time.perf_counter() - t0
        if chunk.usage:
            print(model, "reasoning tokens:", chunk.usage.completion_tokens_details.reasoning_tokens)
    print(model, "first token", round(first, 2), "s, total", round(time.perf_counter() - t0, 2), "s")

Live-Preise für jedes Modell, ohne Schlüssel, sind über GET https://www.ninjachat.ai/api/v1/models abrufbar. Die Verbraucherseite bietet dieselben Modelle in einem Chat-Fenster: Jedes davon auf /models auswählen – mit einem kostenpflichtigen Plan.

Häufig gestellte Fragen

Welches KI-Modell war in diesem Test am schnellsten? GPT-5.6 Terra: im Durchschnitt 2,1 Sekunden bis zum ersten Token und die schnellste vollständige Antwort beim Coding-Prompt mit 2,9 Sekunden. MiniMax M3 und Claude Opus 5 folgten mit jeweils rund drei Sekunden bis zum ersten Token im Durchschnitt.

Welches KI-Modell war am günstigsten? GPT-5.6 Luna und gpt-oss-120b teilten sich den günstigsten Preis mit jeweils etwa einem Zehntel Cent für alle drei Antworten, abgerechnet über die NinjaChat-API am 2. September 2026. MiniMax M3 lag knapp dahinter.

Hat ein Modell die Coding-Aufgabe falsch gelöst? Nein. Alle zwölf produzierten eine Merge-Funktion, deren eigene Tests bestehen. Claude Opus 5 hat die 40-Zeilen-Grenze genau getroffen, MiniMax M3 hat seine Ergebnisse gedruckt statt sie zu prüfen, und vier Modelle sortieren die Liste des Aufrufers direkt – was man wissen sollte, wenn man den Code in eine Bibliothek kopiert.

Warum sind GLM-4.7 und Kimi K3 in den Tabellen so langsam? Reasoning und Hosting, kombiniert. Beide denken ausgiebig nach, bevor sie schreiben, und der Host, der GLM-4.7 an diesem Nachmittag bereitstellte, brauchte etwa eine Minute, um jede Antwort zu beginnen, und zählte das Reasoning in der Ausgabe mit. Mit einem anderen Host oder reduziertem Reasoning-Aufwand würden beide im Mittelfeld landen.

Warum kostet dasselbe Modell bei verschiedenen Prompts unterschiedlich viel? Weil Reasoning-Token als Ausgabe abgerechnet werden. GPT-5.6 Sol verwendete 26 Reasoning-Token für den Code-Prompt und 238 für den Gründer-Prompt, sodass die Gründer-Antwort trotz kürzerem Output fast doppelt so viel kostete wie die Code-Antwort.

Kann ich das reproduzieren? Ja. Die drei Prompts sind oben wortgetreu angegeben, die Einstellungen sind unter „Wie wir gemessen haben" aufgeführt, und der Python-Ausschnitt misst jedes Modell auf dieselbe Weise wie wir und gibt seine Reasoning-Token aus. Die absoluten Zahlen werden zwischen Durchläufen variieren; die Rangfolge sollte sich halten.

NinjaChatNinjaChat

Jedes KI-Modell. Ein Ort.

iPhone-AppIm Web testen
NinjaChat LogoNinjaChat Logo

Jedes KI-Modell an einem Ort.

Im App Store laden

Produkt

  • Dashboard
  • Preise
  • Kostenlose KI-Tools
  • Partnerprogramm
  • iOS-App

Entwickler

  • API
  • API-Modelle
  • Ninja Router
  • MCP / Agents
  • API-Dokumentation
  • Status
  • Changelog

Modelle

  • Model Council
  • Gemini 2.5 Flash
  • Gemini 2.5 Pro
  • Gemini 3 Flash Preview
  • Gemini 3.1 Pro Preview
  • Chat-Modelle
  • KI-Bildgeneratoren
  • KI-Videogeneratoren
  • Alle Modelle anzeigen

Unternehmen

  • Blog
  • Community
  • Karriere
  • Support
  • Datenschutzrichtlinie
  • Nutzungsbedingungen
  • Safety Protocol
  • Do Not Sell or Share My Personal Information
Sprache

Copyright © 2026 NinjaChat AI. Ein Produkt von Bloon Alle Rechte vorbehalten.