GPT-6.1 Sol Reasoning-Aufwand: low, medium, high, xhigh oder max?
Welchen Reasoning-Aufwand Sie bei GPT-6.1 Sol nutzen sollten: echte Zeiten, Token und Kosten bei low, medium, high, xhigh und max, warum es langsam wirkt.
Als Markdown lesenStarten Sie GPT-6.1 Sol mit medium, dem Standard, und nutzen Sie low, wenn Sie die Antwort schnell brauchen. Erhöhen Sie den Aufwand auf high, xhigh oder max nur bei Aufgaben, die mit medium scheitern: lange Refactorings, schwieriges Debugging, mehrstufige Agenten-Arbeit. Bei den kurzen Aufgaben im Test unten lieferte jede Aufwandsstufe die richtige Antwort, aber max brauchte etwa zehnmal so lange bis zum ersten Wort und verbrauchte das Zweieinhalb- bis Fünffache der Token von low.
Das ist auch der Hauptgrund, warum sich GPT-6.1 Sol langsam anfühlt. Es führt vor jeder Antwort Reasoning durch, und Sie warten auf dieses Reasoning, bevor der erste sichtbare Text erscheint.
Welchen Reasoning-Aufwand unterstützt GPT-6.1 Sol?
Fünf Stufen: low, medium, high, xhigh und max. Der Standard ist medium. Laut OpenAIs Modellseite zu GPT-6.1 Sol werden „die Reasoning-Stufen none und minimal nicht unterstützt“, anders als bei GPT-6 Sol lässt sich das Reasoning also nicht abschalten. Ohne none haben auch Sampling-Einstellungen wie temperature und top_p keine Wirkung.
Den Aufwand legen Sie pro Anfrage fest. In der Responses API ist es reasoning.effort:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
response = client.responses.create(
model="gpt-6.1-sol",
input="Find the race condition in this handler and suggest a fix: ...",
reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)In Chat Completions heißt das Feld reasoning_effort. Reasoning-Token werden in output_tokens gezählt, als Ausgabe abgerechnet und teilen sich das Budget von max_output_tokens mit der Antwort.
Wie schneiden die fünf Stufen in der Praxis ab?
Der Test sandte am 5. Oktober 2026 drei Prompts mit bekannten Antworten über SeedRouter an GPT-6.1 Sol, einmal pro Aufwandsstufe, alle fünf Stufen gleichzeitig. Die Zeiten sind Sekunden von der Anfrage bis zur vollständigen Antwort. Die Kosten beruhen auf OpenAIs Listenpreisen von $2 Eingabe und $10 Ausgabe pro Million Token, geprüft am 5. Oktober 2026.
Zählaufgabe — wie viele ganze Zahlen von 1 bis 1000 sind durch 3 oder 5 teilbar, aber nicht durch 7 (Antwort: 401).
| Aufwand | Sekunden | Reasoning-Token | Ausgabe-Token | Kosten | Richtig |
|---|---|---|---|---|---|
low | 14,0 | 51 | 225 | $0,0023 | Ja |
medium | 13,4 | 46 | 187 | $0,0020 | Ja |
high | 14,6 | 134 | 272 | $0,0028 | Ja |
xhigh | 16,2 | 303 | 362 | $0,0037 | Ja |
max | 20,4 | 516 | 574 | $0,0058 | Ja |
Schwierigere Zählaufgabe — wie viele ganze Zahlen von 1 bis 99.999 sind Vielfache von 7 und enthalten keine Ziffer 7 (Antwort: 8.434).
| Aufwand | Sekunden | Reasoning-Token | Ausgabe-Token | Kosten | Richtig |
|---|---|---|---|---|---|
low | 17,5 | 473 | 711 | $0,0072 | Ja |
medium | 27,6 | 1.031 | 1.273 | $0,0128 | Ja |
high | 28,3 | 1.034 | 1.255 | $0,0126 | Ja |
xhigh | 31,2 | 1.552 | 1.763 | $0,0177 | Ja |
max | 42,6 | 2.070 | 2.259 | $0,0227 | Ja |
Code-Review — finde die Fehler in einer vierzeiligen Python-Funktion median, die ihre Eingabe direkt sortiert und Listen gerader Länge falsch behandelt.
| Aufwand | Sekunden | Reasoning-Token | Ausgabe-Token | Kosten | Beide Fehler gefunden |
|---|---|---|---|---|---|
low | 14,9 | 76 | 221 | $0,0023 | Ja, mit korrigierter Version |
medium | 15,4 | 91 | 194 | $0,0020 | Ja |
high | 19,5 | 296 | 396 | $0,0040 | Ja |
xhigh | 19,5 | 516 | 606 | $0,0061 | Ja |
max | 28,4 | 1.034 | 1.114 | $0,0112 | Ja |
Das sind Einzelläufe mit kurzen Aufgaben, verstehen Sie sie also als Größenordnung, nicht als Benchmark. Die Zahl der Reasoning-Token schwankt zwischen Läufen, und erst bei schwierigeren Aufgaben macht sich ein höherer Aufwand bezahlt.
Warum ist GPT-6.1 Sol langsam?
Den Großteil der Wartezeit macht das Reasoning aus, und das Reasoning kommt zuerst. Ein zweiter Test streamte dieselbe Erklärung mit 300 Wörtern bei drei Aufwandsstufen und maß, wann der erste sichtbare Text ankam:
| Aufwand | Erster Text nach | Gesamtzeit | Reasoning-Token | Antworttempo |
|---|---|---|---|---|
low | 3,0 s | 20,5 s | 56 | 25 Token/s |
medium | 13,6 s | 24,7 s | 824 | 40 Token/s |
max | 30,6 s | 43,5 s | 2.517 | 34 Token/s |
Sobald die Antwort beginnt, streamt sie auf jeder Stufe in ähnlichem Tempo. Was sich ändert, ist die stille Phase davor: Bei max verbrachte das Modell eine halbe Minute mit Reasoning, bevor es etwas schrieb. Wenn Ihre Nutzer auf einen Ladekreis schauen, fühlt sich low mit Streaming am schnellsten an.
OpenAI hat in seinem Launch-Beitrag außerdem GPT-6.1 Sol Ultrafast angekündigt, mit „bis zu 8-mal schnellerer Token-Generierung im Vergleich zur Standardgeschwindigkeit in Codex“.
Können xhigh oder max schlechter sein als medium?
Bei einer bestimmten Aufgabe ja: Ein höherer Aufwand garantiert keine bessere Antwort. In den Läufen oben war max bei der Richtigkeit nie besser als low, es kostete nur mehr. OpenAIs eigene Ergebnisse weisen für Routinearbeit in dieselbe Richtung: GPT-6.1 Sol übertraf den besten DeepSWE-Wert von GPT-6 Sol „bei geringerem Reasoning-Aufwand“, und sein größter Zugewinn bei der Faktentreue gegenüber GPT-6 Sol kam bei Aufwand low.
Wo sich höherer Aufwand in OpenAIs Zahlen auszahlt, ist lange, schwierige Arbeit: Seine Ergebnisse für GPT-6.1 Sol in OSWorld 2.0 und Terminal-Bench Science sind bei maximalem Aufwand angegeben. Die praktische Regel lautet, an den eigenen Aufgaben zu messen. Führen Sie eine Stichprobe mit medium und mit einer Stufe höher aus, und behalten Sie die höhere Stufe nur dort, wo sie Fehler behebt.
Welchen Aufwand sollten Sie verwenden?
low— Chat-Antworten, Klassifizierung, Extraktion, einfache Code-Änderungen, alles, worauf ein Nutzer wartet.medium— der Standard für Coding-Hilfe, Reviews und die meisten Agenten-Schritte.high— Änderungen über mehrere Dateien und Debugging, das mitmediumscheitert.xhigh— lange Refactorings und Planung über viele Schritte.max— die schwierigsten Probleme, bei denen eine falsche Antwort mehr kostet als die zusätzlichen Token.
Für einen ganzen Agenten mischen Sie die Stufen: Planen Sie mit höherem Aufwand und führen Sie routinemäßige Tool-Schritte mit low oder medium aus. Die Preise für jede Stufe stehen auf der Seite zu GPT-6.1 Sol, und der Preisleitfaden zu GPT-6.1 Sol erklärt, wie Reasoning-Token auf der Rechnung erscheinen.
Häufig gestellte Fragen
Was ist der Standard-Reasoning-Aufwand von GPT-6.1 Sol?
medium. Wenn Sie das Feld weglassen, führt GPT-6.1 Sol Reasoning mit medium durch.
Soll ich bei GPT-6.1 Sol low oder medium nehmen?
Nutzen Sie medium als Standard und low, wo Geschwindigkeit wichtiger ist als Tiefe. Im Test oben beantwortete low jede Frage richtig und zeigte seinen ersten Text nach etwa drei Sekunden, gegenüber etwa vierzehn bei medium.
Warum ist GPT-6.1 Sol so langsam?
Es führt Reasoning durch, bevor es antwortet, und das Reasoning wird nicht als Text gestreamt. Ab medium macht diese stille Phase den Großteil der Wartezeit aus. Senken Sie den Aufwand oder streamen Sie die Antwort, um früher Text anzuzeigen.
Ist xhigh bei GPT-6.1 Sol besser als high?
Nur bei Aufgaben, die es brauchen. Bei kurzen Aufgaben lieferten beide Stufen dieselben Antworten, und xhigh verbrauchte mehr Token. Testen Sie beide an Ihrer eigenen Arbeit, bevor Sie für xhigh zahlen.
Kann ich das Reasoning bei GPT-6.1 Sol abschalten?
Nein. GPT-6.1 Sol unterstützt weder none noch minimal. Wenn Sie Antworten ohne Reasoning brauchen, unterstützt GPT-6 Sol weiterhin none. Siehe den Vergleich GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol.



