Zuletzt aktualisiert:

Benchmark 04.09.2026: Neue OpenRouter-Modelle gegen die Gemini-Produktion

Auftrag (Dennis, 04.09.): Gemini 3.8 Flash und weitere neue Modelle (Meta Muse Spark 1.3 + Contributor, Qwen 3.8 Flash/27b, GLM 5.3 Flash, nachgereicht DeepSeek V4 Flash Vision exp) gegen die Silverscale-Produktion (Gemini 3.7 Flash für Freitext/Foto, 3.5 Flash-Lite für Portion) — Latenz, Qualität, Kosten. Baseline am selben Tag mitgelaufen.

Kurzfassung

Gemini bleibt — unverändert (3.7 Flash + 3.5 Flash-Lite). Kein Kandidat schlägt die Produktion auf allen drei Achsen zugleich; die interessanten Modelle scheitern jeweils an genau einer Achse:

Modell Freitext Ø-Fehler Foto Ø-Fehler Latenz (Median Freitext) Urteil
Prod: Gemini 3.7 Flash 7,0 % 8,3 % 2,3 s Referenz
Gemini 3.8 Flash 6,4 % 7,2 % 2,6 s Gleichstand (n klein), Foto-Ausreißer 16 s, Portion 2,1 s statt 0,8 s → kein Grund zu wechseln
DeepSeek V4 Flash Vision (Reasoning aus) 6,4 % (Median 3,2 %) 29 % 2,3 s Freitext gleichwertig zu 1/9 des Preises, Foto unbrauchbar, „exp"
GLM 5.3 Flash 5,4 % 14,5 % (+12 % Bias) 3,8 s, p90 12 s, max 24 s Präzisester Freitext, aber Latenz-Schwanz = K.-o.
Meta Muse Spark 1.3 9,1 % 9,8 % 7,8 s Reasoning Pflicht → langsam, 4× teurer als Gemini
Meta Muse Spark Contributor 11,0 % 8,6 % (+8 % Bias) 8,2 s Wie oben, billig, Daten dürfen trainiert werden
Qwen 3.8 Flash (Reasoning aus) 10,2 % 12,9 % 2,5 s Schlechter
Qwen 3.8 27b (Reasoning aus) 19,2 % 26,5 % 5,4 s Schlechter
Qwen (Reasoning low) 11–23 % 24–39 % 19–32 s K.-o.

Kosten des Laufs: 0,75 $ für 748 Calls (Schätzung vorab 0,45 $ — Reasoning-Modelle schrieben 5× mehr Output-Tokens als angenommen; Meta allein 0,26 $).

1. Aufbau

2. Ergebnisse

Freitext-Schätzung (estimate, n=36, GT-Fälle 30)

Konfig Modell Ø|Δ|% MdAPE Bias JSON-Fehler wall med p90 max out-Tok rz-Tok $/Call
Prod gemini-3.7-flash 7,0 5,2 −0,6 0 2,3 3,5 6,7 191 53 0,0009
low gemini-3.8-flash 6,4 6,1 +1,5 0 2,6 3,5 3,8 131 0 0,0007
low glm-5.3-flash 5,4 4,0 −3,0 0 3,8 12,0 24,3 191 62 0,0001
off deepseek-v4-flash-vision-exp 6,4 3,2 −1,4 0 2,3 4,4 5,7 128 0 0,0001
low deepseek-v4-flash-vision-exp 5,3 3,9 −4,3 15 (max_tokens erreicht) 41,6 – 140 2262 2165 0,0015
low muse-spark-1.3 9,1 5,7 −8,1 0 7,8 – 12,2 775 641 0,0035
low muse-spark-1.3-contributor 11,0 10,4 −8,9 0 8,2 – 13,0 767 631 0,0002
off qwen3.8-flash 10,2 8,9 −0,7 0 2,5 – 7,6 133 0 0,0001
low qwen3.8-flash 11,4 7,4 −5,7 5+1 32,2 – 60,6 1783 1672 0,0008
off qwen3.8-27b 19,2 15,0 −12,3 0 5,4 – 8,6 132 0 0,0004
low qwen3.8-27b 23,1 15,0 −14,2 0 19,3 – 34,2 967 828 0,0024

Portion (n=24, GT-Fälle 21)

Konfig Modell Band-Treffer wall med max $/Call
Prod gemini-3.5-flash-lite 21/21 0,8 1,0 0,0002
low gemini-3.8-flash 21/21 2,1 3,2 0,0004
low glm-5.3-flash 18/21 1,4 11,8 0,0001
off deepseek-v4-flash-vision-exp 19/21 1,5 3,4 0,0001
off qwen3.8-flash 19/21 1,6 5,9 0,0001
low muse-spark-1.3-contributor 21/21 7,8 33,0 0,0002
low muse-spark-1.3 18/21 8,2 17,8 0,0036
off qwen3.8-27b 14/21 4,3 5,0 0,0002
low qwen/deepseek (Reasoning) 12–18/21 11–28 16–92 –

Foto (n=8, 4 Teller)

Konfig Modell Ø|Δ|% MdAPE Bias wall med max in-Tok $/Call
Prod gemini-3.7-flash 8,3 8,7 +2,7 4,8 7,2 1339 0,0025
low gemini-3.8-flash 7,2 7,2 +0,2 5,5 16,0 1339 0,0020
low muse-spark-1.3-contributor 8,6 8,4 +8,3 7,9 9,0 4301 0,0003
low muse-spark-1.3 9,8 8,2 +7,6 7,2 10,1 4301 0,0056
off qwen3.8-flash 12,9 11,2 +8,5 9,6 12,1 2762 0,0003
low glm-5.3-flash 14,5 11,3 +11,6 4,6 5,4 8236 0,0013
low qwen3.8-27b 23,5 17,7 +19,2 22,0 84,1 10651 0,0042
off qwen3.8-27b 26,5 13,5 +26,2 15,4 18,3 13358 0,0036
off deepseek-v4-flash-vision-exp 29,3 30,2 +28,4 4,9 6,1 622 0,0002
low deepseek-v4-flash-vision-exp 36,4 28,4 +36,4 37,6 50,3 702 0,0016

Je Teller (Ø kcal, GT in Klammern):

Modell Döner-Teller (628) IMG_0999 (854) IMG_1395 (587) IMG_1413 (596)
gemini-3.7-flash (Prod) 705 +12 % 805 −6 % 555 −5 % 655 +10 %
gemini-3.8-flash 655 +4 % 780 −9 % 560 −5 % 655 +10 %
muse-spark-contributor 700 +11 % 935 +9 % 610 +4 % 645 +8 %
glm-5.3-flash 715 +14 % 915 +7 % 585 −0 % 750 +26 %
deepseek (off) 785 +25 % 988 +16 % 815 +39 % 800 +34 %

Alle Nicht-Gemini-Modelle überschätzen Fotos systematisch (+8 … +39 %); nur die beiden Geminis liegen um die Null. Das war beim Claude-Benchmark 30.08. genauso (+11 … +25 %).

3. Befunde

  1. Gemini 3.8 Flash ≈ 3.7 Flash. Freitext 6,4 vs 7,0 %, Foto 7,2 vs 8,3 % — bei n=30/8 innerhalb des Rauschens (MdAPE Freitext sogar 6,1 vs 5,2 zugunsten 3.7). Gleicher Preis, gleiche Bild-Tokenisierung. Gegen den Wechsel: Foto-Latenz p90 16 s (3.7: 7,2 s), Portion 2,1 s statt 0,8 s der Lite. Kein Wechsel — ohne Nachweis einer Besserung bleibt Prod.
  2. DeepSeek V4 Flash Vision (Reasoning aus) ist der einzige echte Preis-Kandidat: Freitext gleichwertig (MdAPE 3,2 % = bester Median im Feld), 2,3 s, 0,0001 $/Call (1/9 von Gemini). Aber: Foto unbrauchbar (+28 %), Portion 19/21, Modell ist „exp". Ersparnis bei ~20 Freitext-Calls/Tag ≈ 0,50 $/Monat → Qualität sticht Preis, kein Wechsel. Mit Reasoning (low) frisst das Denken das max_tokens-Budget: 15/36 Antworten abgeschnitten (finish=length), 42 s Median. Für DeepSeek ist enabled:false Pflicht.
  3. GLM 5.3 Flash: präzisester Freitext (Ø 5,4 %), praktisch gratis — aber 13/36 Calls > 5 s, p90 12 s, max 24 s; Portion max 11,8 s. Latenz = K.-o. Foto +12 % Bias.
  4. Meta Muse Spark 1.3: Reasoning nicht abschaltbar → 7–8 s je Freitext, 9–11 % Fehler, Vollversion 4× teurer als Gemini. Contributor-Stufe (1/12 Preis) verlangt die konto-weite OpenRouter-Freigabe „Provider dürfen mit Eingaben trainieren" (bis dahin 404 „matching your data policy"); Dennis hat sie am 04.09. gesetzt. Foto 8,6 % ist Gemini-Niveau, aber +8 % Bias und 8 s Latenz. Raus. Hinweis: die Freigabe gilt konto-weit — die Prod-Geminis haben nur Google als Anbieter (trainiert nicht), bei einem Wechsel auf ein Multi-Provider- Modell ist der Schalter zu beachten.
  5. Qwen 3.8: mit Reasoning 19–32 s (K.-o.), ohne Reasoning schlechter als Prod (10–19 % Freitext, 13–27 % Foto). 27b tokenisiert Bilder mit 10–13k Tokens. Raus.
  6. Allgemein: reasoning: {"effort":"low"} wird von Qwen/DeepSeek nicht als „wenig denken" verstanden (800–2200 Reasoning-Tokens); nur {"enabled": false} hilft. Gemini/GLM/ Meta lehnen enabled:false ab. Wer neue Modelle anschließt, muss die Reasoning-Semantik je Modell einzeln prüfen.

4. Urteil und Entscheidung

Meine Empfehlung war: Produktion unverändert lassen (3.8 ≈ 3.7 im Rauschen, Latenzschwanz beim Foto schlechter). Dennis' Entscheidung (04.09.): Freitext + Foto auf Gemini 3.8 Flash umstellen (OR_MODEL_SCHAETZUNG, effort=low bleibt), Portion bleibt Gemini 3.5 Flash-Lite. Umgesetzt — und nach gezielter Foto-Nachmessung wieder zurückgenommen (siehe unten).

Foto-Nachmessung 3.7 vs 3.8 (je 24 Calls = 4 Teller × 6, 04.09.)

Gemini 3.7 Gemini 3.8
Ø-Fehler 8,1 % 9,7 %
Median-Fehler 8,7 % 8,5 %
Latenz p50 / p90 / max 4,7 / 6,5 / 6,5 s 5,4 / 7,4 / 10,8 s
Calls > 5 s 10/24 15/24

Je Teller: 3.8 bei zwei Tellern minimal besser, bei zwei deutlich schlechter (+18 statt +10 %, +13 statt +10 %) und breiter streuend. Zusammen mit dem Hauptlauf (je 32 Foto-Calls): 3.7 ≈ 8,2 %, 3.8 ≈ 9,1 %. Der 7,2 %-Vorteil aus dem 8er-Sample war Rauschen. Dennis (04.09.): zurück auf 3.7 — Foto ist die wichtigste KI-Funktion. Lehre: Foto-Vergleiche brauchen ≥ 24 Calls je Modell. Rohdaten app/data/ai-bench/photo-latenz-3.7-vs-3.8-2026-09-04.json. Beobachtungsliste: DeepSeek V4 Flash Vision, sobald nicht mehr „exp" — als Freitext-Only-Alternative; Gemini 3.8 Flash bei der nächsten Preis-/Deprecation-Änderung nachmessen (dann mit größerem Foto-Set).

5. Grenzen

n=4 Teller / n=30 Freitext-Fälle — Unterschiede unter ~2 Prozentpunkten sind Rauschen. Latenzen aus dem VPS (Strato) an einem Nachmittag, 4 parallele Threads (Qwen Flash 2). Kein Streaming, daher kein TTFT (Prod streamt auch nicht).