Benchmark 04.09.2026: Neue OpenRouter-Modelle gegen die Gemini-Produktion
Auftrag (Dennis, 04.09.): Gemini 3.8 Flash und weitere neue Modelle (Meta Muse Spark 1.3 + Contributor, Qwen 3.8 Flash/27b, GLM 5.3 Flash, nachgereicht DeepSeek V4 Flash Vision exp) gegen die Silverscale-Produktion (Gemini 3.7 Flash für Freitext/Foto, 3.5 Flash-Lite für Portion) — Latenz, Qualität, Kosten. Baseline am selben Tag mitgelaufen.
Kurzfassung
Gemini bleibt — unverändert (3.7 Flash + 3.5 Flash-Lite). Kein Kandidat schlägt die Produktion auf allen drei Achsen zugleich; die interessanten Modelle scheitern jeweils an genau einer Achse:
| Modell | Freitext Ø-Fehler | Foto Ø-Fehler | Latenz (Median Freitext) | Urteil |
|---|---|---|---|---|
| Prod: Gemini 3.7 Flash | 7,0 % | 8,3 % | 2,3 s | Referenz |
| Gemini 3.8 Flash | 6,4 % | 7,2 % | 2,6 s | Gleichstand (n klein), Foto-Ausreißer 16 s, Portion 2,1 s statt 0,8 s → kein Grund zu wechseln |
| DeepSeek V4 Flash Vision (Reasoning aus) | 6,4 % (Median 3,2 %) | 29 % | 2,3 s | Freitext gleichwertig zu 1/9 des Preises, Foto unbrauchbar, „exp" |
| GLM 5.3 Flash | 5,4 % | 14,5 % (+12 % Bias) | 3,8 s, p90 12 s, max 24 s | Präzisester Freitext, aber Latenz-Schwanz = K.-o. |
| Meta Muse Spark 1.3 | 9,1 % | 9,8 % | 7,8 s | Reasoning Pflicht → langsam, 4× teurer als Gemini |
| Meta Muse Spark Contributor | 11,0 % | 8,6 % (+8 % Bias) | 8,2 s | Wie oben, billig, Daten dürfen trainiert werden |
| Qwen 3.8 Flash (Reasoning aus) | 10,2 % | 12,9 % | 2,5 s | Schlechter |
| Qwen 3.8 27b (Reasoning aus) | 19,2 % | 26,5 % | 5,4 s | Schlechter |
| Qwen (Reasoning low) | 11–23 % | 24–39 % | 19–32 s | K.-o. |
Kosten des Laufs: 0,75 $ für 748 Calls (Schätzung vorab 0,45 $ — Reasoning-Modelle schrieben 5× mehr Output-Tokens als angenommen; Meta allein 0,26 $).
1. Aufbau
- Fälle/Prompts verbatim wie Benchmark 30.08. (=
ai_jobs.py-Prompts): 12 Freitext- Schätzungen ×3, 8 Portionsschätzungen ×3, 4 echte Teller-Fotos mit Herstellerwahrheit ×2 = 68 Calls je Modell/Konfig. Ausschluss Pack-Pizza + Pfefferbeißer (schwache GT, wie 16.08.). Bewertung: Ø|Δ|% und MdAPE gegen GT (kcal), Bias, Band-Treffer (Portion), JSON- Fehler, Wall-Latenz (non-streaming, wie Prod), Tokens in/out/Reasoning, Kosten laut OpenRouterusage.cost. - Harness
app/data/ai-bench/bench_or.py(aufbench_claude.py/bench37.py), Auswertunganalyze_or.py, Rohdatenor-2026-09-04.jsonl(748 Zeilen, gitignored). - Reasoning-Konfig: Baseline exakt wie Prod (3.7 Flash
effort=low, Lite ohne). Neue Modellelow=effort=lowdurchgehend;off={"enabled": false}— nur wo der Endpoint es zulässt (Qwen, DeepSeek). Gemini 3.8, GLM 5.3, Meta: „Reasoning is mandatory for this endpoint" (HTTP 400). - Retries mit Backoff bei 429/5xx (Qwen Flash ist bei Alibaba upstream rate-limitiert; 1 Call blieb nach 6 Versuchen im 429).
2. Ergebnisse
Freitext-Schätzung (estimate, n=36, GT-Fälle 30)
| Konfig | Modell | Ø|Δ|% | MdAPE | Bias | JSON-Fehler | wall med | p90 | max | out-Tok | rz-Tok | $/Call |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Prod | gemini-3.7-flash | 7,0 | 5,2 | −0,6 | 0 | 2,3 | 3,5 | 6,7 | 191 | 53 | 0,0009 |
| low | gemini-3.8-flash | 6,4 | 6,1 | +1,5 | 0 | 2,6 | 3,5 | 3,8 | 131 | 0 | 0,0007 |
| low | glm-5.3-flash | 5,4 | 4,0 | −3,0 | 0 | 3,8 | 12,0 | 24,3 | 191 | 62 | 0,0001 |
| off | deepseek-v4-flash-vision-exp | 6,4 | 3,2 | −1,4 | 0 | 2,3 | 4,4 | 5,7 | 128 | 0 | 0,0001 |
| low | deepseek-v4-flash-vision-exp | 5,3 | 3,9 | −4,3 | 15 (max_tokens erreicht) | 41,6 | – | 140 | 2262 | 2165 | 0,0015 |
| low | muse-spark-1.3 | 9,1 | 5,7 | −8,1 | 0 | 7,8 | – | 12,2 | 775 | 641 | 0,0035 |
| low | muse-spark-1.3-contributor | 11,0 | 10,4 | −8,9 | 0 | 8,2 | – | 13,0 | 767 | 631 | 0,0002 |
| off | qwen3.8-flash | 10,2 | 8,9 | −0,7 | 0 | 2,5 | – | 7,6 | 133 | 0 | 0,0001 |
| low | qwen3.8-flash | 11,4 | 7,4 | −5,7 | 5+1 | 32,2 | – | 60,6 | 1783 | 1672 | 0,0008 |
| off | qwen3.8-27b | 19,2 | 15,0 | −12,3 | 0 | 5,4 | – | 8,6 | 132 | 0 | 0,0004 |
| low | qwen3.8-27b | 23,1 | 15,0 | −14,2 | 0 | 19,3 | – | 34,2 | 967 | 828 | 0,0024 |
Portion (n=24, GT-Fälle 21)
| Konfig | Modell | Band-Treffer | wall med | max | $/Call |
|---|---|---|---|---|---|
| Prod | gemini-3.5-flash-lite | 21/21 | 0,8 | 1,0 | 0,0002 |
| low | gemini-3.8-flash | 21/21 | 2,1 | 3,2 | 0,0004 |
| low | glm-5.3-flash | 18/21 | 1,4 | 11,8 | 0,0001 |
| off | deepseek-v4-flash-vision-exp | 19/21 | 1,5 | 3,4 | 0,0001 |
| off | qwen3.8-flash | 19/21 | 1,6 | 5,9 | 0,0001 |
| low | muse-spark-1.3-contributor | 21/21 | 7,8 | 33,0 | 0,0002 |
| low | muse-spark-1.3 | 18/21 | 8,2 | 17,8 | 0,0036 |
| off | qwen3.8-27b | 14/21 | 4,3 | 5,0 | 0,0002 |
| low | qwen/deepseek (Reasoning) | 12–18/21 | 11–28 | 16–92 | – |
Foto (n=8, 4 Teller)
| Konfig | Modell | Ø|Δ|% | MdAPE | Bias | wall med | max | in-Tok | $/Call |
|---|---|---|---|---|---|---|---|---|
| Prod | gemini-3.7-flash | 8,3 | 8,7 | +2,7 | 4,8 | 7,2 | 1339 | 0,0025 |
| low | gemini-3.8-flash | 7,2 | 7,2 | +0,2 | 5,5 | 16,0 | 1339 | 0,0020 |
| low | muse-spark-1.3-contributor | 8,6 | 8,4 | +8,3 | 7,9 | 9,0 | 4301 | 0,0003 |
| low | muse-spark-1.3 | 9,8 | 8,2 | +7,6 | 7,2 | 10,1 | 4301 | 0,0056 |
| off | qwen3.8-flash | 12,9 | 11,2 | +8,5 | 9,6 | 12,1 | 2762 | 0,0003 |
| low | glm-5.3-flash | 14,5 | 11,3 | +11,6 | 4,6 | 5,4 | 8236 | 0,0013 |
| low | qwen3.8-27b | 23,5 | 17,7 | +19,2 | 22,0 | 84,1 | 10651 | 0,0042 |
| off | qwen3.8-27b | 26,5 | 13,5 | +26,2 | 15,4 | 18,3 | 13358 | 0,0036 |
| off | deepseek-v4-flash-vision-exp | 29,3 | 30,2 | +28,4 | 4,9 | 6,1 | 622 | 0,0002 |
| low | deepseek-v4-flash-vision-exp | 36,4 | 28,4 | +36,4 | 37,6 | 50,3 | 702 | 0,0016 |
Je Teller (Ø kcal, GT in Klammern):
| Modell | Döner-Teller (628) | IMG_0999 (854) | IMG_1395 (587) | IMG_1413 (596) |
|---|---|---|---|---|
| gemini-3.7-flash (Prod) | 705 +12 % | 805 −6 % | 555 −5 % | 655 +10 % |
| gemini-3.8-flash | 655 +4 % | 780 −9 % | 560 −5 % | 655 +10 % |
| muse-spark-contributor | 700 +11 % | 935 +9 % | 610 +4 % | 645 +8 % |
| glm-5.3-flash | 715 +14 % | 915 +7 % | 585 −0 % | 750 +26 % |
| deepseek (off) | 785 +25 % | 988 +16 % | 815 +39 % | 800 +34 % |
Alle Nicht-Gemini-Modelle überschätzen Fotos systematisch (+8 … +39 %); nur die beiden Geminis liegen um die Null. Das war beim Claude-Benchmark 30.08. genauso (+11 … +25 %).
3. Befunde
- Gemini 3.8 Flash ≈ 3.7 Flash. Freitext 6,4 vs 7,0 %, Foto 7,2 vs 8,3 % — bei n=30/8 innerhalb des Rauschens (MdAPE Freitext sogar 6,1 vs 5,2 zugunsten 3.7). Gleicher Preis, gleiche Bild-Tokenisierung. Gegen den Wechsel: Foto-Latenz p90 16 s (3.7: 7,2 s), Portion 2,1 s statt 0,8 s der Lite. Kein Wechsel — ohne Nachweis einer Besserung bleibt Prod.
- DeepSeek V4 Flash Vision (Reasoning aus) ist der einzige echte Preis-Kandidat: Freitext
gleichwertig (MdAPE 3,2 % = bester Median im Feld), 2,3 s, 0,0001 $/Call (1/9 von Gemini).
Aber: Foto unbrauchbar (+28 %), Portion 19/21, Modell ist „exp". Ersparnis bei ~20
Freitext-Calls/Tag ≈ 0,50 $/Monat → Qualität sticht Preis, kein Wechsel.
Mit Reasoning (
low) frisst das Denken dasmax_tokens-Budget: 15/36 Antworten abgeschnitten (finish=length), 42 s Median. Für DeepSeek istenabled:falsePflicht. - GLM 5.3 Flash: präzisester Freitext (Ø 5,4 %), praktisch gratis — aber 13/36 Calls > 5 s, p90 12 s, max 24 s; Portion max 11,8 s. Latenz = K.-o. Foto +12 % Bias.
- Meta Muse Spark 1.3: Reasoning nicht abschaltbar → 7–8 s je Freitext, 9–11 % Fehler, Vollversion 4× teurer als Gemini. Contributor-Stufe (1/12 Preis) verlangt die konto-weite OpenRouter-Freigabe „Provider dürfen mit Eingaben trainieren" (bis dahin 404 „matching your data policy"); Dennis hat sie am 04.09. gesetzt. Foto 8,6 % ist Gemini-Niveau, aber +8 % Bias und 8 s Latenz. Raus. Hinweis: die Freigabe gilt konto-weit — die Prod-Geminis haben nur Google als Anbieter (trainiert nicht), bei einem Wechsel auf ein Multi-Provider- Modell ist der Schalter zu beachten.
- Qwen 3.8: mit Reasoning 19–32 s (K.-o.), ohne Reasoning schlechter als Prod (10–19 % Freitext, 13–27 % Foto). 27b tokenisiert Bilder mit 10–13k Tokens. Raus.
- Allgemein:
reasoning: {"effort":"low"}wird von Qwen/DeepSeek nicht als „wenig denken" verstanden (800–2200 Reasoning-Tokens); nur{"enabled": false}hilft. Gemini/GLM/ Meta lehnenenabled:falseab. Wer neue Modelle anschließt, muss die Reasoning-Semantik je Modell einzeln prüfen.
4. Urteil und Entscheidung
Meine Empfehlung war: Produktion unverändert lassen (3.8 ≈ 3.7 im Rauschen, Latenzschwanz
beim Foto schlechter). Dennis' Entscheidung (04.09.): Freitext + Foto auf Gemini 3.8 Flash
umstellen (OR_MODEL_SCHAETZUNG, effort=low bleibt), Portion bleibt Gemini 3.5 Flash-Lite.
Umgesetzt — und nach gezielter Foto-Nachmessung wieder zurückgenommen (siehe unten).
Foto-Nachmessung 3.7 vs 3.8 (je 24 Calls = 4 Teller × 6, 04.09.)
| Gemini 3.7 | Gemini 3.8 | |
|---|---|---|
| Ø-Fehler | 8,1 % | 9,7 % |
| Median-Fehler | 8,7 % | 8,5 % |
| Latenz p50 / p90 / max | 4,7 / 6,5 / 6,5 s | 5,4 / 7,4 / 10,8 s |
| Calls > 5 s | 10/24 | 15/24 |
Je Teller: 3.8 bei zwei Tellern minimal besser, bei zwei deutlich schlechter (+18 statt +10 %,
+13 statt +10 %) und breiter streuend. Zusammen mit dem Hauptlauf (je 32 Foto-Calls): 3.7 ≈ 8,2 %,
3.8 ≈ 9,1 %. Der 7,2 %-Vorteil aus dem 8er-Sample war Rauschen. Dennis (04.09.): zurück auf
3.7 — Foto ist die wichtigste KI-Funktion. Lehre: Foto-Vergleiche brauchen ≥ 24 Calls je Modell.
Rohdaten app/data/ai-bench/photo-latenz-3.7-vs-3.8-2026-09-04.json. Beobachtungsliste: DeepSeek V4 Flash Vision, sobald nicht mehr „exp" — als
Freitext-Only-Alternative; Gemini 3.8 Flash bei der nächsten Preis-/Deprecation-Änderung
nachmessen (dann mit größerem Foto-Set).
5. Grenzen
n=4 Teller / n=30 Freitext-Fälle — Unterschiede unter ~2 Prozentpunkten sind Rauschen. Latenzen aus dem VPS (Strato) an einem Nachmittag, 4 parallele Threads (Qwen Flash 2). Kein Streaming, daher kein TTFT (Prod streamt auch nicht).