Über den Autor

Ich heiße Johannes Eva und entwickle seit 27 Jahren Websites. Das KI-Schreibranking entstand aus einer Lücke: Keine bestehende Rangliste maß, was mich interessierte, nämlich die Schreibqualität von KI-Modellen auf Deutsch.

Öffentliche Benchmarks konzentrieren sich vor allem auf Code, Mathematik und logisches Denken. Der kleine Teil, der sich mit Schreiben beschäftigt, wird fast immer auf Englisch bewertet. Hier zählt nur die Qualität der erzeugten Texte. Die Aufgaben werden direkt auf Deutsch entwickelt, die Antworten blind verglichen.

Modelle, die auf dem eigenen Rechner laufen, haben einen besonderen Platz. Gemma 4, Qwen 3.6 und Mistral Medium 3.5 gehören zu den Familien, die mit 🏠 gekennzeichnet sind. Ich habe sie lokal in mehreren Quantisierungen ausgeführt.

Diese Website ist ein persönliches Projekt. Kein Modellentwickler bezahlt mich, und ich habe keinen Grund, ein Modell zu bevorzugen.

Framework Desktop für lokale Sprachmodelle des KI-Schreibrankings

Der Rechner für die lokalen Modelle

Die lokalen Modelle laufen auf einem Framework Desktop mit AMD Ryzen AI Max+ 395. Seine 128 GB gemeinsamer Speicher stehen Prozessor und Grafikeinheit zur Verfügung. So lassen sich größere Modelle laden, als es mit den meisten Grafikkarten für Privatanwender möglich wäre.

Rechner
Framework Desktop, AMD Ryzen AI Max 300 Serie, Revision A6
Prozessor
AMD Ryzen AI Max+ 395, 16 Kerne und 32 Threads, bis zu 5,19 GHz
Grafik
Integrierte AMD Radeon 8060S
Speicher
128 GB gemeinsamer Speicher für Prozessor und Grafikeinheit

Beobachtete lokale Generierungsgeschwindigkeit

Median der auf diesem Rechner erzeugten Tokens pro Sekunde über alle gültigen Benchmark-Antworten, einschließlich Reasoning-Tokens. Die Geschwindigkeit hängt von Kontextlänge und Software ab.

Beobachtete lokale Generierungsgeschwindigkeit
Modell Quantisierung Median Antworten
Qwen3.6 35B A3B Q4_K_M 71,2 tokens/s 379
Gemma 4 26B A4B QAT QAT-Q4_0 61,3 tokens/s 488
Qwen3.6 35B A3B Q8_0 50,1 tokens/s 425
Gemma 4 26B A4B Q8_0 40,4 tokens/s 382
Gemma 4 E2B Q4_K_M 39,7 tokens/s 189
Gemma 4 E4B Q8_0 35,9 tokens/s 542
Gemma 4 E2B Q6_K 33,8 tokens/s 108
Gemma 4 E2B Q8_0 29,5 tokens/s 152
Nemotron 3 Nano Omni Q4_K_M 25,1 tokens/s 960
Gemma 4 E4B Q4_K_M 22,9 tokens/s 111
Nemotron 3 Super Q4_K_M 21,8 tokens/s 226
Gemma 4 26B A4B Q6_K 21,4 tokens/s 116
Laguna S 2.1 UD Q4_K_M 21,4 tokens/s 371
Nemotron 3 Nano Omni Q8_0 21,1 tokens/s 72
Gemma 4 E4B Q6_K 18,9 tokens/s 108
Gemma 4 12B Q8_0 14,5 tokens/s 429
Gemma 4 12B QAT QAT-Q4_0 11,2 tokens/s 1048
Gemma 4 31B QAT QAT-Q4_0 10,6 tokens/s 499
Gemma 4 12B Q6_K 9,0 tokens/s 144
Qwen3.8 27B Q4_K_M 7,6 tokens/s 96
Qwen3.8 27B Q6_K 6,5 tokens/s 72
Gemma 4 31B Q8_0 6,2 tokens/s 299
Muse Glimmer 30B Kquant 17gb K-Quant 17GB 5,5 tokens/s 138
Muse Glimmer 30B Kquant Dynamic K-Quant Dynamic 4,8 tokens/s 138
Qwen3.8 27B Q8_0 3,8 tokens/s 75
Gemma 4 31B Q6_K 3,5 tokens/s 108
Mistral Medium 3.5 128B Q4_K_M 2,8 tokens/s 771

Vergleichbare veröffentlichte Benchmarks für Ryzen AI Max+ 395