Über den Autor
Ich heiße Johannes Eva und entwickle seit 27 Jahren Websites. Das KI-Schreibranking entstand aus einer Lücke: Keine bestehende Rangliste maß, was mich interessierte, nämlich die Schreibqualität von KI-Modellen auf Deutsch.
Öffentliche Benchmarks konzentrieren sich vor allem auf Code, Mathematik und logisches Denken. Der kleine Teil, der sich mit Schreiben beschäftigt, wird fast immer auf Englisch bewertet. Hier zählt nur die Qualität der erzeugten Texte. Die Aufgaben werden direkt auf Deutsch entwickelt, die Antworten blind verglichen.
Modelle, die auf dem eigenen Rechner laufen, haben einen besonderen Platz. Gemma 4, Qwen 3.6 und Mistral Medium 3.5 gehören zu den Familien, die mit 🏠 gekennzeichnet sind. Ich habe sie lokal in mehreren Quantisierungen ausgeführt.
Diese Website ist ein persönliches Projekt. Kein Modellentwickler bezahlt mich, und ich habe keinen Grund, ein Modell zu bevorzugen.
Der Rechner für die lokalen Modelle
Die lokalen Modelle laufen auf einem Framework Desktop mit AMD Ryzen AI Max+ 395. Seine 128 GB gemeinsamer Speicher stehen Prozessor und Grafikeinheit zur Verfügung. So lassen sich größere Modelle laden, als es mit den meisten Grafikkarten für Privatanwender möglich wäre.
- Rechner
- Framework Desktop, AMD Ryzen AI Max 300 Serie, Revision A6
- Prozessor
- AMD Ryzen AI Max+ 395, 16 Kerne und 32 Threads, bis zu 5,19 GHz
- Grafik
- Integrierte AMD Radeon 8060S
- Speicher
- 128 GB gemeinsamer Speicher für Prozessor und Grafikeinheit
Beobachtete lokale Generierungsgeschwindigkeit
Median der auf diesem Rechner erzeugten Tokens pro Sekunde über alle gültigen Benchmark-Antworten, einschließlich Reasoning-Tokens. Die Geschwindigkeit hängt von Kontextlänge und Software ab.
| Modell | Quantisierung | Median | Antworten |
|---|---|---|---|
| Qwen3.6 35B A3B | Q4_K_M | 71,2 tokens/s | 379 |
| Gemma 4 26B A4B QAT | QAT-Q4_0 | 61,3 tokens/s | 488 |
| Qwen3.6 35B A3B | Q8_0 | 50,1 tokens/s | 425 |
| Gemma 4 26B A4B | Q8_0 | 40,4 tokens/s | 382 |
| Gemma 4 E2B | Q4_K_M | 39,7 tokens/s | 189 |
| Gemma 4 E4B | Q8_0 | 35,9 tokens/s | 542 |
| Gemma 4 E2B | Q6_K | 33,8 tokens/s | 108 |
| Gemma 4 E2B | Q8_0 | 29,5 tokens/s | 152 |
| Nemotron 3 Nano Omni | Q4_K_M | 25,1 tokens/s | 960 |
| Gemma 4 E4B | Q4_K_M | 22,9 tokens/s | 111 |
| Nemotron 3 Super | Q4_K_M | 21,8 tokens/s | 226 |
| Gemma 4 26B A4B | Q6_K | 21,4 tokens/s | 116 |
| Laguna S 2.1 UD | Q4_K_M | 21,4 tokens/s | 371 |
| Nemotron 3 Nano Omni | Q8_0 | 21,1 tokens/s | 72 |
| Gemma 4 E4B | Q6_K | 18,9 tokens/s | 108 |
| Gemma 4 12B | Q8_0 | 14,5 tokens/s | 429 |
| Gemma 4 12B QAT | QAT-Q4_0 | 11,2 tokens/s | 1048 |
| Gemma 4 31B QAT | QAT-Q4_0 | 10,6 tokens/s | 499 |
| Gemma 4 12B | Q6_K | 9,0 tokens/s | 144 |
| Qwen3.8 27B | Q4_K_M | 7,6 tokens/s | 96 |
| Qwen3.8 27B | Q6_K | 6,5 tokens/s | 72 |
| Gemma 4 31B | Q8_0 | 6,2 tokens/s | 299 |
| Muse Glimmer 30B Kquant 17gb | K-Quant 17GB | 5,5 tokens/s | 138 |
| Muse Glimmer 30B Kquant Dynamic | K-Quant Dynamic | 4,8 tokens/s | 138 |
| Qwen3.8 27B | Q8_0 | 3,8 tokens/s | 75 |
| Gemma 4 31B | Q6_K | 3,5 tokens/s | 108 |
| Mistral Medium 3.5 128B | Q4_K_M | 2,8 tokens/s | 771 |
Vergleichbare veröffentlichte Benchmarks für Ryzen AI Max+ 395