Die Modelle, die am besten auf Deutsch schreiben

Das KI-Schreibranking misst, wie gut führende KI-Modelle auf Deutsch schreiben. Grundlage ist ein gemeinsamer Korpus deutschsprachiger Schreibaufgaben. Die Antworten auf dieselbe Aufgabe werden ohne Modellnamen verglichen; aus den Urteilen entsteht eine eigene Rangliste für Deutsch.

An der Spitze über alle Kategorien hinweg

Die 10 besten Modelle

Die zehn besten Modelle für deutsche Texte
#ModellScore
1Claude Opus 5 💡98,6
2Claude Fable 5 High 💡97,4
3Kimi K3 💡96,3
4GPT-5.6 Sol 💡95,8
5Muse Spark 1.2 💡93,4
6Claude Opus 4.8 💡92,3
7Inkling 💡91,7
8Gemini 3.7 Flash 💡91,5
9GLM 5.3 💡90,3
10Claude Sonnet 5 💡86,9

Dieser Score ist keine Prozentnote: 50 entspricht einer geschätzten Chance von eins zu zwei, das durchschnittliche Modell auf Deutsch zu schlagen.

Zuletzt aktualisiert:

Vollständige Rangliste

Die 10 besten lokalen Varianten

Der angegebene VRAM ist ein gerundeter Richtwert für den Grafikspeicher, der zum vollständigen Laden des Modells benötigt wird.

Die zehn besten lokal ausgeführten Varianten
#ModellScoreGeschätzter VRAM
1Gemma 4 31B Q6_K 💡 🏠75,8≈ 32 GB
2Qwen3.8 27B Q8_0 💡 🏠75,3≈ 48 GB
3Gemma 4 31B Q8_0 💡 🏠74,4≈ 48 GB
4Gemma 4 26B A4B Q8_0 💡 🏠73,8≈ 32 GB
5Qwen3.8 27B Q6_K 💡 🏠73,4≈ 32 GB
6Gemma 4 12B Q6_K ↯ 🏠71,6≈ 16 GB
7Muse Glimmer 30B K-Quant 17GB 💡 🏠70,2≈ 24 GB
8Gemma 4 31B QAT-Q4_0 💡 🏠69,0≈ 24 GB
9Gemma 4 31B Q8_0 ↯ 🏠66,1≈ 48 GB
10Gemma 4 31B QAT-Q4_0 ↯ 🏠65,7≈ 24 GB

Je nach Software kann ein Teil des Modells im Arbeitsspeicher verbleiben. Das senkt den VRAM-Bedarf, verlangsamt die Ausführung aber in der Regel.

86verglichene Modelle
38639veröffentlichte KI-Urteile

Die Rangliste bewertet ausschließlich die Schreibqualität. Die Aufgaben entstehen direkt in der geprüften Sprache, und die Modellnamen bleiben bis zum Urteil verborgen, damit ihr Ruf die Bewertung nicht beeinflusst. Diese Website ist ein persönliches Projekt. Kein Modellentwickler bezahlt mich, und ich habe keinen Grund, ein Modell zu bevorzugen.

Mehr erfahren

Muse Glimmer 30B im Schreibtest gegen lokale KI-Modelle

Muse Glimmer 30B läuft auf dem eigenen Rechner, doch seine beiden Quantisierungen schreiben nicht gleich. Der Hauptvergleich und neue vorläufige Duelle mit vier lokalen Modellen zeigen, wo die Stärken liegen und wie vorsichtig die Zahlen zu lesen sind.

Schreibt KI auf Deutsch besser mit oder ohne Reasoning?

Gepaarte Duelle derselben Modellvariante mit und ohne Reasoning: 35 KI-Urteile auf Deutsch, ein knappes Ergebnis, ein breites Intervall und zwei Modellfamilien, die in entgegengesetzte Richtungen zeigen.