Welche lokale KI schreibt am besten?
Was ein LLM ist, und was „lokal“ daran ändert
LLM steht für Large Language Model, ein großes Sprachmodell. Vereinfacht gesagt ist das eine sehr umfangreiche Datei aus Zahlen – den sogenannten Gewichten – plus ein Programm, das diese Datei benutzt, um zu einem Text jeweils die nächste plausible Fortsetzung zu berechnen. Aus dieser Mechanik entstehen Antworten, Aufsätze, Übersetzungen, Dialoge.
Bei Cloud-Diensten liegt diese Datei auf fremden Servern. Bei lokalen LLMs laden Sie sie herunter und führen sie selbst aus. Wenn auch Laufzeit und Integrationen lokal bleiben, müssen Ihre Texte den Rechner nicht verlassen. Das Modell funktioniert ohne Internetverbindung, es ändert sich nicht über Nacht durch ein Update des Anbieters, und Sie behalten die Kontrolle über Systemprompt, Kontextlänge und Einstellungen. Für Manuskripte, Mandantenunterlagen, unveröffentlichte Recherchen oder personenbezogene Daten ist das oft der entscheidende Punkt.
Datenschutz ist allerdings ein Argument für lokale Ausführung, kein Argument für die Schreibqualität eines bestimmten Modells. Beides bewerten wir getrennt.
Offene Gewichte sind nicht dasselbe wie Open Source
Für dieses Ranking zählt ein technisches Kriterium: offene Gewichte (open-weight). Die Modelldatei ist herunterladbar und lokal ausführbar. Ob die Lizenz im Sinne der Open-Source-Definition frei ist, ob Trainingsdaten und Trainingscode offenliegen, ist eine andere – und für Unternehmen durchaus relevante – Frage. Viele populäre Modelle sind open-weight, aber nicht Open Source; manche Lizenzen schränken kommerzielle Nutzung ein. Prüfen Sie die Lizenz für Ihren Anwendungsfall selbst. Sie sagt nichts über die Qualität der deutschen Texte aus, und wir behandeln sie hier auch nicht als Qualitätsmerkmal.
Quantisierung: was sie ist, was sie bringt, was sie kostet
Die Gewichte eines Modells sind ursprünglich in relativ hoher Zahlenpräzision gespeichert, üblicherweise 16 Bit pro Wert. Quantisierung speichert dieselben Gewichte mit weniger Bit. Die Datei schrumpft, der Speicherbedarf sinkt – und weil Inferenz auf üblicher Hardware häufig durch die Speicherbandbreite begrenzt ist, nicht durch Rechenleistung, kann eine kleinere Variante zusätzlich schneller antworten.
Der Preis ist ein möglicher Qualitätsverlust. Wie groß er ausfällt, hängt vom Modell ab, vom Quantisierungsverfahren, von der Aufgabe, von der Sprache, von der Kontextlänge und von der Stufe. Es gibt keinen allgemeingültigen Prozentwert „erhaltener Qualität", und Aussagen dieser Form sollten Sie grundsätzlich misstrauisch machen.
Die Stufen, die in unserem Filter vorkommen:
- Q8 – eine Acht-Bit-Variante. Wir behandeln sie als praktische Qualitätsreferenz für lokale Ausführung, weil sie in der Regel die geringsten Abweichungen zeigt. Ob sie im Einzelfall von einer BF16/FP16-Version unterscheidbar ist, ist eine empirische Frage und keine Selbstverständlichkeit.
- Q4 QAT – Quantization-Aware Training. Das Modell wurde bereits im Hinblick auf Vier-Bit-Ausführung trainiert oder nachbearbeitet. Das ist ein eigener Checkpoint, keine nachträgliche Umwandlung, und deshalb im Ranking eine eigene Zeile.
- Q4_K_M – eine nachträgliche Vier-Bit-Quantisierung im GGUF-Format mit gemischter Präzision für unterschiedliche Gewichtsgruppen. Das ist ausdrücklich kein QAT, auch wenn beide „Q4" im Namen tragen. Die beiden Wege zu vier Bit sind nicht austauschbar.
- Q6 – ein Zwischenschritt, den wir aufnehmen, sobald bewertete Varianten vorliegen.
Die beiden K-Quant-Varianten von Muse Glimmer
Meta veröffentlicht Muse Glimmer 30B in zwei ungewöhnlichen GGUF-Dateien mit durchschnittlich ungefähr vier Bit pro Gewicht. K-Quant Dynamic bewahrt ausgewählte Tensoren in höherer Präzision und zielt auf 32 GB VRAM; K-Quant 17GB komprimiert stärker und zielt auf 24 GB. Es sind keine Q4_K_M-Dateien. Deshalb behalten wir die exakten Namen bei und bewerten beide als getrennte Varianten. Beide stehen im breiten Q4-Filter, der praktische Downloads der Vier-Bit-Klasse bündelt, ohne ein identisches Zahlenformat zu behaupten.
Meta nennt über fünfzehn verbreitete Benchmarks eine durchschnittliche Verschlechterung von 0,2 % beziehungsweise 1,0 %. Das sind Messungen des Herausgebers, keine AIWB-Schreibwerte und keine Garantie für deutsche, englische, französische oder spanische Prosa. Unser Ranking und der direkte Vergleich messen beide Dateien getrennt an nativ verfassten Schreibaufgaben.
Welche Hardware für welches Modell?
8 GB
Beste Schreibqualität
Gemma 4 E2B ↯ 🏠
15,3 · lokaler Rang 39
Schnellere gemessene Alternative
Gemma 4 E2B 💡 🏠
39,7 tok/s · AIWB-Messung auf Strix Halo
16 GB
Beste Schreibqualität
Gemma 4 12B ↯ 🏠
60,1 · lokaler Rang 12
Schnellere gemessene Alternative
Gemma 4 E2B 💡 🏠
39,7 tok/s · AIWB-Messung auf Strix Halo
32 GB
Beste Schreibqualität
Gemma 4 26B A4B 💡 🏠
70,2 · lokaler Rang 2
Schnellere gemessene Alternative
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · AIWB-Messung auf Strix Halo
32 GB
Beste Schreibqualität
Gemma 4 26B A4B 💡 🏠
70,2 · lokaler Rang 2
Schnellere gemessene Alternative
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · AIWB-Messung auf Strix Halo
64 GB
Beste Schreibqualität
Gemma 4 31B 💡 🏠
70,8 · lokaler Rang 1
Schnellere gemessene Alternative
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · AIWB-Messung auf Strix Halo
96 GB
Beste Schreibqualität
Gemma 4 31B 💡 🏠
70,8 · lokaler Rang 1
Schnellere gemessene Alternative
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · AIWB-Messung auf Strix Halo
128 GB
Beste Schreibqualität
Gemma 4 31B 💡 🏠
70,8 · lokaler Rang 1
Schnellere gemessene Alternative
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · AIWB-Messung auf Strix Halo
Lade-Richtwerte, keine Garantien: Kontext, KV-Cache, Batch und Laufzeit verändern den Bedarf. AIWB-Geschwindigkeiten stammen von dem unter „Über“ beschriebenen Strix-Halo-System und sagen keine andere Plattform voraus.
Qualität gegen Geschwindigkeit
Beide Größen laufen auf dieser Seite parallel, aber getrennt. Das Ranking bewertet ausschließlich, wie gut die deutschen Texte sind. Wie schnell eine Variante antwortet und wie viel Speicher sie belegt, sind Hardwarefragen – wichtig für die Auswahl, aber kein Qualitätsmerkmal.
Für die Praxis heißt das: Wer redigiert, überarbeitet oder längere Passagen schreiben lässt, fährt meist besser mit der höherwertigen Variante und wartet ein paar Sekunden länger. Wer interaktiv arbeitet, viele kurze Anläufe braucht oder in einem Editor mitschreiben lässt, wird die schnellere Alternative bevorzugen. Beide Wege stehen in jedem Speichersegment nebeneinander.
Häufige Fragen
Welche lokale KI schreibt am besten auf Deutsch? Die aktuell bestplatzierte Variante steht oben in der Tabelle. Wir nennen hier bewusst keinen festen Namen, weil sich die Reihenfolge mit jeder neuen Auswertung ändern kann. Achten Sie darauf, nicht nur den Modellnamen, sondern auch Quantisierung und Denkmodus zu übernehmen.
Wie viel VRAM brauche ich mindestens? Der konkrete Bedarf hängt von Variante und Kontext ab. Der Reiter „Dedizierte GPU" zeigt für 8, 16 und 32 GB, ob eine bewertete Variante mit der angesetzten Reserve hineinpasst; fehlt eine belastbare Empfehlung, bleibt die Karte leer. Rechnen Sie zusätzlich Platz für den KV-Cache ein, wenn Sie mit langem Kontext arbeiten.
Ist Q4 schlechter als Q8? Sie kann schlechter sein, aber Richtung und Stärke hängen vom Modell, vom Verfahren und von der Aufgabe ab. Q4 QAT und nachträgliches Q4_K_M sind dabei nicht gleichzusetzen. Belastbare Aussagen machen wir nur dort, wo uns direkte Vergleiche desselben Checkpoints im selben Denkmodus vorliegen.
Warum stehen Modelle ab 256 Milliarden Parametern nicht im Ranking? Weil diese Seite auf persönliche Rechner und kompakte Workstations begrenzt bleibt; größere Systeme sind damit nicht grundsätzlich unmöglich. Die Grenze bezieht sich auf die Gesamtparameter, auch bei Mixture-of-Experts-Modellen – der Speicherbedarf richtet sich nach ihnen, nicht nach den aktiven Parametern.
Warum werden Varianten desselben Modells getrennt gelistet? Weil sie sich unterschiedlich verhalten. Eine Q8-Variante mit aktivem Denkmodus ist ein anderes System als eine Q4-Variante ohne. Ein Durchschnittswert über beide würde Ihnen genau die Information nehmen, die Sie zum Herunterladen brauchen.
Was bedeutet „Reasoning unbekannt"? Dass wir aus den vorliegenden technischen Belegen nicht sicher ableiten können, ob während der Generierung tatsächlich gedacht wurde. Eine entsprechende Anforderung in der Konfiguration genügt uns nicht als Nachweis, wenn die Laufzeitumgebung keine Reasoning-Token meldet.
Zählt es gegen ein Modell, wenn es auch gegen Cloud-Modelle antreten musste? Nein. Die Punktzahlen stammen aus dem gemeinsamen deutschen Ranking, damit alle Varianten auf derselben Skala und mit möglichst vielen Vergleichen bewertet werden. Für diese Seite wird nur gefiltert und neu nummeriert.
Sind offene Gewichte dasselbe wie Open Source? Nein. Offene Gewichte bedeuten, dass Sie das Modell herunterladen und lokal ausführen können. Ob die Lizenz frei ist und ob Trainingsdaten offenliegen, ist davon unabhängig – und sollte für kommerzielle Nutzung separat geprüft werden.