Lokale KI: Welche lokalen Sprachmodelle schreiben am besten auf Deutsch?

Diese Seite zeigt, welche Modelle mit offenen Gewichten in unserem deutschen Korpus am besten abschneiden – bewertet an deutschen Texten, nicht an Wissensquiz oder Programmieraufgaben. Bewertet wird immer eine exakte Variante: Modellstand, Quantisierung und Denkmodus. Dazu erklären wir, was Quantisierung wirklich bewirkt und wie viel Speicher eine Variante realistisch braucht.

Rangliste lokaler KI-Modelle

Punktzahlen aus der deutschen Gesamtrangliste. Die Ränge werden vor den Anzeigefiltern über alle zulässigen lokalen Varianten hinweg neu vergeben; ausgeblendete Varianten können daher Lücken in der Rangfolge hinterlassen.

Zuletzt aktualisiert:

Rangliste lokaler Modelle nach Schreibqualität
RankModelAI judge scoreSpeicher-Richtwert
1 Gemma 4 31B Q8_0 💡 on* 🏠 70,8 ≈ 48 GB
2 Gemma 4 26B A4B Q8_0 💡 on* 🏠 70,2 ≈ 32 GB
4 Qwen3.8 27B Q8_0 💡 xhigh** 🏠 66,4 ≈ 48 GB
5 Muse Glimmer 30B K-Quant 17GB 💡 high 🏠 66,2 ≈ 24 GB
8 Gemma 4 31B QAT-Q4_0 💡 on* 🏠 64,0 ≈ 24 GB
10 Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠 60,9 ≈ 32 GB
11 Gemma 4 31B Q8_0 🏠 60,7 ≈ 48 GB
12 Gemma 4 12B Q8_0 🏠 60,1 ≈ 16 GB
13 Gemma 4 31B QAT-Q4_0 🏠 59,6 ≈ 24 GB
15 Mistral Medium 3.5 128B Q4_K_M 🏠 53,7 ≈ 80 GB
17 Gemma 4 12B Q8_0 💡 on* 🏠 51,3 ≈ 16 GB
18 Gemma 4 12B QAT-Q4_0 💡 on* 🏠 51,2 ≈ 12 GB
19 Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠 51,2 ≈ 24 GB
20 Gemma 4 12B QAT-Q4_0 🏠 50,7 ≈ 12 GB
21 Gemma 4 26B A4B Q8_0 🏠 50,4 ≈ 32 GB
23 Qwen3.6 35B A3B Q4_K_M 💡 on* 🏠 45,8 ≈ 32 GB
24 Qwen3.6 35B A3B Q8_0 💡 on* 🏠 45,6 ≈ 48 GB
25 Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠 44,3 ≈ 24 GB
26 Mistral Medium 3.5 💡 high 44,2
29 Nemotron 3 Super 120B A12B Q4_K_M 💡 full 🏠 32,3 ≈ 96 GB
30 Gemma 4 26B A4B QAT-Q4_0 🏠 27,8 ≈ 24 GB
31 Qwen3.8 27B Q8_0 🏠 24,2 ≈ 48 GB
33 Gemma 4 E4B Q8_0 💡 on* 🏠 22,4 ≈ 12 GB
37 Qwen3.8 27B Q4_K_M 🏠 17,0 ≈ 24 GB
38 Qwen3.6 35B A3B Q8_0 🏠 16,1 ≈ 48 GB
39 Gemma 4 E2B Q8_0 🏠 15,3 ≈ 8 GB
40 Gemma 4 E4B Q8_0 🏠 15,2 ≈ 12 GB
41 Gemma 4 E4B Q4_K_M 💡 on* 🏠 12,5 ≈ 12 GB
42 Qwen3.6 35B A3B Q4_K_M 🏠 12,0 ≈ 32 GB
43 Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 on* 🏠 11,9 ≈ 32 GB
44 Gemma 4 E4B Q4_K_M 🏠 10,8 ≈ 12 GB
45 Granite 4.2 30B Q4_K_M 💡 full 🏠 10,6 ≈ 24 GB
46 Gemma 4 E2B Q8_0 💡 on* 🏠 9,9 ≈ 8 GB
47 Gemma 4 E2B Q4_K_M 💡 on* 🏠 9,8 ≈ 8 GB
51 Granite 4.2 30B Q8_0 💡 full 🏠 6,9 ≈ 48 GB
52 Gemma 4 E2B Q4_K_M 🏠 5,0 ≈ 8 GB
53 Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠 4,5 ≈ 48 GB
54 Granite 4.2 8B Q4_K_M 💡 full 🏠 3,0 ≈ 8 GB
55 Laguna S 2.1 UD Q4_K_M 💡 on* 🏠 2,0 ≈ 80 GB
56 Granite 4.2 8B Q8_0 💡 full 🏠 1,6 ≈ 12 GB

Dieser Score verwendet die Skala der Gesamtrangliste und ist keine Prozentnote: Für die aktive Kategorieauswahl entspricht 50 einer geschätzten Chance von eins zu zwei, das durchschnittliche Modell für deutsche Texte zu schlagen.

56 lokale Varianten in der Rangliste53697 veröffentlichte KI-Urteile in der Gesamtrangliste

Direct duel results

Each cell shows the share of available points earned by the row model against the column model: a win is worth 100%, a tie 50%, and a loss 0%. This result matrix uses only the compatible evaluation protocols included in the main ranking.

Directional matrix of points earned in direct duels. Values above 50% favor the row model; values below 50% favor the column model.

💡 kennzeichnet ein Modell mit Reasoning, ↯ eines ohne Reasoning. 🏠 kennzeichnet ein Modell, das lokal auf dem Rechner des Autors dieser Website ausgeführt wurde. „on*“ bedeutet, dass Reasoning ein- oder ausgeschaltet ist (lokale Modelle ohne Zwischenstufen): Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf den standardmäßig aktivierten Modus zurück. Bei lokalen Modellen mit einstellbarem Reasoning (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super) ist das angezeigte Niveau (xhigh**, high, full) das Standardniveau des Modells: Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf das Standardverhalten zurück.

View as a data table
Points earned in direct duels by model pair
ModelGemma 4 31B Q8_0 💡 on* 🏠Gemma 4 26B A4B Q8_0 💡 on* 🏠Qwen3.8 27B Q8_0 💡 xhigh** 🏠Muse Glimmer 30B K-Quant 17GB 💡 high 🏠Gemma 4 31B QAT-Q4_0 💡 on* 🏠Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠Gemma 4 31B Q8_0 🏠Gemma 4 12B Q8_0 🏠Gemma 4 31B QAT-Q4_0 🏠Mistral Medium 3.5 128B Q4_K_M 🏠Gemma 4 12B Q8_0 💡 on* 🏠Gemma 4 12B QAT-Q4_0 💡 on* 🏠Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠Gemma 4 12B QAT-Q4_0 🏠Gemma 4 26B A4B Q8_0 🏠Qwen3.6 35B A3B Q4_K_M 💡 on* 🏠Qwen3.6 35B A3B Q8_0 💡 on* 🏠Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠Mistral Medium 3.5 💡 highNemotron 3 Super 120B A12B Q4_K_M 💡 full 🏠Gemma 4 26B A4B QAT-Q4_0 🏠Qwen3.8 27B Q8_0 🏠Gemma 4 E4B Q8_0 💡 on* 🏠Qwen3.8 27B Q4_K_M 🏠Qwen3.6 35B A3B Q8_0 🏠Gemma 4 E2B Q8_0 🏠Gemma 4 E4B Q8_0 🏠Gemma 4 E4B Q4_K_M 💡 on* 🏠Qwen3.6 35B A3B Q4_K_M 🏠Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 on* 🏠Gemma 4 E4B Q4_K_M 🏠Granite 4.2 30B Q4_K_M 💡 full 🏠Gemma 4 E2B Q8_0 💡 on* 🏠Gemma 4 E2B Q4_K_M 💡 on* 🏠Granite 4.2 30B Q8_0 💡 full 🏠Gemma 4 E2B Q4_K_M 🏠Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠Granite 4.2 8B Q4_K_M 💡 full 🏠Laguna S 2.1 UD Q4_K_M 💡 on* 🏠Granite 4.2 8B Q8_0 💡 full 🏠
Gemma 4 31B Q8_0 💡 on* 🏠54,3%68,2%54,8%67,3%47,6%75,0%75,0%67,5%58,3%76,0%74,1%82,7%72,7%63,6%70,4%72,0%79,2%66,7%95,0%95,5%100,0%97,5%95,5%95,0%100,0%95,0%90,9%100,0%100,0%100,0%100,0%100,0%100,0%100,0%100,0%100,0%100,0%100,0%100,0%
Gemma 4 26B A4B Q8_0 💡 on* 🏠45,7%59,1%40,0%47,9%55,0%75,0%57,5%62,5%54,2%90,0%76,1%67,3%77,3%66,7%65,4%72,5%70,8%79,2%100,0%95,5%91,7%100,0%95,5%87,5%100,0%100,0%100,0%100,0%95,0%100,0%91,7%100,0%100,0%100,0%100,0%100,0%100,0%100,0%100,0%
Qwen3.8 27B Q8_0 💡 xhigh** 🏠31,8%40,9%37,5%72,7%54,2%59,1%54,2%66,7%54,2%50,0%63,6%63,6%91,7%66,7%50,0%68,2%75,0%62,5%50,0%100,0%85,7%90,9%100,0%91,7%100,0%100,0%83,3%100,0%79,2%100,0%100,0%100,0%91,7%100,0%100,0%100,0%100,0%100,0%100,0%
Muse Glimmer 30B K-Quant 17GB 💡 high 🏠45,2%60,0%62,5%55,0%59,6%58,3%65,0%55,0%75,0%50,0%57,1%55,0%100,0%75,0%66,7%65,0%75,0%76,7%95,2%84,6%83,3%82,5%91,7%95,0%100,0%100,0%100,0%95,8%100,0%92,3%91,7%95,2%95,2%91,7%100,0%100,0%83,3%100,0%100,0%
Gemma 4 31B QAT-Q4_0 💡 on* 🏠32,7%52,1%27,3%45,0%40,0%50,0%63,2%45,0%62,5%65,2%78,8%49,2%59,1%63,6%73,3%60,4%72,7%80,8%87,5%90,9%100,0%92,1%81,8%94,7%100,0%100,0%100,0%100,0%100,0%100,0%91,7%95,0%100,0%100,0%100,0%100,0%100,0%100,0%100,0%
Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠52,4%45,0%45,8%40,4%60,0%58,3%45,0%47,5%62,5%65,0%59,5%47,5%70,8%41,7%65,0%65,0%58,3%58,3%80,0%66,7%66,7%82,5%75,0%90,0%83,3%85,0%91,7%91,7%90,5%92,3%79,2%90,5%85,7%83,3%100,0%100,0%91,7%100,0%100,0%
Gemma 4 31B Q8_0 🏠25,0%25,0%40,9%41,7%50,0%41,7%27,3%63,6%58,3%75,0%54,5%66,7%59,1%40,9%63,6%91,7%79,2%58,8%92,3%95,5%87,5%81,8%100,0%63,6%100,0%81,8%91,7%100,0%92,3%100,0%92,9%90,9%100,0%100,0%100,0%100,0%100,0%100,0%100,0%
Gemma 4 12B Q8_0 🏠25,0%42,5%45,8%35,0%36,8%55,0%72,7%50,0%32,5%77,1%65,0%52,5%63,6%59,1%65,0%52,6%58,3%72,7%72,5%90,9%91,7%86,8%90,9%96,4%100,0%89,5%100,0%100,0%100,0%100,0%100,0%95,0%95,0%100,0%100,0%100,0%100,0%100,0%100,0%
Gemma 4 31B QAT-Q4_0 🏠32,5%37,5%33,3%45,0%55,0%52,5%36,4%50,0%25,0%57,9%62,5%63,2%40,9%22,7%68,4%68,4%45,0%45,8%80,0%81,8%72,7%97,4%75,0%89,5%100,0%94,7%100,0%100,0%100,0%100,0%100,0%90,0%95,0%95,8%100,0%100,0%100,0%100,0%100,0%
Mistral Medium 3.5 128B Q4_K_M 🏠41,7%45,8%45,8%25,0%37,5%37,5%41,7%67,5%75,0%65,0%40,0%55,0%77,8%33,3%40,0%75,0%55,6%75,0%80,0%77,8%85,7%85,0%90,0%95,0%100,0%87,5%77,8%100,0%85,0%100,0%86,4%85,0%80,0%90,9%100,0%100,0%90,9%100,0%100,0%
Gemma 4 12B Q8_0 💡 on* 🏠24,0%10,0%50,0%50,0%34,8%35,0%25,0%22,9%42,1%35,0%56,0%41,1%36,4%36,4%56,5%34,8%50,0%59,1%75,0%86,4%81,8%78,9%80,0%68,4%100,0%94,7%100,0%100,0%100,0%100,0%100,0%95,0%100,0%100,0%100,0%100,0%100,0%100,0%100,0%
Gemma 4 12B QAT-Q4_0 💡 on* 🏠25,9%23,9%36,4%42,9%21,2%40,5%45,5%35,0%37,5%60,0%44,0%40,0%50,0%54,5%55,4%48,0%61,1%61,1%67,5%100,0%90,9%95,0%80,0%70,0%100,0%90,0%94,4%88,9%100,0%90,0%90,9%100,0%100,0%90,9%100,0%100,0%100,0%100,0%100,0%
Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠17,3%32,7%36,4%45,0%50,8%52,5%33,3%47,5%36,8%45,0%58,9%60,0%44,4%36,4%57,6%50,0%33,3%66,7%72,5%72,2%83,3%85,0%66,7%85,0%88,9%95,0%80,0%88,9%90,0%100,0%90,9%100,0%92,5%90,9%100,0%100,0%100,0%100,0%100,0%
Gemma 4 12B QAT-Q4_0 🏠27,3%22,7%8,3%0,0%40,9%29,2%40,9%36,4%59,1%22,2%63,6%50,0%55,6%40,9%66,7%66,7%66,7%40,0%70,0%90,0%75,0%85,0%80,0%80,0%100,0%100,0%100,0%100,0%100,0%100,0%90,9%100,0%100,0%100,0%100,0%100,0%100,0%100,0%100,0%
Gemma 4 26B A4B Q8_0 🏠36,4%33,3%33,3%25,0%36,4%58,3%59,1%40,9%77,3%66,7%63,6%45,5%63,6%59,1%54,5%77,3%41,7%66,7%50,0%68,2%81,8%72,7%100,0%81,8%90,9%90,9%83,3%100,0%75,0%81,8%85,7%100,0%90,9%92,9%100,0%91,7%100,0%100,0%100,0%
Qwen3.6 35B A3B Q4_K_M 💡 on* 🏠29,6%34,6%50,0%33,3%26,7%35,0%36,4%35,0%31,6%60,0%43,5%44,6%42,4%33,3%45,5%21,7%55,6%66,7%65,0%55,6%75,0%85,0%75,0%80,0%66,7%75,0%60,0%77,8%75,0%100,0%90,9%85,0%80,0%90,9%94,4%83,3%81,8%100,0%100,0%
Qwen3.6 35B A3B Q8_0 💡 on* 🏠28,0%27,5%31,8%35,0%39,6%35,0%8,3%47,4%31,6%25,0%65,2%52,0%50,0%33,3%22,7%78,3%44,4%55,6%60,0%66,7%72,7%84,2%70,0%70,8%80,0%84,2%83,3%88,9%90,0%88,9%90,9%95,0%95,0%90,9%100,0%100,0%81,8%100,0%100,0%
Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠20,8%29,2%25,0%25,0%27,3%41,7%20,8%41,7%55,0%44,4%50,0%38,9%66,7%33,3%58,3%44,4%55,6%44,4%50,0%50,0%58,3%55,6%60,0%80,0%66,7%85,0%90,0%70,0%55,6%72,2%76,9%100,0%90,0%84,6%90,0%88,9%84,6%100,0%100,0%
Mistral Medium 3.5 💡 high33,3%20,8%37,5%23,3%19,2%41,7%41,2%27,3%54,2%25,0%40,9%38,9%33,3%60,0%33,3%33,3%44,4%55,6%60,0%80,0%58,3%55,0%85,0%90,0%85,0%88,9%77,8%75,0%90,0%90,0%90,0%77,8%88,9%100,0%90,0%90,0%90,0%100,0%100,0%
Nemotron 3 Super 120B A12B Q4_K_M 💡 full 🏠5,0%0,0%50,0%4,8%12,5%20,0%7,7%27,5%20,0%20,0%25,0%32,5%27,5%30,0%50,0%35,0%40,0%50,0%40,0%77,8%62,5%65,0%66,7%75,0%88,9%90,0%77,8%95,0%80,0%80,0%90,9%75,0%80,0%90,9%100,0%100,0%90,9%95,0%100,0%
Gemma 4 26B A4B QAT-Q4_0 🏠4,5%4,5%0,0%15,4%9,1%33,3%4,5%9,1%18,2%22,2%13,6%0,0%27,8%10,0%31,8%44,4%33,3%50,0%20,0%22,2%58,3%44,4%70,0%66,7%70,0%75,0%90,0%55,6%60,0%80,0%72,7%66,7%88,9%90,9%80,0%100,0%90,9%90,0%100,0%
Qwen3.8 27B Q8_0 🏠0,0%8,3%14,3%16,7%0,0%33,3%12,5%8,3%27,3%14,3%18,2%9,1%16,7%25,0%18,2%25,0%27,3%41,7%41,7%37,5%41,7%50,0%54,5%58,3%50,0%45,5%75,0%62,5%75,0%83,3%66,7%81,8%81,8%66,7%91,7%100,0%91,7%91,7%91,7%
Gemma 4 E4B Q8_0 💡 on* 🏠2,5%0,0%9,1%17,5%7,9%17,5%18,2%13,2%2,6%15,0%21,1%5,0%15,0%15,0%27,3%15,0%15,8%44,4%45,0%35,0%55,6%50,0%50,0%36,8%70,0%50,0%88,9%44,4%72,5%66,7%90,9%65,0%85,0%95,5%80,0%100,0%100,0%90,0%100,0%
Qwen3.8 27B Q4_K_M 🏠4,5%4,5%0,0%8,3%18,2%25,0%0,0%9,1%25,0%10,0%20,0%20,0%33,3%20,0%0,0%25,0%30,0%40,0%15,0%33,3%30,0%45,5%50,0%50,0%50,0%55,6%55,6%60,0%50,0%77,8%54,5%66,7%66,7%63,6%88,9%75,0%81,8%88,9%85,0%
Qwen3.6 35B A3B Q8_0 🏠5,0%12,5%8,3%5,0%5,3%10,0%36,4%3,6%10,5%5,0%31,6%30,0%15,0%20,0%18,2%20,0%29,2%20,0%10,0%25,0%33,3%41,7%63,2%50,0%55,6%57,9%50,0%44,4%70,0%61,1%36,4%60,0%65,0%36,4%100,0%55,6%63,6%95,0%90,0%
Gemma 4 E2B Q8_0 🏠0,0%0,0%0,0%0,0%0,0%16,7%0,0%0,0%0,0%0,0%0,0%0,0%11,1%0,0%9,1%33,3%20,0%33,3%15,0%11,1%30,0%50,0%30,0%50,0%44,4%40,0%77,8%50,0%40,0%60,0%61,5%75,0%100,0%92,9%90,0%100,0%92,9%90,0%100,0%
Gemma 4 E4B Q8_0 🏠5,0%0,0%0,0%0,0%0,0%15,0%18,2%10,5%5,3%12,5%5,3%10,0%5,0%0,0%9,1%25,0%15,8%15,0%11,1%10,0%25,0%54,5%50,0%44,4%42,1%60,0%55,6%33,3%67,5%65,0%72,7%80,0%75,0%90,9%85,0%80,0%81,8%100,0%88,9%
Gemma 4 E4B Q4_K_M 💡 on* 🏠9,1%0,0%16,7%0,0%0,0%8,3%8,3%0,0%0,0%22,2%0,0%5,6%20,0%0,0%16,7%40,0%16,7%10,0%22,2%22,2%10,0%25,0%11,1%44,4%50,0%22,2%44,4%50,0%66,7%50,0%54,5%44,4%55,6%72,7%77,8%88,9%81,8%88,9%100,0%
Qwen3.6 35B A3B Q4_K_M 🏠0,0%0,0%0,0%4,2%0,0%8,3%0,0%0,0%0,0%0,0%0,0%11,1%11,1%0,0%0,0%22,2%11,1%30,0%25,0%5,0%44,4%37,5%55,6%40,0%55,6%50,0%66,7%50,0%60,0%60,0%27,3%77,8%66,7%54,5%100,0%70,0%81,8%90,0%90,0%
Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 on* 🏠0,0%5,0%20,8%0,0%0,0%9,5%7,7%0,0%0,0%15,0%0,0%0,0%10,0%0,0%25,0%25,0%10,0%44,4%10,0%20,0%40,0%25,0%27,5%50,0%30,0%60,0%32,5%33,3%40,0%60,0%81,8%55,0%57,5%72,7%80,0%100,0%90,9%70,0%100,0%
Gemma 4 E4B Q4_K_M 🏠0,0%0,0%0,0%7,7%0,0%7,7%0,0%0,0%0,0%0,0%0,0%10,0%0,0%0,0%18,2%0,0%11,1%27,8%10,0%20,0%20,0%16,7%33,3%22,2%38,9%40,0%35,0%50,0%40,0%40,0%63,6%77,8%55,6%81,8%80,0%95,0%91,7%90,0%88,9%
Granite 4.2 30B Q4_K_M 💡 full 🏠0,0%8,3%0,0%8,3%8,3%20,8%7,1%0,0%0,0%13,6%0,0%9,1%9,1%9,1%14,3%9,1%9,1%23,1%10,0%9,1%27,3%33,3%9,1%45,5%63,6%38,5%27,3%45,5%72,7%18,2%36,4%60,0%30,0%54,5%76,9%36,4%81,8%81,8%100,0%
Gemma 4 E2B Q8_0 💡 on* 🏠0,0%0,0%0,0%4,8%5,0%9,5%9,1%5,0%10,0%15,0%5,0%0,0%0,0%0,0%0,0%15,0%5,0%0,0%22,2%25,0%33,3%18,2%35,0%33,3%40,0%25,0%20,0%55,6%22,2%45,0%22,2%40,0%50,0%70,0%88,9%66,7%70,0%70,0%100,0%
Gemma 4 E2B Q4_K_M 💡 on* 🏠0,0%0,0%8,3%4,8%0,0%14,3%0,0%5,0%5,0%20,0%0,0%0,0%7,5%0,0%9,1%20,0%5,0%10,0%11,1%20,0%11,1%18,2%15,0%33,3%35,0%0,0%25,0%44,4%33,3%42,5%44,4%70,0%50,0%80,0%60,0%77,8%80,0%75,0%100,0%
Granite 4.2 30B Q8_0 💡 full 🏠0,0%0,0%0,0%8,3%0,0%16,7%0,0%0,0%4,2%9,1%0,0%9,1%9,1%0,0%7,1%9,1%9,1%15,4%0,0%9,1%9,1%33,3%4,5%36,4%63,6%7,1%9,1%27,3%45,5%27,3%18,2%45,5%30,0%20,0%60,0%36,4%81,8%100,0%75,0%
Gemma 4 E2B Q4_K_M 🏠0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%5,6%0,0%10,0%10,0%0,0%20,0%8,3%20,0%11,1%0,0%10,0%15,0%22,2%0,0%20,0%20,0%23,1%11,1%40,0%40,0%60,0%92,3%90,0%90,0%
Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%8,3%16,7%0,0%11,1%10,0%0,0%0,0%0,0%0,0%25,0%44,4%0,0%20,0%11,1%30,0%0,0%5,0%63,6%33,3%22,2%63,6%40,0%90,9%80,0%90,0%
Granite 4.2 8B Q4_K_M 💡 full 🏠0,0%0,0%0,0%16,7%0,0%8,3%0,0%0,0%0,0%9,1%0,0%0,0%0,0%0,0%0,0%18,2%18,2%15,4%10,0%9,1%9,1%8,3%0,0%18,2%36,4%7,1%18,2%18,2%18,2%9,1%8,3%18,2%30,0%20,0%18,2%7,7%9,1%54,5%10,0%
Laguna S 2.1 UD Q4_K_M 💡 on* 🏠0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%5,0%10,0%8,3%10,0%11,1%5,0%10,0%0,0%11,1%10,0%30,0%10,0%18,2%30,0%25,0%0,0%10,0%20,0%45,5%60,0%
Granite 4.2 8B Q8_0 💡 full 🏠0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%0,0%8,3%0,0%15,0%10,0%0,0%11,1%0,0%10,0%0,0%11,1%0,0%0,0%0,0%25,0%10,0%10,0%90,0%40,0%

Published duel coverage

Each cell shows how many published AI-judged duels across all published evaluation protocols compare the two models for this language and category. The models on both axes are candidates; this matrix does not show which judge produced each verdict.

Symmetric matrix of published duel counts. The diagonal is zero because a model is not compared with itself.

💡 kennzeichnet ein Modell mit Reasoning, ↯ eines ohne Reasoning. 🏠 kennzeichnet ein Modell, das lokal auf dem Rechner des Autors dieser Website ausgeführt wurde. „on*“ bedeutet, dass Reasoning ein- oder ausgeschaltet ist (lokale Modelle ohne Zwischenstufen): Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf den standardmäßig aktivierten Modus zurück. Bei lokalen Modellen mit einstellbarem Reasoning (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super) ist das angezeigte Niveau (xhigh**, high, full) das Standardniveau des Modells: Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf das Standardverhalten zurück.

View as a data table
Published duel counts by model pair
ModelGemma 4 31B Q8_0 💡 on* 🏠Gemma 4 26B A4B Q8_0 💡 on* 🏠Qwen3.8 27B Q8_0 💡 xhigh** 🏠Muse Glimmer 30B K-Quant 17GB 💡 high 🏠Gemma 4 31B QAT-Q4_0 💡 on* 🏠Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠Gemma 4 31B Q8_0 🏠Gemma 4 12B Q8_0 🏠Gemma 4 31B QAT-Q4_0 🏠Mistral Medium 3.5 128B Q4_K_M 🏠Gemma 4 12B Q8_0 💡 on* 🏠Gemma 4 12B QAT-Q4_0 💡 on* 🏠Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠Gemma 4 12B QAT-Q4_0 🏠Gemma 4 26B A4B Q8_0 🏠Qwen3.6 35B A3B Q4_K_M 💡 on* 🏠Qwen3.6 35B A3B Q8_0 💡 on* 🏠Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠Mistral Medium 3.5 💡 highNemotron 3 Super 120B A12B Q4_K_M 💡 full 🏠Gemma 4 26B A4B QAT-Q4_0 🏠Qwen3.8 27B Q8_0 🏠Gemma 4 E4B Q8_0 💡 on* 🏠Qwen3.8 27B Q4_K_M 🏠Qwen3.6 35B A3B Q8_0 🏠Gemma 4 E2B Q8_0 🏠Gemma 4 E4B Q8_0 🏠Gemma 4 E4B Q4_K_M 💡 on* 🏠Qwen3.6 35B A3B Q4_K_M 🏠Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 on* 🏠Gemma 4 E4B Q4_K_M 🏠Granite 4.2 30B Q4_K_M 💡 full 🏠Gemma 4 E2B Q8_0 💡 on* 🏠Gemma 4 E2B Q4_K_M 💡 on* 🏠Granite 4.2 30B Q8_0 💡 full 🏠Gemma 4 E2B Q4_K_M 🏠Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠Granite 4.2 8B Q4_K_M 💡 full 🏠Laguna S 2.1 UD Q4_K_M 💡 on* 🏠Granite 4.2 8B Q8_0 💡 full 🏠
Gemma 4 31B Q8_0 💡 on* 🏠0351121262112202024252926111127251212201112201120112011112011122020121112122012
Gemma 4 26B A4B Q8_0 💡 on* 🏠3501120242012202024202326111226201212201112201120112012112012122020121112122012
Qwen3.8 27B Q8_0 💡 xhigh** 🏠1111012111211121212111111121211111212121114111212121212111211151212151212161212
Muse Glimmer 30B K-Quant 17GB 💡 high 🏠2120120202612202020202120121221201215211312201220122012122113122121121212122113
Gemma 4 31B QAT-Q4_0 💡 on* 🏠2624112002012192020232660111160241126201112191119111912112011122020121112122012
Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠2120122620012202020202120121220201212201212201220122012122113122121121212122013
Gemma 4 31B Q8_0 🏠1212111212120111112121112111111121217131112111211111112111312141111151112151312
Gemma 4 12B Q8_0 🏠2020122019201101920242020111120191211201112191128111912112011122020121111122011
Gemma 4 31B QAT-Q4_0 🏠2020122020201119020192019111119192012201111191219111912112012122020121112122012
Mistral Medium 3.5 128B Q4_K_M 🏠2424122020201220200202020912202091020914201020920992091120201199112010
Gemma 4 12B Q8_0 💡 on* 🏠2520112023201224192002528111123231111201111191019111911112010122020121111122011
Gemma 4 12B QAT-Q4_0 💡 on* 🏠2923112126211120202025020911282599209112010201020992010112020119911209
Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠26261120602012201920282009116627992091220920920109209112020119911209
Gemma 4 12B QAT-Q4_0 🏠1111121211121111119119901199910101012101010101091010101199111010111010
Gemma 4 26B A4B Q8_0 🏠1112121211121111111211111111011111212121111111211111112111211141111141112151212
Qwen3.6 35B A3B Q4_K_M 💡 on* 🏠2726112160201120192023286691102399209122010209201092010112020119911209
Qwen3.6 35B A3B Q8_0 💡 on* 🏠2520112024201219192023252791123099209111910241019992091120201110911209
Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠121212121112121220911999129909101012910109101010991310101310913109
Mistral Medium 3.5 💡 high1212121526121711121011991012999010101210101010991010101099101010101010
Nemotron 3 Super 120B A12B Q4_K_M 💡 full 🏠20201221202013202020202020101220201010091220920920910201011202011109112010
Gemma 4 26B A4B QAT-Q4_0 🏠11111113111211111191199101199101090129109101010910101199111010111010
Qwen3.8 27B Q8_0 🏠1212141212121212111411111212111211121212120121112121112121212121111121212121212
Gemma 4 E4B Q8_0 💡 on* 🏠2020112019201119192019202010112019910209120101910209920911202011109112010
Qwen3.8 27B Q4_K_M 🏠111112121112121112101010910121010101091011100910991010911991191011910
Qwen3.6 35B A3B Q8_0 🏠202012201920112819201920201011202410102091219909191092091120201199112010
Gemma 4 E2B Q8_0 🏠11111212111211111191110910119109109101210109010910101013109141010141010
Gemma 4 E4B Q8_0 🏠20201220192011191920192020101120191092010112091910099201011202011101011209
Gemma 4 E4B Q4_K_M 💡 on* 🏠111212121212121212911910912109109910129910990109101199119911910
Qwen3.6 35B A3B Q4_K_M 🏠11111112111211111191199101199101010912910910910010101199111010111010
Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 on* 🏠2020122120211320202020202010122020910201012201020102091001011202011109112010
Gemma 4 E4B Q4_K_M 🏠111211131113121112910109101110991010101299910101010100119911101012109
Granite 4.2 30B Q4_K_M 💡 full 🏠1212151212121412121112111111141111131011111211111113111111111101010111311111110
Gemma 4 E2B Q8_0 💡 on* 🏠202012212021112020202020209112020109209112092010209920910020109910209
Gemma 4 E2B Q4_K_M 💡 on* 🏠202012212021112020202020209112020109209112092092099209102001010910209
Granite 4.2 30B Q8_0 💡 full 🏠1212151212121512121112111111141111131011111211111114111111111111101001511111110
Gemma 4 E2B Q4_K_M 🏠11111212111211111191199101191010101010121099101091010101391015010131010
Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠121212121212121112911991012999109101291091010910910119911100111010
Granite 4.2 8B Q4_K_M 💡 full 🏠1212161212121512121112111111151111131011111211111114111111111211101011131101110
Laguna S 2.1 UD Q4_K_M 💡 on* 🏠20201221202013202020202020101220201010201012209201020910201011202011101011010
Granite 4.2 8B Q8_0 💡 full 🏠1212121312131211121011991012999101010121010101091010109109910101010100

Welche lokale KI schreibt am besten?

Was ein LLM ist, und was „lokal“ daran ändert

LLM steht für Large Language Model, ein großes Sprachmodell. Vereinfacht gesagt ist das eine sehr umfangreiche Datei aus Zahlen – den sogenannten Gewichten – plus ein Programm, das diese Datei benutzt, um zu einem Text jeweils die nächste plausible Fortsetzung zu berechnen. Aus dieser Mechanik entstehen Antworten, Aufsätze, Übersetzungen, Dialoge.

Bei Cloud-Diensten liegt diese Datei auf fremden Servern. Bei lokalen LLMs laden Sie sie herunter und führen sie selbst aus. Wenn auch Laufzeit und Integrationen lokal bleiben, müssen Ihre Texte den Rechner nicht verlassen. Das Modell funktioniert ohne Internetverbindung, es ändert sich nicht über Nacht durch ein Update des Anbieters, und Sie behalten die Kontrolle über Systemprompt, Kontextlänge und Einstellungen. Für Manuskripte, Mandantenunterlagen, unveröffentlichte Recherchen oder personenbezogene Daten ist das oft der entscheidende Punkt.

Datenschutz ist allerdings ein Argument für lokale Ausführung, kein Argument für die Schreibqualität eines bestimmten Modells. Beides bewerten wir getrennt.

Offene Gewichte sind nicht dasselbe wie Open Source

Für dieses Ranking zählt ein technisches Kriterium: offene Gewichte (open-weight). Die Modelldatei ist herunterladbar und lokal ausführbar. Ob die Lizenz im Sinne der Open-Source-Definition frei ist, ob Trainingsdaten und Trainingscode offenliegen, ist eine andere – und für Unternehmen durchaus relevante – Frage. Viele populäre Modelle sind open-weight, aber nicht Open Source; manche Lizenzen schränken kommerzielle Nutzung ein. Prüfen Sie die Lizenz für Ihren Anwendungsfall selbst. Sie sagt nichts über die Qualität der deutschen Texte aus, und wir behandeln sie hier auch nicht als Qualitätsmerkmal.

Quantisierung: was sie ist, was sie bringt, was sie kostet

Die Gewichte eines Modells sind ursprünglich in relativ hoher Zahlenpräzision gespeichert, üblicherweise 16 Bit pro Wert. Quantisierung speichert dieselben Gewichte mit weniger Bit. Die Datei schrumpft, der Speicherbedarf sinkt – und weil Inferenz auf üblicher Hardware häufig durch die Speicherbandbreite begrenzt ist, nicht durch Rechenleistung, kann eine kleinere Variante zusätzlich schneller antworten.

Der Preis ist ein möglicher Qualitätsverlust. Wie groß er ausfällt, hängt vom Modell ab, vom Quantisierungsverfahren, von der Aufgabe, von der Sprache, von der Kontextlänge und von der Stufe. Es gibt keinen allgemeingültigen Prozentwert „erhaltener Qualität", und Aussagen dieser Form sollten Sie grundsätzlich misstrauisch machen.

Die Stufen, die in unserem Filter vorkommen:

  • Q8 – eine Acht-Bit-Variante. Wir behandeln sie als praktische Qualitätsreferenz für lokale Ausführung, weil sie in der Regel die geringsten Abweichungen zeigt. Ob sie im Einzelfall von einer BF16/FP16-Version unterscheidbar ist, ist eine empirische Frage und keine Selbstverständlichkeit.
  • Q4 QATQuantization-Aware Training. Das Modell wurde bereits im Hinblick auf Vier-Bit-Ausführung trainiert oder nachbearbeitet. Das ist ein eigener Checkpoint, keine nachträgliche Umwandlung, und deshalb im Ranking eine eigene Zeile.
  • Q4_K_M – eine nachträgliche Vier-Bit-Quantisierung im GGUF-Format mit gemischter Präzision für unterschiedliche Gewichtsgruppen. Das ist ausdrücklich kein QAT, auch wenn beide „Q4" im Namen tragen. Die beiden Wege zu vier Bit sind nicht austauschbar.
  • Q6 – ein Zwischenschritt, den wir aufnehmen, sobald bewertete Varianten vorliegen.

Die beiden K-Quant-Varianten von Muse Glimmer

Meta veröffentlicht Muse Glimmer 30B in zwei ungewöhnlichen GGUF-Dateien mit durchschnittlich ungefähr vier Bit pro Gewicht. K-Quant Dynamic bewahrt ausgewählte Tensoren in höherer Präzision und zielt auf 32 GB VRAM; K-Quant 17GB komprimiert stärker und zielt auf 24 GB. Es sind keine Q4_K_M-Dateien. Deshalb behalten wir die exakten Namen bei und bewerten beide als getrennte Varianten. Beide stehen im breiten Q4-Filter, der praktische Downloads der Vier-Bit-Klasse bündelt, ohne ein identisches Zahlenformat zu behaupten.

Meta nennt über fünfzehn verbreitete Benchmarks eine durchschnittliche Verschlechterung von 0,2 % beziehungsweise 1,0 %. Das sind Messungen des Herausgebers, keine AIWB-Schreibwerte und keine Garantie für deutsche, englische, französische oder spanische Prosa. Unser Ranking und der direkte Vergleich messen beide Dateien getrennt an nativ verfassten Schreibaufgaben.

Welche Hardware für welches Modell?

8 GB

Beste Schreibqualität

Gemma 4 E2B Q8_0 🏠

15,3 · lokaler Rang 39

Schnellere gemessene Alternative

Gemma 4 E2B Q4_K_M 💡 on* 🏠

39,7 tok/s · AIWB-Messung auf Strix Halo

16 GB

Beste Schreibqualität

Gemma 4 12B Q8_0 🏠

60,1 · lokaler Rang 12

Schnellere gemessene Alternative

Gemma 4 E2B Q4_K_M 💡 on* 🏠

39,7 tok/s · AIWB-Messung auf Strix Halo

32 GB

Beste Schreibqualität

Gemma 4 26B A4B Q8_0 💡 on* 🏠

70,2 · lokaler Rang 2

Schnellere gemessene Alternative

Qwen3.6 35B A3B Q4_K_M 💡 on* 🏠

71,2 tok/s · AIWB-Messung auf Strix Halo

Lade-Richtwerte, keine Garantien: Kontext, KV-Cache, Batch und Laufzeit verändern den Bedarf. AIWB-Geschwindigkeiten stammen von dem unter „Über“ beschriebenen Strix-Halo-System und sagen keine andere Plattform voraus.

Qualität gegen Geschwindigkeit

Beide Größen laufen auf dieser Seite parallel, aber getrennt. Das Ranking bewertet ausschließlich, wie gut die deutschen Texte sind. Wie schnell eine Variante antwortet und wie viel Speicher sie belegt, sind Hardwarefragen – wichtig für die Auswahl, aber kein Qualitätsmerkmal.

Für die Praxis heißt das: Wer redigiert, überarbeitet oder längere Passagen schreiben lässt, fährt meist besser mit der höherwertigen Variante und wartet ein paar Sekunden länger. Wer interaktiv arbeitet, viele kurze Anläufe braucht oder in einem Editor mitschreiben lässt, wird die schnellere Alternative bevorzugen. Beide Wege stehen in jedem Speichersegment nebeneinander.

Häufige Fragen

Welche lokale KI schreibt am besten auf Deutsch? Die aktuell bestplatzierte Variante steht oben in der Tabelle. Wir nennen hier bewusst keinen festen Namen, weil sich die Reihenfolge mit jeder neuen Auswertung ändern kann. Achten Sie darauf, nicht nur den Modellnamen, sondern auch Quantisierung und Denkmodus zu übernehmen.

Wie viel VRAM brauche ich mindestens? Der konkrete Bedarf hängt von Variante und Kontext ab. Der Reiter „Dedizierte GPU" zeigt für 8, 16 und 32 GB, ob eine bewertete Variante mit der angesetzten Reserve hineinpasst; fehlt eine belastbare Empfehlung, bleibt die Karte leer. Rechnen Sie zusätzlich Platz für den KV-Cache ein, wenn Sie mit langem Kontext arbeiten.

Ist Q4 schlechter als Q8? Sie kann schlechter sein, aber Richtung und Stärke hängen vom Modell, vom Verfahren und von der Aufgabe ab. Q4 QAT und nachträgliches Q4_K_M sind dabei nicht gleichzusetzen. Belastbare Aussagen machen wir nur dort, wo uns direkte Vergleiche desselben Checkpoints im selben Denkmodus vorliegen.

Warum stehen Modelle ab 256 Milliarden Parametern nicht im Ranking? Weil diese Seite auf persönliche Rechner und kompakte Workstations begrenzt bleibt; größere Systeme sind damit nicht grundsätzlich unmöglich. Die Grenze bezieht sich auf die Gesamtparameter, auch bei Mixture-of-Experts-Modellen – der Speicherbedarf richtet sich nach ihnen, nicht nach den aktiven Parametern.

Warum werden Varianten desselben Modells getrennt gelistet? Weil sie sich unterschiedlich verhalten. Eine Q8-Variante mit aktivem Denkmodus ist ein anderes System als eine Q4-Variante ohne. Ein Durchschnittswert über beide würde Ihnen genau die Information nehmen, die Sie zum Herunterladen brauchen.

Was bedeutet „Reasoning unbekannt"? Dass wir aus den vorliegenden technischen Belegen nicht sicher ableiten können, ob während der Generierung tatsächlich gedacht wurde. Eine entsprechende Anforderung in der Konfiguration genügt uns nicht als Nachweis, wenn die Laufzeitumgebung keine Reasoning-Token meldet.

Zählt es gegen ein Modell, wenn es auch gegen Cloud-Modelle antreten musste? Nein. Die Punktzahlen stammen aus dem gemeinsamen deutschen Ranking, damit alle Varianten auf derselben Skala und mit möglichst vielen Vergleichen bewertet werden. Für diese Seite wird nur gefiltert und neu nummeriert.

Sind offene Gewichte dasselbe wie Open Source? Nein. Offene Gewichte bedeuten, dass Sie das Modell herunterladen und lokal ausführen können. Ob die Lizenz frei ist und ob Trainingsdaten offenliegen, ist davon unabhängig – und sollte für kommerzielle Nutzung separat geprüft werden.