Ergebnisse der KI-Juroren

Jeder KI-Juror sieht zwei anonyme Antworten auf dieselbe deutschsprachige Schreibaufgabe. Er wählt den stärkeren Text oder ein Unentschieden, ohne die Namen der Modelle zu kennen.

Ein KI-Juror darf auch ein Paar bewerten, das eine Antwort seines eigenen Modells enthält; während des Urteils bleiben die Urheber beider Antworten verborgen.

Die Tabellen fassen alle validierten und veröffentlichten Duelle für jeden Juror zusammen: Siege, Niederlagen, Unentschieden und Vergleiche. So zählt der Text und nicht die Marke dahinter.

Die Ränge richten sich zuerst nach der Gesamtzahl der Siege, nicht nach Siegquote oder Gegnerstärke; bei unterschiedlicher Abdeckung sollten Siege, Niederlagen und Unentschieden zusammen mit der Zahl der Vergleiche gelesen werden.

Für die ausgewählten Schreibkategorien werden die Ränge vergeben, bevor Filter für Anbieter, Größe, Modellstatus, Generierungsmodus und Zugang Modelle ausblenden; deshalb kann die sichtbare Nummerierung Lücken enthalten.

KI-Urteile machen viele Modellvergleiche nach einem einheitlichen Verfahren möglich. Sie ersetzen menschliche Leser nicht: Die Stimmen des Publikums fließen getrennt in eine menschliche Rangliste ein und zeigen Übereinstimmungen und Unterschiede zwischen Menschen und Maschinen.

Zuletzt berücksichtigtes Urteil:

Claude Fable 5

1071 validierte Duellurteile

Ergebnisse von Claude Fable 5
Rang Modell Siege Niederlagen Unentschieden Vergleiche
1 Claude Fable 5 High 💡 802 61 34 897
2 Claude Opus 5 💡 28 10 7 45
4 MiniMax M3 💡 19 68 3 90
5 DeepSeek V4 Pro 💡 17 49 1 67
6 MiMo V2.5 Pro 💡 17 53 2 72
7 Qwen3.7 Plus 💡 16 54 0 70
10 Qwen3.6 35B A3B Q8_0 💡 🏠 10 22 1 33
11 Kimi K3 💡 9 27 9 45
12 Gemma 4 12B Q8_0 (ohne Reasoning) 🏠 8 10 0 18
13 Gemma 4 31B QAT-Q4_0 💡 🏠 8 24 2 34
15 DeepSeek V4 Flash 💡 8 59 1 68
16 Gemma 4 12B Q8_0 💡 🏠 6 24 1 31
17 Gemma 4 12B QAT-Q4_0 💡 🏠 5 24 0 29
19 GPT-5.6 Sol 💡 4 36 4 44
20 Qwen3.6 35B A3B Q8_0 (ohne Reasoning) 🏠 3 15 0 18
21 Gemma 4 31B Q8_0 💡 🏠 3 29 1 33
22 Gemma 4 26B A4B QAT-Q4_0 💡 🏠 3 32 0 35
24 Gemma 4 31B QAT-Q4_0 (ohne Reasoning) 🏠 1 7 0 8
25 Gemma 4 26B A4B Q8_0 💡 🏠 1 21 1 23
26 Qwen3.6 35B A3B Q4_K_M 💡 🏠 1 32 2 35
27 GPT-5.6 Luna 💡 1 43 1 45
28 Mistral Medium 3.5 128B Q4_K_M (ohne Reasoning) 🏠 0 9 0 9
29 GPT-5.6 Terra 💡 0 45 0 45
30 MiMo V2.5 💡 0 72 1 73

Claude Opus 4.8

779 validierte Duellurteile

Ergebnisse von Claude Opus 4.8
Rang Modell Siege Niederlagen Unentschieden Vergleiche
1 Gemma 4 26B A4B QAT-Q4_0 💡 🏠 69 87 4 160
2 Qwen3.6 35B A3B Q4_K_M 💡 🏠 62 70 1 133
3 MiniMax M3 💡 58 26 0 84
4 Gemma 4 31B QAT-Q4_0 💡 🏠 58 67 3 128
5 Gemma 4 31B Q8_0 💡 🏠 56 56 4 116
6 DeepSeek V4 Pro 💡 42 8 1 51
10 Qwen3.6 35B A3B Q8_0 💡 🏠 38 26 1 65
11 DeepSeek V4 Flash 💡 36 15 1 52
12 Qwen3.7 Plus 💡 34 15 1 50
13 Claude Fable 5 High 💡 32 1 0 33
14 Gemma 4 12B QAT-Q4_0 💡 🏠 31 64 3 98
15 MiMo V2.5 Pro 💡 28 19 0 47
16 Gemma 4 26B A4B Q8_0 💡 🏠 28 40 2 70
18 Gemma 4 12B Q8_0 💡 🏠 22 44 1 67
19 Gemma 4 12B Q8_0 (ohne Reasoning) 🏠 11 3 0 14
20 GPT-5.6 Sol 💡 6 3 0 9
21 Mistral Medium 3.5 128B Q4_K_M (ohne Reasoning) 🏠 4 6 0 10
23 Qwen3.6 35B A3B Q8_0 (ohne Reasoning) 🏠 2 12 0 14
24 Gemma 4 31B QAT-Q4_0 (ohne Reasoning) 🏠 1 2 0 3
25 MiMo V2.5 💡 0 47 0 47

Claude Opus 5

16790 validierte Duellurteile

Ergebnisse von Claude Opus 5
Rang Modell Siege Niederlagen Unentschieden Vergleiche
1 Claude Fable 5 High 💡 782 31 10 823
2 Claude Opus 5 💡 535 1 2 538
3 Kimi K3 💡 494 36 7 537
4 GPT-5.6 Sol 💡 453 68 19 540
5 Claude Sonnet 5 💡 426 94 18 538
7 MiniMax M3 💡 384 144 11 539
8 GPT-5.6 Luna 💡 378 132 27 537
9 GPT-5.6 Terra 💡 371 147 19 537
10 DeepSeek V4 Flash 💡 369 156 16 541
13 Muse Glimmer 30B K-Quant 17GB 💡 🏠 330 224 17 571
14 MiMo V2.5 Pro 💡 329 199 9 537
16 Gemma 4 31B Q8_0 💡 🏠 320 196 32 548
17 Qwen3.7 Plus 💡 314 207 16 537
18 Muse Glimmer 30B K-Quant Dynamic 💡 🏠 310 251 14 575
19 Gemma 4 26B A4B Q8_0 💡 🏠 300 233 24 557
20 Gemma 4 31B QAT-Q4_0 💡 🏠 297 246 21 564
21 Gemma 4 31B QAT-Q4_0 (ohne Reasoning) 🏠 294 263 26 583
22 DeepSeek V4 Pro 💡 287 237 18 542
23 Mistral Medium 3.5 128B Q4_K_M (ohne Reasoning) 🏠 276 250 12 538
24 Gemma 4 12B Q8_0 (ohne Reasoning) 🏠 267 253 25 545
25 Gemma 4 26B A4B QAT-Q4_0 💡 🏠 247 280 15 542
26 Gemma 4 12B Q8_0 💡 🏠 246 282 28 556
27 Qwen3.6 35B A3B Q4_K_M 💡 🏠 242 304 15 561
29 Gemma 4 12B QAT-Q4_0 💡 🏠 237 297 26 560
30 Qwen3.6 35B A3B Q8_0 💡 🏠 224 339 13 576
31 Inkling 💡 209 13 15 237
32 GLM 5.3 💡 199 16 23 238
33 Hy4 Preview 💡 192 29 24 245
34 Muse Spark 1.2 💡 186 23 29 238
35 Gemini 3.7 Flash 💡 185 10 46 241
36 Qwen3.8 Max 💡 173 37 28 238
37 MiMo V2.5 💡 173 359 5 537
39 Nemotron 3 Super 120B A12B Q4_K_M 💡 🏠 162 367 9 538
40 Qwen3.8 27B Q8_0 💡 🏠 161 70 28 259
41 Gemma 4 12B Q6_K (ohne Reasoning) 🏠 157 80 18 255
42 Gemma 4 31B Q6_K 💡 🏠 155 76 29 260
43 Qwen3.8 27B Q6_K 💡 🏠 154 80 24 258
44 Hy3 💡 150 75 14 239
45 Gemma 4 31B Q6_K (ohne Reasoning) 🏠 145 89 21 255
46 Aion 3.0 💡 144 56 38 238
47 Gemma 4 31B Q8_0 (ohne Reasoning) 🏠 143 106 13 262
48 Gemma 4 26B A4B Q8_0 (ohne Reasoning) 🏠 140 115 9 264
49 Qwen3.8 Flash 💡 136 97 11 244
50 Gemma 4 E4B Q8_0 💡 🏠 133 394 13 540
51 Gemma 4 12B QAT-Q4_0 (ohne Reasoning) 🏠 129 121 11 261
52 Gemma 4 26B A4B Q6_K 💡 🏠 128 124 7 259
53 GLM 5.3 Flash 💡 125 106 6 237
54 Gemma 4 26B A4B Q6_K (ohne Reasoning) 🏠 125 115 15 255
55 Qwen3.6 35B A3B Q8_0 (ohne Reasoning) 🏠 125 414 6 545
56 Gemma 4 12B Q6_K 💡 🏠 118 130 16 264
58 Mistral Medium 3.5 💡 112 111 15 238
59 Grok 4.6 💡 112 122 4 238
60 Gemma 4 E4B Q8_0 (ohne Reasoning) 🏠 112 418 6 536
61 Gemma 4 26B A4B QAT-Q4_0 (ohne Reasoning) 🏠 105 157 9 271
62 Qwen3.8 27B Q4_K_M 💡 🏠 104 137 15 256
63 Qwen3.8 27B Q8_0 (ohne Reasoning) 🏠 98 161 4 263
64 Seed 2.1 Turbo (ohne Reasoning) 90 145 3 238
65 Gemma 4 E4B Q6_K (ohne Reasoning) 🏠 71 186 4 261
66 Qwen3.8 27B Q4_K_M (ohne Reasoning) 🏠 70 190 2 262
67 Gemma 4 E2B Q6_K (ohne Reasoning) 🏠 69 188 4 261
68 Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 🏠 68 463 7 538
69 Gemma 4 E2B Q4_K_M 💡 🏠 66 470 1 537
70 Gemma 4 E2B Q8_0 (ohne Reasoning) 🏠 65 193 3 261
71 Gemma 4 E2B Q8_0 💡 🏠 64 472 1 537
72 Qwen3.8 27B Q6_K (ohne Reasoning) 🏠 59 201 2 262
73 Granite 4.2 30B Q4_K_M 💡 🏠 56 175 6 237
74 Qwen3.6 35B A3B Q4_K_M (ohne Reasoning) 🏠 56 208 2 266
75 Gemma 4 E4B Q4_K_M 💡 🏠 52 204 5 261
76 Gemma 4 E4B Q6_K 💡 🏠 49 213 2 264
77 Gemma 4 E4B Q4_K_M (ohne Reasoning) 🏠 48 213 1 262
78 Granite 4.2 30B Q6_K 💡 🏠 45 188 4 237
79 Gemma 4 E2B Q6_K 💡 🏠 42 221 1 264
80 Granite 4.2 30B Q8_0 💡 🏠 25 211 1 237
81 Nemotron 3 Nano Omni 30B A3B Q8_0 💡 🏠 25 230 1 256
82 Gemma 4 E2B Q4_K_M (ohne Reasoning) 🏠 24 238 1 263
84 Granite 4.2 8B Q8_0 💡 🏠 9 228 0 237
85 Granite 4.2 8B Q6_K 💡 🏠 5 229 3 237
86 Granite 4.2 8B Q4_K_M 💡 🏠 3 232 2 237

GPT-5.6 Sol

19999 validierte Duellurteile

Ergebnisse von GPT-5.6 Sol
Rang Modell Siege Niederlagen Unentschieden Vergleiche
1 Claude Fable 5 High 💡 1245 123 1 1369
2 GPT-5.6 Sol 💡 880 51 5 936
3 DeepSeek V4 Flash 💡 573 367 0 940
4 Claude Opus 5 💡 503 43 0 546
5 Kimi K3 💡 490 57 0 547
6 GPT-5.6 Terra 💡 427 119 0 546
7 GPT-5.6 Luna 💡 420 125 2 547
8 Claude Sonnet 5 💡 396 155 0 551
9 Gemma 4 26B A4B Q8_0 💡 🏠 386 217 3 606
10 Hy4 Preview 💡 377 117 2 496
11 Gemma 4 31B QAT-Q4_0 💡 🏠 370 255 0 625
12 Gemma 4 31B Q8_0 💡 🏠 366 245 3 614
13 MiniMax M3 💡 364 224 0 588
14 Qwen3.7 Plus 💡 362 260 1 623
15 DeepSeek V4 Pro 💡 345 379 0 724
16 Gemma 4 12B Q8_0 (ohne Reasoning) 🏠 340 292 0 632
18 Muse Glimmer 30B K-Quant 17GB 💡 🏠 329 204 0 533
19 MiMo V2.5 Pro 💡 307 317 0 624
20 Gemma 4 26B A4B QAT-Q4_0 💡 🏠 307 354 1 662
21 Muse Spark 1.2 💡 303 32 3 338
22 Mistral Medium 3.5 128B Q4_K_M (ohne Reasoning) 🏠 301 510 1 812
23 Gemma 4 31B QAT-Q4_0 (ohne Reasoning) 🏠 300 272 0 572
24 Muse Glimmer 30B K-Quant Dynamic 💡 🏠 295 235 0 530
25 Qwen3.8 Flash 💡 290 220 1 511
26 Gemma 4 12B QAT-Q4_0 💡 🏠 289 311 0 600
29 Gemini 3.7 Flash 💡 283 53 1 337
30 Inkling 💡 273 63 1 337
31 Qwen3.6 35B A3B Q4_K_M 💡 🏠 273 376 0 649
33 GLM 5.3 💡 265 66 2 333
34 Qwen3.8 Max 💡 264 69 1 334
35 Gemma 4 12B Q8_0 💡 🏠 263 335 0 598
36 Qwen3.6 35B A3B Q8_0 💡 🏠 248 316 0 564
37 Aion 3.0 💡 246 92 0 338
38 Hy3 💡 227 109 0 336
39 Nemotron 3 Super 120B A12B Q4_K_M 💡 🏠 227 323 0 550
40 GLM 5.3 Flash 💡 225 276 0 501
41 Gemma 4 31B Q6_K 💡 🏠 214 88 0 302
42 Qwen3.8 27B Q6_K 💡 🏠 205 95 2 302
43 Qwen3.8 27B Q8_0 💡 🏠 204 94 2 300
44 Gemma 4 12B Q6_K (ohne Reasoning) 🏠 198 108 2 308
46 Gemma 4 31B Q8_0 (ohne Reasoning) 🏠 187 100 0 287
47 Grok 4.6 💡 178 154 1 333
49 Gemma 4 31B Q6_K (ohne Reasoning) 🏠 171 131 2 304
50 Mistral Medium 3.5 💡 165 163 1 329
51 Gemma 4 26B A4B Q6_K (ohne Reasoning) 🏠 163 141 0 304
52 Gemma 4 12B QAT-Q4_0 (ohne Reasoning) 🏠 161 128 1 290
53 Gemma 4 26B A4B Q8_0 (ohne Reasoning) 🏠 158 140 0 298
54 Gemma 4 26B A4B Q6_K 💡 🏠 158 144 0 302
55 Gemma 4 12B Q6_K 💡 🏠 154 145 0 299
56 Qwen3.8 27B Q4_K_M 💡 🏠 149 153 0 302
57 MiMo V2.5 💡 148 476 0 624
58 Gemma 4 E4B Q8_0 💡 🏠 144 375 0 519
59 Seed 2.1 Turbo (ohne Reasoning) 132 206 0 338
60 Gemma 4 E4B Q8_0 (ohne Reasoning) 🏠 128 393 0 521
61 Qwen3.6 35B A3B Q8_0 (ohne Reasoning) 🏠 127 485 0 612
62 Gemma 4 E2B Q8_0 💡 🏠 121 412 0 533
63 Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 🏠 116 434 0 550
64 Gemma 4 E2B Q4_K_M 💡 🏠 115 417 0 532
65 Granite 4.2 30B Q4_K_M 💡 🏠 109 370 0 479
67 Gemma 4 26B A4B QAT-Q4_0 (ohne Reasoning) 🏠 94 189 0 283
68 Gemma 4 E2B Q6_K (ohne Reasoning) 🏠 94 209 0 303
69 Qwen3.8 27B Q6_K (ohne Reasoning) 🏠 91 207 0 298
70 Granite 4.2 30B Q8_0 💡 🏠 91 394 0 485
71 Gemma 4 E4B Q6_K (ohne Reasoning) 🏠 89 210 0 299
72 Gemma 4 E2B Q8_0 (ohne Reasoning) 🏠 89 215 0 304
73 Gemma 4 E4B Q4_K_M 💡 🏠 81 217 0 298
74 Qwen3.8 27B Q4_K_M (ohne Reasoning) 🏠 77 223 0 300
75 Qwen3.8 27B Q8_0 (ohne Reasoning) 🏠 75 226 0 301
76 Granite 4.2 8B Q4_K_M 💡 🏠 71 412 0 483
77 Gemma 4 E4B Q4_K_M (ohne Reasoning) 🏠 70 231 0 301
78 Qwen3.6 35B A3B Q4_K_M (ohne Reasoning) 🏠 67 219 0 286
79 Gemma 4 E4B Q6_K 💡 🏠 62 239 0 301
80 Granite 4.2 30B Q6_K 💡 🏠 61 255 0 316
81 Gemma 4 E2B Q6_K 💡 🏠 57 239 0 296
82 Granite 4.2 8B Q6_K 💡 🏠 56 431 0 487
83 Gemma 4 E2B Q4_K_M (ohne Reasoning) 🏠 48 246 0 294
84 Nemotron 3 Nano Omni 30B A3B Q8_0 💡 🏠 47 294 0 341
86 Granite 4.2 8B Q8_0 💡 🏠 21 295 0 316

Die KI hat abgestimmt. Jetzt bist du dran.

Ein KI-Juror liest Tausende Duelle ohne Kaffee- oder Mittagspause. Was dich zum Lachen bringt, berührt oder weiterlesen lässt, weiß er trotzdem nicht. Deine anonyme Stimme stärkt eine eigene menschliche Rangliste und zeigt, wo menschlicher Geschmack und Maschinenurteil auseinanderliegen.

Zwei Texte blind vergleichen