AI-Roundtable Leaderboard
Ranking-Lauf · 01.09.2026

Ranking-Lauf 01.09.2026

Claude Opus 4.7 führt mit 78/100 über alle Domänen. Steuerrecht: Kimi K3 (77) · Medizin: GPT-5.6 Sol (85) · Jura: Claude Opus 4.7 (82) · Wirtschaftsrecht: GPT-5 (79).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260901T060205-7d51d0
Gestartet
2026-09-01 06:02 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
9
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
119.85 USD
Judge-Übereinstimmung
69 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7019 / 297875–81-1591,47—
2GPT-5.6 Sol075 / 1837774–800660,28—
3Kimi K3 n=79/10021144 / 5277671–81—460,42—
4Claude Opus 4.8019 / 287572–78+1710,96—
5GPT-5021 / 357268–77-5660,69—
6Grok 4.5027 / 506359–66+5832,11—
7Gemini 3.1 Pro023 / 335450–580724,79—
8Mistral Large 208 / 145146–55+1524,12—
9GLM-4.6070 / 1454540–490640,52—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 4 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Kimi K3 (Score-Spitze) im Mittel in 1,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,34 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,34.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Kimi K37767–84—1,31,62,8100 %0,3466 %
2Claude Opus 4.77164–78-10,71,82,4100 %1,8779 %
3GPT-5.6 Sol6854–77-20,91,62,593 %0,3471 %
4Claude Opus 4.86559–7100,71,11,8100 %1,3066 %
5Grok 4.55851–64+90,80,31,073 %2,6763 %
6GPT-55439–70-111,31,22,5100 %0,9963 %
7Gemini 3.1 Pro4030–50-41,10,71,873 %7,7872 %
8Mistral Large 23021–41+61,71,22,8100 %5,7446 %
9GLM-4.62416–33+12,00,82,893 %0,8560 %

Medizin · 20 Items

Platz 1–5 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5.6 Sol (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,4 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 80 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 0,42 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,15.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.6 Sol8581–9000,40,40,780 %0,4275 %
2Claude Opus 4.78375–89-10,40,60,9100 %0,9078 %
3Kimi K38174–88—0,80,71,490 %0,4973 %
4Claude Opus 4.88075–8500,30,50,795 %0,6874 %
5GPT-57868–85-60,50,61,185 %0,7981 %
6Mistral Large 26963–76+30,40,71,195 %2,1968 %
7Grok 4.56659–73+20,30,10,340 %1,1869 %
8Gemini 3.1 Pro6255–69-10,30,20,455 %1,7173 %
9GLM-4.65649–63-40,10,30,465 %0,1567 %

Jura · 35 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 80 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,17 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,32.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78277–86+10,20,81,080 %1,1784 %
2Claude Opus 4.88075–85-10,20,50,777 %0,7884 %
3GPT-5.6 Sol7567–8100,50,71,186 %0,3275 %
4Kimi K37566–82—0,91,12,094 %0,3979 %
5GPT-57166–77-20,40,71,186 %0,6770 %
6Grok 4.56559–70+70,30,10,440 %2,0073 %
7Gemini 3.1 Pro6153–66+10,40,30,760 %3,8668 %
8GLM-4.64841–54+30,60,41,166 %0,4665 %
9Mistral Large 24537–5301,20,71,880 %6,0864 %

Wirtschaftsrecht · 30 Items

Platz 1–5 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 93 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,1 pro Antwort. Auf die Antwortlänge bezogen: 0,50 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,21.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57971–85-50,30,91,293 %0,5072 %
2GPT-5.6 Sol7974–84+10,60,81,497 %0,2171 %
3Claude Opus 4.77570–80-30,52,02,5100 %1,7770 %
4Kimi K37564–85—0,62,43,0100 %0,4572 %
5Claude Opus 4.86963–75+30,51,11,697 %1,0866 %
6Grok 4.56154–69+30,50,61,173 %2,2663 %
7Mistral Large 25852–63+10,61,52,0100 %3,4050 %
8Gemini 3.1 Pro4941–56+31,10,71,890 %5,8759 %
9GLM-4.64335–50-11,00,91,993 %0,6058 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).