AI-Roundtable Leaderboard
Ranking-Lauf · 21.06.2026

Ranking-Lauf 21.06.2026

GPT-5.5 Pro führt mit 80/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (74) · Medizin: GPT-5.5 Pro (88) · Jura: Claude Opus 4.7 (82) · Wirtschaftsrecht: GPT-5.5 Pro (82).

Status
offizieller Lauf (Feed, Archiv, Startseite)
Lauf
run-20260621T143914-12112d
Gestartet
2026-06-21 14:39 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
9
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
134.70 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1GPT-5.5 Pro n=97/1003227 / 15478077–83—750,10—
2Claude Opus 4.7019 / 287875–81-1601,48—
3Claude Opus 4.8021 / 317572–78+1740,87—
3GPT-5022 / 357571–790690,61—
4Gemini 3.1 Pro022 / 335753–60—783,68—
4Kimi K2.6 n=98/100271 / 1395752–61—460,27—
5Mistral Large 2010 / 695045–55-1504,35—
6Grok 4.305 / 74641–50-1735,44—
7GLM-4.6042 / 744540–49—650,51—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,9 pro Antwort. Auf die Antwortlänge bezogen: 1,89 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,13.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77467–80+30,51,82,3100 %1,8974 %
2Claude Opus 4.86762–73-20,21,01,2100 %0,8871 %
3GPT-5.5 Pro6752–80—1,01,01,992 %0,1371 %
4GPT-55639–71-71,31,02,393 %0,8573 %
5Gemini 3.1 Pro5447–61—0,60,40,980 %3,7371 %
6Kimi K2.63018–41—2,12,14,2100 %0,4257 %
7Mistral Large 22719–37-12,11,53,593 %7,6552 %
8GLM-4.61910–28—2,10,82,7100 %0,8958 %
9Grok 4.31810–28-92,10,72,8100 %12,7468 %

Medizin · 20 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,4 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 85 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,18 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.5 Pro8883–92—0,50,40,885 %0,1881 %
2GPT-58377–89+20,50,61,090 %0,7272 %
3Claude Opus 4.78173–88-30,70,81,4100 %1,3778 %
4Claude Opus 4.88175–86+20,30,50,790 %0,6676 %
5Kimi K2.67364–80—0,50,71,1100 %0,2274 %
6Mistral Large 26862–75+10,50,51,090 %1,9162 %
7Gemini 3.1 Pro5953–66—0,30,20,460 %1,9072 %
8GLM-4.65751–63—0,20,50,675 %0,2567 %
9Grok 4.35548–6100,40,20,575 %2,3976 %

Jura · 35 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 71 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 0,98 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,07.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78277–8600,20,60,871 %0,9882 %
2GPT-5.5 Pro8075–84—0,30,50,777 %0,0776 %
3Claude Opus 4.87973–8500,20,40,674 %0,6879 %
4GPT-57872–83+50,20,60,880 %0,4674 %
5Gemini 3.1 Pro6154–68—0,40,20,649 %3,1373 %
6Kimi K2.65649–63—0,80,81,680 %0,2063 %
7Grok 4.35044–56+20,40,20,646 %4,4168 %
8GLM-4.64537–52—1,10,31,169 %0,4664 %
9Mistral Large 24435–53-21,20,71,877 %6,1767 %

Wirtschaftsrecht · 30 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,11 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.5 Pro8277–86—0,40,81,2100 %0,1175 %
2GPT-57668–84-40,50,81,393 %0,5768 %
3Claude Opus 4.77469–80-30,51,92,3100 %1,6969 %
4Claude Opus 4.86963–75+10,51,21,697 %1,1167 %
5Kimi K2.65952–65—0,81,92,7100 %0,3057 %
6Mistral Large 25649–63-30,81,32,193 %3,4251 %
7Gemini 3.1 Pro5144–58—0,90,71,587 %4,8562 %
8GLM-4.64944–56—0,51,11,697 %0,5059 %
9Grok 4.34942–56-10,50,71,287 %4,5157 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).