AI-Roundtable Leaderboard
Ranking-Lauf · 19.06.2026

Ranking-Lauf 19.06.2026

Claude Opus 4.7 führt mit 78/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (71) · Medizin: GPT-5.5 Pro (86) · Jura: Claude Opus 4.7 (79) · Wirtschaftsrecht: GPT-5.5 Pro (82).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260619T195640-4ce8c8
Gestartet
2026-06-19 19:56 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
8
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
106.01 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1GPT-5.5 Pro n=72/10028164 / 2668076–84—830,12—
2Claude Opus 4.7019 / 307875–80-2591,52—
3Claude Opus 4.8018 / 297471–780710,98—
4GPT-5036 / 597268–77-4680,65—
5Kimi K2.60100 / 1895753–61+1480,27—
6Gemini 3.1 Pro022 / 345450–58—744,38—
7Mistral Large 2010 / 675247–56+1484,44—
8Grok 4.306 / 74844–51+4754,89—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,6 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GPT-5.5 Pro mit Ø 0,9 pro Antwort. Auf die Antwortlänge bezogen: 1,80 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,14.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77165–78+10,61,62,2100 %1,8073 %
2Claude Opus 4.86758–74-20,41,21,6100 %1,1080 %
3GPT-5.5 Pro6747–83—1,00,10,975 %0,1460 %
4GPT-55542–68-71,11,22,393 %0,8565 %
5Gemini 3.1 Pro4436–52—0,80,41,260 %4,9970 %
6Kimi K2.63322–43-42,11,43,6100 %0,3656 %
7Grok 4.32718–37+41,50,72,193 %8,8759 %
8Mistral Large 22516–34-32,31,33,5100 %7,5850 %

Medizin · 20 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,4 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 85 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,17 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.5 Pro8681–90—0,50,40,785 %0,1773 %
2Claude Opus 4.78376–90-20,50,91,395 %1,3382 %
3Claude Opus 4.88277–87+30,30,40,685 %0,5981 %
4GPT-58073–87-40,40,60,995 %0,6883 %
5Mistral Large 27165–78+30,40,61,095 %2,0270 %
6Kimi K2.66455–71-20,60,61,190 %0,2362 %
7Gemini 3.1 Pro6054–67—0,20,30,460 %1,8571 %
8Grok 4.35649–63+30,30,20,455 %2,1169 %

Jura · 35 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 80 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 1,30 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,09.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77973–84-50,30,81,080 %1,3080 %
2GPT-5.5 Pro7771–83—0,20,40,671 %0,0976 %
3Claude Opus 4.87670–82-20,50,40,863 %0,8472 %
4GPT-57062–76-40,50,51,086 %0,6069 %
5Kimi K2.66155–68+40,70,71,489 %0,1767 %
6Gemini 3.1 Pro5952–65—0,50,30,860 %4,0970 %
7Mistral Large 24940–56+51,10,71,783 %5,7064 %
8Grok 4.34842–54+60,50,20,654 %4,3667 %

Wirtschaftsrecht · 20 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,1 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 90 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,11 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.5 Pro8273–89—0,10,60,790 %0,1176 %
2GPT-57974–85-10,50,91,397 %0,5668 %
3Claude Opus 4.77671–80-20,41,82,397 %1,6463 %
4Claude Opus 4.87165–77+20,61,21,897 %1,1965 %
5Kimi K2.65952–65+10,91,82,793 %0,3357 %
6Mistral Large 25650–62-20,91,62,593 %3,8952 %
7Grok 4.35145–5700,60,71,387 %4,8060 %
8Gemini 3.1 Pro4941–56—1,10,81,793 %5,5056 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).