AI-Roundtable Leaderboard
Ranking-Lauf · 07.06.2026

Ranking-Lauf 07.06.2026

Claude Opus 4.7 führt mit 81/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (77) · Medizin: Claude Opus 4.7 (86) · Jura: Claude Opus 4.7 (84) · Wirtschaftsrecht: GPT-5 (83).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260607T181746-23cbb6
Gestartet
2026-06-07 18:17 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
6
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.3
Pipeline-Kosten
72.24 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7019 / 308178–83+2591,48—
2GPT-5053 / 1467774–81+2720,57—
3Claude Opus 4.8018 / 267471–77—720,93—
4Gemini 2.5 Pro018 / 245450–57+2793,46—
5Mistral Large 2010 / 685046–550494,32—
6Grok 4.304 / 64743–500735,50—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,3 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Claude Opus 4.8 mit Ø 1,4 pro Antwort. Auf die Antwortlänge bezogen: 2,10 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,71.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77771–82+10,42,32,7100 %2,1078 %
2Claude Opus 4.86963–76—0,60,91,493 %1,0473 %
3GPT-56758–75+60,91,01,9100 %0,7170 %
4Gemini 2.5 Pro3526–44+21,30,51,780 %7,6062 %
5Grok 4.32619–33-71,50,72,1100 %9,4454 %
6Mistral Large 22517–32-12,11,03,0100 %6,3449 %

Medizin · 20 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 95 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 1,17 pro 1000 Ausgabe-Tokens, am niedrigsten Claude Opus 4.8 mit 0,57.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78680–91-10,40,81,195 %1,1780 %
2GPT-58275–88+30,40,50,9100 %0,6675 %
3Claude Opus 4.88074–87—0,30,40,685 %0,5775 %
4Mistral Large 26659–7200,50,71,190 %2,2172 %
5Gemini 2.5 Pro5749–64+10,30,40,665 %2,7271 %
6Grok 4.35346–61-20,50,20,775 %3,4970 %

Jura · 35 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 86 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 1,10 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,53.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78480–87+20,30,70,986 %1,1080 %
2Claude Opus 4.87972–84—0,30,50,863 %0,8576 %
3GPT-57468–8000,30,60,980 %0,5375 %
4Gemini 2.5 Pro6258–67+10,20,20,340 %1,3669 %
5Grok 4.34842–5400,60,20,863 %6,0966 %
6Mistral Large 24739–54-11,20,82,083 %6,7164 %

Wirtschaftsrecht · 30 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,49 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58377–88+50,20,91,1100 %0,4978 %
2Claude Opus 4.77670–81+40,32,02,397 %1,6070 %
3Claude Opus 4.86761–72—0,61,11,793 %1,1165 %
4Mistral Large 25750–64+30,71,52,197 %3,3754 %
5Gemini 2.5 Pro5144–57+30,70,51,173 %3,9759 %
6Grok 4.35145–57+40,40,81,283 %4,5060 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).