AI-Roundtable Leaderboard
Ranking-Lauf · 28.05.2026

Ranking-Lauf 28.05.2026

Claude Opus 4.7 führt mit 79/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (76) · Medizin: Claude Opus 4.7 (87) · Jura: Claude Opus 4.7 (82) · Wirtschaftsrecht: GPT-5 (78).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260528T202802-6ce096
Gestartet
2026-05-28 20:28 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
5
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.3
Pipeline-Kosten
76.86 USD
Judge-Übereinstimmung
69 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7020 / 277977–82+3571,53—
2GPT-5039 / 647571–78+1680,64—
3Gemini 2.5 Pro020 / 255248–560774,03—
4Mistral Large 2010 / 695046–55+1494,24—
5Grok 4.308 / 164743–51-1774,53—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 93 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 1,5 pro Antwort. Auf die Antwortlänge bezogen: 1,94 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,73.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77669–83-30,51,92,493 %1,9481 %
2GPT-56151–72+70,81,11,9100 %0,7363 %
3Gemini 2.5 Pro3324–44+31,20,61,787 %7,6265 %
4Grok 4.33324–41+31,10,51,580 %6,5661 %
5Mistral Large 22617–35-11,91,43,3100 %7,0159 %

Medizin · 20 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,1 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 90 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,36 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,81.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78782–91+70,41,11,490 %1,3685 %
2GPT-57971–8600,50,61,190 %0,8177 %
3Mistral Large 26659–73-10,40,91,295 %2,2471 %
4Gemini 2.5 Pro5648–6600,30,30,555 %2,3975 %
5Grok 4.35547–6200,30,20,450 %2,2473 %

Jura · 35 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 71 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,5 pro Antwort. Auf die Antwortlänge bezogen: 0,99 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,50.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78279–86+50,20,70,971 %0,9983 %
2GPT-57468–79-30,20,70,871 %0,5070 %
3Gemini 2.5 Pro6155–66-10,30,20,537 %2,3473 %
4Grok 4.34842–54-20,40,20,549 %4,6268 %
5Mistral Large 24841–56+21,00,61,680 %5,1566 %

Wirtschaftsrecht · 30 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,2 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 93 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,3 pro Antwort. Auf die Antwortlänge bezogen: 0,65 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57872–8400,41,21,593 %0,6572 %
2Claude Opus 4.77267–7800,62,02,6100 %1,8368 %
3Mistral Large 25446–61+20,71,72,497 %3,8353 %
4Gemini 2.5 Pro4841–56-20,70,61,377 %4,8062 %
5Grok 4.34741–54-20,60,71,383 %4,6655 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).