AI-Roundtable Leaderboard
Ranking-Lauf · 29.05.2026

Ranking-Lauf 29.05.2026

Claude Opus 4.7 führt mit 79/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (71) · Medizin: Claude Opus 4.7 (84) · Jura: Claude Opus 4.7 (82) · Wirtschaftsrecht: GPT-5 (80).

Status
offizieller Lauf (Feed, Archiv, Startseite)
Lauf
run-20260529T043500-b4ffe0
Gestartet
2026-05-29 04:35 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
6
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.3
Pipeline-Kosten
72.88 USD
Judge-Übereinstimmung
69 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7019 / 317977–82—571,54—
2GPT-5034 / 597571–79—670,67—
3Claude Opus 4.8018 / 287471–77—720,91—
4Gemini 2.5 Pro021 / 265551–59—803,45—
5Mistral Large 209 / 655147–57—474,62—
6Grok 4.306 / 104743–51—764,80—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Claude Opus 4.8 mit Ø 1,4 pro Antwort. Auf die Antwortlänge bezogen: 1,95 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,83.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77166–77—0,52,02,4100 %1,9578 %
2Claude Opus 4.86963–74—0,60,91,4100 %1,0279 %
3GPT-56352–73—0,91,32,2100 %0,8369 %
4Gemini 2.5 Pro3828–48—1,20,61,880 %8,0360 %
5Mistral Large 22819–39—1,91,63,493 %7,5550 %
6Grok 4.32718–37—1,51,02,4100 %10,9860 %

Medizin · 20 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,15 pro 1000 Ausgabe-Tokens, am niedrigsten Claude Opus 4.8 mit 0,68.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78477–90—0,50,81,1100 %1,1581 %
2GPT-58172–89—0,60,51,080 %0,7578 %
3Claude Opus 4.87972–84—0,40,40,780 %0,6872 %
4Mistral Large 26760–74—0,40,91,295 %2,4770 %
5Gemini 2.5 Pro6152–67—0,10,30,460 %1,7173 %
6Grok 4.35547–64—0,30,20,460 %2,1875 %

Jura · 35 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 86 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,22 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,58.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78277–86—0,20,81,086 %1,2282 %
2Claude Opus 4.87974–84—0,20,40,666 %0,6176 %
3GPT-57366–80—0,40,61,080 %0,5870 %
4Gemini 2.5 Pro6258–67—0,10,10,234 %1,2168 %
5Grok 4.34842–54—0,30,20,434 %3,6067 %
6Mistral Large 24638–54—1,30,71,977 %6,5364 %

Wirtschaftsrecht · 30 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 1,1 pro Antwort. Auf die Antwortlänge bezogen: 0,63 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58073–86—0,41,01,497 %0,6375 %
2Claude Opus 4.77772–81—0,32,22,5100 %1,7668 %
3Claude Opus 4.86863–74—0,51,41,997 %1,1862 %
4Mistral Large 25952–65—0,71,62,397 %3,6258 %
5Gemini 2.5 Pro5245–58—0,70,61,390 %4,2961 %
6Grok 4.35043–57—0,60,61,187 %4,1254 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).