AI-Roundtable Leaderboard
Ranking-Lauf · 20.05.2026

Ranking-Lauf 20.05.2026

Claude Opus 4.7 führt mit 76/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (79) · Medizin: Claude Opus 4.7 (80) · Jura: Claude Opus 4.7 (77) · Wirtschaftsrecht: GPT-5 (78).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260520T074328-4a549c
Gestartet
2026-05-20 07:43 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
5
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.3
Pipeline-Kosten
76.74 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7021 / 317673–79-3551,60—
2GPT-5030 / 477470–78-1670,70—
3Gemini 2.5 Pro022 / 265248–57-2803,44—
4Mistral Large 2012 / 684945–540494,28—
5Grok 4.3013 / 194844–51+2744,59—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,1 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,8 pro Antwort. Auf die Antwortlänge bezogen: 1,92 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 1,01.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77972–86+60,42,12,5100 %1,9277 %
2GPT-55440–67-61,31,22,593 %1,0165 %
3Gemini 2.5 Pro3021–40-101,40,51,887 %8,3659 %
4Grok 4.33022–37+81,50,82,393 %9,1556 %
5Mistral Large 22719–37+31,81,23,0100 %6,3255 %

Medizin · 20 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,6 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 95 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,50 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,91.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78073–87-70,60,91,595 %1,5082 %
2GPT-57969–88-30,60,71,285 %0,9181 %
3Mistral Large 26759–74+30,40,91,395 %2,5668 %
4Gemini 2.5 Pro5647–6400,20,30,550 %2,3573 %
5Grok 4.35548–61+40,30,20,470 %2,0670 %

Jura · 35 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 86 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,46 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,60.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77770–83-60,30,91,286 %1,4683 %
2GPT-57771–82+10,20,81,083 %0,6073 %
3Gemini 2.5 Pro6256–66-10,20,10,229 %1,3172 %
4Grok 4.35045–56-40,30,20,451 %3,4168 %
5Mistral Large 24638–54-41,10,71,883 %6,1262 %

Wirtschaftsrecht · 30 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 93 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,1 pro Antwort. Auf die Antwortlänge bezogen: 0,53 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57872–83+10,31,01,293 %0,5373 %
2Claude Opus 4.77267–76-10,51,72,397 %1,6066 %
3Mistral Large 25246–5900,71,52,293 %3,4056 %
4Gemini 2.5 Pro5043–56+20,60,61,183 %3,7764 %
5Grok 4.34942–56+40,70,71,477 %4,4360 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).