AI-Roundtable Leaderboard
Ranking-Lauf · 18.05.2026

Ranking-Lauf 18.05.2026

Claude Opus 4.7 führt mit 79/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (73) · Medizin: Claude Opus 4.7 (87) · Jura: Claude Opus 4.7 (83) · Wirtschaftsrecht: GPT-5 (77).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260518T043700-b4a380
Gestartet
2026-05-18 04:37 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
5
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.1.0
Pipeline-Kosten
77.02 USD
Judge-Übereinstimmung
69 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7021 / 337976–820581,46—
2GPT-5031 / 537572–790690,62—
3Gemini 2.5 Pro019 / 245450–57+1813,32—
4Mistral Large 2013 / 754945–54-2504,15—
5Grok 4.3011 / 164642–500715,08—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,3 pro Antwort. Auf die Antwortlänge bezogen: 1,71 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,70.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77368–78-30,41,82,2100 %1,7178 %
2GPT-56051–69+11,00,81,8100 %0,7066 %
3Gemini 2.5 Pro4032–50+61,10,41,387 %5,9159 %
4Mistral Large 22415–31-52,11,53,6100 %7,5453 %
5Grok 4.32214–31-41,60,92,587 %10,4359 %

Medizin · 20 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 90 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,21 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,90.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78781–92+30,41,01,390 %1,2183 %
2GPT-58273–88+10,40,81,295 %0,9080 %
3Mistral Large 26456–7100,40,91,290 %2,3367 %
4Gemini 2.5 Pro5648–6400,20,30,445 %2,0176 %
5Grok 4.35143–58-10,40,40,775 %3,1273 %

Jura · 35 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 86 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 1,13 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,46.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78379–87+30,20,81,086 %1,1383 %
2GPT-57672–8100,10,60,886 %0,4672 %
3Gemini 2.5 Pro6357–67+10,20,20,343 %1,6472 %
4Grok 4.35449–58+50,40,30,663 %4,2668 %
5Mistral Large 25043–57+30,90,61,477 %4,6268 %

Wirtschaftsrecht · 30 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,2 pro Antwort. Auf die Antwortlänge bezogen: 0,60 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57770–84-10,50,91,4100 %0,6074 %
2Claude Opus 4.77367–79-20,42,02,4100 %1,7175 %
3Mistral Large 25245–59-50,81,52,393 %3,6260 %
4Gemini 2.5 Pro4842–55-40,70,51,277 %4,3059 %
5Grok 4.34538–51-20,60,71,390 %4,3553 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).