AI-Roundtable Leaderboard
Ranking-Lauf · 17.05.2026

Ranking-Lauf 17.05.2026

Claude Opus 4.7 führt mit 79/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (76) · Medizin: Claude Opus 4.7 (84) · Jura: Claude Opus 4.7 (80) · Wirtschaftsrecht: GPT-5 (78).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260517T131406-f96128
Gestartet
2026-05-17 13:14 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
5
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.1.0
Pipeline-Kosten
76.98 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7019 / 287975–82+3591,50—
2GPT-5028 / 497571–78+4670,67—
3Gemini 2.5 Pro018 / 225350–57+9793,66—
4Mistral Large 2018 / 795146–55+6514,20—
5Grok 4.309 / 154642–50+4764,48—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,7 pro Antwort. Auf die Antwortlänge bezogen: 1,75 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,79.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77668–84+120,32,02,3100 %1,7572 %
2GPT-55947–71+130,91,22,193 %0,7965 %
3Gemini 2.5 Pro3425–44+51,30,61,787 %8,2762 %
4Mistral Large 22920–37+161,61,43,0100 %6,2853 %
5Grok 4.32617–35+81,30,72,080 %8,6561 %

Medizin · 20 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,25 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,94.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78477–89-30,30,91,2100 %1,2584 %
2GPT-58173–87-20,60,71,295 %0,9480 %
3Mistral Large 26458–69-10,30,91,295 %2,2968 %
4Gemini 2.5 Pro5647–63+40,20,30,545 %2,3777 %
5Grok 4.35246–59-70,10,20,235 %1,0475 %

Jura · 35 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 77 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,14 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,57.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78074–86+10,20,81,077 %1,1479 %
2GPT-57669–81+20,20,81,080 %0,5771 %
3Gemini 2.5 Pro6256–65+80,30,10,429 %1,7870 %
4Grok 4.34944–54-10,60,20,760 %4,8266 %
5Mistral Large 24739–5401,10,71,783 %5,6765 %

Wirtschaftsrecht · 30 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,2 pro Antwort. Auf die Antwortlänge bezogen: 0,58 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57872–8300,31,01,497 %0,5870 %
2Claude Opus 4.77569–80+10,51,92,4100 %1,7572 %
3Mistral Large 25751–64+60,71,52,393 %3,6059 %
4Gemini 2.5 Pro5246–59+120,60,61,273 %4,1163 %
5Grok 4.34740–54+60,60,61,270 %4,2259 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).