AI-Roundtable Leaderboard
Ranking-Lauf · 18.06.2026

Ranking-Lauf 18.06.2026

Claude Opus 4.7 führt mit 80/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (70) · Medizin: Claude Opus 4.7 (85) · Jura: Claude Opus 4.7 (84) · Wirtschaftsrecht: GPT-5 (80).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260618T165158-d2543a
Gestartet
2026-06-18 16:51 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
7
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
87.07 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7019 / 298077–83+1601,49—
2GPT-5024 / 387672–79+2690,63—
3Claude Opus 4.8018 / 287470–780691,02—
4Kimi K2.60186 / 7725651–61—450,30—
5Gemini 2.5 Pro021 / 265349–57-1793,66—
6Mistral Large 2010 / 705145–55+2474,60—
7Grok 4.307 / 84439–49-4686,30—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,7 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 93 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 2,0 pro Antwort. Auf die Antwortlänge bezogen: 2,06 pro 1000 Ausgabe-Tokens, am niedrigsten Kimi K2.6 mit 0,37.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77064–77-50,71,82,593 %2,0671 %
2Claude Opus 4.86963–74+30,81,22,0100 %1,4276 %
3GPT-56249–73+31,11,12,2100 %0,8565 %
4Kimi K2.63726–48—1,51,83,3100 %0,3760 %
5Gemini 2.5 Pro3525–46-31,30,72,087 %9,1860 %
6Mistral Large 22818–38-21,71,33,0100 %6,4460 %
7Grok 4.32314–32-31,70,72,4100 %10,3651 %

Medizin · 20 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 95 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,12 pro 1000 Ausgabe-Tokens, am niedrigsten Kimi K2.6 mit 0,18.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78579–9000,40,81,195 %1,1288 %
2GPT-58477–89+40,50,61,090 %0,7778 %
3Claude Opus 4.87971–8600,30,30,675 %0,5676 %
4Mistral Large 26861–74-10,40,81,295 %2,2875 %
5Kimi K2.66659–74—0,50,51,095 %0,1862 %
6Gemini 2.5 Pro5952–66-20,20,40,555 %2,3174 %
7Grok 4.35346–60+10,30,10,440 %1,7968 %

Jura · 35 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 77 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 1,10 pro 1000 Ausgabe-Tokens, am niedrigsten Kimi K2.6 mit 0,26.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78480–88+40,20,80,977 %1,1084 %
2Claude Opus 4.87872–83-20,30,50,871 %0,8877 %
3GPT-57466–80+10,40,61,089 %0,5676 %
4Gemini 2.5 Pro6155–67+20,20,10,329 %1,4074 %
5Kimi K2.65749–65—1,00,91,883 %0,2668 %
6Mistral Large 24436–52+21,30,92,183 %7,0760 %
7Grok 4.34234–49-91,10,31,266 %10,7068 %

Wirtschaftsrecht · 30 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,51 pro 1000 Ausgabe-Tokens, am niedrigsten Kimi K2.6 mit 0,37.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58075–8500,50,71,297 %0,5164 %
2Claude Opus 4.77873–83+10,41,92,3100 %1,6970 %
3Claude Opus 4.86963–75+10,61,21,8100 %1,1370 %
4Kimi K2.65850–66—0,82,02,9100 %0,3753 %
5Mistral Large 25851–64+40,81,52,393 %3,7655 %
6Grok 4.35143–59-20,80,61,477 %4,6756 %
7Gemini 2.5 Pro4841–55-40,70,51,287 %4,0755 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).