AI-Roundtable Leaderboard
Ranking-Lauf · 20.06.2026

Ranking-Lauf 20.06.2026

Claude Opus 4.7 führt mit 80/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (78) · Medizin: GPT-5.5 Pro (87) · Jura: Claude Opus 4.7 (82) · Wirtschaftsrecht: GPT-5.5 Pro (78).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260620T073912-d2125c
Gestartet
2026-06-20 07:39 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
8
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
122.61 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7020 / 298077–83+2591,48—
2GPT-5.5 Pro n=99/1001199 / 8317875–82-2780,10—
3GPT-5028 / 447672–79+4700,60—
4Claude Opus 4.8018 / 277471–770730,90—
5Kimi K2.6 n=99/1001122 / 2665954–64+2510,25—
6Gemini 3.1 Pro023 / 325450–580754,15—
7Mistral Large 2010 / 685146–56-1504,30—
8Grok 4.305 / 74843–520735,19—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 1,1 pro Antwort. Auf die Antwortlänge bezogen: 1,65 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,11.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77873–84+70,51,62,1100 %1,6580 %
2GPT-5.5 Pro6860–76+10,90,71,6100 %0,1168 %
3GPT-56754–79+121,11,02,0100 %0,7974 %
4Claude Opus 4.86559–72-20,61,01,6100 %1,1574 %
5Gemini 3.1 Pro4436–5100,80,51,173 %4,6656 %
6Kimi K2.63018–42-31,92,03,9100 %0,4046 %
7Grok 4.32821–37+11,10,71,993 %8,5554 %
8Mistral Large 22718–37+21,91,63,5100 %7,2152 %

Medizin · 20 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,3 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 80 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,19 pro 1000 Ausgabe-Tokens, am niedrigsten Kimi K2.6 mit 0,17.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.5 Pro8783–91+10,50,30,780 %0,1981 %
2Claude Opus 4.78375–9000,40,91,3100 %1,2688 %
3Claude Opus 4.88175–87-10,30,40,690 %0,5970 %
4GPT-57870–86-20,60,51,0100 %0,7370 %
5Kimi K2.67063–77+60,40,60,990 %0,1767 %
6Mistral Large 26963–75-20,50,51,085 %1,8972 %
7Gemini 3.1 Pro6357–70+30,30,20,460 %2,0070 %
8Grok 4.36050–68+40,20,40,675 %2,8678 %

Jura · 35 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 83 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GPT-5.5 Pro mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 1,22 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,08.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78277–86+30,30,71,083 %1,2282 %
2Claude Opus 4.88074–85+40,20,50,771 %0,7076 %
3GPT-57773–81+70,30,50,777 %0,3971 %
4GPT-5.5 Pro7770–8300,20,40,671 %0,0878 %
5Kimi K2.66357–69+20,60,51,177 %0,1566 %
6Gemini 3.1 Pro5851–64-10,50,30,760 %3,9771 %
7Grok 4.34943–54+10,50,20,660 %4,9767 %
8Mistral Large 24537–52-41,20,71,880 %6,1062 %

Wirtschaftsrecht · 30 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,10 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.5 Pro7871–84-40,30,71,097 %0,1082 %
2Claude Opus 4.77772–81+10,51,82,3100 %1,7069 %
3GPT-57670–81-30,60,91,5100 %0,6265 %
4Claude Opus 4.86762–73-40,61,01,6100 %1,0863 %
5Kimi K2.66155–67+20,81,92,7100 %0,3152 %
6Mistral Large 25750–63+10,71,32,193 %3,4153 %
7Gemini 3.1 Pro4941–5601,00,61,683 %5,0856 %
8Grok 4.34841–56-30,70,81,587 %5,0957 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).