AI-Roundtable Leaderboard
Ranking-Lauf · 11.07.2026

Ranking-Lauf 11.07.2026

Claude Opus 4.7 führt mit 79/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (75) · Medizin: Claude Opus 4.7 (88) · Jura: Claude Opus 4.7 (80) · Wirtschaftsrecht: GPT-5 (81).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260711T103548-436ac1
Gestartet
2026-07-11 10:35 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
9
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
119.54 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7020 / 317976–82-1601,41—
2GPT-5.6 Sol079 / 1917773–80—670,28—
3Claude Opus 4.8019 / 307572–780720,95—
3GPT-5031 / 467571–79-1700,60—
4Kimi K2.6 n=78/10022 (22 T)169 / 2495853–63-1480,27—
5Grok 4.5016 / 315652–61—723,99—
6Gemini 3.1 Pro020 / 285551–59-1744,34—
7Mistral Large 209 / 165147–560534,15—
8GLM-4.6 n=97/1003 (3 T)61 / 864540–49-2650,48—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,5 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 1,1 pro Antwort. Auf die Antwortlänge bezogen: 1,54 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,29.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77567–82+20,41,51,9100 %1,5475 %
2GPT-5.6 Sol7061–78—1,11,42,5100 %0,2969 %
3Claude Opus 4.86762–73+10,70,81,6100 %1,1268 %
4GPT-56556–74+51,00,81,887 %0,6573 %
5Gemini 3.1 Pro4841–5500,90,31,173 %4,6863 %
6Grok 4.54738–55—1,10,71,793 %5,1456 %
7Kimi K2.63319–45+21,91,53,4100 %0,3459 %
8Mistral Large 22821–35+11,71,12,8100 %6,1352 %
9GLM-4.62113–2902,10,82,8100 %0,8964 %

Medizin · 20 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 90 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 1,04 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,13.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78883–92+40,30,81,190 %1,0487 %
2Claude Opus 4.88581–89+50,40,40,685 %0,5980 %
3GPT-5.6 Sol8479–88—0,50,30,780 %0,4277 %
4GPT-58173–88-10,40,61,095 %0,7079 %
5Kimi K2.66957–79-50,70,41,080 %0,2174 %
6Grok 4.56758–76—0,30,10,355 %1,2466 %
7Mistral Large 26760–73+20,50,61,0100 %2,0764 %
8Gemini 3.1 Pro6458–70-10,20,30,460 %1,6770 %
9GLM-4.65752–64-20,10,20,340 %0,1374 %

Jura · 35 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 77 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Claude Opus 4.8 mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 1,11 pro 1000 Ausgabe-Tokens, am niedrigsten Kimi K2.6 mit 0,20.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78075–85-20,20,81,077 %1,1179 %
2Claude Opus 4.87975–82-30,20,40,666 %0,7078 %
3GPT-5.6 Sol7568–82—0,50,61,189 %0,3177 %
4GPT-57163–78-30,60,61,186 %0,6469 %
5Gemini 3.1 Pro6052–67-10,50,20,754 %4,0370 %
6Kimi K2.65851–65-70,80,81,683 %0,2064 %
7Grok 4.55244–60—0,90,31,163 %6,6772 %
8Mistral Large 24940–5700,90,81,777 %5,9068 %
9GLM-4.64639–53-50,70,51,168 %0,4259 %

Wirtschaftsrecht · 30 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,50 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,22.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58174–86-10,40,81,297 %0,5074 %
2GPT-5.6 Sol7771–83—0,50,91,4100 %0,2268 %
3Claude Opus 4.77368–79-40,61,82,5100 %1,7466 %
4Claude Opus 4.86963–7500,61,21,897 %1,2170 %
5Kimi K2.66155–68+40,82,02,8100 %0,3555 %
6Grok 4.55950–67—0,70,71,380 %3,4459 %
7Mistral Large 25649–6200,81,32,197 %3,5056 %
8Gemini 3.1 Pro4739–56-21,20,71,897 %5,6752 %
9GLM-4.64740–54-10,81,01,7100 %0,5157 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).