AI-Roundtable Leaderboard
Ranking-Lauf · 15.07.2026

Ranking-Lauf 15.07.2026

Claude Opus 4.7 führt mit 79/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (72) · Medizin: GPT-5.6 Sol (85) · Jura: Claude Opus 4.7 (81) · Wirtschaftsrecht: GPT-5 (84).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260715T040307-80bf67
Gestartet
2026-07-15 04:03 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
9
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
117.92 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7020 / 297976–820591,44—
2GPT-5032 / 567774–81+2710,61—
2GPT-5.6 Sol n=96/1004 (4 T)91 / 2307773–810700,26—
3Claude Opus 4.8018 / 297471–77-1700,99—
4Kimi K2.6 n=80/10020 (16 T)191 / 3186056–65+2520,29—
5Grok 4.5018 / 305854–62+2753,65—
6Gemini 3.1 Pro020 / 325449–58-1714,80—
7Mistral Large 209 / 155045–54-1484,48—
8GLM-4.6054 / 974540–480650,51—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,7 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,3 pro Antwort. Auf die Antwortlänge bezogen: 2,06 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,31.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77265–79-30,72,02,7100 %2,0679 %
2GPT-5.6 Sol7052–8500,91,32,2100 %0,3174 %
3Claude Opus 4.86557–72-20,41,41,8100 %1,3270 %
4GPT-56555–7601,10,81,993 %0,7566 %
5Grok 4.54943–56+20,80,51,387 %4,2957 %
6Gemini 3.1 Pro4436–51-40,90,71,680 %7,1870 %
7Kimi K2.63521–49+21,42,03,4100 %0,4062 %
8Mistral Large 22415–35-42,31,74,0100 %8,1348 %
9GLM-4.62316–31+21,61,22,893 %0,7962 %

Medizin · 20 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5.6 Sol (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,5 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 90 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GLM-4.6 mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 0,48 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,14.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.6 Sol8580–89+10,40,50,890 %0,4880 %
2Claude Opus 4.78477–91-40,50,71,2100 %1,1286 %
3GPT-58475–92+30,40,50,990 %0,6478 %
4Claude Opus 4.88073–86-50,30,40,775 %0,6879 %
5Kimi K2.67163–79+20,40,60,995 %0,1971 %
6Mistral Large 26660–71-10,60,51,085 %2,0063 %
7Grok 4.56456–73-30,40,20,575 %1,9469 %
8Gemini 3.1 Pro6356–69-10,30,30,560 %2,3874 %
9GLM-4.66054–67+30,30,10,360 %0,1477 %

Jura · 35 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 83 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Claude Opus 4.8 mit Ø 0,7 pro Antwort. Auf die Antwortlänge bezogen: 1,02 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,25.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78176–85+10,30,60,983 %1,0277 %
2Claude Opus 4.88177–85+20,20,50,780 %0,7182 %
3GPT-5.6 Sol7569–8000,50,61,086 %0,2569 %
4GPT-57365–80+20,50,61,186 %0,6571 %
5Gemini 3.1 Pro6052–6700,60,30,860 %4,1963 %
6Grok 4.55850–65+60,70,30,969 %5,1466 %
7Kimi K2.65850–6600,90,71,679 %0,2764 %
8GLM-4.64538–52-10,80,51,277 %0,5365 %
9Mistral Large 24537–54-41,30,61,977 %6,4966 %

Wirtschaftsrecht · 30 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,49 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,22.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58481–88+30,20,81,1100 %0,4980 %
2Claude Opus 4.77874–83+50,31,92,397 %1,6274 %
3GPT-5.6 Sol7871–83+10,60,81,393 %0,2271 %
4Claude Opus 4.86660–73-30,71,11,8100 %1,1866 %
5Kimi K2.66460–68+30,61,92,5100 %0,3258 %
6Grok 4.55850–64-10,70,61,383 %3,3562 %
7Mistral Large 25750–64+10,71,42,097 %3,2755 %
8Gemini 3.1 Pro4638–55-11,00,71,790 %5,5254 %
9GLM-4.64439–49-30,80,81,690 %0,5253 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).