AI-Roundtable Leaderboard
Ranking-Lauf · 01.08.2026

Ranking-Lauf 01.08.2026

Claude Opus 4.7 führt mit 81/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (75) · Medizin: Claude Opus 4.7 (87) · Jura: Claude Opus 4.7 (84) · Wirtschaftsrecht: GPT-5.6 Sol (79).

Status
offizieller Lauf (Feed, Archiv, Startseite)
Lauf
run-20260801T055440-452791
Gestartet
2026-08-01 05:54 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
9
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
119.06 USD
Judge-Übereinstimmung
70 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7020 / 318178–84+1611,36—
2Kimi K3 n=71/10029 (27 T)159 / 4138076–84+3520,38—
3GPT-5.6 Sol089 / 2087773–80+1670,26—
4Claude Opus 4.8020 / 317572–780691,04—
5GPT-5025 / 437369–77-2660,67—
6Grok 4.5029 / 595955–63-4783,03—
7Gemini 3.1 Pro020 / 375652–60+2763,98—
8Mistral Large 209 / 175146–56-2464,60—
9GLM-4.6 n=96/1004 (4 T)60 / 1374641–49-1690,44—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–5 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 1,3 pro Antwort. Auf die Antwortlänge bezogen: 1,60 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,27.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77570–81-30,51,62,2100 %1,6072 %
2GPT-5.6 Sol7162–79+20,91,32,2100 %0,2773 %
3Claude Opus 4.86658–74-30,80,81,5100 %1,1370 %
4GPT-56351–74+41,01,32,393 %0,8169 %
5Kimi K35547–70-62,02,34,3100 %0,4971 %
6Grok 4.55242–60-40,70,81,587 %4,4660 %
7Gemini 3.1 Pro4737–57+60,70,51,367 %5,3269 %
8Mistral Large 22920–39-12,11,23,393 %6,6749 %
9GLM-4.62214–3101,70,92,593 %0,7560 %

Medizin · 20 Items

Platz 1–5 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 90 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GLM-4.6 mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,07 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,08.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78780–93+40,50,71,290 %1,0781 %
2GPT-5.6 Sol8480–89+30,40,40,880 %0,4480 %
3Kimi K38274–90-10,60,81,4100 %0,4183 %
4GPT-58072–87-20,40,71,195 %0,8577 %
5Claude Opus 4.87972–85-10,50,61,0100 %0,9377 %
6Mistral Large 27165–76+20,30,81,195 %2,2567 %
7Gemini 3.1 Pro6661–71+40,20,30,460 %1,6273 %
8Grok 4.56355–71-100,30,20,450 %1,3664 %
9GLM-4.65750–64-30,10,10,237 %0,0881 %

Jura · 35 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 80 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Claude Opus 4.8 mit Ø 0,7 pro Antwort. Auf die Antwortlänge bezogen: 1,03 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,29.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78480–88+40,20,70,980 %1,0385 %
2Kimi K38277–87+20,61,01,594 %0,3179 %
3Claude Opus 4.88176–85+10,10,50,780 %0,7280 %
4GPT-5.6 Sol7365–80+10,50,71,286 %0,2975 %
5GPT-57265–78-20,50,61,080 %0,5972 %
6Gemini 3.1 Pro5952–64-20,50,20,757 %3,7660 %
7Grok 4.55650–63-30,70,20,866 %4,2468 %
8GLM-4.64942–55-30,50,50,967 %0,3966 %
9Mistral Large 24335–51-61,30,82,274 %7,0467 %

Wirtschaftsrecht · 30 Items

Platz 1–5 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5.6 Sol (Score-Spitze) im Mittel in 0,7 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,21 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.6 Sol7973–84-10,70,71,497 %0,2166 %
2Kimi K37968–89+50,52,42,8100 %0,4370 %
3Claude Opus 4.77672–81-40,32,02,3100 %1,6368 %
4GPT-57567–82-40,60,91,4100 %0,5969 %
5Claude Opus 4.87165–77+30,51,41,993 %1,2769 %
6Grok 4.56358–68-10,50,51,087 %2,5060 %
7Mistral Large 25952–66+20,91,42,393 %3,6258 %
8Gemini 3.1 Pro5244–59+40,90,61,587 %4,8261 %
9GLM-4.64741–52+30,80,81,693 %0,4759 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).