AI-Roundtable Leaderboard
Ranking-Lauf · 19.07.2026

Ranking-Lauf 19.07.2026

Claude Opus 4.7 führt mit 80/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (78) · Medizin: Claude Opus 4.7 (83) · Jura: Claude Opus 4.7 (80) · Wirtschaftsrecht: Claude Opus 4.7 (80).

Status
offizieller Lauf (Feed, Archiv, Startseite)
Lauf
run-20260719T120108-c40839
Gestartet
2026-07-19 12:01 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
9
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
121.36 USD
Judge-Übereinstimmung
70 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7020 / 318078–83+2611,36—
2Kimi K3 n=84/10016 (12 T)169 / 2897772–82—440,38—
3GPT-5.6 Sol075 / 2077672–80—660,28—
4Claude Opus 4.8019 / 277572–780720,90—
4GPT-5024 / 387571–780690,64—
5Grok 4.5031 / 586359–66—812,52—
6Gemini 3.1 Pro020 / 275450–58-3724,59—
7Mistral Large 209 / 155348–57+3524,13—
8GLM-4.6074 / 1634743–51+2670,45—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–5 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,2 pro Antwort. Auf die Antwortlänge bezogen: 1,72 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,27.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77870–85+40,51,92,4100 %1,7278 %
2Claude Opus 4.86963–75+20,61,11,6100 %1,1773 %
3GPT-5.6 Sol6953–81—0,91,32,1100 %0,2773 %
4Kimi K36142–77—1,12,83,9100 %0,3564 %
5GPT-55946–73+31,11,22,4100 %0,9368 %
6Grok 4.55648–64—0,70,51,280 %3,4367 %
7Gemini 3.1 Pro4132–50-131,00,51,573 %6,4066 %
8Mistral Large 23019–42+31,91,33,3100 %6,6853 %
9GLM-4.62214–30+31,80,92,6100 %0,7149 %

Medizin · 20 Items

Platz 1–6 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 95 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 1,09 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,12.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78377–89+20,40,81,195 %1,0986 %
2Kimi K38376–90—0,60,81,490 %0,4183 %
3GPT-58273–88-10,50,40,880 %0,6275 %
4GPT-5.6 Sol8176–87—0,50,40,880 %0,4969 %
5Claude Opus 4.88073–86-10,40,40,880 %0,7172 %
6Grok 4.57366–79—0,30,20,360 %1,1575 %
7Mistral Large 26963–75+10,30,60,995 %1,8066 %
8Gemini 3.1 Pro6256–68+30,20,30,565 %2,0976 %
9GLM-4.66055–67+30,10,30,355 %0,1273 %

Jura · 35 Items

Platz 1–5 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 91 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,5 pro Antwort. Auf die Antwortlänge bezogen: 1,06 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,29.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78075–84-20,30,70,991 %1,0680 %
2Claude Opus 4.88076–84+10,30,40,671 %0,6977 %
3Kimi K38075–85—0,51,31,885 %0,3477 %
4GPT-57468–79-40,30,71,086 %0,5674 %
5GPT-5.6 Sol7265–79—0,60,61,186 %0,2970 %
6Gemini 3.1 Pro6153–6700,60,20,863 %4,2272 %
7Grok 4.55952–65—0,50,10,537 %2,9069 %
8GLM-4.65245–58+70,50,50,963 %0,3667 %
9Mistral Large 24941–57+51,10,61,671 %5,4464 %

Wirtschaftsrecht · 30 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,1 pro Antwort. Auf die Antwortlänge bezogen: 1,53 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,25.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78076–84+60,41,82,197 %1,5374 %
2GPT-5.6 Sol8075–86—0,61,01,697 %0,2572 %
3GPT-57974–84+30,60,71,397 %0,5672 %
4Kimi K37464–85—0,42,63,0100 %0,4472 %
5Claude Opus 4.86862–74-10,61,01,597 %1,0271 %
6Grok 4.56459–69—0,40,71,177 %2,5366 %
7Mistral Large 25750–64+10,71,42,193 %3,6056 %
8Gemini 3.1 Pro4840–56-31,00,71,777 %5,3760 %
9GLM-4.64438–50-51,00,91,987 %0,5554 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).