AI-Roundtable Leaderboard
Ranking-Lauf · 01.07.2026

Ranking-Lauf 01.07.2026

Claude Opus 4.7 führt mit 80/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (73) · Medizin: GPT-5.5 Pro (88) · Jura: Claude Opus 4.7 (82) · Wirtschaftsrecht: GPT-5 (82).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260701T043526-2a195e
Gestartet
2026-07-01 04:35 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
9
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.6
Pipeline-Kosten
125.26 USD
Judge-Übereinstimmung
67 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7019 / 308076–830581,51—
1GPT-5.5 Pro n=83/10017 (17 T)223 / 7718076–83+2770,11—
2GPT-5037 / 547672–800650,71—
3Claude Opus 4.8018 / 277572–78+1730,87—
4Kimi K2.60189 / 5195955–640470,30—
5Gemini 3.1 Pro020 / 295652–60+2754,10—
6Mistral Large 2011 / 695147–550484,51—
7GLM-4.6072 / 1164743–51—680,45—
8Grok 4.3010 / 134540–49-3735,38—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 93 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 1,2 pro Antwort. Auf die Antwortlänge bezogen: 1,85 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,19.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77361–80-50,41,92,393 %1,8581 %
2Claude Opus 4.86660–71+10,50,81,487 %0,9964 %
3GPT-56046–71-71,50,82,3100 %0,8962 %
4GPT-5.5 Pro5743–72-111,70,82,3100 %0,1948 %
5Gemini 3.1 Pro4841–55+40,90,31,273 %4,9769 %
6Kimi K2.63120–42+11,91,83,7100 %0,3950 %
7Mistral Large 22719–3501,81,33,1100 %6,5454 %
8Grok 4.32517–33-31,70,42,087 %9,0756 %
9GLM-4.62113–30—1,80,82,5100 %0,8051 %

Medizin · 20 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,3 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 70 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GLM-4.6 mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 0,14 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,12.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-5.5 Pro8884–92+10,30,30,670 %0,1481 %
2Claude Opus 4.78480–89+10,30,81,1100 %1,0481 %
3GPT-58272–90+40,60,61,185 %0,8080 %
4Claude Opus 4.88075–86-10,30,60,890 %0,7979 %
5Kimi K2.67468–82+40,50,60,990 %0,1875 %
6Gemini 3.1 Pro6559–71+20,30,20,460 %1,6072 %
7Mistral Large 26559–72-40,50,61,190 %2,2565 %
8GLM-4.65952–65—0,20,20,345 %0,1270 %
9Grok 4.35751–63-30,10,30,455 %1,9272 %

Jura · 35 Items

Platz 1–4 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 80 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 1,19 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,09.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78277–8700,20,81,080 %1,1980 %
2Claude Opus 4.88276–87+20,20,50,669 %0,6477 %
3GPT-5.5 Pro7670–82-10,20,60,881 %0,0973 %
4GPT-57467–80-30,50,61,180 %0,6477 %
5Kimi K2.66560–70+20,60,81,483 %0,2170 %
6Gemini 3.1 Pro6154–67+30,30,30,646 %3,2664 %
7GLM-4.65144–58—0,40,40,963 %0,3270 %
8Mistral Large 24941–57+41,10,92,086 %6,3466 %
9Grok 4.34640–52-30,80,20,951 %7,5663 %

Wirtschaftsrecht · 30 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,1 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GPT-5.5 Pro mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,64 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,10.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58277–87+60,41,11,597 %0,6475 %
2GPT-5.5 Pro8278–87+40,40,61,092 %0,1073 %
3Claude Opus 4.77772–8300,61,92,5100 %1,8072 %
4Claude Opus 4.86964–74+20,61,11,697 %1,0265 %
5Kimi K2.65750–64-40,72,12,9100 %0,4059 %
6Mistral Large 25649–63-10,91,52,3100 %3,7850 %
7Gemini 3.1 Pro4940–5701,00,71,790 %5,5856 %
8GLM-4.64841–54—0,91,01,997 %0,5659 %
9Grok 4.34638–54-20,70,61,380 %4,4753 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).