AI-Roundtable Leaderboard
Ranking-Lauf · 16.05.2026

Ranking-Lauf 16.05.2026

Claude Opus 4.7 führt mit 76/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (64) · Medizin: Claude Opus 4.7 (87) · Jura: Claude Opus 4.7 (79) · Wirtschaftsrecht: GPT-5 (78).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260516T200347-bc6991
Gestartet
2026-05-16 20:03 UTC
Items
33 (Steuerrecht 8, Medizin 9, Jura 8, Wirtschaftsrecht 8)
Modelle
5
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
28.68 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7022 / 367671–82-2551,40—
2GPT-5049 / 667162–78-2610,71—
3Mistral Large 2023 / 3664537–53+1404,33—
4Gemini 2.5 Pro019 / 224438–51-2734,23—
5Grok 4.307 / 104234–51+1605,81—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,8 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,5 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,8 pro Antwort. Auf die Antwortlänge bezogen: 1,73 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,87.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.76458–72-50,81,52,3100 %1,7377 %
2GPT-54626–65-151,60,82,4100 %0,8765 %
3Gemini 2.5 Pro2916–43+31,40,51,888 %8,3664 %
4Grok 4.3184–3502,41,03,3100 %11,6856 %
5Mistral Large 2138–1902,01,73,7100 %7,7759 %

Medizin · 9 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 89 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 0,93 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,71.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78779–94+60,20,81,089 %0,9388 %
2GPT-58377–89-20,20,81,0100 %0,7185 %
3Mistral Large 26558–71-30,31,01,3100 %2,2370 %
4Grok 4.35949–69+70,30,40,744 %2,9473 %
5Gemini 2.5 Pro5241–6200,30,40,667 %2,7268 %

Jura · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,0 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,14 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,47.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77968–88-60,01,01,0100 %1,1476 %
2GPT-57463–84+60,10,70,863 %0,4777 %
3Gemini 2.5 Pro5444–63+10,10,10,225 %0,9975 %
4Grok 4.35042–57+20,30,30,463 %2,8065 %
5Mistral Large 24738–58-21,00,61,588 %4,9463 %

Wirtschaftsrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,5 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,7 pro Antwort. Auf die Antwortlänge bezogen: 0,70 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57872–85-10,51,52,0100 %0,7071 %
2Claude Opus 4.77463–84-30,52,53,0100 %1,5964 %
3Mistral Large 25140–63+81,61,73,2100 %3,8254 %
4Grok 4.34124–58-31,30,82,0100 %4,7155 %
5Gemini 2.5 Pro4029–51-101,30,51,7100 %4,7051 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).