AI-Roundtable Leaderboard
Ranking-Lauf · 14.05.2026

Ranking-Lauf 14.05.2026

Claude Opus 4.7 führt mit 75/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (68) · Medizin: Claude Opus 4.7 (82) · Jura: Claude Opus 4.7 (77) · Wirtschaftsrecht: GPT-5 (80).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260514T075711-8acb3a
Gestartet
2026-05-14 09:23 UTC
Items
99 (Steuerrecht 24, Medizin 27, Jura 24, Wirtschaftsrecht 24)
Modelle
4
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
73.57 USD
Judge-Übereinstimmung
67 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7020 / 317572–78-2491,59—
2GPT-5032 / 567066–74+1620,68—
3Mistral Large 2016 / 794641–51-1384,36—
4Gemini 2.5 Pro023 / 274541–48-2724,25—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 24 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,8 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,1 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,8 pro Antwort. Auf die Antwortlänge bezogen: 2,09 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,87.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.76862–7400,82,12,8100 %2,0978 %
2GPT-55344–62-31,11,32,496 %0,8772 %
3Gemini 2.5 Pro3023–37+51,40,51,888 %7,8159 %
4Mistral Large 2139–17-42,21,53,7100 %7,6262 %

Medizin · 27 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,15 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,69.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78276–87-30,30,91,2100 %1,1583 %
2GPT-58075–84-60,40,61,096 %0,6968 %
3Mistral Large 26762–72-20,60,91,596 %2,4469 %
4Gemini 2.5 Pro5449–57-20,30,20,474 %1,9271 %

Jura · 24 Items

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 83 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,5 pro Antwort. Auf die Antwortlänge bezogen: 1,35 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,54.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77771–82-10,40,81,283 %1,3573 %
2GPT-56661–70+60,30,61,071 %0,5464 %
3Gemini 2.5 Pro5145–57-40,30,20,546 %2,3870 %
4Mistral Large 24945–54+10,50,81,288 %3,7859 %

Wirtschaftsrecht · 24 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,1 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,57 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58076–84+50,51,11,6100 %0,5774 %
2Claude Opus 4.77265–78-30,62,32,9100 %1,6271 %
3Mistral Large 25143–58-11,52,03,5100 %4,3258 %
4Gemini 2.5 Pro4437–51-61,20,61,792 %4,6944 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).