AI-Roundtable Leaderboard
Ranking-Lauf · 11.05.2026

Ranking-Lauf 11.05.2026

Claude Opus 4.7 führt mit 75/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (69) · Medizin: GPT-5 (84) · Jura: Claude Opus 4.7 (79) · Wirtschaftsrecht: GPT-5 (74).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260511T051320-09184c
Gestartet
2026-05-11 05:13 UTC
Items
99 (Steuerrecht 24, Medizin 27, Jura 24, Wirtschaftsrecht 24)
Modelle
4
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
73.04 USD
Judge-Übereinstimmung
67 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7017 / 267572–78-1551,42—
2GPT-5029 / 517066–74-3610,73—
3Gemini 2.5 Pro020 / 244743–51+3684,70—
4Mistral Large 2019 / 884338–48-2404,30—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 24 Items

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,7 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 2,0 pro Antwort. Auf die Antwortlänge bezogen: 1,86 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,97.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.76963–76-20,71,72,4100 %1,8679 %
2GPT-55141–60-41,51,32,896 %0,9770 %
3Gemini 2.5 Pro3124–38-11,40,72,096 %8,6565 %
4Mistral Large 2118–15+22,41,64,0100 %8,2262 %

Medizin · 27 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,7 pro Antwort. Auf die Antwortlänge bezogen: 0,72 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58480–87+20,30,71,0100 %0,7277 %
2Claude Opus 4.78276–86-10,31,01,3100 %1,2379 %
3Mistral Large 26762–70+30,60,71,2100 %2,0566 %
4Gemini 2.5 Pro5348–59-10,40,30,767 %3,0171 %

Jura · 24 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 79 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,01 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,53.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77973–84+20,30,70,979 %1,0178 %
2GPT-57166–76-20,30,70,975 %0,5372 %
3Gemini 2.5 Pro5549–61+40,30,20,425 %1,8570 %
4Mistral Large 24742–52-70,60,71,392 %4,2560 %

Wirtschaftsrecht · 24 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,1 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,60 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57467–80-50,51,11,6100 %0,6063 %
2Claude Opus 4.76965–75-20,71,92,5100 %1,4262 %
3Gemini 2.5 Pro4638–54+81,10,92,092 %5,0657 %
4Mistral Large 24537–54-71,31,93,1100 %3,8151 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).