AI-Roundtable Leaderboard
Ranking-Lauf · 10.05.2026

Ranking-Lauf 10.05.2026

Claude Opus 4.7 führt mit 78/100 über alle Domänen. Steuerrecht: GPT-5 (90) · Medizin: Claude Opus 4.7 (86) · Jura: Claude Opus 4.7 (80) · Wirtschaftsrecht: Claude Opus 4.7 (74).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260510T164305-2c7b16
Gestartet
2026-05-10 16:43 UTC
Items
33 (Steuerrecht 8, Medizin 9, Jura 8, Wirtschaftsrecht 8)
Modelle
4
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
16.65 USD
Judge-Übereinstimmung
74 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7019 / 307874–82+1541,47—
2GPT-5 n=16/331729 / 377669–83-2810,48—
3Mistral Large 2018 / 3704538–54-1384,30—
4Gemini 2.5 Pro n=5/332833 / 351510–23-17961,61—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 1 Items

Im Bereich Steuerrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,0 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 0 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,00 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-59090–90—0,00,00,00 %0,0071 %
2Claude Opus 4.77164–80+50,52,02,5100 %1,8987 %
3Gemini 2.5 Pro1213–13+120,00,30,3100 %3,92100 %
4Mistral Large 2128–15+32,51,33,8100 %8,3657 %

Medizin · 9 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,1 pro Antwort. Auf die Antwortlänge bezogen: 1,10 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,70.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78681–9200,30,81,1100 %1,1079 %
2GPT-58276–88-20,10,91,078 %0,7068 %
3Mistral Large 26655–76-20,71,01,7100 %2,7067 %
4Gemini 2.5 Pro1913–29-240,00,10,133 %1,0592 %

Jura · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 88 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,0 pro Antwort. Auf die Antwortlänge bezogen: 1,23 pro 1000 Ausgabe-Tokens, am niedrigsten Gemini 2.5 Pro mit 0,00.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78072–88+20,40,71,188 %1,2380 %
2GPT-56555–77-50,00,50,567 %0,2958 %
3Mistral Large 24941–57-40,80,41,275 %3,5256 %
4Gemini 2.5 Pro77–7-310,00,00,00 %0,0089 %

Wirtschaftsrecht · 8 Items

Im Bereich Wirtschaftsrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,2 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 1,52 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77465–83-40,52,22,7100 %1,5274 %
2Mistral Large 25341–62+31,41,83,2100 %3,7459 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).