AI-Roundtable Leaderboard
Ranking-Lauf · 16.05.2026

Ranking-Lauf 16.05.2026

Claude Opus 4.7 führt mit 78/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (69) · Medizin: GPT-5 (85) · Jura: Claude Opus 4.7 (85) · Wirtschaftsrecht: GPT-5 (79).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260516T101429-0435c4
Gestartet
2026-05-16 10:14 UTC
Items
33 (Steuerrecht 8, Medizin 9, Jura 8, Wirtschaftsrecht 8)
Modelle
5
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
28.65 USD
Judge-Übereinstimmung
70 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7021 / 367873–83+3531,50—
2GPT-5030 / 447368–79+3590,74—
3Gemini 2.5 Pro020 / 244640–52+1724,17—
4Mistral Large 2016 / 3684436–52-2444,06—
5Grok 4.309 / 174133–49—694,83—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,9 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 2,0 pro Antwort. Auf die Antwortlänge bezogen: 2,24 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,81.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.76961–76+10,91,92,8100 %2,2478 %
2GPT-56148–73+80,91,52,4100 %0,8180 %
3Gemini 2.5 Pro2616–40-41,30,82,088 %9,1765 %
4Grok 4.3188–28—1,60,52,188 %8,5459 %
5Mistral Large 2137–1902,31,43,6100 %7,3252 %

Medizin · 9 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,1 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 0,81 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58579–90+50,21,11,3100 %0,8180 %
2Claude Opus 4.78170–89-10,20,91,189 %1,0984 %
3Mistral Large 26859–77+10,30,91,2100 %2,1873 %
4Gemini 2.5 Pro5245–58-20,20,40,678 %2,4169 %
5Grok 4.35247–59—0,20,30,644 %2,5974 %

Jura · 8 Items

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,1 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 63 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 0,1 pro Antwort. Auf die Antwortlänge bezogen: 0,83 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,60.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78580–90+80,10,60,763 %0,8392 %
2GPT-56856–79+20,50,61,075 %0,6066 %
3Gemini 2.5 Pro5343–65+20,40,20,425 %1,9769 %
4Mistral Large 24941–5800,40,61,088 %3,2865 %
5Grok 4.34835–59—0,00,10,113 %0,6568 %

Wirtschaftsrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,6 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,2 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,5 pro Antwort. Auf die Antwortlänge bezogen: 0,69 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57971–87-10,61,21,8100 %0,6970 %
2Claude Opus 4.77768–84+50,82,22,9100 %1,5479 %
3Gemini 2.5 Pro5041–59+60,90,71,588 %3,8263 %
4Grok 4.34428–61—1,50,62,1100 %5,2261 %
5Mistral Large 24330–55-81,61,53,2100 %3,8348 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).