AI-Roundtable Leaderboard
Ranking-Lauf · 12.05.2026

Ranking-Lauf 12.05.2026

Claude Opus 4.7 führt mit 78/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (67) · Medizin: Claude Opus 4.7 (82) · Jura: Claude Opus 4.7 (85) · Wirtschaftsrecht: GPT-5 (84).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260512T105829-f0ac95
Gestartet
2026-05-12 10:58 UTC
Items
33 (Steuerrecht 8, Medizin 9, Jura 8, Wirtschaftsrecht 8)
Modelle
4
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
24.58 USD
Judge-Übereinstimmung
71 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7017 / 257873–82+1491,59—
2GPT-5031 / 507265–79-1640,66—
3Gemini 2.5 Pro023 / 274942–55+1734,18—
3Mistral Large 2017 / 3664941–57+1423,91—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,8 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 2,0 pro Antwort. Auf die Antwortlänge bezogen: 2,01 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,91.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.76757–75-40,82,02,8100 %2,0183 %
2GPT-55035–63-131,31,32,5100 %0,9165 %
3Gemini 2.5 Pro3118–46-11,30,72,088 %8,8171 %
4Mistral Large 2179–25+52,41,53,9100 %8,7554 %

Medizin · 9 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,7 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,5 pro Antwort. Auf die Antwortlänge bezogen: 1,55 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,76.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78273–88-30,70,91,6100 %1,5582 %
2GPT-58275–89-30,30,71,0100 %0,7676 %
3Mistral Large 26759–74-30,40,91,3100 %2,0075 %
4Gemini 2.5 Pro5745–68+30,20,30,567 %2,0463 %

Jura · 8 Items

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,0 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 75 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,1 pro Antwort. Auf die Antwortlänge bezogen: 0,98 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,35.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78581–90+50,00,80,875 %0,9889 %
2GPT-57263–81+80,10,50,675 %0,3572 %
3Gemini 2.5 Pro6053–68+90,10,00,125 %0,3872 %
4Mistral Large 25650–6200,30,50,775 %2,0959 %

Wirtschaftsrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,3 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,57 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58479–90+70,41,31,6100 %0,5781 %
2Claude Opus 4.77771–84+60,62,32,9100 %1,5976 %
3Mistral Large 25338–64+41,42,13,5100 %3,8056 %
4Gemini 2.5 Pro4532–58-81,40,51,8100 %5,2360 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).