AI-Roundtable Leaderboard
Ranking-Lauf · 12.05.2026

Ranking-Lauf 12.05.2026

Claude Opus 4.7 führt mit 77/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (71) · Medizin: Claude Opus 4.7 (85) · Jura: Claude Opus 4.7 (80) · Wirtschaftsrecht: GPT-5 (77).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260512T081552-d5fb45
Gestartet
2026-05-12 08:15 UTC
Items
33 (Steuerrecht 8, Medizin 9, Jura 8, Wirtschaftsrecht 8)
Modelle
4
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
24.58 USD
Judge-Übereinstimmung
70 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7017 / 277772–81+2511,56—
2GPT-5029 / 477365–79+3590,72—
3Gemini 2.5 Pro023 / 284842–54+1714,42—
3Mistral Large 2015 / 844839–56+5454,00—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,6 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,9 pro Antwort. Auf die Antwortlänge bezogen: 2,07 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,80.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77164–79+20,62,02,6100 %2,0782 %
2GPT-56349–76+120,91,52,3100 %0,8077 %
3Gemini 2.5 Pro3220–46+11,30,71,988 %7,7965 %
4Mistral Large 2127–17+12,51,13,5100 %7,7460 %

Medizin · 9 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 0,84 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,76.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78575–93+30,20,70,9100 %0,8484 %
2GPT-58578–92+10,30,71,189 %0,7680 %
3Mistral Large 27064–77+30,21,21,4100 %2,2280 %
4Gemini 2.5 Pro5444–63+10,40,30,667 %2,4370 %

Jura · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,1 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 88 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,12 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,68.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78075–85+10,10,91,088 %1,1287 %
2GPT-56444–77-70,90,51,375 %0,6870 %
3Mistral Large 25648–65+90,40,50,975 %2,9560 %
4Gemini 2.5 Pro5141–58-40,40,10,438 %1,9764 %

Wirtschaftsrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,6 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,1 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,64 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57768–84+30,61,11,8100 %0,6471 %
2Claude Opus 4.77163–81+20,62,83,4100 %1,8960 %
3Gemini 2.5 Pro5338–65+70,90,91,8100 %4,9255 %
4Mistral Large 24939–59+41,11,92,9100 %3,8551 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).