AI-Roundtable Leaderboard
Ranking-Lauf · 10.05.2026

Ranking-Lauf 10.05.2026

Claude Opus 4.7 führt mit 77/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (68) · Medizin: GPT-5 (83) · Jura: Claude Opus 4.7 (82) · Wirtschaftsrecht: GPT-5 (76).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260510T175034-5e294d
Gestartet
2026-05-10 17:50 UTC
Items
33 (Steuerrecht 8, Medizin 9, Jura 8, Wirtschaftsrecht 8)
Modelle
4
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
21.23 USD
Judge-Übereinstimmung
75 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7020 / 327773–80-1521,50—
2GPT-5034 / 466759–75-9600,74—
3Mistral Large 2016 / 3684637–55+1384,44—
4Gemini 2.5 Pro n=11/332218 / 342113–30+6971,17—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 8 Items

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,6 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,0 pro Antwort. Auf die Antwortlänge bezogen: 1,82 pro 1000 Ausgabe-Tokens, am niedrigsten Gemini 2.5 Pro mit 0,00.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.76863–73-30,61,82,5100 %1,8281 %
2GPT-54226–57-482,01,03,0100 %1,1170 %
3Mistral Large 272–13-52,81,74,5100 %9,9656 %
4Gemini 2.5 Pro00–0-120,00,00,00 %0,00100 %

Medizin · 9 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,5 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 0,62 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58373–92+10,40,50,9100 %0,6272 %
2Claude Opus 4.78277–87-40,21,01,2100 %1,1983 %
3Mistral Large 26861–75+20,31,01,3100 %2,2075 %
4Gemini 2.5 Pro2919–40+100,00,20,240 %1,7388 %

Jura · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,1 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,0 pro Antwort. Auf die Antwortlänge bezogen: 1,47 pro 1000 Ausgabe-Tokens, am niedrigsten Gemini 2.5 Pro mit 0,00.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78276–87+20,31,11,4100 %1,4776 %
2GPT-56449–78-10,50,51,075 %0,5270 %
3Mistral Large 25349–56+40,50,91,4100 %3,9763 %
4Gemini 2.5 Pro177–34+100,00,00,00 %0,0078 %

Wirtschaftsrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,6 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,0 pro Antwort. Auf die Antwortlänge bezogen: 0,59 pro 1000 Ausgabe-Tokens, am niedrigsten Gemini 2.5 Pro mit 0,00.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57669–83—0,60,91,5100 %0,5974 %
2Claude Opus 4.77465–8200,62,12,7100 %1,4878 %
3Mistral Large 25242–64-11,11,62,7100 %3,4255 %
4Gemini 2.5 Pro2020–20—0,00,00,00 %0,0080 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).