AI-Roundtable Leaderboard
Ranking-Lauf · 10.05.2026

Ranking-Lauf 10.05.2026

Claude Opus 4.7 führt mit 77/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (66) · Medizin: Claude Opus 4.7 (86) · Jura: Claude Opus 4.7 (78) · Wirtschaftsrecht: Claude Opus 4.7 (78).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260510T121001-e3a863
Gestartet
2026-05-10 12:10 UTC
Items
33 (Steuerrecht 8, Medizin 9, Jura 8, Wirtschaftsrecht 8)
Modelle
4
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
17.13 USD
Judge-Übereinstimmung
75 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1GPT-5 n=16/331717 / 247872–84—770,65—
2Claude Opus 4.7020 / 347772–82—491,61—
3Mistral Large 2015 / 794636–55—414,40—
4Gemini 2.5 Pro n=9/332416 / 333219–47—980,73—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 8 Items

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 1,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,5 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,0 pro Antwort. Auf die Antwortlänge bezogen: 2,16 pro 1000 Ausgabe-Tokens, am niedrigsten Gemini 2.5 Pro mit 0,00.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.76659–73—1,41,52,9100 %2,1677 %
2Mistral Large 293–15—2,51,74,2100 %8,4364 %
3Gemini 2.5 Pro00–0—0,00,00,00 %0,00100 %

Medizin · 9 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,43 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,86.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78678–93—0,31,01,4100 %1,4390 %
2GPT-58478–90—0,40,71,189 %0,8679 %
3Mistral Large 26858–77—0,21,01,289 %2,0071 %
4Gemini 2.5 Pro4327–58—0,00,20,250 %1,2878 %

Jura · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 88 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,0 pro Antwort. Auf die Antwortlänge bezogen: 1,29 pro 1000 Ausgabe-Tokens, am niedrigsten Gemini 2.5 Pro mit 0,00.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77870–85—0,30,81,188 %1,2979 %
2GPT-57063–78—0,10,50,686 %0,4261 %
3Mistral Large 25349–58—0,50,81,388 %3,9858 %
4Gemini 2.5 Pro3811–59—0,00,00,00 %0,0079 %

Wirtschaftsrecht · 8 Items

Im Bereich Wirtschaftsrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,3 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,0 pro Antwort. Auf die Antwortlänge bezogen: 1,46 pro 1000 Ausgabe-Tokens, am niedrigsten Gemini 2.5 Pro mit 0,00.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77868–88—0,52,32,8100 %1,4670 %
2Mistral Large 25034–65—1,31,62,9100 %4,0356 %
3Gemini 2.5 Pro77–7—0,00,00,00 %0,0090 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).