AI-Roundtable Leaderboard
Ranking-Lauf · 10.05.2026

Ranking-Lauf 10.05.2026

Claude Opus 4.7 führt mit 76/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (71) · Medizin: Claude Opus 4.7 (83) · Jura: Claude Opus 4.7 (77) · Wirtschaftsrecht: GPT-5 (79).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260510T190628-59fc01
Gestartet
2026-05-10 19:06 UTC
Items
33 (Steuerrecht 8, Medizin 9, Jura 8, Wirtschaftsrecht 8)
Modelle
4
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
24.58 USD
Judge-Übereinstimmung
69 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7017 / 317671–80-1531,48—
2GPT-5029 / 387367–78+6650,62—
3Mistral Large 2033 / 3694536–54-1394,43—
4Gemini 2.5 Pro020 / 244438–50+23724,14—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,6 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,8 pro Antwort. Auf die Antwortlänge bezogen: 1,70 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,89.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77161–80+30,61,72,3100 %1,7080 %
2GPT-55544–68+131,41,12,5100 %0,8975 %
3Gemini 2.5 Pro3219–46+321,30,81,8100 %7,7361 %
4Mistral Large 294–13+22,91,34,2100 %9,8758 %

Medizin · 9 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,5 pro Antwort. Auf die Antwortlänge bezogen: 0,89 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,60.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78373–90+10,30,60,9100 %0,8979 %
2GPT-58275–88-10,20,70,989 %0,6077 %
3Mistral Large 26452–76-40,31,01,3100 %2,2374 %
4Gemini 2.5 Pro5447–61+250,30,30,567 %2,1669 %

Jura · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,41 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,26.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77769–85-50,30,91,2100 %1,4183 %
2GPT-57366–80+90,00,50,575 %0,2668 %
3Mistral Large 25447–63+10,40,61,088 %3,0162 %
4Gemini 2.5 Pro5143–61+340,30,20,450 %1,9575 %

Wirtschaftsrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,3 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,60 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-57973–86+30,41,31,7100 %0,6075 %
2Claude Opus 4.77163–80-30,62,63,2100 %1,7163 %
3Mistral Large 25239–6501,32,13,3100 %3,9557 %
4Gemini 2.5 Pro3827–53+181,40,41,7100 %4,4246 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).