AI-Roundtable Leaderboard
Ranking-Lauf · 15.06.2026

Ranking-Lauf 15.06.2026

Claude Opus 4.7 führt mit 79/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (75) · Medizin: Claude Opus 4.7 (85) · Jura: Claude Opus 4.7 (80) · Wirtschaftsrecht: GPT-5 (80).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260615T043639-30c761
Gestartet
2026-06-15 04:36 UTC
Items
100 (Steuerrecht 15, Medizin 20, Jura 35, Wirtschaftsrecht 30)
Modelle
6
Judges
GPT-5, Claude Opus 4.8, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-17-v1
Code-Version
0.2.4
Pipeline-Kosten
72.01 USD
Judge-Übereinstimmung
67 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7019 / 287976–82-2561,59—
2Claude Opus 4.8017 / 297471–770730,89—
2GPT-5023 / 427470–78-3690,65—
3Gemini 2.5 Pro019 / 235450–580823,17—
4Mistral Large 2010 / 664944–54-1474,46—
5Grok 4.308 / 104844–52+1764,58—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 15 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,5 pro Antwort. Auf die Antwortlänge bezogen: 1,76 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,75.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77568–81-20,32,02,3100 %1,7668 %
2Claude Opus 4.86660–73-30,51,11,6100 %1,2073 %
3GPT-55946–70-81,10,92,0100 %0,7555 %
4Gemini 2.5 Pro3827–48+31,10,61,593 %6,8853 %
5Mistral Large 23020–41+51,52,03,5100 %7,2957 %
6Grok 4.32617–3601,71,02,7100 %11,3758 %

Medizin · 20 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,21 pro 1000 Ausgabe-Tokens, am niedrigsten Claude Opus 4.8 mit 0,65.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78580–90-10,50,81,2100 %1,2175 %
2GPT-58073–86-20,50,40,980 %0,6677 %
3Claude Opus 4.87971–87-10,30,40,775 %0,6568 %
4Mistral Large 26963–75+30,40,71,195 %2,1874 %
5Gemini 2.5 Pro6154–68+40,10,10,240 %0,9870 %
6Grok 4.35247–58-10,30,20,455 %2,0575 %

Jura · 35 Items

Platz 1–3 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 74 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,26 pro 1000 Ausgabe-Tokens, am niedrigsten Claude Opus 4.8 mit 0,62.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.78075–85-40,30,71,074 %1,2681 %
2Claude Opus 4.88075–84+10,20,40,666 %0,6277 %
3GPT-57365–79-10,50,61,180 %0,6974 %
4Gemini 2.5 Pro5954–64-30,20,20,440 %1,9371 %
5Grok 4.35146–55+30,30,20,440 %2,8364 %
6Mistral Large 24234–49-51,30,71,980 %6,3266 %

Wirtschaftsrecht · 30 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 90 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,54 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58075–85-30,40,91,290 %0,5468 %
2Claude Opus 4.77772–82+10,72,02,7100 %1,9272 %
3Claude Opus 4.86862–74+10,51,11,693 %1,0659 %
4Mistral Large 25448–60-30,81,52,397 %3,6252 %
5Grok 4.35348–58+20,50,61,190 %3,8161 %
6Gemini 2.5 Pro5247–58+10,60,51,080 %3,7561 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).