AI-Roundtable Leaderboard
Ranking-Lauf · 12.05.2026

Ranking-Lauf 12.05.2026

Claude Opus 4.7 führt mit 77/100 über alle Domänen. Steuerrecht: Claude Opus 4.7 (68) · Medizin: GPT-5 (86) · Jura: Claude Opus 4.7 (78) · Wirtschaftsrecht: Claude Opus 4.7 (75).

Status
Entwicklungslauf — nicht im Feed, nicht auf der Startseite (Roster-Test / Zwischenlauf)
Lauf
run-20260512T135155-40f852
Gestartet
2026-05-12 13:51 UTC
Items
33 (Steuerrecht 8, Medizin 9, Jura 8, Wirtschaftsrecht 8)
Modelle
4
Judges
GPT-5, Claude Opus 4.7, Mistral Large 2
Frage-Bank
2026-05-08-pilot
Code-Version
0.1.0
Pipeline-Kosten
24.38 USD
Judge-Übereinstimmung
68 %

Gesamt über alle Domänen

#Modelltop10095 % CIΔ VorlaufAusfälleSek. Median/p90Hallu-Bandpro 1000 Tok.Δ eigene Familie
1Claude Opus 4.7017 / 267771–81-1541,45—
2GPT-5046 / 716963–76-3630,67—
3Gemini 2.5 Pro022 / 284740–54-2724,20—
3Mistral Large 2016 / 3724740–55-2453,99—

Δ Vorlauf = Differenz zum vorherigen publizierten Lauf; „—" = Modell war dort nicht dabei. Hallu-Band: 100 = keine, 0 = ≥ 4 Falschbehauptungen pro Antwort. Pro 1000 Tok. = markierte Behauptungen je 1000 Ausgabe-Tokens (längen-normiert). Δ eigene Familie = Score mit allen Judges minus Score nur mit anbieterfremden Judges, in Punkten; positiv = die eigene Familie bewertet großzügiger; „—" = vor code_version 0.2.8 nicht erfasst oder kein fremder Judge (Methodik §4, §6.5).

Steuerrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,6 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GPT-5 mit Ø 2,1 pro Antwort. Auf die Antwortlänge bezogen: 1,95 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,75.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.76860–76+10,62,02,6100 %1,9580 %
2GPT-55645–67+61,01,12,1100 %0,7573 %
3Gemini 2.5 Pro2514–35-61,50,72,2100 %9,9264 %
4Mistral Large 21710–2502,01,33,3100 %7,1561 %

Medizin · 9 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht GPT-5 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 0,67 pro 1000 Ausgabe-Tokens.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1GPT-58681–91+40,30,60,9100 %0,6780 %
2Claude Opus 4.78580–90+30,20,60,889 %0,7979 %
3Mistral Large 26964–75+20,60,61,189 %1,9867 %
4Gemini 2.5 Pro5646–66-10,10,10,333 %1,1471 %

Jura · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,1 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 75 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,01 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,80.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77868–86-70,10,70,875 %1,0174 %
2GPT-56047–69-120,60,81,588 %0,8068 %
3Gemini 2.5 Pro5545–65-50,50,10,450 %1,8170 %
4Mistral Large 24844–52-80,50,81,388 %3,7558 %

Wirtschaftsrecht · 8 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,8 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,4 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GPT-5 mit Ø 1,4 pro Antwort. Auf die Antwortlänge bezogen: 1,71 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,49.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtØ gesamtAntworten betroffenpro 1000 Tok.IRR
1Claude Opus 4.77565–86-20,82,43,2100 %1,7179 %
2GPT-57564–85-90,50,91,4100 %0,4964 %
3Mistral Large 25239–63-11,12,03,2100 %3,9350 %
4Gemini 2.5 Pro5040–58+51,10,71,6100 %4,2957 %

Roh-Daten dieses Laufs

raw.jsonl und progress.jsonl sind die öffentlichen, um Antworttexte bereinigten Streams (Kontaminationsschutz, Methodik §7).