AI-Roundtable Leaderboard
Wirtschaftsrecht · Lauf vom 10.09.2026

Wirtschaftsrecht: Claude Opus 5 führt mit 80/100

14 Modelle auf 30 realen Wirtschaftsrecht-Fällen, bewertet von 4 unabhängigen Judge-Modellen gegen hinterlegte Soll-Fakten. Lauf vom 10. Sep 2026. Der Strich im Konfidenzintervall entscheidet, ob eine Reihenfolge belastbar ist.

Platz 1–9 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Wirtschaftsrecht widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 3,2 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,47 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,25.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtpro 1000 Tok.
1Claude Opus 58074–86-10,53,20,47
2GPT-58072–86-10,31,50,33
3Claude Opus 4.77873–82-10,22,82,06
4GPT-5.6 Sol7872–84+20,31,10,56
5GPT-6 Astra7569–82-10,31,20,93
6Kimi K3 n=247465–82+10,53,10,50
7Claude Fable 5.17365–8100,63,20,81
8Grok 4.66962–75+50,41,02,77
9GLM-5.3 n=116855–78-110,63,60,35
10Claude Opus 4.86762–74+10,51,91,56
11Grok 4.56761–71-10,20,82,28
12DeepSeek V4 Pro5952–67+10,51,40,25
13Mistral Large 25952–66+40,42,13,93
14Gemini 3.1 Pro4942–56-20,70,95,07

Alle Werte pro Antwort. „widerspricht Soll-Fakt" = aktiver Widerspruch zu einem hinterlegten Fakt (nachweislich falsch); „zusätzl. falsch/unbelegt" = vom Judge-Panel markierte Behauptungen außerhalb der Rubrik (Vereinigung über die Judges; unbelegt zählt mit). Definition: Methodik. Vollständiger Lauf: run-20260910T064154-bada0b.

← Alle vier Domänen auf der Startseite · Alle Läufe · Feed (Atom)