AI-Roundtable Leaderboard
Jura · Lauf vom 10.09.2026

Jura: Claude Fable 5.1 führt mit 91/100

14 Modelle auf 35 realen Jura-Fällen, bewertet von 4 unabhängigen Judge-Modellen gegen hinterlegte Soll-Fakten. Lauf vom 10. Sep 2026. Der Strich im Konfidenzintervall entscheidet, ob eine Reihenfolge belastbar ist.

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Jura widerspricht Claude Fable 5.1 (Score-Spitze) im Mittel in 0,0 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 0,60 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,11.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtpro 1000 Tok.
1Claude Fable 5.19188–93+40,01,70,60
2Claude Opus 59188–94+10,11,90,60
3Kimi K3 n=348176–86+30,21,70,40
4Claude Opus 4.88076–84-10,00,70,80
5Claude Opus 4.77973–85-20,21,11,48
6GPT-57770–83+20,21,00,28
7GPT-5.6 Sol7772–82+20,10,80,55
8GPT-6 Astra7367–79+20,31,01,23
9GLM-5.3 n=327060–79-90,72,00,32
10Grok 4.56559–70-30,20,42,84
11Grok 4.66456–71+10,30,43,36
12DeepSeek V4 Pro6154–68+20,30,40,11
13Gemini 3.1 Pro5952–64-40,20,33,12
14Mistral Large 24335–51-21,01,17,15

Alle Werte pro Antwort. „widerspricht Soll-Fakt" = aktiver Widerspruch zu einem hinterlegten Fakt (nachweislich falsch); „zusätzl. falsch/unbelegt" = vom Judge-Panel markierte Behauptungen außerhalb der Rubrik (Vereinigung über die Judges; unbelegt zählt mit). Definition: Methodik. Vollständiger Lauf: run-20260910T064154-bada0b.

← Alle vier Domänen auf der Startseite · Alle Läufe · Feed (Atom)