AI-Roundtable Leaderboard
Steuerrecht · Lauf vom 10.09.2026

Steuerrecht: Claude Opus 5 führt mit 89/100

14 Modelle auf 31 realen Steuerrecht-Fällen, bewertet von 4 unabhängigen Judge-Modellen gegen hinterlegte Soll-Fakten. Lauf vom 10. Sep 2026. Der Strich im Konfidenzintervall entscheidet, ob eine Reihenfolge belastbar ist.

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Steuerrecht widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 3,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,59 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,26.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtpro 1000 Tok.
1Claude Opus 58985–92+70,33,90,59
2Claude Fable 5.18174–87+60,43,60,67
3GPT-6 Astra7468–79+50,31,60,98
4Claude Opus 4.77369–7700,42,72,31
5GPT-5.6 Sol7368–78+50,31,50,52
6Claude Opus 4.87166–76+20,31,71,38
7GPT-56557–73+30,82,00,45
8GLM-5.3 n=95942–71+131,33,80,54
9Grok 4.55853–63+30,40,93,61
10Kimi K3 n=155843–71-61,23,10,49
11Grok 4.65346–58-70,61,34,72
12Gemini 3.1 Pro4943–54+40,40,64,22
13DeepSeek V4 Pro4841–54-20,81,50,26
14Mistral Large 22721–33-21,41,97,22

Alle Werte pro Antwort. „widerspricht Soll-Fakt" = aktiver Widerspruch zu einem hinterlegten Fakt (nachweislich falsch); „zusätzl. falsch/unbelegt" = vom Judge-Panel markierte Behauptungen außerhalb der Rubrik (Vereinigung über die Judges; unbelegt zählt mit). Definition: Methodik. Vollständiger Lauf: run-20260910T064154-bada0b.

← Alle vier Domänen auf der Startseite · Alle Läufe · Feed (Atom)