AI-Roundtable Leaderboard
Medizin · Lauf vom 10.09.2026

Medizin: Claude Opus 5 führt mit 92/100

14 Modelle auf 30 realen Medizin-Fällen, bewertet von 4 unabhängigen Judge-Modellen gegen hinterlegte Soll-Fakten. Lauf vom 10. Sep 2026. Der Strich im Konfidenzintervall entscheidet, ob eine Reihenfolge belastbar ist.

Platz 1–7 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Im Bereich Medizin widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,65 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,24.

#Modelltop10095 % CIΔ Vorlaufwiderspricht Soll-Faktzusätzl. falsch/unbelegtpro 1000 Tok.
1Claude Opus 59287–96+20,21,90,65
2Claude Fable 5.18883–92-20,21,30,71
3GLM-5.38782–91+30,21,40,35
4Kimi K38781–9100,21,30,50
5Claude Opus 4.78580–8900,11,11,25
6GPT-58478–90-10,31,00,41
7GPT-5.6 Sol8379–8800,20,60,78
8GPT-6 Astra8278–85-20,30,71,14
9Claude Opus 4.88175–8600,20,70,87
10Grok 4.57065–7600,10,31,59
11DeepSeek V4 Pro6860–74-20,20,30,24
12Mistral Large 26560–70-30,31,22,85
13Grok 4.66458–70+20,20,42,42
14Gemini 3.1 Pro6054–6500,10,31,90

Alle Werte pro Antwort. „widerspricht Soll-Fakt" = aktiver Widerspruch zu einem hinterlegten Fakt (nachweislich falsch); „zusätzl. falsch/unbelegt" = vom Judge-Panel markierte Behauptungen außerhalb der Rubrik (Vereinigung über die Judges; unbelegt zählt mit). Definition: Methodik. Vollständiger Lauf: run-20260910T064154-bada0b.

← Alle vier Domänen auf der Startseite · Alle Läufe · Feed (Atom)