AI-Roundtable Leaderboard
AI-Roundtable Leaderboard Stand: 10.09.26 Nächster Test: 01.10.26

Ranking der aktuell verlässlichsten KI-Systeme für Steuer, Medizin und Recht.

Reproduzierbare KI-Modell-Bewertung für Berufsträger — monatlich neu. Kein einzelnes Modell ist überall vorn: der pro-Frage-Beste wechselt.

Welches KI-Modell ist diese Woche das richtige für meinen Mandatsfall, meine Diagnose, meinen Vertrag? Der AI-Roundtable Leaderboard liefert die belastbare Antwort: monatlich publiziertes Ranking führender Sprachmodelle auf realen Fällen aus Steuerrecht, Medizin, Jura und Wirtschaftsrecht. Triple-Judge-Bewertung, Halluzinations-Erkennung, Bootstrap-Konfidenz­intervalle, vollständig auditierbare JSONL-Historie.

Jetzt abonnieren + Whitepaper-PDF erhalten (kostenfrei, monatlich)
Empfehlung · Lauf vom 10. Sep 2026
Claude Opus 5
88 von 100 Punkten sehr stark
↑ +2 Punkte stärker als im Vorlauf (86)
Stärkstes Modell in 3 von 4 Berufsfeldern (Ausnahme: Jura → Claude Fable 5.1).
4 unabhängige KI-Gutachter, solide Bewertungs-Konsistenz (Übereinstimmung 74%).
Antwortzeit im Median 63 s — Platz 9 von 14 im Tempo (schnellstes: Mistral Large 2, 8 s).
ACHTUNG! Die Wertungszahl pro Modell kann täuschen! Auch das beste Modell wechselt von Frage zu Frage — auch innerhalb derselben Domäne seine Leistung. Selbst das „Orakel" (pro Frage immer das jeweils beste Modell) erreicht über alle Domänen nur ⌀ 93/100 — kein Einzelmodell kommt da heran, und ein harter Rest bleibt ungelöst. Warum das wichtig ist...? →
Stand & Caveats zum aktuellen Lauf Lauf vom 10. Sep 2026
Stand: Lauf vom 10. Sep 2026, 126 Items, alle aktivierten Domänen. 31 publizierte Läufe seit Mai 2026; Trend-Aussagen im Verlaufs-Chart ab Lauf #4. Methodik vollständig, Roh-JSONL transparent im Audit-Trail einsehbar.
Vollständige Coverage: GLM-5.3 antwortete auf 82/126 Items (44 Ausfälle, davon 24 Timeouts · Antwortzeit Median 126 s, p90 409 s); Kimi K3 antwortete auf 103/126 Items (23 Ausfälle, davon 23 Timeouts · Antwortzeit Median 146 s, p90 272 s). Diagnose-Diff im Audit-Trail mit finish_reason=MAX_TOKENS dokumentiert.

Rangliste — Querschnitt über alle Domänen

Alle getesteten Modelle nach top100-Score als Querschnitt über alle vier Domänen (Steuerrecht, Medizin, Jura, Wirtschaftsrecht). Der Strich auf jedem Balken ist das 95-%-Bootstrap-Konfidenzintervall — überlappen sich zwei Striche, ist die Reihenfolge nicht belastbar (siehe Methodik). Die domänenspezifische Aufschlüsselung folgt weiter unten — sie zeigt, dass die Reihenfolge sich pro Themenfeld i.d.R. unterscheidet. Daher sollten Sie nie einem einzigen Modell vertrauen! Das Kürzel R vor dem Balken nennt den Denkmodus (Reasoning), mit dem das Modell lief — immer der Hersteller-Standard, nichts abgeschaltet, nichts aufgedreht (siehe Methodik).

AI-ROUNDTABLE LEADERBOARD ranking.ai-roundtable.de Stand: 2026-09-10 02550751001Claude Opus 5Denkmodus (Reasoning): an — adaptiv, das Modell wählt die Denktiefe pro Anfrage selbst (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R adaptiv882Claude Fable 5.1Denkmodus (Reasoning): an — adaptiv, das Modell wählt die Denktiefe pro Anfrage selbst (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R adaptiv833Claude Opus 4.7Denkmodus (Reasoning): aus. Das Modell hat keinen Denkmodus oder liefert ihn abgeschaltet aus; es läuft hier so, wie der Hersteller es ausliefert.R aus794GPT-5.6 SolDenkmodus (Reasoning): an — medium, mittlere Stufe (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R medium784Kimi K3Denkmodus (Reasoning): an — Standard, Hersteller-Standard ohne wählbare Stufe (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R Standard7823 Ausfälle, davon 23 Timeouts · Antwortzeit Median 146 s, p90 272 sn=103/1265GPT-5Denkmodus (Reasoning): an — medium, mittlere Stufe (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R medium765GPT-6 AstraDenkmodus (Reasoning): an — medium, mittlere Stufe (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R medium766Claude Opus 4.8Denkmodus (Reasoning): aus. Das Modell hat keinen Denkmodus oder liefert ihn abgeschaltet aus; es läuft hier so, wie der Hersteller es ausliefert.R aus756GLM-5.3Denkmodus (Reasoning): an — Standard, Hersteller-Standard ohne wählbare Stufe (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R Standard7544 Ausfälle, davon 24 Timeouts · Antwortzeit Median 126 s, p90 409 sn=82/1267Grok 4.5Denkmodus (Reasoning): an — high, hohe Stufe (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R high658Grok 4.6Denkmodus (Reasoning): an — high, hohe Stufe (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R high639DeepSeek V4 ProDenkmodus (Reasoning): an — Standard, Hersteller-Standard ohne wählbare Stufe (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R Standard5910Gemini 3.1 ProDenkmodus (Reasoning): an — adaptiv, das Modell wählt die Denktiefe pro Anfrage selbst (Hersteller-Standard). Denkmodus-Modelle bekommen mehr Rechenzeit pro Antwort als Modelle ohne; die Rangliste vergleicht Produkte im Auslieferungszustand, nicht Architekturen.R adaptiv5411Mistral Large 2Denkmodus (Reasoning): aus. Das Modell hat keinen Denkmodus oder liefert ihn abgeschaltet aus; es läuft hier so, wie der Hersteller es ausliefert.R aus48Balken = top100-Score · Strich = 95-%-Bootstrap-CI · blass = unvollständige Abdeckung · geteilter Rang nur bei identischem ScorePlatz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)R = Denkmodus im Hersteller-Standard: aus · low · medium · high · adaptiv · Standard

Score-Verlauf über alle Läufe

Quality-Score, Rang und Hersteller-Vergleich pro Modell über die publizierten Läufe. Ausgeschiedene Modelle bleiben grau sichtbar, Neuzugänge starten mit Markierung.

Score-Verlauf

wird vom Worker geladen …
Legende anklicken, um ein Modell hervorzuheben (zweiter Klick hebt auf, Doppelklick blendet aus). Zeigen auf das Chart liest alle Werte am nächsten Lauf ab.
Tabellenansicht aller Werte

Vier Domänen, 126 reale Fall-Items

Jeder Lauf bewertet alle aktivierten Modelle auf einer fixen, versionierten Frage-Bank (Steuerrecht 31 · Medizin 30 · Jura 35 · Wirtschaftsrecht 30). Die Items sind derzeit vollständig synthetisch und privat — sie werden nie publiziert, damit kein Anbieter sie ins Training aufnehmen kann. Pro Modell: Score (0–100) als Anteil korrekt belegter Soll-Fakten und darunter der Halluzinationsbalken (Skala 0–4 pro Antwort): dunkel = Widersprüche zu hinterlegten Soll-Fakten (nachweislich falsch), hell = zusätzliche Behauptungen, die das Judge-Panel als falsch oder unbelegt markiert. Zeigen oder Antippen blendet die Werte ein.

Steuerrecht · 31 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

vGA, Organschaft, § 8c KStG, Auslandsbezug — komplexe Mandatsfälle
Claude Opus 5R adaptiv89
Claude Fable 5.1R adaptiv81
GPT-6 AstraR medium74
Claude Opus 4.7R aus73
GPT-5.6 SolR medium73
Claude Opus 4.8R aus71
GPT-5R medium65
GLM-5.3R Standard59
Grok 4.5R high58
Kimi K3R Standard58
Grok 4.6R high53
Gemini 3.1 ProR adaptiv49
DeepSeek V4 ProR Standard48
Mistral Large 2R aus27

Im Bereich Steuerrecht widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 3,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,59 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,26.

Medizin · 30 Items

Platz 1–7 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Multimorbidität, Pharma-Interaktionen, atypische Symptompräsentation
Claude Opus 5R adaptiv92
Claude Fable 5.1R adaptiv88
GLM-5.3R Standard87
Kimi K3R Standard87
Claude Opus 4.7R aus85
GPT-5R medium84
GPT-5.6 SolR medium83
GPT-6 AstraR medium82
Claude Opus 4.8R aus81
Grok 4.5R high70
DeepSeek V4 ProR Standard68
Mistral Large 2R aus65
Grok 4.6R high64
Gemini 3.1 ProR adaptiv60

Im Bereich Medizin widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,65 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,24.

Jura · 35 Items

Platz 1–2 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Anspruchskonkurrenz, AGB-Inhaltskontrolle, Form-Mangel-Folgen
Claude Fable 5.1R adaptiv91
Claude Opus 5R adaptiv91
Kimi K3R Standard81
Claude Opus 4.8R aus80
Claude Opus 4.7R aus79
GPT-5R medium77
GPT-5.6 SolR medium77
GPT-6 AstraR medium73
GLM-5.3R Standard70
Grok 4.5R high65
Grok 4.6R high64
DeepSeek V4 ProR Standard61
Gemini 3.1 ProR adaptiv59
Mistral Large 2R aus43

Im Bereich Jura widerspricht Claude Fable 5.1 (Score-Spitze) im Mittel in 0,0 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 0,60 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,11.

Wirtschaftsrecht · 30 Items

Platz 1–9 statistisch gleichauf (95-%-CI überlappt mit Platz 1)

Vinkulierung, Stimmverbote, faktische Konzernhaftung
Claude Opus 5R adaptiv80
GPT-5R medium80
Claude Opus 4.7R aus78
GPT-5.6 SolR medium78
GPT-6 AstraR medium75
Kimi K3R Standard74
Claude Fable 5.1R adaptiv73
Grok 4.6R high69
GLM-5.3R Standard68
Claude Opus 4.8R aus67
Grok 4.5R high67
DeepSeek V4 ProR Standard59
Mistral Large 2R aus59
Gemini 3.1 ProR adaptiv49

Im Bereich Wirtschaftsrecht widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 3,2 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,47 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,25.

✓ Live-Daten · Auto-Refresh aus dem aktuell publizierten Lauf · erster Balken pro Domäne grün hervorgehoben, letzter rot · Aktualisierung mit jedem neuen Monats-Lauf.

Kein Modell ist überall vorn — warum eine Zahl pro Modell täuscht

Eine Domänen-Prozentzahl ist ein Mittel über viele Fragen. Pro Frage wechselt das beste Modell — auch innerhalb derselben Domäne. Das Orakel („Bester pro Frage": man wählte für jede Frage das jeweils stärkste Modell) ist eine Obergrenze, die man vorab nicht treffen kann — und selbst sie bleibt unter 100: ein harter Rest, den kein Modell löst.

92

Steuerrecht

Orakel 92 (Bester pro Frage) vs. bestes Einzelmodell 89 (Claude Opus 5) — kein Einzelmodell erreicht das Orakel (+3 Punkte), und das Orakel selbst bleibt unter 100.

96

Medizin

Orakel 96 (Bester pro Frage) vs. bestes Einzelmodell 92 (Claude Opus 5) — kein Einzelmodell erreicht das Orakel (+4 Punkte), und das Orakel selbst bleibt unter 100.

95

Jura

Orakel 95 (Bester pro Frage) vs. bestes Einzelmodell 91 (Claude Opus 5) — kein Einzelmodell erreicht das Orakel (+4 Punkte), und das Orakel selbst bleibt unter 100.

89

Wirtschaftsrecht

Orakel 89 (Bester pro Frage) vs. bestes Einzelmodell 80 (Claude Opus 5) — kein Einzelmodell erreicht das Orakel (+9 Punkte), und das Orakel selbst bleibt unter 100.

Der AI-Roundtable löst das Modell-Auswahlproblem: er erreicht zwar nicht das (theoretische) Orakel „Bester pro Frage", schlägt aber jedes vorab fix wählbare Einzelmodell zuverlässig — denn kein Modell ist über alle Fragen und Domänen konsistent das beste. Damit eliminiert AI-Roundtable das Modell-Auswahlrisiko des Anwenders und liefert ein über jedem fix wählbaren Solo-Modell liegendes Ergebnis. Methodik → Modell-Auswahl

Basis: voller publizierter Monats-Lauf, 30–35 Items/Domäne, alle Domänen — ausdrücklich nicht die kleine Gegenprobe-Stichprobe. Lauf vom 10. Sep 2026.

Höchste Sicherheit, wenn's drauf ankommt.

Wer im betrieblich-professionellen Umfeld auf KI setzt, kann es sich nicht leisten, mit dem falschen Modell zu arbeiten — eine erfundene Fundstelle, eine falsche Diagnose, ein verlegener Mandanten-Brief sind zu teuer. Der AI-Roundtable Leaderboard liefert jeden Monat die belastbare Antwort: Welches Modell ist für den nächsten Monat das richtige.

→

Klare Handlungs­empfehlung

Pro Lauf eine eindeutige Modell-Empfehlung pro Domäne — auf Basis von Score, Halluzinations-Rate und Konfidenz-Intervall. Keine Listen-Lektüre, sondern eine konkrete Empfehlung.

⟳

Zwei-wöchiger Rhythmus

Modell-Versionen ändern sich rapide. Der Leaderboard hält Sie automatisch aktuell — die Empfehlung von vor drei Monaten ist heute oft die falsche.

✓

Compliance-bewusst aufbereitet

Roh-Daten öffentlich, Methodik git-versioniert, Audit-Trail vollständig nachvollziehbar. Belegbar gegenüber Aufsicht, Prüfer und Mandant — Pflicht-Lektüre dort, wo Verlässlichkeit verlangt wird.

✉

Direkt ins Postfach

Snapshot der wichtigsten Bewegungen nach jedem Monats-Lauf automatisch im Postfach. Subject-Zeile zeigt das Top-Mover-Highlight. Monatlich kündbar, kein Account, kein Login.

Was den Leaderboard auszeichnet

Triple-Judge-Bewertung

Drei unabhängige Judge-Modelle aus drei verschiedenen Anbieter-Familien (Opus 4.7 · GPT-5 · Mistral Large 2) bewerten jede Antwort source-label-blinded. Inter-Rater-Agreement ist Teil des öffentlichen Audit-Werts.

Halluzinations-Erkennung

Jede frei erfundene Behauptung — falsches Aktenzeichen, frei erfundener Paragraph, nicht-existierende Studie — wird wortwörtlich extrahiert und in den Audit-Trail aufgenommen.

Bootstrap-Konfidenzintervalle

Pro Modell × Domäne 1000 Resamples auf den Cell-Scores. Veröffentlicht wird Score-Mittel + 95-%-Perzentil — kein Punktwert ohne Unsicherheits-Angabe.

Reproduzierbar bei T=0

Question-Bank git-versioniert, Modell-Konfig versioniert, deterministische Sampling-Parameter. Ein zweiter Lauf derselben Version produziert byte-identische Antworten.

Append-Only-Historie

Einmal publizierte Lauf-Ergebnisse werden nie modifiziert oder gelöscht. Methodik-Wechsel triggern eine neue Question-Bank-Version; alte Punkte bleiben unter ihrer Original-Version sichtbar.

Roh-Daten öffentlich

Pro Lauf liegt das vollständige JSONL — jede Modell-Antwort, jede Judge-Begründung — frei downloadbar im Audit-Trail. Kein Auth, keine Rate-Limits.

Perfekt in Kombination mit der AI-Roundtable App

Wer die App auf seinem Mac einsetzt, lässt mehrere Spitzen-Modelle gleichzeitig debattieren und sich gegenseitig prüfen. Der Leaderboard beantwortet die Frage davor: welche Modelle gehören in den Roundtable, und welches sollte den nächsten Monat die Schlüsselrolle übernehmen. Beide Produkte greifen ineinander.

Häufige Fragen

Die wichtigsten Einordnungs-Fragen zum Leaderboard — eingeklappt, klick zum Aufklappen. Wer tiefer einsteigen will, findet das vollständige Verfahren in der Methodik.

Es gibt auch andere Ranking-Studien, die ganz andere Ergebnisse liefern. Wie passt das zusammen?

Weil sie etwas anderes messen. Die großen öffentlichen Leaderboards bewerten meist generische Aufgaben — Multiple-Choice-Wissen (MMLU), Chat-Präferenz nach Bauchgefühl (LMArena), Coding-Aufgaben, fast durchweg auf Englisch. Der AI-Roundtable Leaderboard misst etwas sehr Schmales und Konkretes: deutschsprachige Berufsträger-Fälle aus Steuerrecht, Medizin, Jura und Wirtschaftsrecht, gegen von Hand hinterlegte Soll-Fakten, source-label-blinded von drei Judge-Familien geprüft.

Ein Modell, das eine generische englische Bestenliste anführt, kann auf einem § 8c-KStG-Mandatsfall oder einer Differentialdiagnose anders abschneiden — genau das zeigen unsere Domänen-Aufschlüsselungen. Drei Fragen entscheiden, ob zwei Rankings überhaupt vergleichbar sind: Was wird gemessen, auf welcher Aufgaben­art und Sprache, und zu welchem Datum (Modell-Versionen ändern sich rapide — daher unser Monats-Rhythmus). Unsere Antworten auf diese drei Fragen sind offengelegt und im Audit-Trail nachprüfbar; das ist der eigentliche Unterschied.

Hinzu kommt bei manuellen wissenschaftlichen Studien oft die Problematik, dass zwischen Durchführung und Veröffentlichung der (zumeist ernüchternden) Ergebnisse z.T. sehr lange Zeiträume von >1,5 Jahren liegen können. Das bedeutet die Studienveröffentlichungen die Sie aktuell vielleicht in den News gelesen haben beziehen sich damit größtenteils auf KI-Modelle die vor über 12 Monaten Stand der Technik waren. Das sind in aktuellen IT-Epochen aber sprichtwörtlich Lichtjahre. Aber vor allen Dingen weiß der Nutzer damit in dieser Sekunde immer noch nicht, was JETZT also aktuell das beste Modell wäre. Dieses ist daher auch der Grund warum wir in unseren Leaderboard-Ranking jeden Monat alle populären Top-Modelle messen. Nur so schaffen wir echte, zeitnahe Transparenz und vor allen Dingen Verlaufsdarstellungen mit praktischem Nutzen.

Nach aktuellem Stand sind KI-Systeme immer noch schlechter als menschliche Beurteilungen, z. B. bei medizinischen Fragestellungen. Stimmt das?

Für anspruchsvolle Fälle: oft ja — und genau so positionieren wir den Leaderboard. Die Fachkraft bleibt vorerst der Maßstab und die letzte Instanz. Unsere eigenen Zahlen sagen dasselbe: selbst das Orakel (für jede Frage vorab das jeweils beste Modell wählen — praktisch nicht erreichbar) bleibt über alle Domänen unter 100 Punkten. Es gibt einen harten Rest, den derzeit kein Modell löst (warum eine Zahl pro Modell täuscht).

KI ist hier ein Werkzeug zur Unterstützung und Zweitmeinung, kein Ersatz für die fachliche Beurteilung. Der Leaderboard hilft, für den nächsten Monat das verlässlichste verfügbare Werkzeug zu wählen — die inhaltliche Verantwortung, die Gegen-Lektüre und die Letztentscheidung bleiben beim Berufsträger. Die Ranking-Werte sind methodisch abgeleitete Orientierung, ausdrücklich keine rechtliche, steuerliche oder ärztliche Beratung.

Allerdings ist eine weitere Ehrlichkeit des täglichen Lebens notwendigerweise einzugestehen: Wie hoch die Wahrscheinlichkeit ist mit (s)einer persönlichen Frage an einen menschlichen Fachexperten zu gelangen, der tatsächlich "die" gewünschte korrekte und fundierte Antwort geben kann, ist ebenfalls unsicher. Denn auch nicht jeder Mensch ist tatsächlich uneingeschränkter Experte seines Fachs. Beispiel: Unser Roundtable KI Modell hätte das schweizerische Jura-Staatsexamen in allen Durchlöufen mit einer Abschlussnote von 1.x im ersten Durchlauf bestanden. Wieviele Menschen schaffen das ebenfalls? Erfahrungsgemäß wenige. Und noch weniger sind definitiv besser als eine KI - noch. Wie hoch die Wahrscheinlichkeit ist mit einem Anliegen bei einem tatsächlichen Experten zu landen, möge der Leser besser selbst einschätzen.

Was fange ich mit den Ergebnissen dieser Rankings nun ganz konkret an?

Praktisch in fünf Schritten:

  • Modell pro Domäne wählen. Für die nächste Aufgabe das aktuell für Ihre Domäne (Steuer / Medizin / Jura / Wirtschaftsrecht) am höchsten platzierte Modell einsetzen — nicht pauschal „das beste Modell".
  • Nicht einem einzigen Modell vertrauen. Bei wichtigen Fragen mehrere Modelle gegeneinander prüfen lassen; der Abstand zum Orakel zeigt, dass jedes fix gewählte Solo-Modell Lücken hat.
  • Output als Entwurf behandeln. Jede Antwort ist Zuarbeit, die fachliche Gegen-Lektüre bleibt Pflicht — vor allem bei hohem Score, der trügerisch sicher wirkt.
  • Halluzinations-Rate mitlesen. Sie kalibriert, wie skeptisch Sie Fundstellen, Aktenzeichen und Zahlen prüfen sollten.
  • Jeden Monat neu schauen. Die Empfehlung von vor drei Monaten ist heute oft die falsche — Modell-Versionen verschieben die Reihenfolge.
Wodurch lässt sich die Sicherheit von KI-Systemen bei wichtigen Fragestellungen erhöhen?

Es gibt mehrere wirksame Hebel, die sich kombinieren lassen:

  • Mehrere unabhängige Modelle kreuzweise prüfen lassen. Das Prinzip hinter Triple-Judge und der AI-Roundtable App: ein Befund, den mehrere Modelle aus verschiedenen Familien tragen, ist belastbarer als die Aussage eines Einzelmodells.
  • Antworten an Quellen binden. Statt freier Generierung das Modell mit echten Dokumenten und Fundstellen arbeiten lassen (Retrieval, Dokument-Abruf, Web-/URL-Abruf) und jede zitierte Stelle gegenprüfen.
  • Mensch in der Schleife. Fachliche Abschluss-Kontrolle durch den Berufsträger bleibt der wichtigste Sicherheitsanker.
  • Quellen einfordern und verifizieren. Explizit nach Aktenzeichen, Paragraph, Leitlinie fragen — und prüfen, ob es sie wirklich gibt.
  • Das passende Modell für die Domäne wählen — nach aktuellem Ranking, nicht nach Gewohnheit.
  • Sensible Daten pseudonymisieren, bevor sie ein Modell überhaupt sehen (in der App über den Mandatsmodus abgesichert).
Inwieweit lassen sich z. B. Halluzinationen erkennen oder sogar reduzieren?

Beides ist möglich — vollständig ausschließen lässt sich eine Halluzination nicht, aber erkennen und deutlich verringern.

Erkennen:

  • Konsens über mehrere Modelle. Eine Tatsache, die nur ein einziges Modell behauptet und die anderen nicht stützen, ist verdächtig.
  • Quellen-Abgleich. Prüfen, ob das genannte Aktenzeichen, der Paragraph oder die zitierte Studie real existiert — frei erfundene Fundstellen sind der häufigste Fall.
  • Maschinelle Extraktion. Unsere Judges ziehen jede frei erfundene Behauptung (falsches Az., erfundener Paragraph, nicht-existierende Studie) wortwörtlich aus der Antwort und publizieren die aggregierte Halluzinations-Rate pro Lauf.

Reduzieren:

  • An echte Quellen binden (Retrieval / Tool-Use): Das Modell argumentiert auf vorgelegten Dokumenten statt aus dem Gedächtnis.
  • Modell-Debatte, in der sich die Modelle gegenseitig auf unbelegte Aussagen festnageln — genau das Verfahren der AI-Roundtable App.
  • Zitate einfordern und verifizieren sowie eng umrissene, gut gestellte Prompts statt offener „Erzähl mir von …"-Fragen.

Mehr zur Halluzinations-Erfassung im Bewertungsverfahren: Methodik → Bewertung.

Auf welcher empirischen Grundlage steht dieses Ranking?

Bevor der Leaderboard im April 2026 in den Betrieb ging, wurde die Bewertungs-Pipeline in einer mehrmonatigen Validierungs-Studie über vier Berufsfelder hinweg geprüft. Erst nach Bestehen dieser Cross-Domain-Validierung wurden die heutigen Lauf-Parameter eingefroren.

4

Domänen wissenschaftlich validiert

Steuerrecht, Medizin (BMJ + Multimorbiditäts-Fälle), Jura (BGH-Senate quotengewichtet) und Wirtschaftsrecht — jede Domäne mit einer eigenen Frage-Bank-Version und reproduzierbarer Skoring-Pipeline.

74 %

Judge-Übereinstimmung im aktuellen Lauf

Anteil der Soll-Fakten, bei denen alle 4 Judges dasselbe Urteil fällen (Lauf vom 10.09.26). In der Validierungs-Phase (Pilot, Mai 2026) lag die Inter-Judge-Stabilität bei ρ ≥ 0,84; der Wert im Regelbetrieb mit vier Judges und längeren Antworten ist niedriger und wird pro Lauf publiziert. Phase-E-Sprints mit jeweils N=25–100 realen Fall-Items pro Lauf, getestet auf Inter-Judge-Stabilität, Cross-Domain-Generalisierung und Memorization-Confound-Robustheit (Pre-/Post-Trainings-Cutoff vergleich).

4

Judges aus 3 Anbieter-Familien

GPT-5 · Claude Opus 4.8 · Claude Opus 4.7 · Mistral Large 2; source-label-blinded Bewertung pro Antwort. Zwei der Judges sind Anthropic-Modelle. Self-Preference im aktuellen Lauf (Score mit allen Judges minus Score nur mit anbieterfremden Judges): Anthropic: +1,3 … +2,6 · OpenAI: -4,2 … -2,5 · Mistral: +4,4 Punkte. Der Headline-Score bleibt der All-Judge-Mittelwert; Details pro Modell auf der Lauf-Seite. Mehr Detail unter Methodik → Triple-Judge.

Die in der Validierungs-Phase ermittelten methodischen Befunde (z. B. Mistral-Tax-Schwäche als Domain-Stratifikations-Effekt, Expert-Roles-Lift in BFH, Inter-Judge-Stabilität nach Tier-1-Prompts) fließen in die Methodik des laufenden Leaderboards ein und sind im vollständigen Methodik-Dokument nachvollziehbar dokumentiert.

Die vollständige Cross-Domain-Validierung mit allen Roh-Statistiken, Win-/Loss-/Tie-Tabellen pro Sub-Stratum, Limitations und Critique-Response liegt öffentlich als 10-File-Gist vor:

→ Public Validation Gist · 10 Files · ~80 Sessions Cross-Domain · Stand 20.05.2026

Enthält u. a.: Methodik, Legal Study (BGH/BFH), Medical Study (BMJ + MedExpQA), Raw-Metrics-JSON, Production-Roadmap, Limitations & Threats-to-Validity, Critique Response, Layman Abstract. Direkt zur Limitations-Datei →

Warum macht ihr die Frage-Bank nicht öffentlich?
Schutz vor Trainings-Kontamination. Die Mandats-Items (derzeit 100 % synthetisch, 126 Stück) liegen ausschließlich in einem privaten Repository und werden niemals publiziert. Würden die Item-Prompts öffentlich, könnten Modell-Anbieter sie in ihren nächsten Trainings-Datensatz aufnehmen — das Ranking würde von einer Messung echter Generalisierungs-Fähigkeit zu einer Messung von Auswendiglernen kippen, und alle Folge-Läufe wären kontaminiert. Aus demselben Grund werden im publizierten raw.jsonl die Modell-Antwort-Texte sowie die wörtlich extrahierten Halluzinationen entfernt — daraus wären die Original-Fall-Konstellationen rekonstruierbar. Die aggregierten Validations-Resultate (oben im Gist) bleiben dabei vollständig öffentlich — kein einzelner Item-Text in den 10 Files, nur Methodik, Sub-Stratum- Statistik und Cross-Domain-Vergleich. Vollständige Roh-Antworten gibt es ausschließlich auf direkte NDA-Anfrage für externes Auditing.

Jetzt weiterempfehlen

Kennen Sie jemanden, der im betrieblich-professionellen Umfeld mit KI arbeitet? Der Leaderboard ist als Branchen-Standard für reproduzierbare Modell-Bewertung gedacht — Verbreitung ist Teil der Wirkung.

Audit-Trail

Jeder Lauf wird als kompletter, unveränderbarer Datensatz publiziert.

Lauf vom 10. Sep 2026 (06:41 UTC)
126 Items · 14 Modelle · 4-Judge-Aggregation · Inter-Rater 0,74
Run-ID: run-20260910T064154-bada0b
Live-API: https://licenses.ai-roundtable.de/benchmarks/run/run-20260910T064154-bada0b
→ Vollständige Lauf-Historie
Ranking-Infodienst · kostenfrei · inkl. Whitepaper

Jetzt Ranking-Leaderboard abonnieren und das Whitepaper-PDF erhalten

Nach jedem Monats-Lauf bekommen Sie die fundierte Auswertung aus Ihrem Fachbereich — auf welches Modell Sie oder Ihre Kolleg:innen vorrangig setzen sollten, solange Sie noch keine AI-Roundtable-App einsetzen. Nach der Anmeldung erhalten Sie einmalig unser Whitepaper als PDF. Double-Opt-In, jederzeit mit einem Klick abbestellbar, keine Weitergabe an Dritte.

DOUBLE-OPT-IN · KEINE WEITERGABE AN DRITTE · VORLÄUFIG KOSTENFREI, ÄNDERUNGEN VORBEHALTEN