<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
<channel>
<title>AI-Roundtable Ranking — ein Eintrag pro Benchmark-Lauf</title>
<link>https://ranking.ai-roundtable.de/</link>
<description>Monatliches, reproduzierbares Ranking führender KI-Modelle auf deutschsprachigen Berufsträger-Fällen (Steuerrecht, Medizin, Jura, Wirtschaftsrecht) mit Halluzinationsraten.</description>
<language>de</language>
<atom:link href="https://ranking.ai-roundtable.de/rss.xml" rel="self" type="application/rss+xml"/>
<lastBuildDate>Thu, 10 Sep 2026 06:41:54 GMT</lastBuildDate>
<item>
<title>Ranking-Lauf 10.09.2026: Steuerrecht Claude Opus 5 · Medizin Claude Opus 5 · Jura Claude Fable 5.1 · Wirtschaftsrecht Claude Opus 5</title>
<link>https://ranking.ai-roundtable.de/runs/run-20260910T064154-bada0b</link>
<guid isPermaLink="false">tag:ranking.ai-roundtable.de,2026:run:run-20260910T064154-bada0b</guid>
<pubDate>Thu, 10 Sep 2026 06:41:54 GMT</pubDate>
<description>&lt;p&gt;&lt;strong&gt;Steuerrecht:&lt;/strong&gt; Claude Opus 5 89/100. &lt;strong&gt;Medizin:&lt;/strong&gt; Claude Opus 5 92/100. &lt;strong&gt;Jura:&lt;/strong&gt; Claude Fable 5.1 91/100. &lt;strong&gt;Wirtschaftsrecht:&lt;/strong&gt; Claude Opus 5 80/100.&lt;/p&gt;&lt;p&gt;Im Bereich Steuerrecht widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 3,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,59 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,26.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,65 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,24.&lt;/p&gt;&lt;p&gt;Im Bereich Jura widerspricht Claude Fable 5.1 (Score-Spitze) im Mittel in 0,0 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 0,60 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,11.&lt;/p&gt;&lt;p&gt;Im Bereich Wirtschaftsrecht widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 3,2 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,47 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,25.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260910T064154-bada0b&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</description>
</item>
<item>
<title>Ranking-Lauf 07.09.2026: Steuerrecht Claude Opus 5 · Medizin Claude Fable 5.1 · Jura Claude Opus 5 · Wirtschaftsrecht Claude Opus 5</title>
<link>https://ranking.ai-roundtable.de/runs/run-20260907T181839-5742df</link>
<guid isPermaLink="false">tag:ranking.ai-roundtable.de,2026:run:run-20260907T181839-5742df</guid>
<pubDate>Mon, 07 Sep 2026 18:18:39 GMT</pubDate>
<description>&lt;p&gt;&lt;strong&gt;Steuerrecht:&lt;/strong&gt; Claude Opus 5 82/100. &lt;strong&gt;Medizin:&lt;/strong&gt; Claude Fable 5.1 90/100. &lt;strong&gt;Jura:&lt;/strong&gt; Claude Opus 5 90/100. &lt;strong&gt;Wirtschaftsrecht:&lt;/strong&gt; Claude Opus 5 81/100.&lt;/p&gt;&lt;p&gt;Im Bereich Steuerrecht widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 1,0 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,4 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,2 pro Antwort. Auf die Antwortlänge bezogen: 0,43 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,26.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Fable 5.1 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 0,52 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-5.3 mit 0,20.&lt;/p&gt;&lt;p&gt;Im Bereich Jura widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,4 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 94 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,47 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,13.&lt;/p&gt;&lt;p&gt;Im Bereich Wirtschaftsrecht widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,8 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,2 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,41 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-5.3 mit 0,21.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260907T181839-5742df&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</description>
</item>
<item>
<title>Ranking-Lauf 01.08.2026: Steuerrecht Claude Opus 4.7 · Medizin Claude Opus 4.7 · Jura Claude Opus 4.7 · Wirtschaftsrecht GPT-5.6 Sol</title>
<link>https://ranking.ai-roundtable.de/runs/run-20260801T055440-452791</link>
<guid isPermaLink="false">tag:ranking.ai-roundtable.de,2026:run:run-20260801T055440-452791</guid>
<pubDate>Sat, 01 Aug 2026 05:54:40 GMT</pubDate>
<description>&lt;p&gt;&lt;strong&gt;Steuerrecht:&lt;/strong&gt; Claude Opus 4.7 75/100. &lt;strong&gt;Medizin:&lt;/strong&gt; Claude Opus 4.7 87/100. &lt;strong&gt;Jura:&lt;/strong&gt; Claude Opus 4.7 84/100. &lt;strong&gt;Wirtschaftsrecht:&lt;/strong&gt; GPT-5.6 Sol 79/100.&lt;/p&gt;&lt;p&gt;Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 1,3 pro Antwort. Auf die Antwortlänge bezogen: 1,60 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,27.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 90 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GLM-4.6 mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,07 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,08.&lt;/p&gt;&lt;p&gt;Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 80 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Claude Opus 4.8 mit Ø 0,7 pro Antwort. Auf die Antwortlänge bezogen: 1,03 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,29.&lt;/p&gt;&lt;p&gt;Im Bereich Wirtschaftsrecht widerspricht GPT-5.6 Sol (Score-Spitze) im Mittel in 0,7 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,0 pro Antwort. Auf die Antwortlänge bezogen: 0,21 pro 1000 Ausgabe-Tokens.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260801T055440-452791&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</description>
</item>
<item>
<title>Ranking-Lauf 19.07.2026: Steuerrecht Claude Opus 4.7 · Medizin Claude Opus 4.7 · Jura Claude Opus 4.7 · Wirtschaftsrecht Claude Opus 4.7</title>
<link>https://ranking.ai-roundtable.de/runs/run-20260719T120108-c40839</link>
<guid isPermaLink="false">tag:ranking.ai-roundtable.de,2026:run:run-20260719T120108-c40839</guid>
<pubDate>Sun, 19 Jul 2026 12:01:08 GMT</pubDate>
<description>&lt;p&gt;&lt;strong&gt;Steuerrecht:&lt;/strong&gt; Claude Opus 4.7 78/100. &lt;strong&gt;Medizin:&lt;/strong&gt; Claude Opus 4.7 83/100. &lt;strong&gt;Jura:&lt;/strong&gt; Claude Opus 4.7 80/100. &lt;strong&gt;Wirtschaftsrecht:&lt;/strong&gt; Claude Opus 4.7 80/100.&lt;/p&gt;&lt;p&gt;Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,2 pro Antwort. Auf die Antwortlänge bezogen: 1,72 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,27.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 95 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 1,09 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,12.&lt;/p&gt;&lt;p&gt;Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 91 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,5 pro Antwort. Auf die Antwortlänge bezogen: 1,06 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,29.&lt;/p&gt;&lt;p&gt;Im Bereich Wirtschaftsrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 1,1 pro Antwort. Auf die Antwortlänge bezogen: 1,53 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.6 Sol mit 0,25.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260719T120108-c40839&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</description>
</item>
<item>
<title>Ranking-Lauf 21.06.2026: Steuerrecht Claude Opus 4.7 · Medizin GPT-5.5 Pro · Jura Claude Opus 4.7 · Wirtschaftsrecht GPT-5.5 Pro</title>
<link>https://ranking.ai-roundtable.de/runs/run-20260621T143914-12112d</link>
<guid isPermaLink="false">tag:ranking.ai-roundtable.de,2026:run:run-20260621T143914-12112d</guid>
<pubDate>Sun, 21 Jun 2026 14:39:14 GMT</pubDate>
<description>&lt;p&gt;&lt;strong&gt;Steuerrecht:&lt;/strong&gt; Claude Opus 4.7 74/100. &lt;strong&gt;Medizin:&lt;/strong&gt; GPT-5.5 Pro 88/100. &lt;strong&gt;Jura:&lt;/strong&gt; Claude Opus 4.7 82/100. &lt;strong&gt;Wirtschaftsrecht:&lt;/strong&gt; GPT-5.5 Pro 82/100.&lt;/p&gt;&lt;p&gt;Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,9 pro Antwort. Auf die Antwortlänge bezogen: 1,89 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,13.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,4 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 85 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,18 pro 1000 Ausgabe-Tokens.&lt;/p&gt;&lt;p&gt;Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,6 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 71 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 0,6 pro Antwort. Auf die Antwortlänge bezogen: 0,98 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5.5 Pro mit 0,07.&lt;/p&gt;&lt;p&gt;Im Bereich Wirtschaftsrecht widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Auf die Antwortlänge bezogen: 0,11 pro 1000 Ausgabe-Tokens.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260621T143914-12112d&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</description>
</item>
<item>
<title>Ranking-Lauf 29.05.2026: Steuerrecht Claude Opus 4.7 · Medizin Claude Opus 4.7 · Jura Claude Opus 4.7 · Wirtschaftsrecht GPT-5</title>
<link>https://ranking.ai-roundtable.de/runs/run-20260529T043500-b4ffe0</link>
<guid isPermaLink="false">tag:ranking.ai-roundtable.de,2026:run:run-20260529T043500-b4ffe0</guid>
<pubDate>Fri, 29 May 2026 04:35:00 GMT</pubDate>
<description>&lt;p&gt;&lt;strong&gt;Steuerrecht:&lt;/strong&gt; Claude Opus 4.7 71/100. &lt;strong&gt;Medizin:&lt;/strong&gt; Claude Opus 4.7 84/100. &lt;strong&gt;Jura:&lt;/strong&gt; Claude Opus 4.7 82/100. &lt;strong&gt;Wirtschaftsrecht:&lt;/strong&gt; GPT-5 80/100.&lt;/p&gt;&lt;p&gt;Im Bereich Steuerrecht widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 2,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Claude Opus 4.8 mit Ø 1,4 pro Antwort. Auf die Antwortlänge bezogen: 1,95 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,83.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,15 pro 1000 Ausgabe-Tokens, am niedrigsten Claude Opus 4.8 mit 0,68.&lt;/p&gt;&lt;p&gt;Im Bereich Jura widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 86 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,22 pro 1000 Ausgabe-Tokens, am niedrigsten GPT-5 mit 0,58.&lt;/p&gt;&lt;p&gt;Im Bereich Wirtschaftsrecht widerspricht GPT-5 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,0 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 97 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.3 mit Ø 1,1 pro Antwort. Auf die Antwortlänge bezogen: 0,63 pro 1000 Ausgabe-Tokens.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260529T043500-b4ffe0&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</description>
</item>
</channel>
</rss>
