<?xml version="1.0" encoding="utf-8"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="de">
<title>AI-Roundtable Ranking — ein Eintrag pro Benchmark-Lauf — Medizin</title>
<id>tag:ranking.ai-roundtable.de,2026:/feed/medizin.xml</id>
<link rel="self" type="application/atom+xml" href="https://ranking.ai-roundtable.de/feed/medizin.xml"/>
<link rel="alternate" type="text/html" href="https://ranking.ai-roundtable.de/"/>
<updated>2026-09-10T06:41:54.000Z</updated>
<author><name>AI-Roundtable Leaderboard</name><uri>https://ranking.ai-roundtable.de</uri></author>
<entry>
<id>tag:ranking.ai-roundtable.de,2026:run:run-20260910T064154-bada0b:medizin</id>
<title>Medizin 10.09.2026: Claude Opus 5 (92)</title>
<link rel="alternate" type="text/html" href="https://ranking.ai-roundtable.de/runs/run-20260910T064154-bada0b"/>
<updated>2026-09-10T06:41:54.000Z</updated>
<published>2026-09-10T06:41:54.000Z</published>
<content type="html">&lt;p&gt;&lt;strong&gt;Medizin:&lt;/strong&gt; Claude Opus 5 92/100.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Opus 5 (Score-Spitze) im Mittel in 0,2 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 1,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,65 pro 1000 Ausgabe-Tokens, am niedrigsten DeepSeek V4 Pro mit 0,24.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260910T064154-bada0b&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</content>
</entry>
<entry>
<id>tag:ranking.ai-roundtable.de,2026:run:run-20260907T181839-5742df:medizin</id>
<title>Medizin 07.09.2026: Claude Fable 5.1 (90)</title>
<link rel="alternate" type="text/html" href="https://ranking.ai-roundtable.de/runs/run-20260907T181839-5742df"/>
<updated>2026-09-07T18:18:39.000Z</updated>
<published>2026-09-07T18:18:39.000Z</published>
<content type="html">&lt;p&gt;&lt;strong&gt;Medizin:&lt;/strong&gt; Claude Fable 5.1 90/100.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Fable 5.1 (Score-Spitze) im Mittel in 0,3 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,9 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 0,52 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-5.3 mit 0,20.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260907T181839-5742df&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</content>
</entry>
<entry>
<id>tag:ranking.ai-roundtable.de,2026:run:run-20260801T055440-452791:medizin</id>
<title>Medizin 01.08.2026: Claude Opus 4.7 (87)</title>
<link rel="alternate" type="text/html" href="https://ranking.ai-roundtable.de/runs/run-20260801T055440-452791"/>
<updated>2026-08-01T05:54:40.000Z</updated>
<published>2026-08-01T05:54:40.000Z</published>
<content type="html">&lt;p&gt;&lt;strong&gt;Medizin:&lt;/strong&gt; Claude Opus 4.7 87/100.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,7 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 90 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat GLM-4.6 mit Ø 0,2 pro Antwort. Auf die Antwortlänge bezogen: 1,07 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,08.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260801T055440-452791&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</content>
</entry>
<entry>
<id>tag:ranking.ai-roundtable.de,2026:run:run-20260719T120108-c40839:medizin</id>
<title>Medizin 19.07.2026: Claude Opus 4.7 (83)</title>
<link rel="alternate" type="text/html" href="https://ranking.ai-roundtable.de/runs/run-20260719T120108-c40839"/>
<updated>2026-07-19T12:01:08.000Z</updated>
<published>2026-07-19T12:01:08.000Z</published>
<content type="html">&lt;p&gt;&lt;strong&gt;Medizin:&lt;/strong&gt; Claude Opus 4.7 83/100.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,4 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 95 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Grok 4.5 mit Ø 0,3 pro Antwort. Auf die Antwortlänge bezogen: 1,09 pro 1000 Ausgabe-Tokens, am niedrigsten GLM-4.6 mit 0,12.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260719T120108-c40839&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</content>
</entry>
<entry>
<id>tag:ranking.ai-roundtable.de,2026:run:run-20260621T143914-12112d:medizin</id>
<title>Medizin 21.06.2026: GPT-5.5 Pro (88)</title>
<link rel="alternate" type="text/html" href="https://ranking.ai-roundtable.de/runs/run-20260621T143914-12112d"/>
<updated>2026-06-21T14:39:14.000Z</updated>
<published>2026-06-21T14:39:14.000Z</published>
<content type="html">&lt;p&gt;&lt;strong&gt;Medizin:&lt;/strong&gt; GPT-5.5 Pro 88/100.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht GPT-5.5 Pro (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,4 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 85 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 3.1 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 0,18 pro 1000 Ausgabe-Tokens.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260621T143914-12112d&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</content>
</entry>
<entry>
<id>tag:ranking.ai-roundtable.de,2026:run:run-20260529T043500-b4ffe0:medizin</id>
<title>Medizin 29.05.2026: Claude Opus 4.7 (84)</title>
<link rel="alternate" type="text/html" href="https://ranking.ai-roundtable.de/runs/run-20260529T043500-b4ffe0"/>
<updated>2026-05-29T04:35:00.000Z</updated>
<published>2026-05-29T04:35:00.000Z</published>
<content type="html">&lt;p&gt;&lt;strong&gt;Medizin:&lt;/strong&gt; Claude Opus 4.7 84/100.&lt;/p&gt;&lt;p&gt;Im Bereich Medizin widerspricht Claude Opus 4.7 (Score-Spitze) im Mittel in 0,5 Fällen pro Antwort einem hinterlegten Soll-Fakt und fügt Ø 0,8 Behauptungen hinzu, die das Judge-Panel als falsch oder unbelegt markiert; 100 % der Antworten enthalten mindestens eine Markierung. Den niedrigsten Wert hat Gemini 2.5 Pro mit Ø 0,4 pro Antwort. Auf die Antwortlänge bezogen: 1,15 pro 1000 Ausgabe-Tokens, am niedrigsten Claude Opus 4.8 mit 0,68.&lt;/p&gt;&lt;p&gt;&lt;a href=&quot;https://ranking.ai-roundtable.de/runs/run-20260529T043500-b4ffe0&quot;&gt;Vollständiger Lauf mit Konfidenzintervallen, Diff zum Vorlauf und Roh-Daten&lt;/a&gt;&lt;/p&gt;</content>
</entry>
</feed>
