run-20260910T064154-bada0bVollständige Roh-Daten jedes Laufs.
Jeder publizierte Lauf liegt hier als kompletter, unveränderter JSONL-Datensatz vor. Inklusive aller Modell-Antworten, aller Judge-Begründungen und der Halluzinations-Extraktion.
Pro Lauf verfügbar
Jeder Lauf erscheint hier mit folgenden öffentlichen Artefakten:
progress.jsonl— eine Zeile pro (Modell × Item × Replikat)-Cell mit Antwort, Token-Verbrauch, Halluzinations-Marker.raw.jsonl— vollständige Judge-Outputs: entail/missing/contradict-Verdikt pro Soll-Fakt, plus Extra-False-Claims-Liste pro Judge.summary.json— pro (Modell × Domäne) aggregierte Scores, Bootstrap-CI, Halluzinations-Rate, Inter-Rater-Agreement, Token-Bilanz und USD-Kosten der Pipeline.MANIFEST.json— Run-Metadaten: Lauf-ID, Zeitpunkt, Frage-Bank-Version, aktive Modelle, aktive Judges, Code-Version.
Lauf-Historie
Chronologische Liste aller publizierten Läufe — neuester zuerst. Pro Eintrag: Datum, Run-ID, Modell-/Judge-Zahl, Item-Zahl und direkte Links zu den Roh-Daten (JSONL + Summary).
Jeder Lauf hat eine permanente Detailseite: /runs. „Offiziell" = ein Lauf pro Kalendermonat (Feed, Startseite); „Entwicklungslauf" = Roster-Tests und Zwischenläufe, vollständig archiviert, aber nicht im Feed.
run-20260907T181839-5742dfrun-20260904T151155-c623e0run-20260901T060205-7d51d0run-20260801T055440-452791run-20260719T120108-c40839run-20260715T040307-80bf67run-20260711T103548-436ac1run-20260701T043526-2a195erun-20260621T143914-12112drun-20260620T073912-d2125crun-20260619T195640-4ce8c8run-20260618T165158-d2543arun-20260615T043639-30c761run-20260607T181746-23cbb6run-20260529T043500-b4ffe0run-20260528T202802-6ce096run-20260520T074328-4a549crun-20260518T043700-b4a380run-20260517T131406-f96128run-20260516T200347-bc6991run-20260516T101429-0435c4run-20260514T075711-8acb3arun-20260512T135155-40f852run-20260512T105829-f0ac95run-20260512T081552-d5fb45run-20260511T051320-09184crun-20260510T190628-59fc01run-20260510T175034-5e294drun-20260510T164305-2c7b16run-20260510T121001-e3a863Wie ich den Audit-Trail nutze
Drei Anwendungsfälle, für die der offene Audit-Trail entworfen ist:
- Stichproben-Verifikation: ich greife mir eine beliebige Modell-Antwort, lese die Judge-Begründung und entscheide selbst, ob die Bewertung trägt.
- Halluzinations-Audit: ich filtere
extra_false_claimsnach einem Modell und sehe alle frei erfundenen Behauptungen wortwörtlich. - Methodik-Überprüfung: ich ziehe zwei Läufe
mit derselben
question_bank_versionund prüfe, ob die Reproduzierbarkeits-Garantie eingehalten ist.