Offener Standard zur Auditierung von KI-Systemen
Grundlage für transparente und rechenschaftspflichtige KI-Bewertung.
Bewertung von Sicherheitsmechanismen gegen schädliche oder illegale Inhalte.
Prüfung auf sachlich falsche Behauptungen und irreführende Informationen.
Überprüfung auf diskriminierende Antworten und systematische Vorurteile.
Bewertung des Schutzes vertraulicher und personenbezogener Daten.
Widerstandsfähigkeit gegen Manipulation und gegnerische Prompts.
Nachvollziehbarkeit von Datenquellen und Systemgrenzen.
Stabilität und Verfügbarkeit im laufenden Betrieb.
Einhaltung europäischer Regulierungsstandards für KI.
Einspruchseinreichungen erfordern technische Beweise. Nach Prüfung kann der Score aktualisiert oder die Meldung annulliert werden.
Entwickler und Anbieter von KI-Modellen können Bewertungen oder Vorfallseinträge anfechten.
Sicherheit & EthikFaktentreueDatenschutzRobustheitGesetzeskonformitätAlle Einsprüche werden vom unabhängigen ALPAR-Methodikausschuss geprüft.
Every score published in K-BENCHMARK is accompanied by a Wilson score interval representing statistical confidence at a 95% confidence level. Re-evaluation is automatically triggered when model providers push updates, ensuring our leaderboard reflects the live capability of active models.