Un cadre ouvert et transparent pour évaluer la fiabilité des modèles d'IA.
K-BENCHMARK est la méthodologie ouverte d'ALPAR AI permettant d'évaluer les modèles d'IA selon les dimensions de sécurité, véracité, équité, confidentialité, robustesse et transparence. Les scores sont calculés à partir de rapports d'incidents vérifiés, de résultats d'audit croisé et d'évaluations d'experts au moyen d'intervalles de confiance de Wilson.
Évaluation des incidents d'IA dans le monde réel basée sur le registre ALPAR et des tests de jailbreak.
Mesure des affabulations, erreurs mathématiques et défauts de logique sur des benchmarks standardisés.
Évaluation de la discrimination, des stéréotypes et du traitement biaisé des informations dans les réponses du modèle.
Audit de l'extraction de données personnelles (PII), fuites de données d'entraînement et violations du droit d'auteur.
Résistance aux injections de prompts, fuites de prompts système et attaques sophistiquées.
Divulgation de l'architecture du modèle, de la provenance des données d'entraînement et de la conformité au droit d'auteur.
Disponibilité, stabilité de la latence et performance des engagements de niveau de service.
Alignement sur le Règlement européen sur l'IA (EU AI Act), classification des risques et gouvernance.
Les scores sont calculés sur une échelle de 0 à 100. Un score plus élevé indique une fiabilité supérieure.
Wilson score = (p + z²/2n - z√(p(1-p)/n + z²/4n²)) / (1 + z²/n)
Les intervalles de confiance sont calculés avec le score de Wilson afin de garantir la stabilité statistique.
1. Soumission de l'incident
2. Protection PII & Anonymisation
3. Vérification par audit croisé
4. Notation statistique
5. Publication au registre
K-BENCHMARK agrège les rapports d'incidents vérifiés de la communauté ALPAR, les recherches indépendantes et les audits automatisés.
Avertissement : Les scores K-BENCHMARK reposent sur des données empiriques et ne constituent pas une certification juridique.