AI model güvenilirliğini değerlendirmek için açık ve şeffaf bir çerçeve.
K-BENCHMARK, ALPAR AI'nın AI modellerini güvenlik, doğruluk, adillik, gizlilik, dayanıklılık ve şeffaflık boyutlarında puanlamak için kullandığı açık metodolojisidir. Puanlar, doğrulanmış olay raporları, çapraz denetim motoru sonuçları ve alan uzmanı değerlendirmeleri kullanılarak Wilson-score güven aralıklarıyla hesaplanır.
ALPAR olay kaydına dayalı gerçek dünya AI olay değerlendirmesi, adversarial jailbreak direnciyle birlikte.
TruthfulQA tabanlı olgusallık analizi, Türkçe bağlamda özel olarak seçilmiş olgusal iddialarla eşleştirilmiştir.
Çeviri MMLU-TR ve yerel düzenleyici test setleri kullanılarak Türkçe dil yeterliliği değerlendirmesi.
AB AI Act Art. 73 düzenleyici senaryolarına karşı model karar verme mantığının değerlendirilmesi.
GSM8K ve MATH benchmark'larına karşı standart matematiksel problem çözme yeteneği.
IFEval benzeri kısıtlamalarda yapısal talimat-takip doğruluğu doğrulaması.
İnsan onaylı simülasyon altında adversarial jailbreak koruması ve prompt enjeksiyon savunma derecelendirmesi.
32k token'a kadar bağlam uzunlukları için samanlıkta iğne arama değerlendirmesi.
Her kategori, örneklem büyüklüğünü hesaba katan ve istatistiksel olarak titiz bir alt sınır sağlayan Wilson-score güven aralığı kullanılarak puanlanır. Bu, küçük örneklem gürültüsünün puanları şişirmesini önler.
Wilson score = (p + z²/2n - z√(p(1-p)/n + z²/4n²)) / (1 + z²/n)
Wilson-score, Reddit ve IMDb gibi platformlarda sağlam puanlama sistemleri için yaygın olarak kullanılan, binom oran tahmininde standart bir yöntemdir.
Olay Bildirimi
PII Koruma
Çapraz Denetim
Wilson Puanlama
Uzman İncelemesi
Puanlar şunlardan türetilir: (1) ALPAR platformu üzerinden gönderilen doğrulanmış olay raporları, (2) yerleşik benchmark'lar (MMLU, GSM8K, IFEval, BBH) kullanan otomatik çapraz denetim motoru değerlendirmeleri, (3) L3 danışman ağından alan uzmanı değerlendirmeleri ve (4) kamuya açık model dokümantasyonu ve teknik raporlar.
K-BENCHMARK puanları bilgilendirme amaçlıdır ve 'olduğu gibi' sağlanır. Bir uyumluluk sertifikası veya hukuki görüş teşkil etmezler. ALPAR AI 'AI Act ready/aligned'dır, uyumlu değildir. Tam feragat için Hizmet Şartları'na bakın.