Güven Skorunu nasıl hesaplıyoruz
Özel metodolojimiz tarafsız ve şeffaf sıralamalar sağlar.
K5 Metrik Açıklaması
K6 Metrik Açıklaması
K7 Metrik Açıklaması
K8 Metrik Açıklaması
K9 Metrik Açıklaması
K10 Metrik Açıklaması
K11 Metrik Açıklaması
K12 Metrik Açıklaması
Geleneksel kıyaslama kurulumlarından farklı olarak, ALPAR AI dinamik bir çapraz model tartışması kullanır. İki model bir olayı bağımsız olarak değerlendirir, birbirlerinin değerlendirmelerini sorgular ve savunmalarını sunar; ayrı bir hakem ('Yüksek Mahkeme') modeli daha sonra tartışmayı nihai Doğruluk Skoru olarak sentezler. Bu, statik puanlama yanlılığını en aza indirir ve sağlam, akran denetimli değerlendirme metrikleri sağlar.
Çapraz sorgu motoru, anlaşmazlıkları iki bağımsız model arasındaki tartışma yoluyla çözer ve ayrı bir hakem ('Yüksek Mahkeme') modeli, tartışmayı nihai Doğruluk Skoru'nda sentezler. Hakem zinciri, kaynak kodda tanımlıdır (src/lib/ai/openrouter-gateway.ts içindeki SUPREME_COURT_CHAIN) ve şu anda şu modelleri içerir:
gemini-1.5-pro (Google, premium)anthropic/claude-3.5-sonnet (OpenRouter, premium)openai/gpt-4o (OpenRouter, premium)meta-llama/llama-3.1-70b-instruct (OpenRouter, premium)mistralai/mistral-large (OpenRouter, premium)Bu liste, src/lib/ai/openrouter-gateway.ts içindeki kodun birebir aynısı olarak yayımlanmıştır. Hakem zinciri şu anda sağlayıcı düzeyinde yedeklilik içeren 5 premium model içerir; zincir değiştiğinde bu sayfa da güncellenir.
Every score published in K-BENCHMARK is accompanied by a Wilson score interval representing statistical confidence at a 95% confidence level. Re-evaluation is automatically triggered when model providers push updates, ensuring our leaderboard reflects the live capability of active models.