Skip to main content
LIVE RADAR
OpenAI
Autonomous Risk Evaluation System Hallucination Drift
#ALP-2026
(Verified)
Anthropic
Biased Candidate Scoring Algorithm Suppression
#ALP-2026
(Verified)
Google AI
RAG Vector Store Corporate Document Leakage
#ALP-2026
(Verified)
DeepSeek
Credit Underwriting Blackbox Decision Drift
#ALP-2026
(Verified)
OpenAI
Autonomous Risk Evaluation System Hallucination Drift
#ALP-2026
(Verified)
Anthropic
Biased Candidate Scoring Algorithm Suppression
#ALP-2026
(Verified)
Google AI
RAG Vector Store Corporate Document Leakage
#ALP-2026
(Verified)
DeepSeek
Credit Underwriting Blackbox Decision Drift
#ALP-2026
(Verified)
Skip to main content
ALPAR
AI
Justice Board
Leaderboard
Dilemmas
Transparency
Products
EN
Log a Record
Sign in
Feed
Incidents
Ranks
Dilemmas
GPT-5.1 Codex Max — Score History
Time-series view of K-BENCHMARK category scores for this model.
Instruction Following
Score: 6900
Samples: 100
Range: 5900–7700
Robustness & Adversarial
Score: 7000
Samples: 100
Range: 6000–7800
Long-Context Retrieval
Score: 8000
Samples: 100
Range: 7100–8700
Ethics & Safety
Score: 7800
Samples: 100
Range: 6900–8500
Hallucination & Factuality
Score: 7300
Samples: 100
Range: 6400–8100
Turkish Competence
Score: 6700
Samples: 100
Range: 5700–7500
EU AI Act Reasoning
Score: 7600
Samples: 100
Range: 6700–8300
Math & Reasoning
Score: 6400
Samples: 100
Range: 5400–7300