# Clinical Benchmarks > One index of every healthcare AI benchmark with current frontier-model results: 18 benchmarks, each score carrying its source. Updated 2026-08-16. ## Index - [The index](https://clinicalbenchmarks.ai/): all 18 benchmarks with current leaders and sources - [Full data, JSON](https://clinicalbenchmarks.ai/data/benchmarks.json): the index with metadata and sources, CC BY 4.0 - [Full data, CSV](https://clinicalbenchmarks.ai/data/benchmarks.csv): one flat row per result - [Plain-text index](https://clinicalbenchmarks.ai/llms-full.txt): everything in a single document ## Benchmarks - [HealthBench Professional](https://clinicalbenchmarks.ai/benchmarks/healthbench-professional): Claude Fable 5 leads at 0.660, via healthbenchprofessional.com - [HealthBench Hard](https://clinicalbenchmarks.ai/benchmarks/healthbench-hard): Muse Spark leads at 0.428, via healthbenchhard.ai - [HealthBench](https://clinicalbenchmarks.ai/benchmarks/healthbench): Claude Opus 5 leads at 67.1, via OpenAI Deployment Safety Hub (GPT-5.6 system card + August 2026 updates); benchlm.ai and llm-stats.com mirror - [Health Optimization Bench](https://clinicalbenchmarks.ai/benchmarks/health-optimization-bench): Claude Fable 5 leads at 83.8, via healthoptimizationbench.com - [MAST (Medical AI Superintelligence Test)](https://clinicalbenchmarks.ai/benchmarks/mast): GPT-5.6 Sol leads at 60.2%, via ARISE MAST leaderboard - [MedHELM](https://clinicalbenchmarks.ai/benchmarks/medhelm): Gemini 3.1 Pro (Preview) leads at 0.652, via MedHELM leaderboard (medhelm.org), v5.0.0 - [First, Do NOHARM (v2)](https://clinicalbenchmarks.ai/benchmarks/first-do-noharm): Claude Opus 5 leads at 74.6%, via ARISE MAST technical leaderboard - [HealthAgentBench](https://clinicalbenchmarks.ai/benchmarks/healthagentbench): Claude Code (Opus 5) leads at 55%, via HealthAgentBench leaderboard (Microsoft GitHub Pages) - [CHI-Bench](https://clinicalbenchmarks.ai/benchmarks/chi-bench): erius + claude-opus-5 leads at 54.7%, via CHI-Bench leaderboard (actAVA) - [MedCode (Vals AI)](https://clinicalbenchmarks.ai/benchmarks/medcode): Claude Opus 5 leads at 63.57%, via Vals AI MedCode leaderboard - [MedScribe (Vals AI)](https://clinicalbenchmarks.ai/benchmarks/medscribe): Claude Opus 5 leads at 90.99%, via Vals AI MedScribe leaderboard - [MedXpertQA (MM)](https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm): Gemini 3.1 Pro leads at 81.3%, via benchlm.ai mirror of Meta's Muse Spark evaluation - [Artificial Analysis Healthcare & Medical Index](https://clinicalbenchmarks.ai/benchmarks/artificial-analysis-healthcare): Claude Opus 5 (Adaptive Reasoning, Max Effort) leads at 51, via Artificial Analysis healthcare capability page - [PhysicianBench](https://clinicalbenchmarks.ai/benchmarks/physicianbench): GPT-5.5 leads at 46.3 ± 1.2, via PhysicianBench paper (Table 2) - [EHR-Complex](https://clinicalbenchmarks.ai/benchmarks/ehr-complex): GPT-5.4 (high reasoning) leads at 0.65, via EHR-Complex paper - [WHBench](https://clinicalbenchmarks.ai/benchmarks/whbench): Claude Opus 4.6 leads at 72.1%, via arXiv paper (v2 revised 2026-07-23) - [HealthAdminBench](https://clinicalbenchmarks.ai/benchmarks/healthadminbench): Claude Opus 4.6 (computer-use agent) leads at 36.3%, via Kinetic Systems blog - [OpenAI Dynamic Mental Health Evaluations](https://clinicalbenchmarks.ai/benchmarks/openai-mental-health-evals): GPT-5.5 Instant (June Update) leads at 0.991, via OpenAI GPT-5.6 August Updates (PDF) ## Categories - [Rubric-graded benchmarks](https://clinicalbenchmarks.ai/categories/rubric) - [Agentic and workflow benchmarks](https://clinicalbenchmarks.ai/categories/agentic) - [Documentation and coding benchmarks](https://clinicalbenchmarks.ai/categories/documentation) - [Safety benchmarks](https://clinicalbenchmarks.ai/categories/safety) - [Knowledge and exam benchmarks](https://clinicalbenchmarks.ai/categories/knowledge) - [Composite indices](https://clinicalbenchmarks.ai/categories/composite) ## Background - [Methodology](https://clinicalbenchmarks.ai/methodology): sourcing rules, comparability limits, refresh cadence - [Models](https://clinicalbenchmarks.ai/models): one page per frontier model across all boards - [FAQ](https://clinicalbenchmarks.ai/faq): the landscape questions, answered from the data ## Optional - [Updates](https://clinicalbenchmarks.ai/updates): dated index history - [HealthBench Professional leaderboard](https://healthbenchprofessional.com/): dedicated full board - [HealthBench Hard leaderboard](https://healthbenchhard.ai/): dedicated full board - [Health Optimization Bench](https://healthoptimizationbench.com/): dedicated full board