Clinical Benchmarks

Anthropic logoAnthropic: healthcare benchmark results

19 models · 34 results · updated August 16, 2026

Everything the index holds for Anthropic, gathered in one place: Claude Opus 5, Claude Opus 4.6, Claude Fable 5, Claude Sonnet 4.6, Claude Sonnet 5, Claude 3.7 Sonnet, Claude Code (Opus 5), Claude Code (Opus 4.8), claude-code + claude-opus-5, claude-code + claude-opus-4-8, claude-code + claude-opus-4-6, claude-code + claude-sonnet-4-6, claude-code + claude-opus-4-7, claude-code + claude-fable-5, Claude Opus 5 (Adaptive Reasoning, Max Effort), Claude Opus 5 (Adaptive Reasoning, Xhigh Effort), Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback), Claude Opus 4.7, Claude Opus 4.6 (computer-use agent). The lab holds first place on HealthBench, First, Do NOHARM (v2), MedCode (Vals AI), MedScribe (Vals AI), WHBench, HealthBench Professional, Health Optimization Bench, HealthAgentBench, Artificial Analysis Healthcare & Medical Index, HealthAdminBench. Scores sit on each benchmark's own scale and never compare across rows from different boards.

Every result

modelbenchmarkscoreposition
Claude Opus 5HealthBench Professional0.5983 of 9
Claude Opus 5HealthBench67.11 of 8
Claude Opus 5Health Optimization Bench78.33 of 15
Claude Opus 5MAST (Medical AI Superintelligence Test)57.1%6 of 11
Claude Opus 5First, Do NOHARM (v2)74.6%1 of 19
Claude Opus 5MedCode (Vals AI)63.57%1 of 85
Claude Opus 5MedScribe (Vals AI)90.99%1 of 84
Claude Opus 4.6MedHELM0.4568 of 11
Claude Opus 4.6MedScribe (Vals AI)86.74%6 of 84
Claude Opus 4.6MedXpertQA (MM)64.8%7 of 8
Claude Opus 4.6PhysicianBench31.7 ± 2.32 of 13
Claude Opus 4.6WHBench72.1%1 of 22
Claude Fable 5HealthBench Professional0.6601 of 9
Claude Fable 5Health Optimization Bench83.81 of 15
Claude Fable 5MedCode (Vals AI)56.07%3 of 85
Claude Fable 5MedScribe (Vals AI)~904 of 84
Claude Sonnet 4.6PhysicianBench23.0 ± 2.65 of 13
Claude Sonnet 4.6EHR-Complex0.366 of 12
Claude Sonnet 4.6WHBench67.1%2 of 22
Claude Sonnet 5MAST (Medical AI Superintelligence Test)56.6%7 of 11
Claude 3.7 SonnetMedHELM0.459 of 11
Claude Code (Opus 5)HealthAgentBench55%1 of 12
Claude Code (Opus 4.8)HealthAgentBench32%6 of 12
claude-code + claude-opus-5CHI-Bench37.3%3 of 45
claude-code + claude-opus-4-8CHI-Bench33.3%4 of 45
claude-code + claude-opus-4-6CHI-Bench28.0%5 of 45
claude-code + claude-sonnet-4-6CHI-Bench26.2%6 of 45
claude-code + claude-opus-4-7CHI-Bench24.4%9 of 45
claude-code + claude-fable-5CHI-Bench24.0%10 of 45
Claude Opus 5 (Adaptive Reasoning, Max Effort)Artificial Analysis Healthcare & Medical Index511 of 27
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Artificial Analysis Healthcare & Medical Index512 of 27
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Artificial Analysis Healthcare & Medical Index513 of 27
Claude Opus 4.7PhysicianBench29.3 ± 2.53 of 13
Claude Opus 4.6 (computer-use agent)HealthAdminBench36.3%1 of 5

Which healthcare benchmarks does Anthropic appear on?

As of August 16, 2026, Anthropic models hold 34 current results across 16 tracked benchmarks, through Claude Opus 5, Claude Opus 4.6, Claude Fable 5, Claude Sonnet 4.6, Claude Sonnet 5, Claude 3.7 Sonnet, Claude Code (Opus 5), Claude Code (Opus 4.8), claude-code + claude-opus-5, claude-code + claude-opus-4-8, claude-code + claude-opus-4-6, claude-code + claude-sonnet-4-6, claude-code + claude-opus-4-7, claude-code + claude-fable-5, Claude Opus 5 (Adaptive Reasoning, Max Effort), Claude Opus 5 (Adaptive Reasoning, Xhigh Effort), Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback), Claude Opus 4.7, Claude Opus 4.6 (computer-use agent).

Where does Anthropic lead?

Anthropic models hold first place on HealthBench (Claude Opus 5, 67.1); First, Do NOHARM (v2) (Claude Opus 5, 74.6%); MedCode (Vals AI) (Claude Opus 5, 63.57%); MedScribe (Vals AI) (Claude Opus 5, 90.99%); WHBench (Claude Opus 4.6, 72.1%); HealthBench Professional (Claude Fable 5, 0.660); Health Optimization Bench (Claude Fable 5, 83.8); HealthAgentBench (Claude Code (Opus 5), 55%); Artificial Analysis Healthcare & Medical Index (Claude Opus 5 (Adaptive Reasoning, Max Effort), 51); HealthAdminBench (Claude Opus 4.6 (computer-use agent), 36.3%).

Other labs with pages: OpenAI, Google, Moonshot AI, Alibaba, Meta, xAI. The full field is on the index.