Anthropic: healthcare benchmark results
19 models · 34 results · updated August 16, 2026
Everything the index holds for Anthropic, gathered in one place: Claude Opus 5, Claude Opus 4.6, Claude Fable 5, Claude Sonnet 4.6, Claude Sonnet 5, Claude 3.7 Sonnet, Claude Code (Opus 5), Claude Code (Opus 4.8), claude-code + claude-opus-5, claude-code + claude-opus-4-8, claude-code + claude-opus-4-6, claude-code + claude-sonnet-4-6, claude-code + claude-opus-4-7, claude-code + claude-fable-5, Claude Opus 5 (Adaptive Reasoning, Max Effort), Claude Opus 5 (Adaptive Reasoning, Xhigh Effort), Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback), Claude Opus 4.7, Claude Opus 4.6 (computer-use agent). The lab holds first place on HealthBench, First, Do NOHARM (v2), MedCode (Vals AI), MedScribe (Vals AI), WHBench, HealthBench Professional, Health Optimization Bench, HealthAgentBench, Artificial Analysis Healthcare & Medical Index, HealthAdminBench. Scores sit on each benchmark's own scale and never compare across rows from different boards.
Every result
Which healthcare benchmarks does Anthropic appear on?
As of August 16, 2026, Anthropic models hold 34 current results across 16 tracked benchmarks, through Claude Opus 5, Claude Opus 4.6, Claude Fable 5, Claude Sonnet 4.6, Claude Sonnet 5, Claude 3.7 Sonnet, Claude Code (Opus 5), Claude Code (Opus 4.8), claude-code + claude-opus-5, claude-code + claude-opus-4-8, claude-code + claude-opus-4-6, claude-code + claude-sonnet-4-6, claude-code + claude-opus-4-7, claude-code + claude-fable-5, Claude Opus 5 (Adaptive Reasoning, Max Effort), Claude Opus 5 (Adaptive Reasoning, Xhigh Effort), Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback), Claude Opus 4.7, Claude Opus 4.6 (computer-use agent).
Where does Anthropic lead?
Anthropic models hold first place on HealthBench (Claude Opus 5, 67.1); First, Do NOHARM (v2) (Claude Opus 5, 74.6%); MedCode (Vals AI) (Claude Opus 5, 63.57%); MedScribe (Vals AI) (Claude Opus 5, 90.99%); WHBench (Claude Opus 4.6, 72.1%); HealthBench Professional (Claude Fable 5, 0.660); Health Optimization Bench (Claude Fable 5, 83.8); HealthAgentBench (Claude Code (Opus 5), 55%); Artificial Analysis Healthcare & Medical Index (Claude Opus 5 (Adaptive Reasoning, Max Effort), 51); HealthAdminBench (Claude Opus 4.6 (computer-use agent), 36.3%).
Other labs with pages: OpenAI, Google, Moonshot AI, Alibaba, Meta, xAI. The full field is on the index.