Clinical Benchmarks

GPT-5.3-Codex

Released 5 Feb 2026$1.75 input, $14 output per million tokens400K contextproprietaryCompare with other models

Boards
1 of 13
Results
1
Latest measurement
Jul 2026

Results

Each line is placed on its own board. Dark tick: the board leader.

EHR and workflow agents

  1. HealthAgentBench
    Listed as Codex (GPT 5.3)
    $1.0/task; Codex harness; mean success across 3 attempts × 54 tasks
    22
    Rank 9 of 12Leader Claude Code (Opus 5) 55
    Official leaderboard
    Measured Jul 2026

Sources

Open a line for the quote and page.

  1. 9HealthAgentBench $1.0/task; Codex harness; mean success across 3 attempts × 54 tasks 22
    Printed as 22%Official leaderboard, measured Jul 2026Configuration: $1.0/task; Codex harness; mean success across 3 attempts × 54 tasks
    HealthAgentBench leaderboard official leaderboard, Microsoft Research (HealthAgentBench), 27 Jul 2026. Homepage leaderboard, rank 9, Success Rate and cost/task; displayed 2026-09-30.
    Agent | Success Rate | cost/task Codex (GPT 5.3) 22% $1.0
    Every result from this document

Other OpenAI models: GPT-4.1, GPT-4.1 mini, GPT-4o, GPT-5, GPT-5.1, GPT-5.2, GPT-5.4, GPT-5.4 mini, GPT-5.4 nano, GPT-5.5, GPT-5.5 Instant, GPT-5.6 Luna, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5 mini, GPT-5 nano, GPT-6.1 Sol, GPT-6 Astra, GPT-6 Luna, GPT-6 Sol, GPT OSS 120B, GPT OSS 20B, o3, o4-mini