{
  "dataset": "Clinical Benchmarks",
  "kind": "results",
  "url": "https://clinicalbenchmarks.ai",
  "updated": "2026-09-30",
  "revision": 7165,
  "licence": {
    "name": "CC BY 4.0",
    "url": "https://creativecommons.org/licenses/by/4.0/",
    "attribution": "Clinical Benchmarks (clinicalbenchmarks.ai)",
    "note": "The compilation is licensed CC BY 4.0. Source documents keep their own terms."
  },
  "rule": "Each board ranks only its own rows. Scores from different benchmarks are combined only in this site's own index (/api/v1/index.json), which is labelled as such.",
  "data": [
    {
      "id": 1799,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-6-astra",
      "modelKind": "model",
      "name": "GPT-6 Astra (Anthropic run)",
      "label": "GPT-6 Astra (Anthropic run)",
      "lab": "openai",
      "variant": "Anthropic public-API reproduction; max effort; no system prompt; Opus 4.8 grader; length-adjusted; raw 74.0%",
      "value": 0.703,
      "valueLabel": "0.703",
      "display": "70.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "On HealthBench Professional at max effort, length adjustment changes the ranking.\nAfter: GPT-6 Astra (70.3%) > Claude Sonnet 5.5 (69.2%) > Claude Opus 5.5 (65.6%) > Claude Fable 5.1 (62.1%).",
      "locator": "p. 138, paragraph above Figure 8.15.B, HealthBench Professional after length adjustment.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-1799"
    },
    {
      "id": 1800,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-sonnet-5.5",
      "modelKind": "model",
      "name": "Claude Sonnet 5.5",
      "label": null,
      "lab": "anthropic",
      "variant": "Anthropic; max effort; Opus 4.8 grader; safety classifiers enabled; length-adjusted; raw 77.1%",
      "value": 0.6920000000000001,
      "valueLabel": "0.692",
      "display": "69.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "On HealthBench Professional at max effort, length adjustment changes the ranking.\nAfter: GPT-6 Astra (70.3%) > Claude Sonnet 5.5 (69.2%) > Claude Opus 5.5 (65.6%) > Claude Fable 5.1 (62.1%).",
      "locator": "p. 138, Section 8.15.2 and paragraph above Figure 8.15.B.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-1800"
    },
    {
      "id": 204,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-fable-5",
      "modelKind": "model",
      "name": "Claude Fable 5",
      "label": null,
      "lab": "anthropic",
      "variant": "length-adjusted, Anthropic protocol: adaptive thinking at max effort, Claude Opus 4.8 grader, averaged over 5 trials, no tools or custom system prompt (raw 70.3%). Measured as Claude Mythos 5; Anthropic itself prints 66.0 in the Fable 5 column of the Opus 5 card with footnote Mythos 5.",
      "value": 0.66,
      "valueLabel": "0.660",
      "display": "66.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 61,
      "sourceUrl": "https://anthropic.com/claude-fable-5-mythos-5-system-card",
      "quote": "HealthBench\nProfessional\n66.0 - 64.7 56.9 51.8 -",
      "locator": "p. 252, Table 8.1.A, row HealthBench Professional, column Mythos 5 (Fable 5 column '-'); Figure 8.18.2.A p. 298 bar label 66.0% on Claude Mythos 5",
      "corroborating": [
        {
          "source": 98,
          "role": "corroborating",
          "scoreDisplay": "66.0",
          "quote": "HealthBench Professional 59.8 57.4 66.011 60.5",
          "locator": "p. 152, Table 8.1.A, column Fable 5 (footnote 11: Mythos 5)"
        },
        {
          "source": 123,
          "role": "conflicting",
          "scoreDisplay": "63.3%",
          "quote": "HealthBench Professional 62.1% 63.3% 59.8% –",
          "locator": "p. 167, Table 8.1.A, column 'Claude Fable 5/Mythos 5'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-204"
    },
    {
      "id": 1801,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-opus-5.5",
      "modelKind": "model",
      "name": "Claude Opus 5.5",
      "label": null,
      "lab": "anthropic",
      "variant": "Anthropic; adaptive max effort; Opus 4.8 grader; five trials; no tools or custom system prompt; safety classifiers and refusal fallback to Opus 5; length-adjusted; raw 77.1%",
      "value": 0.6559999999999999,
      "valueLabel": "0.656",
      "display": "65.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1288,
      "sourceUrl": "https://www.anthropic.com/claude-opus-5-5-system-card",
      "quote": "8.15.2 HealthBench Professional results\nlength adjustment, which penalizes verbose model responses, Claude Opus 5.5 achieved a score of 65.6%.",
      "locator": "pp. 213–214, Section 8.15.2, paragraph and Figure 8.15.2.A.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-1801"
    },
    {
      "id": 563,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-6-astra",
      "modelKind": "model",
      "name": "GPT-6 Astra",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted, max reasoning effort (69.5 unadjusted, 4,097 mean response chars); GPT-6 Astra system card Table 6, column 'gpt-6 Astra'.",
      "value": 0.647,
      "valueLabel": "0.647",
      "display": "64.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1106,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-6-astra/healthbench",
      "quote": "Evaluation | GPT-5.5 | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | GPT-6 Astra | GPT-6 Sol | GPT-6 Luna\nHealthBench Professional length-adjusted | 51.8 (57.2, 3818) | 60.5 (64.1, 3228) | 57.7 (62.4, 3618) | 55.7 (59.8, 3389) | 64.7 (68.2, 3185) | 60.8 (59.5, 1573) | 60.8 (61.2, 2119)",
      "locator": "Section 11.4.1, Table 29, HealthBench Professional length-adjusted, GPT-6 Astra column; September 22 correction.",
      "corroborating": [
        {
          "source": 1107,
          "role": "corroborating",
          "scoreDisplay": "63.4%",
          "quote": "| HealthBench Professional (length-adjusted) | 63.4% | 60.5% | 58.1% | 60.9% | 56.4% | 52.1% |",
          "locator": "Science and Health table"
        },
        {
          "source": 1106,
          "role": "mirror",
          "scoreDisplay": "63.4",
          "quote": "Astra has a length-adjusted HealthBench Professional score of 63.4 (+2.9 relative to GPT-5.6 Sol)",
          "locator": "section 6.1, HTML rendering of the same card"
        },
        {
          "source": 1104,
          "role": "conflicting",
          "scoreDisplay": "63.4",
          "quote": "Astra has a length-adjusted HealthBench Professional score of 63.4 (+2.9 relative to GPT-5.6 Sol), HealthBench score of 58.1 (+1.1), HealthBench Hard score of 36.3 (+3.2), and HealthBench Consensus score of 95.8 (+0.3).",
          "locator": "p. 19, sec. 6.1 (Table 6 cell, column 'gpt-6 Astra': 63.4 (69.5, 4097))"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-563"
    },
    {
      "id": 1870,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-fable-5",
      "modelKind": "model",
      "name": "Claude Fable 5 (September card)",
      "label": "Claude Fable 5 (September card)",
      "lab": "anthropic",
      "variant": "Measured as Claude Fable 5; Anthropic September card; length-adjusted; adaptive max effort; Opus 4.8 grader; five trials; no tools or custom system prompt; raw 68.9%",
      "value": 0.633,
      "valueLabel": "0.633",
      "display": "63.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 123,
      "sourceUrl": "https://www.anthropic.com/claude-fable-5-1-mythos-5-1-system-card",
      "quote": "HealthBench Professional | Length-adjusted score | Claude Fable 5 | 63.3%",
      "locator": "p. 199, Figure 8.17.2.A, Claude Fable 5 length-adjusted bar (visually read printed labels).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-1870"
    },
    {
      "id": 561,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-fable-5.1",
      "modelKind": "model",
      "name": "Claude Fable 5.1",
      "label": null,
      "lab": "anthropic",
      "variant": "length-adjusted (method published in the HealthBench Professional paper); Anthropic protocol: adaptive thinking at max effort, Claude Opus 4.8 grader, averaged over five trials, no tools or customized system prompt; Fable 5.1 run with safety classifiers active and a refusal-fallback to Claude Opus 5 (raw 74.2%).",
      "value": 0.621,
      "valueLabel": "0.621",
      "display": "62.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 123,
      "sourceUrl": "https://www.anthropic.com/claude-fable-5-1-mythos-5-1-system-card",
      "quote": "On HealthBench Professional, Claude Fable 5.1 achieved a raw score of 74.2%, ahead of Claude Opus 5 at 73.4%, Fable 5 at 68.9%, and Claude Sonnet 5 at 62.4%. After length adjustment, which penalizes verbose model responses, Fable 5.1 achieved a score of 62.1%.",
      "locator": "p. 199, sec. 8.17.2 (same figure printed as 62.1% in Table 8.1.A, p. 167)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-561"
    },
    {
      "id": 1803,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-6-luna",
      "modelKind": "model",
      "name": "GPT-6 Luna",
      "label": null,
      "lab": "openai",
      "variant": "OpenAI; length-adjusted; maximum reasoning effort; 60.8 (61.2, 2119) (adjusted, raw, mean response characters)",
      "value": 0.608,
      "valueLabel": "0.608",
      "display": "60.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1106,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-6-astra/healthbench",
      "quote": "Evaluation | GPT-5.5 | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | GPT-6 Astra | GPT-6 Sol | GPT-6 Luna\nHealthBench Professional length-adjusted | 51.8 (57.2, 3818) | 60.5 (64.1, 3228) | 57.7 (62.4, 3618) | 55.7 (59.8, 3389) | 64.7 (68.2, 3185) | 60.8 (59.5, 1573) | 60.8 (61.2, 2119)",
      "locator": "Section 11.4.1, Table 29, HealthBench Professional length-adjusted, GPT-6 Luna column; September 22 correction.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-1803"
    },
    {
      "id": 1802,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-6-sol",
      "modelKind": "model",
      "name": "GPT-6 Sol",
      "label": null,
      "lab": "openai",
      "variant": "OpenAI; length-adjusted; maximum reasoning effort; 60.8 (59.5, 1573) (adjusted, raw, mean response characters)",
      "value": 0.608,
      "valueLabel": "0.608",
      "display": "60.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1106,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-6-astra/healthbench",
      "quote": "Evaluation | GPT-5.5 | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | GPT-6 Astra | GPT-6 Sol | GPT-6 Luna\nHealthBench Professional length-adjusted | 51.8 (57.2, 3818) | 60.5 (64.1, 3228) | 57.7 (62.4, 3618) | 55.7 (59.8, 3389) | 64.7 (68.2, 3185) | 60.8 (59.5, 1573) | 60.8 (61.2, 2119)",
      "locator": "Section 11.4.1, Table 29, HealthBench Professional length-adjusted, GPT-6 Sol column; September 22 correction.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-1802"
    },
    {
      "id": 205,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.6-sol",
      "modelKind": "model",
      "name": "GPT-5.6 Sol",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted, max reasoning effort (64.1 unadjusted, 3,228 mean response chars); GPT-5.6 system card Table 6, column GPT-5.6-SOL. API max-effort setting, not the August ChatGPT production setting measured in row 492.",
      "value": 0.605,
      "valueLabel": "0.605",
      "display": "60.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 50,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-5-6/healthbench",
      "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
      "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)), column GPT-5.6-SOL",
      "corroborating": [
        {
          "source": 16,
          "role": "corroborating",
          "scoreDisplay": "60.5",
          "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
          "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)) (preview card, published 2026-06-26), column GPT-5.6-SOL"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-205"
    },
    {
      "id": 206,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-opus-5",
      "modelKind": "model",
      "name": "Claude Opus 5",
      "label": null,
      "lab": "anthropic",
      "variant": "length-adjusted, Anthropic protocol: adaptive thinking at max effort, Claude Opus 4.8 grader, averaged over 5 trials, no tools or custom system prompt (raw 73.4%).",
      "value": 0.598,
      "valueLabel": "0.598",
      "display": "59.8%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 31,
      "measured": "2026-07",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 98,
      "sourceUrl": "https://www.anthropic.com/claude-opus-5-system-card",
      "quote": "Claude Opus 5 achieved a raw score of 73.4%, which is the highest amongst all Claude models, ahead of Claude Mythos 5 at 70.3%, Claude Opus 4.8 at 60.3%, and Claude Sonnet 5 at 62.4%. After length adjustment, which penalizes verbose model responses, Claude Opus 5 achieved a score of 59.8%.",
      "locator": "p. 189, section 8.15.2 HealthBench Professional results; also Table 8.1.A p. 152 ('HealthBench Professional 59.8 ...')",
      "corroborating": [
        {
          "source": 123,
          "role": "corroborating",
          "scoreDisplay": "59.8%",
          "quote": "HealthBench Professional 62.1% 63.3% 59.8% –",
          "locator": "p. 167, Table 8.1.A, column 'Claude Opus 5'; raw 73.4% also reprinted on p. 199, sec. 8.17.2"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-206"
    },
    {
      "id": 505,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "muse-spark-1.1",
      "modelKind": "model",
      "name": "Muse Spark 1.1",
      "label": null,
      "lab": "meta",
      "variant": "length-normalized, GPT-5.4 low-reasoning grader, xhigh reasoning via Meta Model API (Muse Spark 1.1 Evaluation Report Figure 44)",
      "value": 0.593,
      "valueLabel": "0.593",
      "display": "59.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 31,
      "measured": "2026-07",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 105,
      "sourceUrl": "https://research.meta.ai/static/muse-spark-1-1-evaluation-report",
      "quote": "Health | HealthBench Professional | 59.3 | 54.1 | 41.6 | 55.8 | 51.8 (Figure 44 image table row; columns Muse Spark 1.1, Muse Spark, Gemini 3.1 Pro (high), Opus 4.8 (max), GPT 5.5 (xhigh))",
      "locator": "p. 101, Figure 44 'General capability benchmark results' (image), row HealthBench Professional, column Muse Spark 1.1; protocol p. 104 (printed 103): HealthBench Pro comprises 525 evaluation data points graded by rubrics. We use GPT-5.4 with low reasoning effort as the grader and report the length-normalized rubric score as done in their paper.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-505"
    },
    {
      "id": 207,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-sonnet-5",
      "modelKind": "model",
      "name": "Claude Sonnet 5",
      "label": null,
      "lab": "anthropic",
      "variant": "length-adjusted, Anthropic protocol: adaptive thinking at max effort, Claude Opus 4.8 grader, averaged over 5 trials, no tools or custom system prompt (raw 62.4%).",
      "value": 0.578,
      "valueLabel": "0.578",
      "display": "57.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 99,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-system-card",
      "quote": "HealthBench\nProfessional\n57.8 44.2 51.8 -",
      "locator": "p. 115, Table 8.1.A, row HealthBench Professional, column Claude Sonnet 5; Figure 8.12.2.A p. 139",
      "corroborating": [
        {
          "source": 98,
          "role": "corroborating",
          "scoreDisplay": "57.8%",
          "quote": "Figure 8.15.2.A bar labels: Claude Sonnet 5 62.4% raw / 57.8% length-adjusted (prose: 'Claude Sonnet 5 at 62.4%')",
          "locator": "p. 189, section 8.15.2, Figure 8.15.2.A"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-207"
    },
    {
      "id": 208,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.6-terra",
      "modelKind": "model",
      "name": "GPT-5.6 Terra",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted, max reasoning effort (62.4 unadjusted, 3,618 mean response chars); GPT-5.6 system card Table 6, column GPT-5.6-TERRA.",
      "value": 0.577,
      "valueLabel": "0.577",
      "display": "57.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 50,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-5-6/healthbench",
      "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
      "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)), column GPT-5.6-TERRA",
      "corroborating": [
        {
          "source": 16,
          "role": "corroborating",
          "scoreDisplay": "57.7",
          "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
          "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)) (preview card, published 2026-06-26), column GPT-5.6-TERRA"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-208"
    },
    {
      "id": 1871,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-opus-4.8",
      "modelKind": "model",
      "name": "Claude Opus 4.8 (Opus 4.8 grader)",
      "label": "Claude Opus 4.8 (Opus 4.8 grader)",
      "lab": "anthropic",
      "variant": "Anthropic June evaluation; length-adjusted; adaptive max effort; Opus 4.8 grader; five trials; no tools or custom system prompt",
      "value": 0.574,
      "valueLabel": "0.574",
      "display": "57.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 99,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-system-card",
      "quote": "HealthBench Professional | Length-adjusted score (%) | Claude Opus 4.8 | 57.4%",
      "locator": "p. 139, Figure 8.12.2.A, Claude Opus 4.8 bar (visually read printed labels).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-1871"
    },
    {
      "id": 1804,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "grok-4.7",
      "modelKind": "model",
      "name": "Grok 4.7",
      "label": null,
      "lab": "xai",
      "variant": "SpaceXAI evaluation; xHigh effort; HealthBench Professional",
      "value": 0.5670000000000001,
      "valueLabel": "0.567",
      "display": "56.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1290,
      "sourceUrl": "https://x.ai/news/grok-4-7",
      "quote": "Grok 4.7 xHigh\nGrok 4.6 High\nGPT-5.6 Sol Max\nFable 5.1 Max\nClinical reasoningHealthBench Professional\n56.7%\n48.5%\n60.5%\n62.1%",
      "locator": "Model Improvements comparison table, Clinical reasoning / HealthBench Professional row; Grok 4.7 column; September 21, 2026.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-1804"
    },
    {
      "id": 209,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-opus-4.8",
      "modelKind": "model",
      "name": "Claude Opus 4.8",
      "label": null,
      "lab": "anthropic",
      "variant": "length-adjusted, adaptive thinking at max effort, Claude Sonnet 4.6 grader (the grader used by the Opus 4.8 card itself); the other Claude rows on this board use the Claude Opus 4.8 grader, under which Anthropic later prints 57.4 for this model.",
      "value": 0.558,
      "valueLabel": "0.558",
      "display": "55.8%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 31,
      "measured": "2026-05",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 101,
      "sourceUrl": "https://www.anthropic.com/claude-opus-4-8-system-card",
      "quote": "Claude Opus 4.8 scores 55.8%, a meaningful improvement over Claude Opus 4.7 at 51.9% and Claude Sonnet 4.6 at 41.7%.",
      "locator": "p. 228, section 8.14.1 HealthBench Professional; Figure 8.14.A p. 229",
      "corroborating": [
        {
          "source": 61,
          "role": "conflicting",
          "scoreDisplay": "56.9",
          "quote": "HealthBench\nProfessional\n66.0 - 64.7 56.9 51.8 -",
          "locator": "p. 252, Table 8.1.A, column Opus 4.8"
        },
        {
          "source": 98,
          "role": "conflicting",
          "scoreDisplay": "57.4",
          "quote": "HealthBench Professional 59.8 57.4 66.011 60.5",
          "locator": "p. 152, Table 8.1.A, column Opus 4.8"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-209"
    },
    {
      "id": 210,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.6-luna",
      "modelKind": "model",
      "name": "GPT-5.6 Luna",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted, max reasoning effort (59.8 unadjusted, 3,389 mean response chars); GPT-5.6 system card Table 6, column GPT-5.6-LUNA. API max-effort setting, not the August ChatGPT production setting measured in row 493.",
      "value": 0.557,
      "valueLabel": "0.557",
      "display": "55.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 50,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-5-6/healthbench",
      "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
      "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)), column GPT-5.6-LUNA",
      "corroborating": [
        {
          "source": 16,
          "role": "corroborating",
          "scoreDisplay": "55.7",
          "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
          "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)) (preview card, published 2026-06-26), column GPT-5.6-LUNA"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-210"
    },
    {
      "id": 506,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "muse-spark",
      "modelKind": "model",
      "name": "Muse Spark",
      "label": null,
      "lab": "meta",
      "variant": "length-normalized, GPT-5.4 low-reasoning grader; Muse Spark (1.0) column in the Muse Spark 1.1 Evaluation Report Figure 44",
      "value": 0.541,
      "valueLabel": "0.541",
      "display": "54.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 31,
      "measured": "2026-07",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 105,
      "sourceUrl": "https://research.meta.ai/static/muse-spark-1-1-evaluation-report",
      "quote": "Health | HealthBench Professional | 59.3 | 54.1 | 41.6 | 55.8 | 51.8 (Figure 44 image table row; columns Muse Spark 1.1, Muse Spark, Gemini 3.1 Pro (high), Opus 4.8 (max), GPT 5.5 (xhigh))",
      "locator": "p. 101, Figure 44 (image), row HealthBench Professional, column Muse Spark; protocol p. 104 (printed 103)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-506"
    },
    {
      "id": 492,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.6-sol",
      "modelKind": "model",
      "name": "GPT-5.6 Sol (August)",
      "label": "GPT-5.6 Sol (August)",
      "lab": "openai",
      "variant": "ChatGPT production (Instant) deployment setting, length-adjusted, GPT-5.6 August Updates PDF column GPT-5.6 Sol (August) (56.6 unadjusted, 2,894 chars)",
      "value": 0.54,
      "valueLabel": "0.540",
      "display": "54.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 31,
      "measured": "2026-08",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 30,
      "sourceUrl": "https://cdn.openai.com/pdf/GPT_5_6_August_Updates.pdf",
      "quote": "HealthBench Professional 32.9 (33.8, 2,285) 38.4 (40.7, 2,775) 54.0 (56.6, 2,894) 44.1 (46.8, 2,920)",
      "locator": "p. 11, section 5.1 HealthBench, table \"Reported as length-adjusted score (unadjusted, mean response length in characters)\", column GPT-5.6 Sol (August)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-492"
    },
    {
      "id": 504,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-opus-4.7",
      "modelKind": "model",
      "name": "Claude Opus 4.7",
      "label": null,
      "lab": "anthropic",
      "variant": "length-adjusted; adaptive thinking at max effort; Claude Sonnet 4.6 grader; 5 trials; comparison model in the Opus 4.8 card",
      "value": 0.519,
      "valueLabel": "0.519",
      "display": "51.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 31,
      "measured": "2026-05",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 101,
      "sourceUrl": "https://www.anthropic.com/claude-opus-4-8-system-card",
      "quote": "Claude Opus 4.8 scores 55.8%, a meaningful improvement over Claude Opus 4.7 at 51.9% and Claude Sonnet 4.6 at 41.7%.",
      "locator": "p. 228, section 8.14.1 HealthBench Professional; Figure 8.14.A p. 229",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-504"
    },
    {
      "id": 489,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.5",
      "modelKind": "model",
      "name": "GPT-5.5",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted, max reasoning effort, GPT-5.6 system card Table 6 column GPT-5.5 (57.2 unadjusted, 3818 chars)",
      "value": 0.518,
      "valueLabel": "0.518",
      "display": "51.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 22,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 50,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-5-6/healthbench",
      "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
      "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)), column GPT-5.5",
      "corroborating": [
        {
          "source": 16,
          "role": "corroborating",
          "scoreDisplay": "51.8",
          "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
          "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)) (preview card, published 2026-06-26), column GPT-5.5"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-489"
    },
    {
      "id": 1805,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "grok-4.6",
      "modelKind": "model",
      "name": "Grok 4.6",
      "label": null,
      "lab": "xai",
      "variant": "SpaceXAI evaluation; High effort; HealthBench Professional",
      "value": 0.485,
      "valueLabel": "0.485",
      "display": "48.5%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 23,
      "rowsOnBoard": 31,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1290,
      "sourceUrl": "https://x.ai/news/grok-4-7",
      "quote": "Grok 4.7 xHigh\nGrok 4.6 High\nGPT-5.6 Sol Max\nFable 5.1 Max\nClinical reasoningHealthBench Professional\n56.7%\n48.5%\n60.5%\n62.1%",
      "locator": "Model Improvements comparison table, Clinical reasoning / HealthBench Professional row; Grok 4.6 column; September 21, 2026.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-1805"
    },
    {
      "id": 488,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT-5.4",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted, max reasoning effort, GPT-5.6 system card Table 6 column GPT-5.4 (51.9 unadjusted, 3308 chars)",
      "value": 0.481,
      "valueLabel": "0.481",
      "display": "48.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 50,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-5-6/healthbench",
      "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
      "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)), column GPT-5.4",
      "corroborating": [
        {
          "source": 16,
          "role": "corroborating",
          "scoreDisplay": "48.1",
          "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
          "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)) (preview card, published 2026-06-26), column GPT-5.4"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-488"
    },
    {
      "id": 485,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT-5",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted, max reasoning effort, GPT-5.6 system card Table 6 column GPT-5 (51.0 unadjusted, 3616 chars)",
      "value": 0.462,
      "valueLabel": "0.462",
      "display": "46.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 50,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-5-6/healthbench",
      "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
      "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)), column GPT-5",
      "corroborating": [
        {
          "source": 16,
          "role": "corroborating",
          "scoreDisplay": "46.2",
          "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
          "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)) (preview card, published 2026-06-26), column GPT-5"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-485"
    },
    {
      "id": 487,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT-5.2",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted, max reasoning effort, GPT-5.6 system card Table 6 column GPT-5.2 (50.0 unadjusted, 3400 chars)",
      "value": 0.459,
      "valueLabel": "0.459",
      "display": "45.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 50,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-5-6/healthbench",
      "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
      "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)), column GPT-5.2",
      "corroborating": [
        {
          "source": 16,
          "role": "corroborating",
          "scoreDisplay": "45.9",
          "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
          "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)) (preview card, published 2026-06-26), column GPT-5.2"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-487"
    },
    {
      "id": 503,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude Sonnet 4.6",
      "label": null,
      "lab": "anthropic",
      "variant": "length-adjusted; Anthropic protocol: adaptive thinking at max effort, Claude Opus 4.8 grader, averaged over 5 trials, no tools or custom system prompt; comparison column in the Sonnet 5 card. Other Anthropic prints: 44.4% (Fable card Figure 8.18.2.A), 41.7% (Opus 4.8 card, Sonnet 4.6 grader)",
      "value": 0.442,
      "valueLabel": "0.442",
      "display": "44.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 27,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 99,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-system-card",
      "quote": "HealthBench\nProfessional\n57.8 44.2 51.8 -",
      "locator": "p. 115, Table 8.1.A, row HealthBench Professional, column Claude Sonnet 4.6",
      "corroborating": [
        {
          "source": 101,
          "role": "conflicting",
          "scoreDisplay": "41.7%",
          "quote": "Claude Opus 4.8 scores 55.8%, a meaningful improvement over Claude Opus 4.7 at 51.9% and Claude Sonnet 4.6 at 41.7%.",
          "locator": "p. 228, section 8.14.1"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-503"
    },
    {
      "id": 493,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.6-luna",
      "modelKind": "model",
      "name": "GPT-5.6 Luna (August)",
      "label": "GPT-5.6 Luna (August)",
      "lab": "openai",
      "variant": "ChatGPT production (Instant) deployment setting, length-adjusted, GPT-5.6 August Updates PDF column GPT-5.6 Luna (August) (46.8 unadjusted, 2,920 chars)",
      "value": 0.441,
      "valueLabel": "0.441",
      "display": "44.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 31,
      "measured": "2026-08",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 30,
      "sourceUrl": "https://cdn.openai.com/pdf/GPT_5_6_August_Updates.pdf",
      "quote": "HealthBench Professional 32.9 (33.8, 2,285) 38.4 (40.7, 2,775) 54.0 (56.6, 2,894) 44.1 (46.8, 2,920)",
      "locator": "p. 11, section 5.1 HealthBench, table \"Reported as length-adjusted score (unadjusted, mean response length in characters)\", column GPT-5.6 Luna (August)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-493"
    },
    {
      "id": 486,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.1",
      "modelKind": "model",
      "name": "GPT-5.1",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted, max reasoning effort, GPT-5.6 system card Table 6 column GPT-5.1 (48.0 unadjusted, 4863 chars)",
      "value": 0.396,
      "valueLabel": "0.396",
      "display": "39.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 29,
      "rowsOnBoard": 31,
      "measured": "2026-06",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 50,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-5-6/healthbench",
      "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
      "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)), column GPT-5.1",
      "corroborating": [
        {
          "source": 16,
          "role": "corroborating",
          "scoreDisplay": "39.6",
          "quote": "HealthBench Professional length-adjusted   46.2 (51.0, 3616)   39.6 (48.0, 4863)   45.9 (50.0, 3400)   48.1 (51.9, 3308)   51.8 (57.2, 3818)   60.5 (64.1, 3228)   57.7 (62.4, 3618)   55.7 (59.8, 3389)",
          "locator": "Section 5.1 HealthBench, Table 6 (reported as length-adjusted score (unadjusted, mean response length in characters)) (preview card, published 2026-06-26), column GPT-5.1"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-486"
    },
    {
      "id": 211,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "gpt-5.5-instant",
      "modelKind": "model",
      "name": "GPT-5.5 Instant",
      "label": null,
      "lab": "openai",
      "variant": "length-adjusted (40.7 unadjusted, 2,775 mean response chars); GPT-5.5 Instant system card Table 5, column GPT-5.5 INSTANT.",
      "value": 0.384,
      "valueLabel": "0.384",
      "display": "38.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 30,
      "rowsOnBoard": 31,
      "measured": "2026-05",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 51,
      "sourceUrl": "https://deploymentsafety.openai.com/gpt-5-5-instant/healthbench",
      "quote": "HealthBench Professional   37.6 (40.4, 2,973)   35.7 (38.3, 2,872)   32.9 (33.8, 2,285)   38.4 (40.7, 2,775)",
      "locator": "Section 4.1 HealthBench, Table 5 (reported as length-adjusted score (unadjusted, mean response length in characters)), column GPT-5.5 INSTANT",
      "corroborating": [
        {
          "source": 30,
          "role": "corroborating",
          "scoreDisplay": "38.4",
          "quote": "HealthBench Professional 32.9 (33.8, 2,285) 38.4 (40.7, 2,775) 54.0 (56.6, 2,894) 44.1 (46.8, 2,920)",
          "locator": "p. 11, section 5.1 HealthBench, table \"Reported as length-adjusted score (unadjusted, mean response length in characters)\", column GPT-5.5 Instant"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-211"
    },
    {
      "id": 212,
      "benchmark": "healthbench-professional",
      "metric": null,
      "model": "mai-thinking-1",
      "modelKind": "model",
      "name": "MAI-Thinking-1",
      "label": null,
      "lab": "microsoft",
      "variant": "length-adjusted (HealthBench Professional length penalty), standard GPT-5.4 grader and OpenAI rubrics, Microsoft AI run; printed at integer precision.",
      "value": 0.35,
      "valueLabel": "0.350",
      "display": "35",
      "lo": null,
      "hi": null,
      "rankOnBoard": 31,
      "rowsOnBoard": 31,
      "measured": "2026-08",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 75,
      "sourceUrl": "https://microsoft.ai/pdf/mai-thinking-1.pdf",
      "quote": "Model AIR-Bench CyberSec Instruct CyberSec Auto Long Fact Truthful QA HealthBench Prof. MedXpert QA\nMAI-Thinking-1 88 63 63 98 88 35 43\nSonnet 4.6 88 62 56 98 88 38 49",
      "locator": "p. 54, Table 12 'Post-trained model evaluation results on various public benchmarks', Health group, column HealthBench Prof.; protocol Appendix K.6 p. 106: HealthBench Professional introduces a length penalty for the primary metric, to correct for a well-observed correlation between lengthy responses and artificially increased LLM-grader scores. For all reported scores, we use the standard GPT-5.4 grader and rubrics provided by OpenAI.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthbench-professional#r-212"
    },
    {
      "id": 2151,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-5.5",
      "modelKind": "model",
      "name": "Claude Opus 5.5",
      "label": null,
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-5-5; temperature=1; max_output_tokens=128000; compute_effort=max",
      "value": 91.43,
      "valueLabel": "91.43",
      "display": "91.43%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "1 | Claude Opus 5.5 | 91.43%±1.93 | $4/$20 | 7m22s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 1 of 105 (Claude Opus 5.5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-5-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2151"
    },
    {
      "id": 354,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-fable-5.1",
      "modelKind": "model",
      "name": "Claude Fable 5.1",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 91.29,
      "valueLabel": "91.29",
      "display": "91.29%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "2 | Claude Fable 5.1 | 91.29%±1.95 | $10/$50 | 3m08s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 2 of 105 (Claude Fable 5.1), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-fable-5-1\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-354"
    },
    {
      "id": 2152,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-sonnet-5.5",
      "modelKind": "model",
      "name": "Claude Sonnet 5.5",
      "label": null,
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-5-5; temperature=1; max_output_tokens=128000; compute_effort=max",
      "value": 91.1,
      "valueLabel": "91.10",
      "display": "91.10%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "3 | Claude Sonnet 5.5 | 91.10%±1.96 | $2/$10 | 5m07s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 3 of 105 (Claude Sonnet 5.5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-5-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2152"
    },
    {
      "id": 150,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-5",
      "modelKind": "model",
      "name": "Claude Opus 5",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 90.98,
      "valueLabel": "90.98",
      "display": "90.98%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "4 | Claude Opus 5 | 90.98%±1.92 | $5/$25 | 76.56s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 4 of 105 (Claude Opus 5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-150"
    },
    {
      "id": 355,
      "benchmark": "medscribe",
      "metric": null,
      "model": "muse-spark-1.2",
      "modelKind": "model",
      "name": "Muse Spark 1.2",
      "label": null,
      "lab": "meta",
      "variant": "",
      "value": 90.06,
      "valueLabel": "90.06",
      "display": "90.06%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "5 | Muse Spark 1.2 | 90.06%±1.96 | $1.25/$4.25 | 61.46s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 5 of 105 (Muse Spark 1.2), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"meta/muse_spark_1_2\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-355"
    },
    {
      "id": 2153,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4.7",
      "modelKind": "model",
      "name": "Grok 4.7",
      "label": null,
      "lab": "xai",
      "variant": "model ID grok/grok-4.7; temperature=1; top_p=0.95; reasoning_effort=xhigh",
      "value": 89.38,
      "valueLabel": "89.38",
      "display": "89.38%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "6 | Grok 4.7 | 89.38%±1.89 | $2/$6 | 2m33s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 6 of 105 (Grok 4.7), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4.7\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2153"
    },
    {
      "id": 2154,
      "benchmark": "medscribe",
      "metric": null,
      "model": "glm-5.3-flash",
      "modelKind": "model",
      "name": "GLM 5.3 Flash",
      "label": null,
      "lab": "zhipu",
      "variant": "model ID zai/glm-5.3-flash; temperature=1; top_p=0.95; max_output_tokens=30000; reasoning_effort=max",
      "value": 88.94,
      "valueLabel": "88.94",
      "display": "88.94%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "7 | GLM 5.3 Flash | 88.94%±1.91 | $0.075/$0.25 | 86.98s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 7 of 105 (GLM 5.3 Flash), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"zai/glm-5.3-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2154"
    },
    {
      "id": 356,
      "benchmark": "medscribe",
      "metric": null,
      "model": "muse-spark-1.1",
      "modelKind": "model",
      "name": "Muse Spark 1.1",
      "label": null,
      "lab": "meta",
      "variant": "",
      "value": 88.89,
      "valueLabel": "88.89",
      "display": "88.89%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "8 | Muse Spark 1.1 | 88.89%±1.95 | $1.25/$4.25 | 63.34s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 8 of 105 (Muse Spark 1.1), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"meta/muse_spark_1_1\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-356"
    },
    {
      "id": 2155,
      "benchmark": "medscribe",
      "metric": null,
      "model": "glm-5.3",
      "modelKind": "model",
      "name": "GLM 5.3",
      "label": null,
      "lab": "zhipu",
      "variant": "model ID zai/glm-5.3; temperature=1; top_p=0.95; max_output_tokens=30000; reasoning_effort=max",
      "value": 88.81,
      "valueLabel": "88.81",
      "display": "88.81%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "9 | GLM 5.3 | 88.81%±2.00 | $1.4/$4.4 | 2m02s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 9 of 105 (GLM 5.3), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"zai/glm-5.3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2155"
    },
    {
      "id": 357,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-fable-5",
      "modelKind": "model",
      "name": "Claude Fable 5",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 88.52,
      "valueLabel": "88.52",
      "display": "88.52%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "10 | Claude Fable 5 | 88.52%±1.95 | $10/$50 | 119.47s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 10 of 105 (Claude Fable 5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-fable-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-357"
    },
    {
      "id": 2156,
      "benchmark": "medscribe",
      "metric": null,
      "model": "mimo-v2.6-pro",
      "modelKind": "model",
      "name": "MiMo V2.6 Pro",
      "label": null,
      "lab": "xiaomi",
      "variant": "model ID xiaomi/mimo-v2.6-pro; temperature=1; top_p=0.95; max_output_tokens=128000",
      "value": 88.31,
      "valueLabel": "88.31",
      "display": "88.31%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "11 | MiMo V2.6 Pro | 88.31%±1.94 | $0.435/$0.87 | 2m53s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 11 of 105 (MiMo V2.6 Pro), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"xiaomi/mimo-v2.6-pro\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2156"
    },
    {
      "id": 358,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5.1",
      "modelKind": "model",
      "name": "GPT 5.1",
      "label": "GPT 5.1",
      "lab": "openai",
      "variant": "",
      "value": 88.09,
      "valueLabel": "88.09",
      "display": "88.09%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "12 | GPT 5.1 | 88.09%±1.94 | $1.25/$10 | 77.98s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 12 of 105 (GPT 5.1), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5.1-2025-11-13\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-358"
    },
    {
      "id": 359,
      "benchmark": "medscribe",
      "metric": null,
      "model": "kimi-k3",
      "modelKind": "model",
      "name": "Kimi K3",
      "label": null,
      "lab": "moonshot",
      "variant": "",
      "value": 87.96,
      "valueLabel": "87.96",
      "display": "87.96%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "13 | Kimi K3 | 87.96%±1.89 | $3/$15 | 2m17s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 13 of 105 (Kimi K3), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"kimi/kimi-k3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-359"
    },
    {
      "id": 567,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-6-astra",
      "modelKind": "model",
      "name": "GPT-6 Astra",
      "label": null,
      "lab": "openai",
      "variant": "",
      "value": 87.91,
      "valueLabel": "87.91",
      "display": "87.91%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "14 | GPT-6 Astra | 87.91%±1.94 | $10/$50 | 2m34s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 14 of 105 (GPT-6 Astra), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-6-astra\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-567"
    },
    {
      "id": 360,
      "benchmark": "medscribe",
      "metric": null,
      "model": "minimax-m3",
      "modelKind": "model",
      "name": "MiniMax-M3",
      "label": "MiniMax-M3",
      "lab": "minimax",
      "variant": "",
      "value": 87.25,
      "valueLabel": "87.25",
      "display": "87.25%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "15 | MiniMax-M3 | 87.25%±1.96 | $0.6/$2.4 | 2m04s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 15 of 105 (MiniMax-M3), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"minimax/MiniMax-M3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-360"
    },
    {
      "id": 2157,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4.5",
      "modelKind": "model",
      "name": "Grok 4.5",
      "label": null,
      "lab": "xai",
      "variant": "model ID grok/grok-4.5; temperature=1; top_p=0.95; max_output_tokens=30000; reasoning_effort=high",
      "value": 86.88,
      "valueLabel": "86.88",
      "display": "86.88%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "16 | Grok 4.5 | 86.88%±1.94 | $2/$6 | 11m45s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 16 of 105 (Grok 4.5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2157"
    },
    {
      "id": 361,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5.5",
      "modelKind": "model",
      "name": "GPT 5.5",
      "label": "GPT 5.5",
      "lab": "openai",
      "variant": "",
      "value": 86.87,
      "valueLabel": "86.87",
      "display": "86.87%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "17 | GPT 5.5 | 86.87%±1.93 | $5/$30 | 2m13s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 17 of 105 (GPT 5.5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-361"
    },
    {
      "id": 362,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude Opus 4.6 (Nonthinking)",
      "label": "Claude Opus 4.6 (Nonthinking)",
      "lab": "anthropic",
      "variant": "",
      "value": 86.74,
      "valueLabel": "86.74",
      "display": "86.74%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "18 | Claude Opus 4.6 (Nonthinking) | 86.74%±1.94 | $5/$25 | 54.32s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 18 of 105 (Claude Opus 4.6 (Nonthinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-6\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-362"
    },
    {
      "id": 363,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4.6",
      "modelKind": "model",
      "name": "Grok 4.6",
      "label": null,
      "lab": "xai",
      "variant": "",
      "value": 86.53,
      "valueLabel": "86.53",
      "display": "86.53%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "19 | Grok 4.6 | 86.53%±1.96 | $2/$6 | 70.94s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 19 of 105 (Grok 4.6), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4.6\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-363"
    },
    {
      "id": 2158,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-6.1-sol",
      "modelKind": "model",
      "name": "GPT-6.1 Sol",
      "label": null,
      "lab": "openai",
      "variant": "model ID openai/gpt-6.1-sol; max_output_tokens=128000; reasoning_effort=max",
      "value": 86.45,
      "valueLabel": "86.45",
      "display": "86.45%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "20 | GPT-6.1 Sol | 86.45%±1.90 | $2/$10 | 2m50s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 20 of 105 (GPT-6.1 Sol), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-6.1-sol\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2158"
    },
    {
      "id": 2159,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude Opus 4.6 (Thinking)",
      "label": "Claude Opus 4.6 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-6-thinking; temperature=1; max_output_tokens=30000; compute_effort=max",
      "value": 86.13,
      "valueLabel": "86.13",
      "display": "86.13%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "21 | Claude Opus 4.6 (Thinking) | 86.13%±1.94 | $5/$25 | 2m08s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 21 of 105 (Claude Opus 4.6 (Thinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-6-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2159"
    },
    {
      "id": 2160,
      "benchmark": "medscribe",
      "metric": null,
      "model": "muse-spark",
      "modelKind": "model",
      "name": "Muse Spark",
      "label": null,
      "lab": "meta",
      "variant": "model ID meta/muse_spark; temperature=1; max_output_tokens=30000",
      "value": 85.9,
      "valueLabel": "85.90",
      "display": "85.90%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 22,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "22 | Muse Spark | 85.90%±1.85 | N/A | 3m11s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 22 of 105 (Muse Spark), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"meta/muse_spark\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2160"
    },
    {
      "id": 2161,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-4.8",
      "modelKind": "model",
      "name": "Claude Opus 4.8",
      "label": null,
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-8; temperature=1; max_output_tokens=30000; compute_effort=max",
      "value": 85.75,
      "valueLabel": "85.75",
      "display": "85.75%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 23,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "23 | Claude Opus 4.8 | 85.75%±1.93 | $5/$25 | 82.36s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 23 of 105 (Claude Opus 4.8), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-8\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2161"
    },
    {
      "id": 2162,
      "benchmark": "medscribe",
      "metric": null,
      "model": "deepseek-v4.1-flash",
      "modelKind": "model",
      "name": "DeepSeek V4.1 Flash",
      "label": null,
      "lab": "deepseek",
      "variant": "model ID deepseek/deepseek-v4.1-flash; max_output_tokens=384000; reasoning_effort=high",
      "value": 85.5,
      "valueLabel": "85.50",
      "display": "85.50%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "24 | DeepSeek V4.1 Flash | 85.50%±1.92 | $0.3/$1.2 | 53.83s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 24 of 105 (DeepSeek V4.1 Flash), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"deepseek/deepseek-v4.1-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2162"
    },
    {
      "id": 2163,
      "benchmark": "medscribe",
      "metric": null,
      "model": "inkling",
      "modelKind": "model",
      "name": "Inkling",
      "label": null,
      "lab": "thinking-machines",
      "variant": "model ID thinkingmachines/inkling; temperature=1; top_p=1; max_output_tokens=30000; reasoning_effort=0.99",
      "value": 85.41,
      "valueLabel": "85.41",
      "display": "85.41%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "25 | Inkling | 85.41%±1.84 | $1/$4.05 | 4m05s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 25 of 105 (Inkling), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"thinkingmachines/inkling\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2163"
    },
    {
      "id": 2164,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-4.5",
      "modelKind": "model",
      "name": "Claude Opus 4.5 (Thinking)",
      "label": "Claude Opus 4.5 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-5-20251101-thinking; temperature=1; max_output_tokens=30000; compute_effort=high",
      "value": 85.32,
      "valueLabel": "85.32",
      "display": "85.32%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "26 | Claude Opus 4.5 (Thinking) | 85.32%±1.90 | $5/$25 | 72.11s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 26 of 105 (Claude Opus 4.5 (Thinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-5-20251101-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2164"
    },
    {
      "id": 2165,
      "benchmark": "medscribe",
      "metric": null,
      "model": "mimo-v2.6-flash",
      "modelKind": "model",
      "name": "MiMo V2.6 Flash",
      "label": null,
      "lab": "xiaomi",
      "variant": "model ID xiaomi/mimo-v2.6-flash; temperature=1; top_p=0.95; max_output_tokens=128000",
      "value": 85.28,
      "valueLabel": "85.28",
      "display": "85.28%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 27,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "27 | MiMo V2.6 Flash | 85.28%±1.99 | $0.14/$0.28 | 74.48s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 27 of 105 (MiMo V2.6 Flash), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"xiaomi/mimo-v2.6-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2165"
    },
    {
      "id": 2167,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-haiku-4.5",
      "modelKind": "model",
      "name": "Claude Haiku 4.5 (Thinking)",
      "label": "Claude Haiku 4.5 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-haiku-4-5-20251001-thinking; temperature=1; max_output_tokens=30000",
      "value": 85.23,
      "valueLabel": "85.23",
      "display": "85.23%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "29 | Claude Haiku 4.5 (Thinking) | 85.23%±1.90 | $1/$5 | 66.20s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 29 of 105 (Claude Haiku 4.5 (Thinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-haiku-4-5-20251001-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2167"
    },
    {
      "id": 2166,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5.6-sol",
      "modelKind": "model",
      "name": "GPT-5.6 Sol",
      "label": null,
      "lab": "openai",
      "variant": "model ID openai/gpt-5.6-sol; max_output_tokens=30000; reasoning_effort=max",
      "value": 85.23,
      "valueLabel": "85.23",
      "display": "85.23%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "28 | GPT-5.6 Sol | 85.23%±1.97 | $4/$20 | 94.40s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 28 of 105 (GPT-5.6 Sol), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5.6-sol\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2166"
    },
    {
      "id": 2168,
      "benchmark": "medscribe",
      "metric": null,
      "model": "qwen3.8-max",
      "modelKind": "model",
      "name": "Qwen 3.8 Max",
      "label": "Qwen 3.8 Max",
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.8-max; temperature=1; max_output_tokens=30000",
      "value": 84.95,
      "valueLabel": "84.95",
      "display": "84.95%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 30,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "30 | Qwen 3.8 Max | 84.95%±2.00 | $2/$6 | 4m11s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 30 of 105 (Qwen 3.8 Max), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"alibaba/qwen3.8-max\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2168"
    },
    {
      "id": 2169,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-sonnet-4.5",
      "modelKind": "model",
      "name": "Claude Sonnet 4.5 (Nonthinking)",
      "label": "Claude Sonnet 4.5 (Nonthinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-4-5-20250929; temperature=1; max_output_tokens=30000",
      "value": 84.52,
      "valueLabel": "84.52",
      "display": "84.52%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 31,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "31 | Claude Sonnet 4.5 (Nonthinking) | 84.52%±1.93 | $3/$15 | 44.42s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 31 of 105 (Claude Sonnet 4.5 (Nonthinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-4-5-20250929\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2169"
    },
    {
      "id": 2170,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-3.8-flash",
      "modelKind": "model",
      "name": "Gemini 3.8 Flash",
      "label": null,
      "lab": "google",
      "variant": "model ID google/gemini-3.8-flash; temperature=1; max_output_tokens=65536; reasoning_effort=high",
      "value": 84.5,
      "valueLabel": "84.50",
      "display": "84.50%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 32,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "32 | Gemini 3.8 Flash | 84.50%±1.94 | $1.5/$7.5 | 21.14s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 32 of 105 (Gemini 3.8 Flash), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-3.8-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2170"
    },
    {
      "id": 2172,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT 5.2",
      "label": "GPT 5.2",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.2-2025-12-11; max_output_tokens=30000; reasoning_effort=xhigh",
      "value": 84.39,
      "valueLabel": "84.39",
      "display": "84.39%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 33,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "34 | GPT 5.2 | 84.39%±1.86 | $1.75/$14 | 2m06s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 34 of 105 (GPT 5.2), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5.2-2025-12-11\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2172"
    },
    {
      "id": 2171,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5.6-luna",
      "modelKind": "model",
      "name": "GPT-5.6 Luna",
      "label": null,
      "lab": "openai",
      "variant": "model ID openai/gpt-5.6-luna; max_output_tokens=30000; reasoning_effort=max",
      "value": 84.39,
      "valueLabel": "84.39",
      "display": "84.39%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 33,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "33 | GPT-5.6 Luna | 84.39%±2.58 | $0.2/$1.2 | 116.89s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 33 of 105 (GPT-5.6 Luna), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5.6-luna\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2171"
    },
    {
      "id": 2173,
      "benchmark": "medscribe",
      "metric": null,
      "model": "inkling-small",
      "modelKind": "model",
      "name": "Inkling Small",
      "label": null,
      "lab": "thinking-machines",
      "variant": "model ID thinkingmachines/inkling-small; temperature=1; top_p=1; max_output_tokens=30000; reasoning_effort=0.99",
      "value": 84.11,
      "valueLabel": "84.11",
      "display": "84.11%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 35,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "35 | Inkling Small | 84.11%±1.87 | $0.3/$1.2 | 3m50s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 35 of 105 (Inkling Small), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"thinkingmachines/inkling-small\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2173"
    },
    {
      "id": 2174,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-sonnet-4.5",
      "modelKind": "model",
      "name": "Claude Sonnet 4.5 (Thinking)",
      "label": "Claude Sonnet 4.5 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-4-5-20250929-thinking; temperature=1; max_output_tokens=30000",
      "value": 84.1,
      "valueLabel": "84.10",
      "display": "84.10%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 36,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "36 | Claude Sonnet 4.5 (Thinking) | 84.10%±1.87 | $3/$15 | 67.92s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 36 of 105 (Claude Sonnet 4.5 (Thinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-4-5-20250929-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2174"
    },
    {
      "id": 2175,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-3.7-flash",
      "modelKind": "model",
      "name": "Gemini 3.7 Flash",
      "label": null,
      "lab": "google",
      "variant": "model ID google/gemini-3.7-flash; temperature=1; max_output_tokens=30000; reasoning_effort=high",
      "value": 83.94,
      "valueLabel": "83.94",
      "display": "83.94%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 37,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "37 | Gemini 3.7 Flash | 83.94%±2.00 | $1.5/$7.5 | 16.82s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 37 of 105 (Gemini 3.7 Flash), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-3.7-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2175"
    },
    {
      "id": 2176,
      "benchmark": "medscribe",
      "metric": null,
      "model": "qwen-3.8-27b",
      "modelKind": "model",
      "name": "Qwen 3.8 27B",
      "label": null,
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.8-27b; temperature=1; top_p=0.95; max_output_tokens=30000; reasoning_effort=xhigh",
      "value": 83.85,
      "valueLabel": "83.85",
      "display": "83.85%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 38,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "38 | Qwen 3.8 27B | 83.85%±1.98 | $0.5/$3 | 89.70s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 38 of 105 (Qwen 3.8 27B), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"alibaba/qwen3.8-27b\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2176"
    },
    {
      "id": 2177,
      "benchmark": "medscribe",
      "metric": null,
      "model": "mimo-v2.5-pro",
      "modelKind": "model",
      "name": "MiMo V2.5 Pro",
      "label": null,
      "lab": "xiaomi",
      "variant": "model ID xiaomi/mimo-v2.5-pro; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 83.73,
      "valueLabel": "83.73",
      "display": "83.73%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 39,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "39 | MiMo V2.5 Pro | 83.73%±2.06 | $0.435/$0.87 | 90.71s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 39 of 105 (MiMo V2.5 Pro), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"xiaomi/mimo-v2.5-pro\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2177"
    },
    {
      "id": 2178,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-6-luna",
      "modelKind": "model",
      "name": "GPT-6 Luna",
      "label": null,
      "lab": "openai",
      "variant": "model ID openai/gpt-6-luna; max_output_tokens=128000; reasoning_effort=max",
      "value": 83.71,
      "valueLabel": "83.71",
      "display": "83.71%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 40,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "40 | GPT-6 Luna | 83.71%±1.95 | $0.1/$0.5 | 2m50s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 40 of 105 (GPT-6 Luna), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-6-luna\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2178"
    },
    {
      "id": 2179,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT 5",
      "label": "GPT 5",
      "lab": "openai",
      "variant": "model ID openai/gpt-5-2025-08-07; max_output_tokens=30000; reasoning_effort=high",
      "value": 83.65,
      "valueLabel": "83.65",
      "display": "83.65%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 41,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "41 | GPT 5 | 83.65%±1.94 | $1.25/$10 | 3m05s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 41 of 105 (GPT 5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5-2025-08-07\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2179"
    },
    {
      "id": 2180,
      "benchmark": "medscribe",
      "metric": null,
      "model": "hy4-preview",
      "modelKind": "model",
      "name": "Hy4 Preview",
      "label": null,
      "lab": "tencent",
      "variant": "model ID tencent/hy4-preview; temperature=1; top_p=1; max_output_tokens=64000",
      "value": 83.6,
      "valueLabel": "83.60",
      "display": "83.60%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 42,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "42 | Hy4 Preview | 83.60%±2.06 | $0.834/$2.501 | 5m50s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 42 of 105 (Hy4 Preview), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"tencent/hy4-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2180"
    },
    {
      "id": 2181,
      "benchmark": "medscribe",
      "metric": null,
      "model": "glm-5.2",
      "modelKind": "model",
      "name": "GLM 5.2",
      "label": null,
      "lab": "zhipu",
      "variant": "model ID zai/glm-5.2; temperature=1; max_output_tokens=30000",
      "value": 83.53,
      "valueLabel": "83.53",
      "display": "83.53%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 43,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "43 | GLM 5.2 | 83.53%±2.00 | $1.4/$4.4 | 2m18s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 43 of 105 (GLM 5.2), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"zai/glm-5.2\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2181"
    },
    {
      "id": 2182,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-4.5",
      "modelKind": "model",
      "name": "Claude Opus 4.5 (Nonthinking)",
      "label": "Claude Opus 4.5 (Nonthinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-5-20251101; temperature=1; max_output_tokens=30000; compute_effort=high",
      "value": 83.25,
      "valueLabel": "83.25",
      "display": "83.25%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 44,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "44 | Claude Opus 4.5 (Nonthinking) | 83.25%±1.93 | $5/$25 | 43.30s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 44 of 105 (Claude Opus 4.5 (Nonthinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-5-20251101\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2182"
    },
    {
      "id": 2183,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-2.5-flash",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash (7/17) (Thinking)",
      "label": "Gemini 2.5 Flash (7/17) (Thinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-thinking; temperature=1; max_output_tokens=30000",
      "value": 82.98,
      "valueLabel": "82.98",
      "display": "82.98%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 45,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "45 | Gemini 2.5 Flash (7/17) (Thinking) | 82.98%±1.91 | $0.3/$2.5 | 22.53s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 45 of 105 (Gemini 2.5 Flash (7/17) (Thinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2183"
    },
    {
      "id": 2184,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-4.7",
      "modelKind": "model",
      "name": "Claude Opus 4.7",
      "label": null,
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-7; temperature=1; max_output_tokens=30000; compute_effort=max",
      "value": 82.95,
      "valueLabel": "82.95",
      "display": "82.95%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 46,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "46 | Claude Opus 4.7 | 82.95%±1.98 | $5/$25 | 67.50s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 46 of 105 (Claude Opus 4.7), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-7\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2184"
    },
    {
      "id": 2185,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-2.5-flash",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash (7/17) (Nonthinking)",
      "label": "Gemini 2.5 Flash (7/17) (Nonthinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash; temperature=1; max_output_tokens=30000",
      "value": 82.87,
      "valueLabel": "82.87",
      "display": "82.87%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 47,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "47 | Gemini 2.5 Flash (7/17) (Nonthinking) | 82.87%±1.91 | $0.3/$2.5 | 22.79s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 47 of 105 (Gemini 2.5 Flash (7/17) (Nonthinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2185"
    },
    {
      "id": 2186,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5.6-terra",
      "modelKind": "model",
      "name": "GPT-5.6 Terra",
      "label": null,
      "lab": "openai",
      "variant": "model ID openai/gpt-5.6-terra; max_output_tokens=30000; reasoning_effort=xhigh",
      "value": 82.87,
      "valueLabel": "82.87",
      "display": "82.87%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 47,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "48 | GPT-5.6 Terra | 82.87%±1.95 | $2/$12 | 35.53s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 48 of 105 (GPT-5.6 Terra), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5.6-terra\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2186"
    },
    {
      "id": 2187,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-6-sol",
      "modelKind": "model",
      "name": "GPT-6 Sol",
      "label": null,
      "lab": "openai",
      "variant": "model ID openai/gpt-6-sol; max_output_tokens=128000; reasoning_effort=max",
      "value": 82.03,
      "valueLabel": "82.03",
      "display": "82.03%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 49,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "49 | GPT-6 Sol | 82.03%±1.94 | $2/$10 | 81.14s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 49 of 105 (GPT-6 Sol), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-6-sol\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2187"
    },
    {
      "id": 2188,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4-fast-reasoning",
      "modelKind": "model",
      "name": "Grok 4 Fast (Reasoning)",
      "label": null,
      "lab": "xai",
      "variant": "model ID grok/grok-4-fast-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 81.63,
      "valueLabel": "81.63",
      "display": "81.63%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 50,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "50 | Grok 4 Fast (Reasoning) | 81.63%±2.14 | $0.2/$0.5 | 12.42s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 50 of 105 (Grok 4 Fast (Reasoning)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4-fast-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2188"
    },
    {
      "id": 2189,
      "benchmark": "medscribe",
      "metric": null,
      "model": "ling-3.0-flash",
      "modelKind": "model",
      "name": "Ling 3.0 Flash",
      "label": null,
      "lab": "ant-group",
      "variant": "model ID ant/ling-3.0-flash-2607; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 80.9,
      "valueLabel": "80.90",
      "display": "80.90%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 51,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "51 | Ling 3.0 Flash | 80.90%±2.04 | $0.075/$0.22 | 12.12s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 51 of 105 (Ling 3.0 Flash), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"ant/ling-3.0-flash-2607\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2189"
    },
    {
      "id": 2190,
      "benchmark": "medscribe",
      "metric": null,
      "model": "minimax-m2.1",
      "modelKind": "model",
      "name": "MiniMax-M2.1",
      "label": null,
      "lab": "minimax",
      "variant": "model ID minimax/MiniMax-M2.1; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 80.78,
      "valueLabel": "80.78",
      "display": "80.78%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 52,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "52 | MiniMax-M2.1 | 80.78%±1.83 | $0.3/$1.2 | 53.16s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 52 of 105 (MiniMax-M2.1), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"minimax/MiniMax-M2.1\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2190"
    },
    {
      "id": 2191,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5-mini",
      "modelKind": "model",
      "name": "GPT 5 Mini",
      "label": "GPT 5 Mini",
      "lab": "openai",
      "variant": "model ID openai/gpt-5-mini-2025-08-07; max_output_tokens=30000; reasoning_effort=high",
      "value": 80.58,
      "valueLabel": "80.58",
      "display": "80.58%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 53,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "53 | GPT 5 Mini | 80.58%±1.92 | $0.25/$2 | 4m36s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 53 of 105 (GPT 5 Mini), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5-mini-2025-08-07\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2191"
    },
    {
      "id": 2192,
      "benchmark": "medscribe",
      "metric": null,
      "model": "deepseek-v4-flash",
      "modelKind": "model",
      "name": "DeepSeek V4 Flash 0731",
      "label": "DeepSeek V4 Flash 0731",
      "lab": "deepseek",
      "variant": "model ID deepseek/deepseek-v4-flash-0731; max_output_tokens=30000; reasoning_effort=high",
      "value": 80.36,
      "valueLabel": "80.36",
      "display": "80.36%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 54,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "54 | DeepSeek V4 Flash 0731 | 80.36%±1.97 | $0.44/$1.32 | 77.55s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 54 of 105 (DeepSeek V4 Flash 0731), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"deepseek/deepseek-v4-flash-0731\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2192"
    },
    {
      "id": 2193,
      "benchmark": "medscribe",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek V4 Pro 0813",
      "label": "DeepSeek V4 Pro 0813",
      "lab": "deepseek",
      "variant": "model ID deepseek/deepseek-v4-pro-0813; max_output_tokens=30000; reasoning_effort=max",
      "value": 80.17,
      "valueLabel": "80.17",
      "display": "80.17%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 55,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "55 | DeepSeek V4 Pro 0813 | 80.17%±2.00 | $1.32/$3.96 | 2m36s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 55 of 105 (DeepSeek V4 Pro 0813), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"deepseek/deepseek-v4-pro-0813\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2193"
    },
    {
      "id": 2194,
      "benchmark": "medscribe",
      "metric": null,
      "model": "minimax-m2.7",
      "modelKind": "model",
      "name": "MiniMax-M2.7",
      "label": null,
      "lab": "minimax",
      "variant": "model ID minimax/MiniMax-M2.7; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 79.87,
      "valueLabel": "79.87",
      "display": "79.87%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 56,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "56 | MiniMax-M2.7 | 79.87%±1.86 | $0.3/$1.2 | 27.25s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 56 of 105 (MiniMax-M2.7), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"minimax/MiniMax-M2.7\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2194"
    },
    {
      "id": 2195,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4-fast-non-reasoning",
      "modelKind": "model",
      "name": "Grok 4 Fast (Non-Reasoning)",
      "label": null,
      "lab": "xai",
      "variant": "model ID grok/grok-4-fast-non-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 79.72,
      "valueLabel": "79.72",
      "display": "79.72%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 57,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "57 | Grok 4 Fast (Non-Reasoning) | 79.72%±1.87 | $0.2/$0.5 | 8.48s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 57 of 105 (Grok 4 Fast (Non-Reasoning)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4-fast-non-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2195"
    },
    {
      "id": 2196,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-3.6-flash",
      "modelKind": "model",
      "name": "Gemini 3.6 Flash",
      "label": null,
      "lab": "google",
      "variant": "model ID google/gemini-3.6-flash; temperature=1; max_output_tokens=30000; reasoning_effort=high",
      "value": 79.66,
      "valueLabel": "79.66",
      "display": "79.66%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 58,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "58 | Gemini 3.6 Flash | 79.66%±1.86 | $1.5/$7.5 | 33.55s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 58 of 105 (Gemini 3.6 Flash), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-3.6-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2196"
    },
    {
      "id": 2197,
      "benchmark": "medscribe",
      "metric": null,
      "model": "qwen-3.7-max",
      "modelKind": "model",
      "name": "Qwen 3.7 Max",
      "label": null,
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.7-max; temperature=1; max_output_tokens=30000",
      "value": 79.4,
      "valueLabel": "79.40",
      "display": "79.40%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 59,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "59 | Qwen 3.7 Max | 79.40%±1.91 | $2.5/$7.5 | 108.05s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 59 of 105 (Qwen 3.7 Max), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"alibaba/qwen3.7-max\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2197"
    },
    {
      "id": 2198,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4.1-fast-reasoning",
      "modelKind": "model",
      "name": "Grok 4.1 Fast (Reasoning)",
      "label": null,
      "lab": "xai",
      "variant": "model ID grok/grok-4-1-fast-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 78.73,
      "valueLabel": "78.73",
      "display": "78.73%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 60,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "60 | Grok 4.1 Fast (Reasoning) | 78.73%±1.87 | $0.2/$0.5 | 39.29s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 60 of 105 (Grok 4.1 Fast (Reasoning)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4-1-fast-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2198"
    },
    {
      "id": 2199,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-2.5-flash",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Preview (9/25) (Thinking)",
      "label": "Gemini 2.5 Flash Preview (9/25) (Thinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-preview-09-2025-thinking; temperature=1; max_output_tokens=30000",
      "value": 78.5,
      "valueLabel": "78.50",
      "display": "78.50%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 61,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "61 | Gemini 2.5 Flash Preview (9/25) (Thinking) | 78.50%±1.99 | $0.3/$2.5 | 31.39s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 61 of 105 (Gemini 2.5 Flash Preview (9/25) (Thinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-preview-09-2025-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2199"
    },
    {
      "id": 2200,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4",
      "modelKind": "model",
      "name": "Grok 4",
      "label": null,
      "lab": "xai",
      "variant": "model ID grok/grok-4-0709; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 78.15,
      "valueLabel": "78.15",
      "display": "78.15%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 62,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "62 | Grok 4 | 78.15%±2.08 | $3/$15 | 74.05s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 62 of 105 (Grok 4), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4-0709\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2200"
    },
    {
      "id": 2201,
      "benchmark": "medscribe",
      "metric": null,
      "model": "kimi-k2.6",
      "modelKind": "model",
      "name": "Kimi K2.6",
      "label": null,
      "lab": "moonshot",
      "variant": "model ID kimi/kimi-k2.6; top_p=0.95; max_output_tokens=30000",
      "value": 78.15,
      "valueLabel": "78.15",
      "display": "78.15%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 62,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "63 | Kimi K2.6 | 78.15%±1.79 | $0.95/$4 | 8m14s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 63 of 105 (Kimi K2.6), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"kimi/kimi-k2.6\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2201"
    },
    {
      "id": 2202,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-2.5-flash",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Preview (9/25) (Nonthinking)",
      "label": "Gemini 2.5 Flash Preview (9/25) (Nonthinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-preview-09-2025; temperature=1; max_output_tokens=30000",
      "value": 77.95,
      "valueLabel": "77.95",
      "display": "77.95%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 64,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "64 | Gemini 2.5 Flash Preview (9/25) (Nonthinking) | 77.95%±1.92 | $0.3/$2.5 | 22.89s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 64 of 105 (Gemini 2.5 Flash Preview (9/25) (Nonthinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-preview-09-2025\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2202"
    },
    {
      "id": 2203,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT 5.4 (xhigh)",
      "label": "GPT 5.4 (xhigh)",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.4-2026-03-05; max_output_tokens=30000; reasoning_effort=xhigh",
      "value": 77.55,
      "valueLabel": "77.55",
      "display": "77.55%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 65,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "65 | GPT 5.4 (xhigh) | 77.55%±3.32 | $2.5/$15 | 4m43s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 65 of 105 (GPT 5.4 (xhigh)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5.4-2026-03-05\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2203"
    },
    {
      "id": 2204,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4.1-fast-non-reasoning",
      "modelKind": "model",
      "name": "Grok 4.1 Fast Non-Reasoning",
      "label": null,
      "lab": "xai",
      "variant": "model ID grok/grok-4-1-fast-non-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 77.46,
      "valueLabel": "77.46",
      "display": "77.46%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 66,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "66 | Grok 4.1 Fast Non-Reasoning | 77.46%±2.04 | $0.2/$0.5 | 19.86s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 66 of 105 (Grok 4.1 Fast Non-Reasoning), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4-1-fast-non-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2204"
    },
    {
      "id": 2205,
      "benchmark": "medscribe",
      "metric": null,
      "model": "qwen-3-vl-plus",
      "modelKind": "model",
      "name": "Qwen 3 VL Plus",
      "label": null,
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3-vl-plus-2025-09-23; temperature=1; max_output_tokens=30000",
      "value": 77.13,
      "valueLabel": "77.13",
      "display": "77.13%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 67,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "67 | Qwen 3 VL Plus | 77.13%±1.92 | $0.2/$1.6 | 71.35s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 67 of 105 (Qwen 3 VL Plus), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"alibaba/qwen3-vl-plus-2025-09-23\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2205"
    },
    {
      "id": 2206,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5.4-nano",
      "modelKind": "model",
      "name": "GPT 5.4 Nano",
      "label": "GPT 5.4 Nano",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.4-nano-2026-03-17; max_output_tokens=30000; reasoning_effort=high",
      "value": 77.09,
      "valueLabel": "77.09",
      "display": "77.09%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 68,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "68 | GPT 5.4 Nano | 77.09%±1.89 | $0.2/$1.25 | 20.53s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 68 of 105 (GPT 5.4 Nano), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5.4-nano-2026-03-17\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2206"
    },
    {
      "id": 2207,
      "benchmark": "medscribe",
      "metric": null,
      "model": "qwen3.6-plus",
      "modelKind": "model",
      "name": "Qwen 3.6 Plus",
      "label": "Qwen 3.6 Plus",
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.6-plus; temperature=1; max_output_tokens=30000",
      "value": 76.96,
      "valueLabel": "76.96",
      "display": "76.96%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 69,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "69 | Qwen 3.6 Plus | 76.96%±1.92 | $0.5/$3 | 2m54s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 69 of 105 (Qwen 3.6 Plus), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"alibaba/qwen3.6-plus\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2207"
    },
    {
      "id": 2208,
      "benchmark": "medscribe",
      "metric": null,
      "model": "o3",
      "modelKind": "model",
      "name": "o3",
      "label": null,
      "lab": "openai",
      "variant": "model ID openai/o3-2025-04-16; max_output_tokens=30000; reasoning_effort=high",
      "value": 76.65,
      "valueLabel": "76.65",
      "display": "76.65%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 70,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "70 | o3 | 76.65%±1.87 | $2/$8 | 46.39s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 70 of 105 (o3), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/o3-2025-04-16\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2208"
    },
    {
      "id": 2209,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-3.5-flash",
      "modelKind": "model",
      "name": "Gemini 3.5 Flash",
      "label": null,
      "lab": "google",
      "variant": "model ID google/gemini-3.5-flash; temperature=1; max_output_tokens=30000; reasoning_effort=high",
      "value": 76.57,
      "valueLabel": "76.57",
      "display": "76.57%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 71,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "71 | Gemini 3.5 Flash | 76.57%±1.92 | $1.5/$9 | 57.08s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 71 of 105 (Gemini 3.5 Flash), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-3.5-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2209"
    },
    {
      "id": 2210,
      "benchmark": "medscribe",
      "metric": null,
      "model": "kimi-k2.5",
      "modelKind": "model",
      "name": "Kimi K2.5",
      "label": null,
      "lab": "moonshot",
      "variant": "model ID kimi/kimi-k2.5-thinking; top_p=0.95; max_output_tokens=30000",
      "value": 76.44,
      "valueLabel": "76.44",
      "display": "76.44%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 72,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "72 | Kimi K2.5 | 76.44%±1.99 | $0.6/$3 | 2m27s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 72 of 105 (Kimi K2.5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"kimi/kimi-k2.5-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2210"
    },
    {
      "id": 2211,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini 3.1 Pro Preview (02/26)",
      "label": "Gemini 3.1 Pro Preview (02/26)",
      "lab": "google",
      "variant": "model ID google/gemini-3.1-pro-preview; temperature=1; max_output_tokens=30000; reasoning_effort=high",
      "value": 76.11,
      "valueLabel": "76.11",
      "display": "76.11%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 73,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "73 | Gemini 3.1 Pro Preview (02/26) | 76.11%±1.92 | $2/$12 | 69.14s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 73 of 105 (Gemini 3.1 Pro Preview (02/26)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-3.1-pro-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2211"
    },
    {
      "id": 2212,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-sonnet-5",
      "modelKind": "model",
      "name": "Claude Sonnet 5",
      "label": null,
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-5; temperature=1; max_output_tokens=30000; compute_effort=max",
      "value": 76.05,
      "valueLabel": "76.05",
      "display": "76.05%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 74,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "74 | Claude Sonnet 5 | 76.05%±3.05 | $2/$10 | 4m12s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 74 of 105 (Claude Sonnet 5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2212"
    },
    {
      "id": 2213,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-2.5-flash-lite",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Lite (9/25) (Nonthinking)",
      "label": "Gemini 2.5 Flash Lite (9/25) (Nonthinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-lite-preview-09-2025; temperature=1; max_output_tokens=30000",
      "value": 75.82,
      "valueLabel": "75.82",
      "display": "75.82%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 75,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "75 | Gemini 2.5 Flash Lite (9/25) (Nonthinking) | 75.82%±1.85 | $0.1/$0.4 | 4.49s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 75 of 105 (Gemini 2.5 Flash Lite (9/25) (Nonthinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-lite-preview-09-2025\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2213"
    },
    {
      "id": 2214,
      "benchmark": "medscribe",
      "metric": null,
      "model": "ling-3.0-flash-fin",
      "modelKind": "model",
      "name": "Ling 3.0 Flash Fin",
      "label": null,
      "lab": "ant-group",
      "variant": "model ID ant/ling-3.0-flash-af-rc3; temperature=1; top_p=0.95; max_output_tokens=131072",
      "value": 75.59,
      "valueLabel": "75.59",
      "display": "75.59%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 76,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "76 | Ling 3.0 Flash Fin | 75.59%±2.03 | $0.06/$0.18 | 44.81s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 76 of 105 (Ling 3.0 Flash Fin), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"ant/ling-3.0-flash-af-rc3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2214"
    },
    {
      "id": 2215,
      "benchmark": "medscribe",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek V4",
      "label": "DeepSeek V4",
      "lab": "deepseek",
      "variant": "model ID deepseek/deepseek-v4-pro; max_output_tokens=128000; reasoning_effort=max",
      "value": 75.14,
      "valueLabel": "75.14",
      "display": "75.14%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 77,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "77 | DeepSeek V4 | 75.14%±2.00 | $1.32/$3.96 | 5m46s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 77 of 105 (DeepSeek V4), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"deepseek/deepseek-v4-pro\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2215"
    },
    {
      "id": 2216,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4.3",
      "modelKind": "model",
      "name": "Grok 4.3",
      "label": null,
      "lab": "xai",
      "variant": "model ID grok/grok-4.3; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 74.4,
      "valueLabel": "74.40",
      "display": "74.40%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 78,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "78 | Grok 4.3 | 74.40%±2.02 | $1.25/$2.5 | 100.46s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 78 of 105 (Grok 4.3), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4.3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2216"
    },
    {
      "id": 2217,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-4.1",
      "modelKind": "model",
      "name": "Claude Opus 4.1 (Thinking)",
      "label": "Claude Opus 4.1 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-1-20250805-thinking; temperature=1; max_output_tokens=30000",
      "value": 73.9,
      "valueLabel": "73.90",
      "display": "73.90%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 79,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "79 | Claude Opus 4.1 (Thinking) | 73.90%±1.97 | $15/$75 | 57.40s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 79 of 105 (Claude Opus 4.1 (Thinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-1-20250805-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2217"
    },
    {
      "id": 2218,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini 2.5 Pro",
      "label": null,
      "lab": "google",
      "variant": "model ID google/gemini-2.5-pro; temperature=1; max_output_tokens=30000",
      "value": 73.55,
      "valueLabel": "73.55",
      "display": "73.55%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 80,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "80 | Gemini 2.5 Pro | 73.55%±1.91 | $1.25/$10 | 35.91s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 80 of 105 (Gemini 2.5 Pro), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-2.5-pro\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2218"
    },
    {
      "id": 2219,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gpt-5-nano",
      "modelKind": "model",
      "name": "GPT 5 Nano",
      "label": "GPT 5 Nano",
      "lab": "openai",
      "variant": "model ID openai/gpt-5-nano-2025-08-07; max_output_tokens=30000; reasoning_effort=high",
      "value": 72.86,
      "valueLabel": "72.86",
      "display": "72.86%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 81,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "81 | GPT 5 Nano | 72.86%±1.89 | $0.05/$0.4 | 112.91s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 81 of 105 (GPT 5 Nano), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/gpt-5-nano-2025-08-07\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2219"
    },
    {
      "id": 2220,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-2.5-flash-lite",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Lite (Nonthinking)",
      "label": "Gemini 2.5 Flash Lite (Nonthinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-lite; temperature=1; max_output_tokens=30000",
      "value": 72.83,
      "valueLabel": "72.83",
      "display": "72.83%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 82,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "82 | Gemini 2.5 Flash Lite (Nonthinking) | 72.83%±1.98 | $0.1/$0.4 | 4.85s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 82 of 105 (Gemini 2.5 Flash Lite (Nonthinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-lite\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2220"
    },
    {
      "id": 2221,
      "benchmark": "medscribe",
      "metric": null,
      "model": "qwen-3-max-thinking",
      "modelKind": "model",
      "name": "Qwen 3 Max Thinking",
      "label": null,
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3-max-2026-01-23; temperature=1; max_output_tokens=30000",
      "value": 72.71,
      "valueLabel": "72.71",
      "display": "72.71%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 83,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "83 | Qwen 3 Max Thinking | 72.71%±1.91 | $1.2/$6 | 6m02s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 83 of 105 (Qwen 3 Max Thinking), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"alibaba/qwen3-max-2026-01-23\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2221"
    },
    {
      "id": 2222,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-sonnet-4",
      "modelKind": "model",
      "name": "Claude Sonnet 4 (Nonthinking)",
      "label": "Claude Sonnet 4 (Nonthinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-4-20250514; temperature=1; max_output_tokens=30000",
      "value": 72.41,
      "valueLabel": "72.41",
      "display": "72.41%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 84,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "84 | Claude Sonnet 4 (Nonthinking) | 72.41%±1.93 | $3/$15 | 25.67s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 84 of 105 (Claude Sonnet 4 (Nonthinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-4-20250514\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2222"
    },
    {
      "id": 2223,
      "benchmark": "medscribe",
      "metric": null,
      "model": "glm-5.1",
      "modelKind": "model",
      "name": "GLM 5.1",
      "label": null,
      "lab": "zhipu",
      "variant": "model ID zai/glm-5.1; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 72.27,
      "valueLabel": "72.27",
      "display": "72.27%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 85,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "85 | GLM 5.1 | 72.27%±2.06 | $1/$3.2 | 95.70s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 85 of 105 (GLM 5.1), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"zai/glm-5.1\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2223"
    },
    {
      "id": 2224,
      "benchmark": "medscribe",
      "metric": null,
      "model": "mimo-v2.5",
      "modelKind": "model",
      "name": "MiMo V2.5",
      "label": null,
      "lab": "xiaomi",
      "variant": "model ID xiaomi/mimo-v2.5; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 72.15,
      "valueLabel": "72.15",
      "display": "72.15%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 86,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "86 | MiMo V2.5 | 72.15%±1.85 | $0.14/$0.28 | 20.26s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 86 of 105 (MiMo V2.5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"xiaomi/mimo-v2.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2224"
    },
    {
      "id": 2225,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-3-pro",
      "modelKind": "model",
      "name": "Gemini 3 Pro (11/25)",
      "label": "Gemini 3 Pro (11/25)",
      "lab": "google",
      "variant": "model ID google/gemini-3-pro-preview; temperature=1; max_output_tokens=30000; reasoning_effort=high",
      "value": 72.04,
      "valueLabel": "72.04",
      "display": "72.04%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 87,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "87 | Gemini 3 Pro (11/25) | 72.04%±1.90 | $2/$12 | 43.39s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 87 of 105 (Gemini 3 Pro (11/25)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-3-pro-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2225"
    },
    {
      "id": 2226,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-opus-4.1",
      "modelKind": "model",
      "name": "Claude Opus 4.1 (Nonthinking)",
      "label": "Claude Opus 4.1 (Nonthinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-1-20250805; temperature=1; max_output_tokens=30000",
      "value": 71.75,
      "valueLabel": "71.75",
      "display": "71.75%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 88,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "88 | Claude Opus 4.1 (Nonthinking) | 71.75%±2.02 | $15/$75 | 38.04s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 88 of 105 (Claude Opus 4.1 (Nonthinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-1-20250805\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2226"
    },
    {
      "id": 2227,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-3.5-flash-lite",
      "modelKind": "model",
      "name": "Gemini 3.5 Flash Lite",
      "label": "Gemini 3.5 Flash Lite",
      "lab": "google",
      "variant": "model ID google/gemini-3.5-flash-lite; temperature=1; max_output_tokens=30000; reasoning_effort=high",
      "value": 70.89,
      "valueLabel": "70.89",
      "display": "70.89%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 89,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "89 | Gemini 3.5 Flash Lite | 70.89%±2.03 | $0.3/$2.5 | 18.99s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 89 of 105 (Gemini 3.5 Flash Lite), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-3.5-flash-lite\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2227"
    },
    {
      "id": 2228,
      "benchmark": "medscribe",
      "metric": null,
      "model": "qwen-3.5-flash",
      "modelKind": "model",
      "name": "Qwen 3.5 Flash",
      "label": null,
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.5-flash; temperature=1; max_output_tokens=30000",
      "value": 70.62,
      "valueLabel": "70.62",
      "display": "70.62%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 90,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "90 | Qwen 3.5 Flash | 70.62%±2.09 | $0.1/$0.4 | 80.41s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 90 of 105 (Qwen 3.5 Flash), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"alibaba/qwen3.5-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2228"
    },
    {
      "id": 2229,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-3-flash",
      "modelKind": "model",
      "name": "Gemini 3 Flash (12/25)",
      "label": "Gemini 3 Flash (12/25)",
      "lab": "google",
      "variant": "model ID google/gemini-3-flash-preview; temperature=1; max_output_tokens=30000; reasoning_effort=high",
      "value": 69.92,
      "valueLabel": "69.92",
      "display": "69.92%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 91,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "91 | Gemini 3 Flash (12/25) | 69.92%±1.90 | $0.5/$3 | 23.49s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 91 of 105 (Gemini 3 Flash (12/25)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-3-flash-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2229"
    },
    {
      "id": 2230,
      "benchmark": "medscribe",
      "metric": null,
      "model": "claude-sonnet-4",
      "modelKind": "model",
      "name": "Claude Sonnet 4 (Thinking)",
      "label": "Claude Sonnet 4 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-4-20250514-thinking; max_output_tokens=30000",
      "value": 69.35,
      "valueLabel": "69.35",
      "display": "69.35%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 92,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "92 | Claude Sonnet 4 (Thinking) | 69.35%±2.21 | $3/$15 | 39.57s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 92 of 105 (Claude Sonnet 4 (Thinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-4-20250514-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2230"
    },
    {
      "id": 2231,
      "benchmark": "medscribe",
      "metric": null,
      "model": "o4-mini",
      "modelKind": "model",
      "name": "o4 Mini",
      "label": "o4 Mini",
      "lab": "openai",
      "variant": "model ID openai/o4-mini-2025-04-16; max_output_tokens=30000; reasoning_effort=high",
      "value": 69.14,
      "valueLabel": "69.14",
      "display": "69.14%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 93,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "93 | o4 Mini | 69.14%±1.96 | $1.1/$4.4 | 81.96s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 93 of 105 (o4 Mini), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"openai/o4-mini-2025-04-16\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2231"
    },
    {
      "id": 2232,
      "benchmark": "medscribe",
      "metric": null,
      "model": "glm-4.7",
      "modelKind": "model",
      "name": "GLM 4.7",
      "label": null,
      "lab": "zhipu",
      "variant": "model ID zai/glm-4.7; temperature=1; top_p=1; max_output_tokens=30000",
      "value": 68.63,
      "valueLabel": "68.63",
      "display": "68.63%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 94,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "94 | GLM 4.7 | 68.63%±2.12 | $0.6/$2.2 | 2m47s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 94 of 105 (GLM 4.7), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"zai/glm-4.7\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2232"
    },
    {
      "id": 2233,
      "benchmark": "medscribe",
      "metric": null,
      "model": "mistral-medium-3.5",
      "modelKind": "model",
      "name": "Mistral Medium 3.5",
      "label": null,
      "lab": "mistral",
      "variant": "model ID mistralai/mistral-medium-3.5; temperature=1; top_p=0.95; max_output_tokens=30000; reasoning_effort=high",
      "value": 67.73,
      "valueLabel": "67.73",
      "display": "67.73%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 95,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "95 | Mistral Medium 3.5 | 67.73%±2.01 | $1.5/$7.5 | 104.05s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 95 of 105 (Mistral Medium 3.5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"mistralai/mistral-medium-3.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2233"
    },
    {
      "id": 2234,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-2.5-flash-lite",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Lite (9/25) (Thinking)",
      "label": "Gemini 2.5 Flash Lite (9/25) (Thinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-lite-preview-09-2025-thinking; temperature=1; max_output_tokens=30000",
      "value": 66.88,
      "valueLabel": "66.88",
      "display": "66.88%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 96,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "96 | Gemini 2.5 Flash Lite (9/25) (Thinking) | 66.88%±1.92 | $0.1/$0.4 | 11.52s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 96 of 105 (Gemini 2.5 Flash Lite (9/25) (Thinking)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-lite-preview-09-2025-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2234"
    },
    {
      "id": 2235,
      "benchmark": "medscribe",
      "metric": null,
      "model": "laguna-m.1",
      "modelKind": "model",
      "name": "Laguna M.1",
      "label": null,
      "lab": "poolside",
      "variant": "model ID poolside/laguna-m.1; temperature=1; max_output_tokens=30000",
      "value": 65.91,
      "valueLabel": "65.91",
      "display": "65.91%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 97,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "97 | Laguna M.1 | 65.91%±2.01 | N/A | 111.82s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 97 of 105 (Laguna M.1), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"poolside/laguna-m.1\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2235"
    },
    {
      "id": 2236,
      "benchmark": "medscribe",
      "metric": null,
      "model": "gemini-3.1-flash-lite-preview",
      "modelKind": "model",
      "name": "Gemini 3.1 Flash Lite Preview",
      "label": "Gemini 3.1 Flash Lite Preview",
      "lab": "google",
      "variant": "model ID google/gemini-3.1-flash-lite-preview; temperature=1; max_output_tokens=30000; reasoning_effort=high",
      "value": 63.9,
      "valueLabel": "63.90",
      "display": "63.90%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 98,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "98 | Gemini 3.1 Flash Lite Preview | 63.90%±1.82 | $0.25/$1.5 | 16.79s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 98 of 105 (Gemini 3.1 Flash Lite Preview), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"google/gemini-3.1-flash-lite-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2236"
    },
    {
      "id": 2237,
      "benchmark": "medscribe",
      "metric": null,
      "model": "grok-4.20",
      "modelKind": "model",
      "name": "Grok 4.20 (Reasoning)",
      "label": "Grok 4.20 (Reasoning)",
      "lab": "xai",
      "variant": "model ID grok/grok-4.20-0309-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 63.41,
      "valueLabel": "63.41",
      "display": "63.41%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 99,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "99 | Grok 4.20 (Reasoning) | 63.41%±2.10 | $2/$6 | 18.60s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 99 of 105 (Grok 4.20 (Reasoning)), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"grok/grok-4.20-0309-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2237"
    },
    {
      "id": 2238,
      "benchmark": "medscribe",
      "metric": null,
      "model": "laguna-xs.2",
      "modelKind": "model",
      "name": "Laguna XS.2",
      "label": null,
      "lab": "poolside",
      "variant": "model ID poolside/laguna-xs.2; temperature=1; max_output_tokens=30000",
      "value": 61.43,
      "valueLabel": "61.43",
      "display": "61.43%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 100,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "100 | Laguna XS.2 | 61.43%±2.35 | N/A | 68.82s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 100 of 105 (Laguna XS.2), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"poolside/laguna-xs.2\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2238"
    },
    {
      "id": 2239,
      "benchmark": "medscribe",
      "metric": null,
      "model": "command-a-plus",
      "modelKind": "model",
      "name": "Command A+",
      "label": null,
      "lab": "cohere",
      "variant": "model ID cohere/command-a-plus-05-2026; temperature=1; top_p=0.95; max_output_tokens=64000",
      "value": 55.68,
      "valueLabel": "55.68",
      "display": "55.68%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 101,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "101 | Command A+ | 55.68%±3.65 | N/A | 3m23s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 101 of 105 (Command A+), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"cohere/command-a-plus-05-2026\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2239"
    },
    {
      "id": 2240,
      "benchmark": "medscribe",
      "metric": null,
      "model": "mercury-2.5",
      "modelKind": "model",
      "name": "Mercury 2.5",
      "label": null,
      "lab": "inception",
      "variant": "model ID inception/mercury-2.5; temperature=1; max_output_tokens=65536; reasoning_effort=high",
      "value": 55.09,
      "valueLabel": "55.09",
      "display": "55.09%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 102,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "102 | Mercury 2.5 | 55.09%±2.10 | $0.2/$0.75 | 9.99s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 102 of 105 (Mercury 2.5), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"inception/mercury-2.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2240"
    },
    {
      "id": 2241,
      "benchmark": "medscribe",
      "metric": null,
      "model": "llama-4-maverick",
      "modelKind": "model",
      "name": "Llama 4 Maverick",
      "label": null,
      "lab": "meta",
      "variant": "model ID fireworks/llama4-maverick-instruct-basic; temperature=1; max_output_tokens=30000",
      "value": 54.22,
      "valueLabel": "54.22",
      "display": "54.22%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 103,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "103 | Llama 4 Maverick | 54.22%±1.87 | $0.22/$0.88 | 25.05s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 103 of 105 (Llama 4 Maverick), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"fireworks/llama4-maverick-instruct-basic\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2241"
    },
    {
      "id": 2242,
      "benchmark": "medscribe",
      "metric": null,
      "model": "llama-4-scout",
      "modelKind": "model",
      "name": "Llama 4 Scout",
      "label": null,
      "lab": "meta",
      "variant": "model ID together/meta-llama/Llama-4-Scout-17B-16E-Instruct; temperature=1; max_output_tokens=30000",
      "value": 50.59,
      "valueLabel": "50.59",
      "display": "50.59%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 104,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "104 | Llama 4 Scout | 50.59%±1.90 | $0.18/$0.59 | 11.32s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 104 of 105 (Llama 4 Scout), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"together/meta-llama/Llama-4-Scout-17B-16E-Instruct\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2242"
    },
    {
      "id": 2243,
      "benchmark": "medscribe",
      "metric": null,
      "model": "nemotron-3.5-lightning",
      "modelKind": "model",
      "name": "Nemotron 3.5 Lightning",
      "label": null,
      "lab": "nvidia",
      "variant": "model ID fireworks/nemotron-lightning-3p5-30b-a3b; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 4.27,
      "valueLabel": "4.27",
      "display": "4.27%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 105,
      "rowsOnBoard": 105,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 23,
      "sourceUrl": "https://www.vals.ai/benchmarks/medscribe",
      "quote": "105 | Nemotron 3.5 Lightning | 4.27%±0.49 | $0.05/$0.2 | 105.52s",
      "locator": "Vals AI MedScribe leaderboard, View: All Models, Task: Overall, row 105 of 105 (Nemotron 3.5 Lightning), Accuracy column; Updated 9/29/2026. Rendered BenchmarkView table; configuration from embedded astro-island BenchmarkView props, benchmarkView.default.tasks.overall[\"fireworks/nemotron-lightning-3p5-30b-a3b\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medscribe#r-2243"
    },
    {
      "id": 145,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-5",
      "modelKind": "model",
      "name": "Claude Opus 5",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 63.57,
      "valueLabel": "63.57",
      "display": "63.57%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "1 | Claude Opus 5 | 63.57%±1.99 | $5/$25 | 24.50s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 1 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-145"
    },
    {
      "id": 146,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini 3.1 Pro Preview (02/26)",
      "label": "Gemini 3.1 Pro Preview (02/26)",
      "lab": "google",
      "variant": "",
      "value": 59.06,
      "valueLabel": "59.06",
      "display": "59.06%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "2 | Gemini 3.1 Pro Preview (02/26) | 59.06%±2.00 | $2/$12 | 38.52s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 2 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-3.1-pro-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-146"
    },
    {
      "id": 147,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-fable-5",
      "modelKind": "model",
      "name": "Claude Fable 5",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 56.07,
      "valueLabel": "56.07",
      "display": "56.07%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "3 | Claude Fable 5 | 56.07%±2.20 | $10/$50 | 91.44s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 3 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-fable-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-147"
    },
    {
      "id": 148,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-3-flash",
      "modelKind": "model",
      "name": "Gemini 3 Flash (12/25)",
      "label": "Gemini 3 Flash (12/25)",
      "lab": "google",
      "variant": "",
      "value": 55.92,
      "valueLabel": "55.92",
      "display": "55.92%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "4 | Gemini 3 Flash (12/25) | 55.92%±2.11 | $0.5/$3 | 44.15s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 4 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-3-flash-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-148"
    },
    {
      "id": 149,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-3.5-flash",
      "modelKind": "model",
      "name": "Gemini 3.5 Flash",
      "label": null,
      "lab": "google",
      "variant": "",
      "value": 55.83,
      "valueLabel": "55.83",
      "display": "55.83%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "5 | Gemini 3.5 Flash | 55.83%±2.11 | $1.5/$9 | 25.29s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 5 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-3.5-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-149"
    },
    {
      "id": 346,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-4.7",
      "modelKind": "model",
      "name": "Claude Opus 4.7",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 54.86,
      "valueLabel": "54.86",
      "display": "54.86%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "6 | Claude Opus 4.7 | 54.86%±2.21 | $5/$25 | 54.25s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 6 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-7\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-346"
    },
    {
      "id": 348,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-fable-5.1",
      "modelKind": "model",
      "name": "Claude Fable 5.1",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 53.51,
      "valueLabel": "53.51",
      "display": "53.51%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "7 | Claude Fable 5.1 | 53.51%±2.17 | $10/$50 | 3m35s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 7 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-fable-5-1\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-348"
    },
    {
      "id": 1966,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-3.7-flash",
      "modelKind": "model",
      "name": "Gemini 3.7 Flash",
      "label": "Gemini 3.7 Flash",
      "lab": "google",
      "variant": "model ID google/gemini-3.7-flash; reasoning_effort=high; temperature=1; max_output_tokens=30000",
      "value": 53.39,
      "valueLabel": "53.39",
      "display": "53.39%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "8 | Gemini 3.7 Flash | 53.39%±2.12 | $1.5/$7.5 | 9.16s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 8 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-3.7-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1966"
    },
    {
      "id": 350,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-4.8",
      "modelKind": "model",
      "name": "Claude Opus 4.8",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 53.22,
      "valueLabel": "53.22",
      "display": "53.22%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "9 | Claude Opus 4.8 | 53.22%±2.17 | $5/$25 | 105.92s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 9 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-8\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-350"
    },
    {
      "id": 352,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-3.6-flash",
      "modelKind": "model",
      "name": "Gemini 3.6 Flash",
      "label": null,
      "lab": "google",
      "variant": "",
      "value": 53.15,
      "valueLabel": "53.15",
      "display": "53.15%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "10 | Gemini 3.6 Flash | 53.15%±2.16 | $1.5/$7.5 | 16.68s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 10 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-3.6-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-352"
    },
    {
      "id": 1967,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-sonnet-5.5",
      "modelKind": "model",
      "name": "Claude Sonnet 5.5",
      "label": "Claude Sonnet 5.5",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-5-5; compute_effort=max; temperature=1; max_output_tokens=128000",
      "value": 52.92,
      "valueLabel": "52.92",
      "display": "52.92%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "11 | Claude Sonnet 5.5 | 52.92%±2.12 | $2/$10 | 3m59s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 11 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-5-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1967"
    },
    {
      "id": 353,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5.1",
      "modelKind": "model",
      "name": "GPT 5.1",
      "label": "GPT 5.1",
      "lab": "openai",
      "variant": "",
      "value": 52.73,
      "valueLabel": "52.73",
      "display": "52.73%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "12 | GPT 5.1 | 52.73%±2.15 | $1.25/$10 | 54.55s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 12 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5.1-2025-11-13\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-353"
    },
    {
      "id": 1968,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-3-pro-11-25",
      "modelKind": "model",
      "name": "Gemini 3 Pro (11/25)",
      "label": "Gemini 3 Pro (11/25)",
      "lab": "google",
      "variant": "model ID google/gemini-3-pro-preview; reasoning_effort=high; temperature=1; max_output_tokens=30000",
      "value": 52.2,
      "valueLabel": "52.20",
      "display": "52.20%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "13 | Gemini 3 Pro (11/25) | 52.20%±2.07 | $2/$12 | 55.84s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 13 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-3-pro-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1968"
    },
    {
      "id": 1969,
      "benchmark": "medcode",
      "metric": null,
      "model": "muse-spark",
      "modelKind": "model",
      "name": "Muse Spark",
      "label": "Muse Spark",
      "lab": "meta",
      "variant": "model ID meta/muse_spark; temperature=1; max_output_tokens=30000",
      "value": 51.31,
      "valueLabel": "51.31",
      "display": "51.31%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "14 | Muse Spark | 51.31%±2.24 | N/A | 2m03s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 14 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"meta/muse_spark\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1969"
    },
    {
      "id": 1970,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini 2.5 Pro",
      "label": "Gemini 2.5 Pro",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-pro; temperature=1; max_output_tokens=30000",
      "value": 50.59,
      "valueLabel": "50.59",
      "display": "50.59%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "15 | Gemini 2.5 Pro | 50.59%±2.11 | $1.25/$10 | 27.41s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 15 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-2.5-pro\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1970"
    },
    {
      "id": 1971,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-5.5",
      "modelKind": "model",
      "name": "Claude Opus 5.5",
      "label": "Claude Opus 5.5",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-5-5; compute_effort=max; temperature=1; max_output_tokens=128000",
      "value": 49.8,
      "valueLabel": "49.80",
      "display": "49.80%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "16 | Claude Opus 5.5 | 49.80%±2.27 | $4/$20 | 4m07s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 16 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-5-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1971"
    },
    {
      "id": 1972,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT 5.2",
      "label": "GPT 5.2",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.2-2025-12-11; reasoning_effort=xhigh; max_output_tokens=30000",
      "value": 49.75,
      "valueLabel": "49.75",
      "display": "49.75%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "17 | GPT 5.2 | 49.75%±2.26 | $1.75/$14 | 2m37s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 17 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5.2-2025-12-11\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1972"
    },
    {
      "id": 1973,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT 5",
      "label": "GPT 5",
      "lab": "openai",
      "variant": "model ID openai/gpt-5-2025-08-07; reasoning_effort=high; max_output_tokens=30000",
      "value": 49.63,
      "valueLabel": "49.63",
      "display": "49.63%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "18 | GPT 5 | 49.63%±2.10 | $1.25/$10 | 58.27s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 18 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5-2025-08-07\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1973"
    },
    {
      "id": 1974,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4.7",
      "modelKind": "model",
      "name": "Grok 4.7",
      "label": "Grok 4.7",
      "lab": "xai",
      "variant": "model ID grok/grok-4.7; reasoning_effort=xhigh; temperature=1; top_p=0.95",
      "value": 49.55,
      "valueLabel": "49.55",
      "display": "49.55%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "19 | Grok 4.7 | 49.55%±2.17 | $2/$6 | 3m33s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 19 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4.7\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1974"
    },
    {
      "id": 1975,
      "benchmark": "medcode",
      "metric": null,
      "model": "muse-spark-1.2",
      "modelKind": "model",
      "name": "Muse Spark 1.2",
      "label": "Muse Spark 1.2",
      "lab": "meta",
      "variant": "model ID meta/muse_spark_1_2; reasoning_effort=xhigh; temperature=1; max_output_tokens=30000",
      "value": 49.35,
      "valueLabel": "49.35",
      "display": "49.35%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "20 | Muse Spark 1.2 | 49.35%±2.19 | $1.25/$4.25 | 60.17s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 20 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"meta/muse_spark_1_2\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1975"
    },
    {
      "id": 1976,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-4.5",
      "modelKind": "model",
      "name": "Claude Opus 4.5 (Thinking)",
      "label": "Claude Opus 4.5 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-5-20251101-thinking; compute_effort=high; temperature=1; max_output_tokens=30000",
      "value": 49.16,
      "valueLabel": "49.16",
      "display": "49.16%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "21 | Claude Opus 4.5 (Thinking) | 49.16%±2.01 | $5/$25 | 60.84s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 21 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-5-20251101-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1976"
    },
    {
      "id": 1977,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude Opus 4.6 (Thinking)",
      "label": "Claude Opus 4.6 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-6-thinking; compute_effort=max; temperature=1; max_output_tokens=30000",
      "value": 49.13,
      "valueLabel": "49.13",
      "display": "49.13%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 22,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "22 | Claude Opus 4.6 (Thinking) | 49.13%±2.08 | $5/$25 | 2m36s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 22 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-6-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1977"
    },
    {
      "id": 1978,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5.5",
      "modelKind": "model",
      "name": "GPT 5.5",
      "label": "GPT 5.5",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.5; reasoning_effort=xhigh; temperature=1; max_output_tokens=30000",
      "value": 49.1,
      "valueLabel": "49.10",
      "display": "49.10%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 23,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "23 | GPT 5.5 | 49.10%±2.19 | $5/$30 | 2m40s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 23 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1978"
    },
    {
      "id": 1979,
      "benchmark": "medcode",
      "metric": null,
      "model": "kimi-k3",
      "modelKind": "model",
      "name": "Kimi K3",
      "label": "Kimi K3",
      "lab": "moonshot",
      "variant": "model ID kimi/kimi-k3; temperature=1; max_output_tokens=30000",
      "value": 48.88,
      "valueLabel": "48.88",
      "display": "48.88%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "24 | Kimi K3 | 48.88%±2.19 | $3/$15 | 116.18s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 24 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"kimi/kimi-k3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1979"
    },
    {
      "id": 1980,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-6.1-sol",
      "modelKind": "model",
      "name": "GPT-6.1 Sol",
      "label": "GPT-6.1 Sol",
      "lab": "openai",
      "variant": "model ID openai/gpt-6.1-sol; reasoning_effort=max; max_output_tokens=128000",
      "value": 48.84,
      "valueLabel": "48.84",
      "display": "48.84%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "25 | GPT-6.1 Sol | 48.84%±2.12 | $2/$10 | 115.34s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 25 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-6.1-sol\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1980"
    },
    {
      "id": 568,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-6-astra",
      "modelKind": "model",
      "name": "GPT-6 Astra",
      "label": null,
      "lab": "openai",
      "variant": "",
      "value": 48.49,
      "valueLabel": "48.49",
      "display": "48.49%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "26 | GPT-6 Astra | 48.49%±2.13 | $10/$50 | 102.86s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 26 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-6-astra\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-568"
    },
    {
      "id": 1981,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude Opus 4.6 (Nonthinking)",
      "label": "Claude Opus 4.6 (Nonthinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-6; compute_effort=max; temperature=1; max_output_tokens=30000",
      "value": 48.24,
      "valueLabel": "48.24",
      "display": "48.24%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 27,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "27 | Claude Opus 4.6 (Nonthinking) | 48.24%±2.05 | $5/$25 | 4.06s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 27 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-6\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1981"
    },
    {
      "id": 1982,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-3.8-flash",
      "modelKind": "model",
      "name": "Gemini 3.8 Flash",
      "label": "Gemini 3.8 Flash",
      "lab": "google",
      "variant": "model ID google/gemini-3.8-flash; reasoning_effort=high; temperature=1; max_output_tokens=65536",
      "value": 48.13,
      "valueLabel": "48.13",
      "display": "48.13%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "28 | Gemini 3.8 Flash | 48.13%±2.18 | $1.5/$7.5 | 42.89s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 28 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-3.8-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1982"
    },
    {
      "id": 1983,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-3.1-flash-lite-preview",
      "modelKind": "model",
      "name": "Gemini 3.1 Flash Lite Preview",
      "label": "Gemini 3.1 Flash Lite Preview",
      "lab": "google",
      "variant": "model ID google/gemini-3.1-flash-lite-preview; reasoning_effort=high; temperature=1; max_output_tokens=30000",
      "value": 47.6,
      "valueLabel": "47.60",
      "display": "47.60%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 29,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "29 | Gemini 3.1 Flash Lite Preview | 47.60%±2.07 | $0.25/$1.5 | 8.55s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 29 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-3.1-flash-lite-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1983"
    },
    {
      "id": 1984,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-sonnet-5",
      "modelKind": "model",
      "name": "Claude Sonnet 5",
      "label": "Claude Sonnet 5",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-5; compute_effort=max; temperature=1; max_output_tokens=30000",
      "value": 47.54,
      "valueLabel": "47.54",
      "display": "47.54%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 30,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "30 | Claude Sonnet 5 | 47.54%±2.27 | $2/$10 | 2m15s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 30 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1984"
    },
    {
      "id": 1985,
      "benchmark": "medcode",
      "metric": null,
      "model": "o3",
      "modelKind": "model",
      "name": "o3",
      "label": "o3",
      "lab": "openai",
      "variant": "model ID openai/o3-2025-04-16; reasoning_effort=high; max_output_tokens=30000",
      "value": 47.29,
      "valueLabel": "47.29",
      "display": "47.29%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 31,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "31 | o3 | 47.29%±2.16 | $2/$8 | 17.68s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 31 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/o3-2025-04-16\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1985"
    },
    {
      "id": 1986,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-4.1",
      "modelKind": "model",
      "name": "Claude Opus 4.1 (Thinking)",
      "label": "Claude Opus 4.1 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-1-20250805-thinking; temperature=1; max_output_tokens=30000",
      "value": 47.23,
      "valueLabel": "47.23",
      "display": "47.23%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 32,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "32 | Claude Opus 4.1 (Thinking) | 47.23%±2.07 | $15/$75 | 33.26s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 32 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-1-20250805-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1986"
    },
    {
      "id": 1987,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-6-sol",
      "modelKind": "model",
      "name": "GPT-6 Sol",
      "label": "GPT-6 Sol",
      "lab": "openai",
      "variant": "model ID openai/gpt-6-sol; reasoning_effort=max; max_output_tokens=128000",
      "value": 47.07,
      "valueLabel": "47.07",
      "display": "47.07%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 33,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "33 | GPT-6 Sol | 47.07%±2.12 | $2/$10 | 62.71s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 33 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-6-sol\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1987"
    },
    {
      "id": 1988,
      "benchmark": "medcode",
      "metric": null,
      "model": "minimax-m3",
      "modelKind": "model",
      "name": "MiniMax-M3",
      "label": "MiniMax-M3",
      "lab": "minimax",
      "variant": "model ID minimax/MiniMax-M3; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 46.29,
      "valueLabel": "46.29",
      "display": "46.29%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 34,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "34 | MiniMax-M3 | 46.29%±2.10 | $0.6/$2.4 | 63.12s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 34 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"minimax/MiniMax-M3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1988"
    },
    {
      "id": 1989,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-4.5",
      "modelKind": "model",
      "name": "Claude Opus 4.5 (Nonthinking)",
      "label": "Claude Opus 4.5 (Nonthinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-5-20251101; compute_effort=high; temperature=1; max_output_tokens=30000",
      "value": 45.17,
      "valueLabel": "45.17",
      "display": "45.17%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 35,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "35 | Claude Opus 4.5 (Nonthinking) | 45.17%±1.89 | $5/$25 | 5.02s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 35 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-5-20251101\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1989"
    },
    {
      "id": 1990,
      "benchmark": "medcode",
      "metric": null,
      "model": "mimo-v2.6-pro",
      "modelKind": "model",
      "name": "MiMo V2.6 Pro",
      "label": "MiMo V2.6 Pro",
      "lab": "xiaomi",
      "variant": "model ID xiaomi/mimo-v2.6-pro; temperature=1; top_p=0.95; max_output_tokens=128000",
      "value": 44.97,
      "valueLabel": "44.97",
      "display": "44.97%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 36,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "36 | MiMo V2.6 Pro | 44.97%±2.10 | $0.435/$0.87 | 2m57s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 36 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"xiaomi/mimo-v2.6-pro\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1990"
    },
    {
      "id": 1991,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4.6",
      "modelKind": "model",
      "name": "Grok 4.6",
      "label": "Grok 4.6",
      "lab": "xai",
      "variant": "model ID grok/grok-4.6; reasoning_effort=high; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 44.71,
      "valueLabel": "44.71",
      "display": "44.71%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 37,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "37 | Grok 4.6 | 44.71%±2.26 | $2/$6 | 2m07s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 37 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4.6\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1991"
    },
    {
      "id": 1992,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-6-luna",
      "modelKind": "model",
      "name": "GPT-6 Luna",
      "label": "GPT-6 Luna",
      "lab": "openai",
      "variant": "model ID openai/gpt-6-luna; reasoning_effort=max; max_output_tokens=128000",
      "value": 44.69,
      "valueLabel": "44.69",
      "display": "44.69%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 38,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "38 | GPT-6 Luna | 44.69%±2.30 | $0.1/$0.5 | 108.77s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 38 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-6-luna\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1992"
    },
    {
      "id": 1993,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-sonnet-4.5",
      "modelKind": "model",
      "name": "Claude Sonnet 4.5 (Thinking)",
      "label": "Claude Sonnet 4.5 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-4-5-20250929-thinking; temperature=1; max_output_tokens=30000",
      "value": 44.13,
      "valueLabel": "44.13",
      "display": "44.13%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 39,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "39 | Claude Sonnet 4.5 (Thinking) | 44.13%±2.00 | $3/$15 | 74.33s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 39 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-4-5-20250929-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1993"
    },
    {
      "id": 1994,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5.6-sol",
      "modelKind": "model",
      "name": "GPT-5.6 Sol",
      "label": "GPT-5.6 Sol",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.6-sol; reasoning_effort=max; max_output_tokens=30000",
      "value": 43.97,
      "valueLabel": "43.97",
      "display": "43.97%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 40,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "40 | GPT-5.6 Sol | 43.97%±2.26 | $4/$20 | 96.59s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 40 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5.6-sol\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1994"
    },
    {
      "id": 1995,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-3.5-flash-lite",
      "modelKind": "model",
      "name": "Gemini 3.5 Flash Lite",
      "label": "Gemini 3.5 Flash Lite",
      "lab": "google",
      "variant": "model ID google/gemini-3.5-flash-lite; reasoning_effort=high; temperature=1; max_output_tokens=30000",
      "value": 43.49,
      "valueLabel": "43.49",
      "display": "43.49%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 41,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "41 | Gemini 3.5 Flash Lite | 43.49%±1.95 | $0.3/$2.5 | 6.02s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 41 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-3.5-flash-lite\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1995"
    },
    {
      "id": 1996,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5.6-terra",
      "modelKind": "model",
      "name": "GPT-5.6 Terra",
      "label": "GPT-5.6 Terra",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.6-terra; reasoning_effort=xhigh; max_output_tokens=30000",
      "value": 43.41,
      "valueLabel": "43.41",
      "display": "43.41%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 42,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "42 | GPT-5.6 Terra | 43.41%±2.17 | $2/$12 | 18.41s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 42 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5.6-terra\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1996"
    },
    {
      "id": 1997,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4.5",
      "modelKind": "model",
      "name": "Grok 4.5",
      "label": "Grok 4.5",
      "lab": "xai",
      "variant": "model ID grok/grok-4.5; reasoning_effort=high; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 43.29,
      "valueLabel": "43.29",
      "display": "43.29%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 43,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "43 | Grok 4.5 | 43.29%±2.31 | $2/$6 | 59.64s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 43 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1997"
    },
    {
      "id": 1998,
      "benchmark": "medcode",
      "metric": null,
      "model": "hy4-preview",
      "modelKind": "model",
      "name": "Hy4 Preview",
      "label": "Hy4 Preview",
      "lab": "tencent",
      "variant": "model ID tencent/hy4-preview; temperature=1; top_p=1; max_output_tokens=64000",
      "value": 43.25,
      "valueLabel": "43.25",
      "display": "43.25%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 44,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "44 | Hy4 Preview | 43.25%±2.13 | $0.834/$2.501 | 6m39s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 44 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"tencent/hy4-preview\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1998"
    },
    {
      "id": 1999,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5-mini",
      "modelKind": "model",
      "name": "GPT 5 Mini",
      "label": "GPT 5 Mini",
      "lab": "openai",
      "variant": "model ID openai/gpt-5-mini-2025-08-07; reasoning_effort=high; max_output_tokens=30000",
      "value": 43.05,
      "valueLabel": "43.05",
      "display": "43.05%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 45,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "45 | GPT 5 Mini | 43.05%±2.04 | $0.25/$2 | 28.17s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 45 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5-mini-2025-08-07\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-1999"
    },
    {
      "id": 2000,
      "benchmark": "medcode",
      "metric": null,
      "model": "glm-5.3",
      "modelKind": "model",
      "name": "GLM 5.3",
      "label": "GLM 5.3",
      "lab": "zhipu",
      "variant": "model ID zai/glm-5.3; reasoning_effort=max; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 42.86,
      "valueLabel": "42.86",
      "display": "42.86%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 46,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "46 | GLM 5.3 | 42.86%±2.11 | $1.4/$4.4 | 2m49s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 46 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"zai/glm-5.3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2000"
    },
    {
      "id": 2001,
      "benchmark": "medcode",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek V4 Pro 0813",
      "label": "DeepSeek V4 Pro 0813",
      "lab": "deepseek",
      "variant": "model ID deepseek/deepseek-v4-pro-0813; reasoning_effort=max; max_output_tokens=30000",
      "value": 42.47,
      "valueLabel": "42.47",
      "display": "42.47%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 47,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "47 | DeepSeek V4 Pro 0813 | 42.47%±2.16 | $1.32/$3.96 | 3m01s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 47 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"deepseek/deepseek-v4-pro-0813\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2001"
    },
    {
      "id": 2002,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5.6-luna",
      "modelKind": "model",
      "name": "GPT-5.6 Luna",
      "label": "GPT-5.6 Luna",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.6-luna; reasoning_effort=max; max_output_tokens=30000",
      "value": 42.39,
      "valueLabel": "42.39",
      "display": "42.39%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 48,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "48 | GPT-5.6 Luna | 42.39%±2.27 | $0.2/$1.2 | 81.28s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 48 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5.6-luna\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2002"
    },
    {
      "id": 2003,
      "benchmark": "medcode",
      "metric": null,
      "model": "glm-5.1",
      "modelKind": "model",
      "name": "GLM 5.1",
      "label": "GLM 5.1",
      "lab": "zhipu",
      "variant": "model ID zai/glm-5.1; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 41.6,
      "valueLabel": "41.60",
      "display": "41.60%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 49,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "49 | GLM 5.1 | 41.60%±2.12 | $1/$3.2 | 77.58s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 49 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"zai/glm-5.1\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2003"
    },
    {
      "id": 2004,
      "benchmark": "medcode",
      "metric": null,
      "model": "deepseek-v4-flash-0731",
      "modelKind": "model",
      "name": "DeepSeek V4 Flash 0731",
      "label": "DeepSeek V4 Flash 0731",
      "lab": "deepseek",
      "variant": "model ID deepseek/deepseek-v4-flash-0731; reasoning_effort=high; max_output_tokens=30000",
      "value": 41.41,
      "valueLabel": "41.41",
      "display": "41.41%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 50,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "50 | DeepSeek V4 Flash 0731 | 41.41%±2.15 | $0.44/$1.32 | 2m07s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 50 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"deepseek/deepseek-v4-flash-0731\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2004"
    },
    {
      "id": 2005,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-opus-4.1",
      "modelKind": "model",
      "name": "Claude Opus 4.1 (Nonthinking)",
      "label": "Claude Opus 4.1 (Nonthinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-opus-4-1-20250805; temperature=1; max_output_tokens=30000",
      "value": 41.37,
      "valueLabel": "41.37",
      "display": "41.37%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 51,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "51 | Claude Opus 4.1 (Nonthinking) | 41.37%±1.96 | $15/$75 | 13.08s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 51 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-opus-4-1-20250805\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2005"
    },
    {
      "id": 2006,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT 5.4 (xhigh)",
      "label": "GPT 5.4 (xhigh)",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.4-2026-03-05; reasoning_effort=xhigh; max_output_tokens=30000",
      "value": 41.29,
      "valueLabel": "41.29",
      "display": "41.29%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 52,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "52 | GPT 5.4 (xhigh) | 41.29%±2.15 | $2.5/$15 | 3m07s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 52 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5.4-2026-03-05\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2006"
    },
    {
      "id": 2007,
      "benchmark": "medcode",
      "metric": null,
      "model": "inkling",
      "modelKind": "model",
      "name": "Inkling",
      "label": "Inkling",
      "lab": "thinking-machines",
      "variant": "model ID thinkingmachines/inkling; reasoning_effort=0.99; temperature=1; top_p=1; max_output_tokens=30000",
      "value": 41.19,
      "valueLabel": "41.19",
      "display": "41.19%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 53,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "53 | Inkling | 41.19%±2.23 | $1/$4.05 | 2m47s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 53 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"thinkingmachines/inkling\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2007"
    },
    {
      "id": 2008,
      "benchmark": "medcode",
      "metric": null,
      "model": "deepseek-v4.1-flash",
      "modelKind": "model",
      "name": "DeepSeek V4.1 Flash",
      "label": "DeepSeek V4.1 Flash",
      "lab": "deepseek",
      "variant": "model ID deepseek/deepseek-v4.1-flash; reasoning_effort=high; max_output_tokens=384000",
      "value": 41.17,
      "valueLabel": "41.17",
      "display": "41.17%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 54,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "54 | DeepSeek V4.1 Flash | 41.17%±2.04 | $0.3/$1.2 | 35.13s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 54 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"deepseek/deepseek-v4.1-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2008"
    },
    {
      "id": 2009,
      "benchmark": "medcode",
      "metric": null,
      "model": "mimo-v2.6-flash",
      "modelKind": "model",
      "name": "MiMo V2.6 Flash",
      "label": "MiMo V2.6 Flash",
      "lab": "xiaomi",
      "variant": "model ID xiaomi/mimo-v2.6-flash; temperature=1; top_p=0.95; max_output_tokens=128000",
      "value": 41.06,
      "valueLabel": "41.06",
      "display": "41.06%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 55,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "55 | MiMo V2.6 Flash | 41.06%±2.03 | $0.14/$0.28 | 93.37s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 55 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"xiaomi/mimo-v2.6-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2009"
    },
    {
      "id": 2010,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5.4-nano",
      "modelKind": "model",
      "name": "GPT 5.4 Nano",
      "label": "GPT 5.4 Nano",
      "lab": "openai",
      "variant": "model ID openai/gpt-5.4-nano-2026-03-17; reasoning_effort=high; max_output_tokens=30000",
      "value": 41.03,
      "valueLabel": "41.03",
      "display": "41.03%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 56,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "56 | GPT 5.4 Nano | 41.03%±2.26 | $0.2/$1.25 | 8.04s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 56 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5.4-nano-2026-03-17\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2010"
    },
    {
      "id": 2011,
      "benchmark": "medcode",
      "metric": null,
      "model": "glm-5.2",
      "modelKind": "model",
      "name": "GLM 5.2",
      "label": "GLM 5.2",
      "lab": "zhipu",
      "variant": "model ID zai/glm-5.2; temperature=1; max_output_tokens=30000",
      "value": 40.77,
      "valueLabel": "40.77",
      "display": "40.77%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 57,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "57 | GLM 5.2 | 40.77%±2.17 | $1.4/$4.4 | 95.27s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 57 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"zai/glm-5.2\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2011"
    },
    {
      "id": 2012,
      "benchmark": "medcode",
      "metric": null,
      "model": "qwen3.8-max",
      "modelKind": "model",
      "name": "Qwen 3.8 Max",
      "label": "Qwen 3.8 Max",
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.8-max; temperature=1; max_output_tokens=30000",
      "value": 40.67,
      "valueLabel": "40.67",
      "display": "40.67%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 58,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "58 | Qwen 3.8 Max | 40.67%±2.03 | $2/$6 | 6m18s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 58 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"alibaba/qwen3.8-max\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2012"
    },
    {
      "id": 2013,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-sonnet-4.5",
      "modelKind": "model",
      "name": "Claude Sonnet 4.5 (Nonthinking)",
      "label": "Claude Sonnet 4.5 (Nonthinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-4-5-20250929; temperature=1; max_output_tokens=30000",
      "value": 40.57,
      "valueLabel": "40.57",
      "display": "40.57%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 59,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "59 | Claude Sonnet 4.5 (Nonthinking) | 40.57%±2.00 | $3/$15 | 12.01s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 59 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-4-5-20250929\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2013"
    },
    {
      "id": 2014,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-2.5-flash-preview-9-25",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Preview (9/25) (Nonthinking)",
      "label": "Gemini 2.5 Flash Preview (9/25) (Nonthinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-preview-09-2025; temperature=1; max_output_tokens=30000",
      "value": 40.54,
      "valueLabel": "40.54",
      "display": "40.54%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 60,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "60 | Gemini 2.5 Flash Preview (9/25) (Nonthinking) | 40.54%±1.93 | $0.3/$2.5 | 12.70s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 60 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-preview-09-2025\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2014"
    },
    {
      "id": 2015,
      "benchmark": "medcode",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek V4",
      "label": "DeepSeek V4",
      "lab": "deepseek",
      "variant": "model ID deepseek/deepseek-v4-pro; reasoning_effort=max; max_output_tokens=128000",
      "value": 40.45,
      "valueLabel": "40.45",
      "display": "40.45%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 61,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "61 | DeepSeek V4 | 40.45%±2.12 | $1.32/$3.96 | 6m23s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 61 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"deepseek/deepseek-v4-pro\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2015"
    },
    {
      "id": 2016,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-2.5-flash-7-17",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash (7/17) (Thinking)",
      "label": "Gemini 2.5 Flash (7/17) (Thinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-thinking; temperature=1; max_output_tokens=30000",
      "value": 40.36,
      "valueLabel": "40.36",
      "display": "40.36%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 62,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "62 | Gemini 2.5 Flash (7/17) (Thinking) | 40.36%±1.95 | $0.3/$2.5 | 22.83s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 62 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2016"
    },
    {
      "id": 2017,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-2.5-flash-preview-9-25",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Preview (9/25) (Thinking)",
      "label": "Gemini 2.5 Flash Preview (9/25) (Thinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-preview-09-2025-thinking; temperature=1; max_output_tokens=30000",
      "value": 40.33,
      "valueLabel": "40.33",
      "display": "40.33%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 63,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "63 | Gemini 2.5 Flash Preview (9/25) (Thinking) | 40.33%±1.92 | $0.3/$2.5 | 16.11s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 63 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-preview-09-2025-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2017"
    },
    {
      "id": 2018,
      "benchmark": "medcode",
      "metric": null,
      "model": "kimi-k2.6",
      "modelKind": "model",
      "name": "Kimi K2.6",
      "label": "Kimi K2.6",
      "lab": "moonshot",
      "variant": "model ID kimi/kimi-k2.6; top_p=0.95; max_output_tokens=30000",
      "value": 40.14,
      "valueLabel": "40.14",
      "display": "40.14%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 64,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "64 | Kimi K2.6 | 40.14%±2.04 | $0.95/$4 | 5m05s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 64 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"kimi/kimi-k2.6\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2018"
    },
    {
      "id": 2019,
      "benchmark": "medcode",
      "metric": null,
      "model": "kimi-k2.5",
      "modelKind": "model",
      "name": "Kimi K2.5",
      "label": "Kimi K2.5",
      "lab": "moonshot",
      "variant": "model ID kimi/kimi-k2.5-thinking; top_p=0.95; max_output_tokens=30000",
      "value": 39.32,
      "valueLabel": "39.32",
      "display": "39.32%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 65,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "65 | Kimi K2.5 | 39.32%±2.12 | $0.6/$3 | 75.45s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 65 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"kimi/kimi-k2.5-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2019"
    },
    {
      "id": 2020,
      "benchmark": "medcode",
      "metric": null,
      "model": "qwen-3.7-max",
      "modelKind": "model",
      "name": "Qwen 3.7 Max",
      "label": "Qwen 3.7 Max",
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.7-max; temperature=1; max_output_tokens=30000",
      "value": 38.75,
      "valueLabel": "38.75",
      "display": "38.75%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 66,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "66 | Qwen 3.7 Max | 38.75%±2.20 | $2.5/$7.5 | 28.75s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 66 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"alibaba/qwen3.7-max\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2020"
    },
    {
      "id": 2021,
      "benchmark": "medcode",
      "metric": null,
      "model": "nemotron-3-ultra",
      "modelKind": "model",
      "name": "Nemotron 3 Ultra",
      "label": "Nemotron 3 Ultra",
      "lab": "nvidia",
      "variant": "model ID nvidia/nemotron-3-ultra-550b-a55b; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 38.62,
      "valueLabel": "38.62",
      "display": "38.62%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 67,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "67 | Nemotron 3 Ultra | 38.62%±2.00 | N/A | 18.68s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 67 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"nvidia/nemotron-3-ultra-550b-a55b\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2021"
    },
    {
      "id": 2022,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-2.5-flash-7-17",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash (7/17) (Nonthinking)",
      "label": "Gemini 2.5 Flash (7/17) (Nonthinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash; temperature=1; max_output_tokens=30000",
      "value": 38.42,
      "valueLabel": "38.42",
      "display": "38.42%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 68,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "68 | Gemini 2.5 Flash (7/17) (Nonthinking) | 38.42%±1.92 | $0.3/$2.5 | 22.14s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 68 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2022"
    },
    {
      "id": 2023,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4",
      "modelKind": "model",
      "name": "Grok 4",
      "label": "Grok 4",
      "lab": "xai",
      "variant": "model ID grok/grok-4-0709; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 38.08,
      "valueLabel": "38.08",
      "display": "38.08%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 69,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "69 | Grok 4 | 38.08%±2.21 | $3/$15 | 89.00s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 69 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4-0709\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2023"
    },
    {
      "id": 2024,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4.3",
      "modelKind": "model",
      "name": "Grok 4.3",
      "label": "Grok 4.3",
      "lab": "xai",
      "variant": "model ID grok/grok-4.3; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 38.07,
      "valueLabel": "38.07",
      "display": "38.07%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 70,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "70 | Grok 4.3 | 38.07%±2.08 | $1.25/$2.5 | 43.92s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 70 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4.3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2024"
    },
    {
      "id": 2025,
      "benchmark": "medcode",
      "metric": null,
      "model": "inkling-small",
      "modelKind": "model",
      "name": "Inkling Small",
      "label": "Inkling Small",
      "lab": "thinking-machines",
      "variant": "model ID thinkingmachines/inkling-small; reasoning_effort=0.99; temperature=1; top_p=1; max_output_tokens=30000",
      "value": 37.89,
      "valueLabel": "37.89",
      "display": "37.89%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 71,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "71 | Inkling Small | 37.89%±2.21 | $0.3/$1.2 | 3m11s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 71 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"thinkingmachines/inkling-small\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2025"
    },
    {
      "id": 2026,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4-fast-reasoning",
      "modelKind": "model",
      "name": "Grok 4 Fast (Reasoning)",
      "label": "Grok 4 Fast (Reasoning)",
      "lab": "xai",
      "variant": "model ID grok/grok-4-fast-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 37.38,
      "valueLabel": "37.38",
      "display": "37.38%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 72,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "72 | Grok 4 Fast (Reasoning) | 37.38%±1.94 | $0.2/$0.5 | 17.52s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 72 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4-fast-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2026"
    },
    {
      "id": 2027,
      "benchmark": "medcode",
      "metric": null,
      "model": "qwen3.6-plus",
      "modelKind": "model",
      "name": "Qwen 3.6 Plus",
      "label": "Qwen 3.6 Plus",
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.6-plus; temperature=1; max_output_tokens=30000",
      "value": 36.89,
      "valueLabel": "36.89",
      "display": "36.89%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 73,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "73 | Qwen 3.6 Plus | 36.89%±2.02 | $0.5/$3 | 56.22s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 73 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"alibaba/qwen3.6-plus\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2027"
    },
    {
      "id": 2028,
      "benchmark": "medcode",
      "metric": null,
      "model": "llama-4-maverick",
      "modelKind": "model",
      "name": "Llama 4 Maverick",
      "label": "Llama 4 Maverick",
      "lab": "meta",
      "variant": "model ID fireworks/llama4-maverick-instruct-basic; temperature=1; max_output_tokens=30000",
      "value": 36.51,
      "valueLabel": "36.51",
      "display": "36.51%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 74,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "74 | Llama 4 Maverick | 36.51%±1.99 | $0.22/$0.88 | 21.24s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 74 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"fireworks/llama4-maverick-instruct-basic\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2028"
    },
    {
      "id": 2029,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-sonnet-4",
      "modelKind": "model",
      "name": "Claude Sonnet 4 (Thinking)",
      "label": "Claude Sonnet 4 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-4-20250514-thinking; max_output_tokens=30000",
      "value": 34.96,
      "valueLabel": "34.96",
      "display": "34.96%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 75,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "75 | Claude Sonnet 4 (Thinking) | 34.96%±1.94 | $3/$15 | 39.80s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 75 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-4-20250514-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2029"
    },
    {
      "id": 2030,
      "benchmark": "medcode",
      "metric": null,
      "model": "minimax-m2.7",
      "modelKind": "model",
      "name": "MiniMax-M2.7",
      "label": "MiniMax-M2.7",
      "lab": "minimax",
      "variant": "model ID minimax/MiniMax-M2.7; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 34.44,
      "valueLabel": "34.44",
      "display": "34.44%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 76,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "76 | MiniMax-M2.7 | 34.44%±1.99 | $0.3/$1.2 | 30.25s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 76 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"minimax/MiniMax-M2.7\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2030"
    },
    {
      "id": 2031,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-2.5-flash-lite-9-25",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Lite (9/25) (Thinking)",
      "label": "Gemini 2.5 Flash Lite (9/25) (Thinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-lite-preview-09-2025-thinking; temperature=1; max_output_tokens=30000",
      "value": 34.19,
      "valueLabel": "34.19",
      "display": "34.19%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 77,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "77 | Gemini 2.5 Flash Lite (9/25) (Thinking) | 34.19%±1.74 | $0.1/$0.4 | 10.49s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 77 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-lite-preview-09-2025-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2031"
    },
    {
      "id": 2032,
      "benchmark": "medcode",
      "metric": null,
      "model": "minimax-m2.1",
      "modelKind": "model",
      "name": "MiniMax-M2.1",
      "label": "MiniMax-M2.1",
      "lab": "minimax",
      "variant": "model ID minimax/MiniMax-M2.1; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 34.08,
      "valueLabel": "34.08",
      "display": "34.08%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 78,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "78 | MiniMax-M2.1 | 34.08%±1.94 | $0.3/$1.2 | 19.55s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 78 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"minimax/MiniMax-M2.1\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2032"
    },
    {
      "id": 2033,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-sonnet-4",
      "modelKind": "model",
      "name": "Claude Sonnet 4 (Nonthinking)",
      "label": "Claude Sonnet 4 (Nonthinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-sonnet-4-20250514; temperature=1; max_output_tokens=30000",
      "value": 33.94,
      "valueLabel": "33.94",
      "display": "33.94%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 79,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "79 | Claude Sonnet 4 (Nonthinking) | 33.94%±1.91 | $3/$15 | 7.30s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 79 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-sonnet-4-20250514\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2033"
    },
    {
      "id": 2034,
      "benchmark": "medcode",
      "metric": null,
      "model": "o4-mini",
      "modelKind": "model",
      "name": "o4 Mini",
      "label": "o4 Mini",
      "lab": "openai",
      "variant": "model ID openai/o4-mini-2025-04-16; reasoning_effort=high; max_output_tokens=30000",
      "value": 33.79,
      "valueLabel": "33.79",
      "display": "33.79%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 80,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "80 | o4 Mini | 33.79%±2.02 | $1.1/$4.4 | 21.06s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 80 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/o4-mini-2025-04-16\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2034"
    },
    {
      "id": 2035,
      "benchmark": "medcode",
      "metric": null,
      "model": "mistral-medium-3.5",
      "modelKind": "model",
      "name": "Mistral Medium 3.5",
      "label": "Mistral Medium 3.5",
      "lab": "mistral",
      "variant": "model ID mistralai/mistral-medium-3.5; reasoning_effort=high; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 33.75,
      "valueLabel": "33.75",
      "display": "33.75%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 81,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "81 | Mistral Medium 3.5 | 33.75%±1.15 | $1.5/$7.5 | 34.88s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 81 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"mistralai/mistral-medium-3.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2035"
    },
    {
      "id": 2036,
      "benchmark": "medcode",
      "metric": null,
      "model": "qwen-3.5-flash",
      "modelKind": "model",
      "name": "Qwen 3.5 Flash",
      "label": "Qwen 3.5 Flash",
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.5-flash; temperature=1; max_output_tokens=30000",
      "value": 33,
      "valueLabel": "33.00",
      "display": "33.00%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 82,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "82 | Qwen 3.5 Flash | 33.00%±1.79 | $0.1/$0.4 | 63.07s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 82 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"alibaba/qwen3.5-flash\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2036"
    },
    {
      "id": 2037,
      "benchmark": "medcode",
      "metric": null,
      "model": "glm-4.7",
      "modelKind": "model",
      "name": "GLM 4.7",
      "label": "GLM 4.7",
      "lab": "zhipu",
      "variant": "model ID zai/glm-4.7; temperature=1; top_p=1; max_output_tokens=30000",
      "value": 32.77,
      "valueLabel": "32.77",
      "display": "32.77%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 83,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "83 | GLM 4.7 | 32.77%±2.00 | $0.6/$2.2 | 2m03s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 83 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"zai/glm-4.7\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2037"
    },
    {
      "id": 2038,
      "benchmark": "medcode",
      "metric": null,
      "model": "claude-haiku-4.5",
      "modelKind": "model",
      "name": "Claude Haiku 4.5 (Thinking)",
      "label": "Claude Haiku 4.5 (Thinking)",
      "lab": "anthropic",
      "variant": "model ID anthropic/claude-haiku-4-5-20251001-thinking; temperature=1; max_output_tokens=30000",
      "value": 32.68,
      "valueLabel": "32.68",
      "display": "32.68%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 84,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "84 | Claude Haiku 4.5 (Thinking) | 32.68%±2.00 | $1/$5 | 34.29s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 84 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"anthropic/claude-haiku-4-5-20251001-thinking\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2038"
    },
    {
      "id": 2039,
      "benchmark": "medcode",
      "metric": null,
      "model": "mimo-v2.5-pro",
      "modelKind": "model",
      "name": "MiMo V2.5 Pro",
      "label": "MiMo V2.5 Pro",
      "lab": "xiaomi",
      "variant": "model ID xiaomi/mimo-v2.5-pro; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 32.48,
      "valueLabel": "32.48",
      "display": "32.48%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 85,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "85 | MiMo V2.5 Pro | 32.48%±1.91 | $0.435/$0.87 | 38.45s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 85 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"xiaomi/mimo-v2.5-pro\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2039"
    },
    {
      "id": 2040,
      "benchmark": "medcode",
      "metric": null,
      "model": "ling-3.0-flash",
      "modelKind": "model",
      "name": "Ling 3.0 Flash",
      "label": "Ling 3.0 Flash",
      "lab": "ant-group",
      "variant": "model ID ant/ling-3.0-flash-2607; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 32.27,
      "valueLabel": "32.27",
      "display": "32.27%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 86,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "86 | Ling 3.0 Flash | 32.27%±1.91 | $0.075/$0.22 | 9.65s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 86 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"ant/ling-3.0-flash-2607\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2040"
    },
    {
      "id": 2041,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4.20",
      "modelKind": "model",
      "name": "Grok 4.20 (Reasoning)",
      "label": "Grok 4.20 (Reasoning)",
      "lab": "xai",
      "variant": "model ID grok/grok-4.20-0309-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 32.16,
      "valueLabel": "32.16",
      "display": "32.16%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 87,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "87 | Grok 4.20 (Reasoning) | 32.16%±2.12 | $2/$6 | 16.55s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 87 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4.20-0309-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2041"
    },
    {
      "id": 2042,
      "benchmark": "medcode",
      "metric": null,
      "model": "mimo-v2.5",
      "modelKind": "model",
      "name": "MiMo V2.5",
      "label": "MiMo V2.5",
      "lab": "xiaomi",
      "variant": "model ID xiaomi/mimo-v2.5; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 31.89,
      "valueLabel": "31.89",
      "display": "31.89%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 88,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "88 | MiMo V2.5 | 31.89%±2.02 | $0.14/$0.28 | 17.70s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 88 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"xiaomi/mimo-v2.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2042"
    },
    {
      "id": 2043,
      "benchmark": "medcode",
      "metric": null,
      "model": "qwen-3-vl-plus",
      "modelKind": "model",
      "name": "Qwen 3 VL Plus",
      "label": "Qwen 3 VL Plus",
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3-vl-plus-2025-09-23; temperature=1; max_output_tokens=30000",
      "value": 31.65,
      "valueLabel": "31.65",
      "display": "31.65%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 89,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "89 | Qwen 3 VL Plus | 31.65%±1.84 | $0.2/$1.6 | 9.95s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 89 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"alibaba/qwen3-vl-plus-2025-09-23\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2043"
    },
    {
      "id": 2044,
      "benchmark": "medcode",
      "metric": null,
      "model": "qwen-3-max-thinking",
      "modelKind": "model",
      "name": "Qwen 3 Max Thinking",
      "label": "Qwen 3 Max Thinking",
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3-max-2026-01-23; temperature=1; max_output_tokens=30000",
      "value": 31.37,
      "valueLabel": "31.37",
      "display": "31.37%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 90,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "90 | Qwen 3 Max Thinking | 31.37%±1.89 | $1.2/$6 | 3m02s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 90 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"alibaba/qwen3-max-2026-01-23\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2044"
    },
    {
      "id": 2045,
      "benchmark": "medcode",
      "metric": null,
      "model": "mercury-2.5",
      "modelKind": "model",
      "name": "Mercury 2.5",
      "label": "Mercury 2.5",
      "lab": "inception",
      "variant": "model ID inception/mercury-2.5; reasoning_effort=high; temperature=1; max_output_tokens=65536",
      "value": 31.33,
      "valueLabel": "31.33",
      "display": "31.33%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 91,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "91 | Mercury 2.5 | 31.33%±1.95 | $0.2/$0.75 | 7.93s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 91 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"inception/mercury-2.5\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2045"
    },
    {
      "id": 2046,
      "benchmark": "medcode",
      "metric": null,
      "model": "gpt-5-nano",
      "modelKind": "model",
      "name": "GPT 5 Nano",
      "label": "GPT 5 Nano",
      "lab": "openai",
      "variant": "model ID openai/gpt-5-nano-2025-08-07; reasoning_effort=high; max_output_tokens=30000",
      "value": 30.44,
      "valueLabel": "30.44",
      "display": "30.44%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 92,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "92 | GPT 5 Nano | 30.44%±1.95 | $0.05/$0.4 | 29.74s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 92 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"openai/gpt-5-nano-2025-08-07\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2046"
    },
    {
      "id": 2047,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4-fast-non-reasoning",
      "modelKind": "model",
      "name": "Grok 4 Fast (Non-Reasoning)",
      "label": "Grok 4 Fast (Non-Reasoning)",
      "lab": "xai",
      "variant": "model ID grok/grok-4-fast-non-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 30.04,
      "valueLabel": "30.04",
      "display": "30.04%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 93,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "93 | Grok 4 Fast (Non-Reasoning) | 30.04%±1.97 | $0.2/$0.5 | 18.21s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 93 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4-fast-non-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2047"
    },
    {
      "id": 2048,
      "benchmark": "medcode",
      "metric": null,
      "model": "ling-3.0-flash-fin",
      "modelKind": "model",
      "name": "Ling 3.0 Flash Fin",
      "label": "Ling 3.0 Flash Fin",
      "lab": "ant-group",
      "variant": "model ID ant/ling-3.0-flash-af-rc3; temperature=1; top_p=0.95; max_output_tokens=131072",
      "value": 29.3,
      "valueLabel": "29.30",
      "display": "29.30%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 94,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "94 | Ling 3.0 Flash Fin | 29.30%±1.94 | $0.06/$0.18 | 31.17s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 94 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"ant/ling-3.0-flash-af-rc3\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2048"
    },
    {
      "id": 2049,
      "benchmark": "medcode",
      "metric": null,
      "model": "qwen-3.8-27b",
      "modelKind": "model",
      "name": "Qwen 3.8 27B",
      "label": "Qwen 3.8 27B",
      "lab": "alibaba",
      "variant": "model ID alibaba/qwen3.8-27b; reasoning_effort=xhigh; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 28.7,
      "valueLabel": "28.70",
      "display": "28.70%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 95,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "95 | Qwen 3.8 27B | 28.70%±1.97 | $0.5/$3 | 89.38s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 95 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"alibaba/qwen3.8-27b\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2049"
    },
    {
      "id": 2050,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4.1-fast-non-reasoning",
      "modelKind": "model",
      "name": "Grok 4.1 Fast Non-Reasoning",
      "label": "Grok 4.1 Fast Non-Reasoning",
      "lab": "xai",
      "variant": "model ID grok/grok-4-1-fast-non-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 28.35,
      "valueLabel": "28.35",
      "display": "28.35%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 96,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "96 | Grok 4.1 Fast Non-Reasoning | 28.35%±1.92 | $0.2/$0.5 | 4.50s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 96 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4-1-fast-non-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2050"
    },
    {
      "id": 2051,
      "benchmark": "medcode",
      "metric": null,
      "model": "grok-4.1-fast-reasoning",
      "modelKind": "model",
      "name": "Grok 4.1 Fast (Reasoning)",
      "label": "Grok 4.1 Fast (Reasoning)",
      "lab": "xai",
      "variant": "model ID grok/grok-4-1-fast-reasoning; temperature=1; top_p=0.95; max_output_tokens=30000",
      "value": 28.08,
      "valueLabel": "28.08",
      "display": "28.08%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 97,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "97 | Grok 4.1 Fast (Reasoning) | 28.08%±1.99 | $0.2/$0.5 | 46.50s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 97 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"grok/grok-4-1-fast-reasoning\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2051"
    },
    {
      "id": 2052,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-2.5-flash-lite",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Lite (Nonthinking)",
      "label": "Gemini 2.5 Flash Lite (Nonthinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-lite; temperature=1; max_output_tokens=30000",
      "value": 27.11,
      "valueLabel": "27.11",
      "display": "27.11%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 98,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "98 | Gemini 2.5 Flash Lite (Nonthinking) | 27.11%±1.84 | $0.1/$0.4 | 5.75s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 98 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-lite\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2052"
    },
    {
      "id": 2053,
      "benchmark": "medcode",
      "metric": null,
      "model": "gemini-2.5-flash-lite-9-25",
      "modelKind": "model",
      "name": "Gemini 2.5 Flash Lite (9/25) (Nonthinking)",
      "label": "Gemini 2.5 Flash Lite (9/25) (Nonthinking)",
      "lab": "google",
      "variant": "model ID google/gemini-2.5-flash-lite-preview-09-2025; temperature=1; max_output_tokens=30000",
      "value": 27.08,
      "valueLabel": "27.08",
      "display": "27.08%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 99,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "99 | Gemini 2.5 Flash Lite (9/25) (Nonthinking) | 27.08%±1.91 | $0.1/$0.4 | 6.24s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 99 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"google/gemini-2.5-flash-lite-preview-09-2025\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2053"
    },
    {
      "id": 2054,
      "benchmark": "medcode",
      "metric": null,
      "model": "llama-4-scout",
      "modelKind": "model",
      "name": "Llama 4 Scout",
      "label": "Llama 4 Scout",
      "lab": "meta",
      "variant": "model ID together/meta-llama/Llama-4-Scout-17B-16E-Instruct; temperature=1; max_output_tokens=30000",
      "value": 23.31,
      "valueLabel": "23.31",
      "display": "23.31%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 100,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "100 | Llama 4 Scout | 23.31%±1.75 | $0.18/$0.59 | 10.74s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 100 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"together/meta-llama/Llama-4-Scout-17B-16E-Instruct\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2054"
    },
    {
      "id": 2055,
      "benchmark": "medcode",
      "metric": null,
      "model": "laguna-m.1",
      "modelKind": "model",
      "name": "Laguna M.1",
      "label": "Laguna M.1",
      "lab": "poolside",
      "variant": "model ID poolside/laguna-m.1; temperature=1; max_output_tokens=30000",
      "value": 23.11,
      "valueLabel": "23.11",
      "display": "23.11%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 101,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "101 | Laguna M.1 | 23.11%±1.69 | N/A | 71.00s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 101 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"poolside/laguna-m.1\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2055"
    },
    {
      "id": 2056,
      "benchmark": "medcode",
      "metric": null,
      "model": "laguna-xs.2",
      "modelKind": "model",
      "name": "Laguna XS.2",
      "label": "Laguna XS.2",
      "lab": "poolside",
      "variant": "model ID poolside/laguna-xs.2; temperature=1; max_output_tokens=30000",
      "value": 21.25,
      "valueLabel": "21.25",
      "display": "21.25%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 102,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "102 | Laguna XS.2 | 21.25%±1.70 | N/A | 33.09s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 102 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"poolside/laguna-xs.2\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2056"
    },
    {
      "id": 2057,
      "benchmark": "medcode",
      "metric": null,
      "model": "command-a-plus",
      "modelKind": "model",
      "name": "Command A+",
      "label": "Command A+",
      "lab": "cohere",
      "variant": "model ID cohere/command-a-plus-05-2026; temperature=1; top_p=0.95; max_output_tokens=64000",
      "value": 19.72,
      "valueLabel": "19.72",
      "display": "19.72%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 103,
      "rowsOnBoard": 103,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 22,
      "sourceUrl": "https://www.vals.ai/benchmarks/medcode",
      "quote": "103 | Command A+ | 19.72%±1.83 | N/A | 103.75s",
      "locator": "MedCode leaderboard, Overall task, All Models expanded, rank 103 of 103; Accuracy column; board Updated 9/29/2026. Rendered table row; configuration from embedded BenchmarkView props benchmarkView.default.tasks.overall[\"cohere/command-a-plus-05-2026\"].",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medcode#r-2057"
    },
    {
      "id": 1567,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini-3.1-Pro",
      "label": "Gemini-3.1-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 80.7,
      "valueLabel": "80.7",
      "display": "80.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-3.1-Pro | 80.7 | 87.7 | 69.9 | 17.7 | 74.6 | 77.9 | 48.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-3.1-Pro, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1567"
    },
    {
      "id": 1560,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT-5",
      "label": "GPT-5",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 75.6,
      "valueLabel": "75.6",
      "display": "75.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5 | 75.6 | 83.5 | 63.4 | 20.1 | 70.4 | 61.8 | 38.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1560"
    },
    {
      "id": 1553,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "qwen-3.5-plus",
      "modelKind": "model",
      "name": "Qwen3.5-Plus",
      "label": "Qwen3.5-Plus",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 72.4,
      "valueLabel": "72.4",
      "display": "72.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-Plus | 72.4 | 81.7 | 57.9 | 23.8 | 66.2 | 55.9 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-Plus, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1553"
    },
    {
      "id": 1546,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek-V4-Pro",
      "label": "DeepSeek-V4-Pro",
      "lab": "deepseek",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 71.7,
      "valueLabel": "71.7",
      "display": "71.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "DeepSeek-V4-Pro | 71.7 | 81.3 | 56.8 | 24.5 | 67.6 | 50.0 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row DeepSeek-V4-Pro, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1546"
    },
    {
      "id": 1518,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "gpt-oss-120b",
      "modelKind": "model",
      "name": "GPT-OSS-120B",
      "label": "GPT-OSS-120B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 70.7,
      "valueLabel": "70.7",
      "display": "70.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-120B | 70.7 | 79.6 | 56.8 | 22.7 | 62.0 | 55.9 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-120B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1518"
    },
    {
      "id": 1511,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "qwen-3.5-27b",
      "modelKind": "model",
      "name": "Qwen3.5-27B",
      "label": "Qwen3.5-27B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 69.4,
      "valueLabel": "69.4",
      "display": "69.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-27B | 69.4 | 78.2 | 55.7 | 22.4 | 67.6 | 51.5 | 31.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-27B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1511"
    },
    {
      "id": 1504,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "qwen-3.5-35b-a3b",
      "modelKind": "model",
      "name": "Qwen3.5-35B-A3B",
      "label": "Qwen3.5-35B-A3B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 68.5,
      "valueLabel": "68.5",
      "display": "68.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-35B-A3B | 68.5 | 77.5 | 54.6 | 22.8 | 70.4 | 45.6 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-35B-A3B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1504"
    },
    {
      "id": 1539,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT-5.2",
      "label": "GPT-5.2",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 68.1,
      "valueLabel": "68.1",
      "display": "68.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5.2 | 68.1 | 78.2 | 52.5 | 25.7 | 63.4 | 42.6 | 29.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5.2, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1539"
    },
    {
      "id": 1532,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude-Sonnet-4.6",
      "label": "Claude-Sonnet-4.6",
      "lab": "anthropic",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 64.2,
      "valueLabel": "64.2",
      "display": "64.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Claude-Sonnet-4.6 | 64.2 | 74.6 | 48.1 | 26.6 | 62.0 | 35.3 | 21.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Claude-Sonnet-4.6, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1532"
    },
    {
      "id": 1497,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "qwen-3.5-9b",
      "modelKind": "model",
      "name": "Qwen3.5-9B",
      "label": "Qwen3.5-9B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 63.8,
      "valueLabel": "63.8",
      "display": "63.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-9B | 63.8 | 73.9 | 48.1 | 25.9 | 54.9 | 47.1 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-9B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1497"
    },
    {
      "id": 1448,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "medgemma-27b-text",
      "modelKind": "model",
      "name": "MedGemma-27B-Text",
      "label": "MedGemma-27B-Text",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 61.2,
      "valueLabel": "61.2",
      "display": "61.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-27B-Text | 61.2 | 67.6 | 51.4 | 16.2 | 76.1 | 32.4 | 23.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-27B-Text, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1448"
    },
    {
      "id": 1441,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "fleming-r1-32b",
      "modelKind": "model",
      "name": "Fleming-R1-32B",
      "label": "Fleming-R1-32B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 60.6,
      "valueLabel": "60.6",
      "display": "60.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-32B | 60.6 | 69.0 | 47.5 | 21.5 | 59.2 | 44.1 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-32B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1441"
    },
    {
      "id": 1455,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "lingshu-32b",
      "modelKind": "model",
      "name": "Lingshu-32B",
      "label": "Lingshu-32B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 59.5,
      "valueLabel": "59.5",
      "display": "59.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-32B | 59.5 | 63.7 | 53.0 | 10.7 | 60.6 | 54.4 | 25.8",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-32B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1455"
    },
    {
      "id": 1490,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "gpt-oss-20b",
      "modelKind": "model",
      "name": "GPT-OSS-20B",
      "label": "GPT-OSS-20B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 59.1,
      "valueLabel": "59.1",
      "display": "59.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-20B | 59.1 | 66.5 | 47.5 | 19.0 | 52.1 | 48.5 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-20B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1490"
    },
    {
      "id": 1483,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "llama-3.1-70b",
      "modelKind": "model",
      "name": "Llama-3.1-70B",
      "label": "Llama-3.1-70B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 55.7,
      "valueLabel": "55.7",
      "display": "55.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-70B | 55.7 | 61.3 | 47.0 | 14.3 | 63.4 | 32.4 | 16.9",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-70B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1483"
    },
    {
      "id": 1434,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "huatuogpt-o1-70b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-70B",
      "label": "HuatuoGPT-o1-70B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 55.2,
      "valueLabel": "55.2",
      "display": "55.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-70B | 55.2 | 63.7 | 42.1 | 21.7 | 63.4 | 23.5 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-70B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1434"
    },
    {
      "id": 1525,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini-2.5-Pro",
      "label": "Gemini-2.5-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 54.4,
      "valueLabel": "54.4",
      "display": "54.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-2.5-Pro | 54.4 | 60.6 | 44.8 | 15.8 | 63.4 | 27.9 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-2.5-Pro, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1525"
    },
    {
      "id": 1420,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "fleming-r1-7b",
      "modelKind": "model",
      "name": "Fleming-R1-7B",
      "label": "Fleming-R1-7B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 50.7,
      "valueLabel": "50.7",
      "display": "50.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-7B | 50.7 | 59.9 | 36.6 | 23.2 | 53.5 | 29.4 | 12.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-7B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1420"
    },
    {
      "id": 1427,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "baichuan-m2-32b",
      "modelKind": "model",
      "name": "Baichuan-M2-32B",
      "label": "Baichuan-M2-32B",
      "lab": "baichuan",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 47.8,
      "valueLabel": "47.8",
      "display": "47.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Baichuan-M2-32B | 47.8 | 54.6 | 37.2 | 17.4 | 49.3 | 30.9 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Baichuan-M2-32B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1427"
    },
    {
      "id": 1413,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "huatuogpt-o1-8b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-8B",
      "label": "HuatuoGPT-o1-8B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 44.3,
      "valueLabel": "44.3",
      "display": "44.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-8B | 44.3 | 50.0 | 35.5 | 14.5 | 49.3 | 20.6 | 13.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-8B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1413"
    },
    {
      "id": 1392,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "lingshu-7b",
      "modelKind": "model",
      "name": "Lingshu-7B",
      "label": "Lingshu-7B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 43.3,
      "valueLabel": "43.3",
      "display": "43.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-7B | 43.3 | 50.7 | 31.7 | 19.0 | 39.4 | 32.4 | 6.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-7B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1392"
    },
    {
      "id": 1378,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "healthgpt-pro-8b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-8B",
      "label": "HealthGPT-Pro-8B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 42.6,
      "valueLabel": "42.6",
      "display": "42.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 22,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-8B | 42.6 | 51.8 | 28.4 | 23.3 | 42.3 | 20.6 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-8B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1378"
    },
    {
      "id": 1399,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "hulu-med-7b",
      "modelKind": "model",
      "name": "Hulu-Med-7B",
      "label": "Hulu-Med-7B",
      "lab": "zju-ai4h",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 42,
      "valueLabel": "42.0",
      "display": "42.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 23,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Hulu-Med-7B | 42.0 | 48.2 | 32.2 | 16.0 | 36.6 | 38.2 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Hulu-Med-7B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1399"
    },
    {
      "id": 1469,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "gemma-3-27b",
      "modelKind": "model",
      "name": "Gemma-3-27B",
      "label": "Gemma-3-27B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 40.3,
      "valueLabel": "40.3",
      "display": "40.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-27B | 40.3 | 44.7 | 33.3 | 11.4 | 53.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-27B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1469"
    },
    {
      "id": 1476,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "llama-3.1-8b",
      "modelKind": "model",
      "name": "Llama-3.1-8B",
      "label": "Llama-3.1-8B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 40,
      "valueLabel": "40.0",
      "display": "40.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-8B | 40.0 | 44.4 | 33.3 | 11.0 | 54.9 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-8B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1476"
    },
    {
      "id": 1462,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "gemma-3-12b",
      "modelKind": "model",
      "name": "Gemma-3-12B",
      "label": "Gemma-3-12B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 39.6,
      "valueLabel": "39.6",
      "display": "39.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-12B | 39.6 | 44.0 | 32.8 | 11.2 | 57.7 | 7.4 | 3.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-12B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1462"
    },
    {
      "id": 1385,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "medgemma-4b",
      "modelKind": "model",
      "name": "MedGemma-4B",
      "label": "MedGemma-4B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 39.6,
      "valueLabel": "39.6",
      "display": "39.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-4B | 39.6 | 45.4 | 30.6 | 14.8 | 46.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-4B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1385"
    },
    {
      "id": 1406,
      "benchmark": "medpic-bench",
      "metric": null,
      "model": "healthgpt-pro-4b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-4B",
      "label": "HealthGPT-Pro-4B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 36,
      "valueLabel": "36.0",
      "display": "36.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-4B | 36.0 | 37.7 | 33.3 | 4.3 | 36.6 | 41.2 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-4B, column Overall; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1406"
    },
    {
      "id": 1568,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini-3.1-Pro",
      "label": "Gemini-3.1-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 87.7,
      "valueLabel": "87.7",
      "display": "87.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-3.1-Pro | 80.7 | 87.7 | 69.9 | 17.7 | 74.6 | 77.9 | 48.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-3.1-Pro, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1568"
    },
    {
      "id": 1561,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT-5",
      "label": "GPT-5",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 83.5,
      "valueLabel": "83.5",
      "display": "83.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5 | 75.6 | 83.5 | 63.4 | 20.1 | 70.4 | 61.8 | 38.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1561"
    },
    {
      "id": 1554,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "qwen-3.5-plus",
      "modelKind": "model",
      "name": "Qwen3.5-Plus",
      "label": "Qwen3.5-Plus",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 81.7,
      "valueLabel": "81.7",
      "display": "81.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-Plus | 72.4 | 81.7 | 57.9 | 23.8 | 66.2 | 55.9 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-Plus, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1554"
    },
    {
      "id": 1547,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek-V4-Pro",
      "label": "DeepSeek-V4-Pro",
      "lab": "deepseek",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 81.3,
      "valueLabel": "81.3",
      "display": "81.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "DeepSeek-V4-Pro | 71.7 | 81.3 | 56.8 | 24.5 | 67.6 | 50.0 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row DeepSeek-V4-Pro, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1547"
    },
    {
      "id": 1519,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "gpt-oss-120b",
      "modelKind": "model",
      "name": "GPT-OSS-120B",
      "label": "GPT-OSS-120B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 79.6,
      "valueLabel": "79.6",
      "display": "79.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-120B | 70.7 | 79.6 | 56.8 | 22.7 | 62.0 | 55.9 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-120B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1519"
    },
    {
      "id": 1540,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT-5.2",
      "label": "GPT-5.2",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 78.2,
      "valueLabel": "78.2",
      "display": "78.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5.2 | 68.1 | 78.2 | 52.5 | 25.7 | 63.4 | 42.6 | 29.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5.2, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1540"
    },
    {
      "id": 1512,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "qwen-3.5-27b",
      "modelKind": "model",
      "name": "Qwen3.5-27B",
      "label": "Qwen3.5-27B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 78.2,
      "valueLabel": "78.2",
      "display": "78.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-27B | 69.4 | 78.2 | 55.7 | 22.4 | 67.6 | 51.5 | 31.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-27B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1512"
    },
    {
      "id": 1505,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "qwen-3.5-35b-a3b",
      "modelKind": "model",
      "name": "Qwen3.5-35B-A3B",
      "label": "Qwen3.5-35B-A3B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 77.5,
      "valueLabel": "77.5",
      "display": "77.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-35B-A3B | 68.5 | 77.5 | 54.6 | 22.8 | 70.4 | 45.6 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-35B-A3B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1505"
    },
    {
      "id": 1533,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude-Sonnet-4.6",
      "label": "Claude-Sonnet-4.6",
      "lab": "anthropic",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 74.6,
      "valueLabel": "74.6",
      "display": "74.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Claude-Sonnet-4.6 | 64.2 | 74.6 | 48.1 | 26.6 | 62.0 | 35.3 | 21.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Claude-Sonnet-4.6, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1533"
    },
    {
      "id": 1498,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "qwen-3.5-9b",
      "modelKind": "model",
      "name": "Qwen3.5-9B",
      "label": "Qwen3.5-9B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 73.9,
      "valueLabel": "73.9",
      "display": "73.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-9B | 63.8 | 73.9 | 48.1 | 25.9 | 54.9 | 47.1 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-9B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1498"
    },
    {
      "id": 1442,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "fleming-r1-32b",
      "modelKind": "model",
      "name": "Fleming-R1-32B",
      "label": "Fleming-R1-32B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 69,
      "valueLabel": "69.0",
      "display": "69.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-32B | 60.6 | 69.0 | 47.5 | 21.5 | 59.2 | 44.1 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-32B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1442"
    },
    {
      "id": 1449,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "medgemma-27b-text",
      "modelKind": "model",
      "name": "MedGemma-27B-Text",
      "label": "MedGemma-27B-Text",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 67.6,
      "valueLabel": "67.6",
      "display": "67.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-27B-Text | 61.2 | 67.6 | 51.4 | 16.2 | 76.1 | 32.4 | 23.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-27B-Text, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1449"
    },
    {
      "id": 1491,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "gpt-oss-20b",
      "modelKind": "model",
      "name": "GPT-OSS-20B",
      "label": "GPT-OSS-20B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 66.5,
      "valueLabel": "66.5",
      "display": "66.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-20B | 59.1 | 66.5 | 47.5 | 19.0 | 52.1 | 48.5 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-20B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1491"
    },
    {
      "id": 1435,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "huatuogpt-o1-70b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-70B",
      "label": "HuatuoGPT-o1-70B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 63.7,
      "valueLabel": "63.7",
      "display": "63.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-70B | 55.2 | 63.7 | 42.1 | 21.7 | 63.4 | 23.5 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-70B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1435"
    },
    {
      "id": 1456,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "lingshu-32b",
      "modelKind": "model",
      "name": "Lingshu-32B",
      "label": "Lingshu-32B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 63.7,
      "valueLabel": "63.7",
      "display": "63.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-32B | 59.5 | 63.7 | 53.0 | 10.7 | 60.6 | 54.4 | 25.8",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-32B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1456"
    },
    {
      "id": 1484,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "llama-3.1-70b",
      "modelKind": "model",
      "name": "Llama-3.1-70B",
      "label": "Llama-3.1-70B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 61.3,
      "valueLabel": "61.3",
      "display": "61.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-70B | 55.7 | 61.3 | 47.0 | 14.3 | 63.4 | 32.4 | 16.9",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-70B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1484"
    },
    {
      "id": 1526,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini-2.5-Pro",
      "label": "Gemini-2.5-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 60.6,
      "valueLabel": "60.6",
      "display": "60.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-2.5-Pro | 54.4 | 60.6 | 44.8 | 15.8 | 63.4 | 27.9 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-2.5-Pro, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1526"
    },
    {
      "id": 1421,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "fleming-r1-7b",
      "modelKind": "model",
      "name": "Fleming-R1-7B",
      "label": "Fleming-R1-7B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 59.9,
      "valueLabel": "59.9",
      "display": "59.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-7B | 50.7 | 59.9 | 36.6 | 23.2 | 53.5 | 29.4 | 12.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-7B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1421"
    },
    {
      "id": 1428,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "baichuan-m2-32b",
      "modelKind": "model",
      "name": "Baichuan-M2-32B",
      "label": "Baichuan-M2-32B",
      "lab": "baichuan",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 54.6,
      "valueLabel": "54.6",
      "display": "54.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Baichuan-M2-32B | 47.8 | 54.6 | 37.2 | 17.4 | 49.3 | 30.9 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Baichuan-M2-32B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1428"
    },
    {
      "id": 1379,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "healthgpt-pro-8b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-8B",
      "label": "HealthGPT-Pro-8B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 51.8,
      "valueLabel": "51.8",
      "display": "51.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-8B | 42.6 | 51.8 | 28.4 | 23.3 | 42.3 | 20.6 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-8B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1379"
    },
    {
      "id": 1393,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "lingshu-7b",
      "modelKind": "model",
      "name": "Lingshu-7B",
      "label": "Lingshu-7B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 50.7,
      "valueLabel": "50.7",
      "display": "50.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-7B | 43.3 | 50.7 | 31.7 | 19.0 | 39.4 | 32.4 | 6.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-7B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1393"
    },
    {
      "id": 1414,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "huatuogpt-o1-8b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-8B",
      "label": "HuatuoGPT-o1-8B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 50,
      "valueLabel": "50.0",
      "display": "50.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 22,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-8B | 44.3 | 50.0 | 35.5 | 14.5 | 49.3 | 20.6 | 13.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-8B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1414"
    },
    {
      "id": 1400,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "hulu-med-7b",
      "modelKind": "model",
      "name": "Hulu-Med-7B",
      "label": "Hulu-Med-7B",
      "lab": "zju-ai4h",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 48.2,
      "valueLabel": "48.2",
      "display": "48.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 23,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Hulu-Med-7B | 42.0 | 48.2 | 32.2 | 16.0 | 36.6 | 38.2 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Hulu-Med-7B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1400"
    },
    {
      "id": 1386,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "medgemma-4b",
      "modelKind": "model",
      "name": "MedGemma-4B",
      "label": "MedGemma-4B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 45.4,
      "valueLabel": "45.4",
      "display": "45.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-4B | 39.6 | 45.4 | 30.6 | 14.8 | 46.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-4B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1386"
    },
    {
      "id": 1470,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "gemma-3-27b",
      "modelKind": "model",
      "name": "Gemma-3-27B",
      "label": "Gemma-3-27B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 44.7,
      "valueLabel": "44.7",
      "display": "44.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-27B | 40.3 | 44.7 | 33.3 | 11.4 | 53.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-27B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1470"
    },
    {
      "id": 1477,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "llama-3.1-8b",
      "modelKind": "model",
      "name": "Llama-3.1-8B",
      "label": "Llama-3.1-8B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 44.4,
      "valueLabel": "44.4",
      "display": "44.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-8B | 40.0 | 44.4 | 33.3 | 11.0 | 54.9 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-8B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1477"
    },
    {
      "id": 1463,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "gemma-3-12b",
      "modelKind": "model",
      "name": "Gemma-3-12B",
      "label": "Gemma-3-12B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 44,
      "valueLabel": "44.0",
      "display": "44.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 27,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-12B | 39.6 | 44.0 | 32.8 | 11.2 | 57.7 | 7.4 | 3.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-12B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1463"
    },
    {
      "id": 1407,
      "benchmark": "medpic-bench",
      "metric": "guideline_following",
      "model": "healthgpt-pro-4b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-4B",
      "label": "HealthGPT-Pro-4B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 37.7,
      "valueLabel": "37.7",
      "display": "37.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-4B | 36.0 | 37.7 | 33.3 | 4.3 | 36.6 | 41.2 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-4B, column GF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1407"
    },
    {
      "id": 1569,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini-3.1-Pro",
      "label": "Gemini-3.1-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 69.9,
      "valueLabel": "69.9",
      "display": "69.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-3.1-Pro | 80.7 | 87.7 | 69.9 | 17.7 | 74.6 | 77.9 | 48.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-3.1-Pro, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1569"
    },
    {
      "id": 1562,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT-5",
      "label": "GPT-5",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 63.4,
      "valueLabel": "63.4",
      "display": "63.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5 | 75.6 | 83.5 | 63.4 | 20.1 | 70.4 | 61.8 | 38.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1562"
    },
    {
      "id": 1555,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "qwen-3.5-plus",
      "modelKind": "model",
      "name": "Qwen3.5-Plus",
      "label": "Qwen3.5-Plus",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 57.9,
      "valueLabel": "57.9",
      "display": "57.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-Plus | 72.4 | 81.7 | 57.9 | 23.8 | 66.2 | 55.9 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-Plus, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1555"
    },
    {
      "id": 1548,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek-V4-Pro",
      "label": "DeepSeek-V4-Pro",
      "lab": "deepseek",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 56.8,
      "valueLabel": "56.8",
      "display": "56.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "DeepSeek-V4-Pro | 71.7 | 81.3 | 56.8 | 24.5 | 67.6 | 50.0 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row DeepSeek-V4-Pro, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1548"
    },
    {
      "id": 1520,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "gpt-oss-120b",
      "modelKind": "model",
      "name": "GPT-OSS-120B",
      "label": "GPT-OSS-120B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 56.8,
      "valueLabel": "56.8",
      "display": "56.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-120B | 70.7 | 79.6 | 56.8 | 22.7 | 62.0 | 55.9 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-120B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1520"
    },
    {
      "id": 1513,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "qwen-3.5-27b",
      "modelKind": "model",
      "name": "Qwen3.5-27B",
      "label": "Qwen3.5-27B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 55.7,
      "valueLabel": "55.7",
      "display": "55.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-27B | 69.4 | 78.2 | 55.7 | 22.4 | 67.6 | 51.5 | 31.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-27B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1513"
    },
    {
      "id": 1506,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "qwen-3.5-35b-a3b",
      "modelKind": "model",
      "name": "Qwen3.5-35B-A3B",
      "label": "Qwen3.5-35B-A3B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 54.6,
      "valueLabel": "54.6",
      "display": "54.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-35B-A3B | 68.5 | 77.5 | 54.6 | 22.8 | 70.4 | 45.6 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-35B-A3B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1506"
    },
    {
      "id": 1457,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "lingshu-32b",
      "modelKind": "model",
      "name": "Lingshu-32B",
      "label": "Lingshu-32B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 53,
      "valueLabel": "53.0",
      "display": "53.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-32B | 59.5 | 63.7 | 53.0 | 10.7 | 60.6 | 54.4 | 25.8",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-32B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1457"
    },
    {
      "id": 1541,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT-5.2",
      "label": "GPT-5.2",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 52.5,
      "valueLabel": "52.5",
      "display": "52.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5.2 | 68.1 | 78.2 | 52.5 | 25.7 | 63.4 | 42.6 | 29.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5.2, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1541"
    },
    {
      "id": 1450,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "medgemma-27b-text",
      "modelKind": "model",
      "name": "MedGemma-27B-Text",
      "label": "MedGemma-27B-Text",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 51.4,
      "valueLabel": "51.4",
      "display": "51.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-27B-Text | 61.2 | 67.6 | 51.4 | 16.2 | 76.1 | 32.4 | 23.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-27B-Text, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1450"
    },
    {
      "id": 1534,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude-Sonnet-4.6",
      "label": "Claude-Sonnet-4.6",
      "lab": "anthropic",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 48.1,
      "valueLabel": "48.1",
      "display": "48.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Claude-Sonnet-4.6 | 64.2 | 74.6 | 48.1 | 26.6 | 62.0 | 35.3 | 21.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Claude-Sonnet-4.6, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1534"
    },
    {
      "id": 1499,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "qwen-3.5-9b",
      "modelKind": "model",
      "name": "Qwen3.5-9B",
      "label": "Qwen3.5-9B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 48.1,
      "valueLabel": "48.1",
      "display": "48.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-9B | 63.8 | 73.9 | 48.1 | 25.9 | 54.9 | 47.1 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-9B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1499"
    },
    {
      "id": 1443,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "fleming-r1-32b",
      "modelKind": "model",
      "name": "Fleming-R1-32B",
      "label": "Fleming-R1-32B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 47.5,
      "valueLabel": "47.5",
      "display": "47.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-32B | 60.6 | 69.0 | 47.5 | 21.5 | 59.2 | 44.1 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-32B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1443"
    },
    {
      "id": 1492,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "gpt-oss-20b",
      "modelKind": "model",
      "name": "GPT-OSS-20B",
      "label": "GPT-OSS-20B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 47.5,
      "valueLabel": "47.5",
      "display": "47.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-20B | 59.1 | 66.5 | 47.5 | 19.0 | 52.1 | 48.5 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-20B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1492"
    },
    {
      "id": 1485,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "llama-3.1-70b",
      "modelKind": "model",
      "name": "Llama-3.1-70B",
      "label": "Llama-3.1-70B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 47,
      "valueLabel": "47.0",
      "display": "47.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-70B | 55.7 | 61.3 | 47.0 | 14.3 | 63.4 | 32.4 | 16.9",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-70B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1485"
    },
    {
      "id": 1527,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini-2.5-Pro",
      "label": "Gemini-2.5-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 44.8,
      "valueLabel": "44.8",
      "display": "44.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-2.5-Pro | 54.4 | 60.6 | 44.8 | 15.8 | 63.4 | 27.9 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-2.5-Pro, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1527"
    },
    {
      "id": 1436,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "huatuogpt-o1-70b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-70B",
      "label": "HuatuoGPT-o1-70B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 42.1,
      "valueLabel": "42.1",
      "display": "42.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-70B | 55.2 | 63.7 | 42.1 | 21.7 | 63.4 | 23.5 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-70B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1436"
    },
    {
      "id": 1429,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "baichuan-m2-32b",
      "modelKind": "model",
      "name": "Baichuan-M2-32B",
      "label": "Baichuan-M2-32B",
      "lab": "baichuan",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 37.2,
      "valueLabel": "37.2",
      "display": "37.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Baichuan-M2-32B | 47.8 | 54.6 | 37.2 | 17.4 | 49.3 | 30.9 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Baichuan-M2-32B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1429"
    },
    {
      "id": 1422,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "fleming-r1-7b",
      "modelKind": "model",
      "name": "Fleming-R1-7B",
      "label": "Fleming-R1-7B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 36.6,
      "valueLabel": "36.6",
      "display": "36.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-7B | 50.7 | 59.9 | 36.6 | 23.2 | 53.5 | 29.4 | 12.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-7B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1422"
    },
    {
      "id": 1415,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "huatuogpt-o1-8b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-8B",
      "label": "HuatuoGPT-o1-8B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 35.5,
      "valueLabel": "35.5",
      "display": "35.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-8B | 44.3 | 50.0 | 35.5 | 14.5 | 49.3 | 20.6 | 13.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-8B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1415"
    },
    {
      "id": 1471,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "gemma-3-27b",
      "modelKind": "model",
      "name": "Gemma-3-27B",
      "label": "Gemma-3-27B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 33.3,
      "valueLabel": "33.3",
      "display": "33.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-27B | 40.3 | 44.7 | 33.3 | 11.4 | 53.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-27B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1471"
    },
    {
      "id": 1408,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "healthgpt-pro-4b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-4B",
      "label": "HealthGPT-Pro-4B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 33.3,
      "valueLabel": "33.3",
      "display": "33.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-4B | 36.0 | 37.7 | 33.3 | 4.3 | 36.6 | 41.2 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-4B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1408"
    },
    {
      "id": 1478,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "llama-3.1-8b",
      "modelKind": "model",
      "name": "Llama-3.1-8B",
      "label": "Llama-3.1-8B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 33.3,
      "valueLabel": "33.3",
      "display": "33.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-8B | 40.0 | 44.4 | 33.3 | 11.0 | 54.9 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-8B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1478"
    },
    {
      "id": 1464,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "gemma-3-12b",
      "modelKind": "model",
      "name": "Gemma-3-12B",
      "label": "Gemma-3-12B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 32.8,
      "valueLabel": "32.8",
      "display": "32.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-12B | 39.6 | 44.0 | 32.8 | 11.2 | 57.7 | 7.4 | 3.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-12B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1464"
    },
    {
      "id": 1401,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "hulu-med-7b",
      "modelKind": "model",
      "name": "Hulu-Med-7B",
      "label": "Hulu-Med-7B",
      "lab": "zju-ai4h",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 32.2,
      "valueLabel": "32.2",
      "display": "32.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Hulu-Med-7B | 42.0 | 48.2 | 32.2 | 16.0 | 36.6 | 38.2 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Hulu-Med-7B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1401"
    },
    {
      "id": 1394,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "lingshu-7b",
      "modelKind": "model",
      "name": "Lingshu-7B",
      "label": "Lingshu-7B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 31.7,
      "valueLabel": "31.7",
      "display": "31.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-7B | 43.3 | 50.7 | 31.7 | 19.0 | 39.4 | 32.4 | 6.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-7B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1394"
    },
    {
      "id": 1387,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "medgemma-4b",
      "modelKind": "model",
      "name": "MedGemma-4B",
      "label": "MedGemma-4B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 30.6,
      "valueLabel": "30.6",
      "display": "30.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 27,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-4B | 39.6 | 45.4 | 30.6 | 14.8 | 46.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-4B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1387"
    },
    {
      "id": 1380,
      "benchmark": "medpic-bench",
      "metric": "counterfactual",
      "model": "healthgpt-pro-8b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-8B",
      "label": "HealthGPT-Pro-8B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 28.4,
      "valueLabel": "28.4",
      "display": "28.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-8B | 42.6 | 51.8 | 28.4 | 23.3 | 42.3 | 20.6 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-8B, column CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1380"
    },
    {
      "id": 1573,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini-3.1-Pro",
      "label": "Gemini-3.1-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 48.3,
      "valueLabel": "48.3",
      "display": "48.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-3.1-Pro | 80.7 | 87.7 | 69.9 | 17.7 | 74.6 | 77.9 | 48.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-3.1-Pro, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1573"
    },
    {
      "id": 1566,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT-5",
      "label": "GPT-5",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 38.2,
      "valueLabel": "38.2",
      "display": "38.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5 | 75.6 | 83.5 | 63.4 | 20.1 | 70.4 | 61.8 | 38.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1566"
    },
    {
      "id": 1552,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek-V4-Pro",
      "label": "DeepSeek-V4-Pro",
      "lab": "deepseek",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 32.6,
      "valueLabel": "32.6",
      "display": "32.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "DeepSeek-V4-Pro | 71.7 | 81.3 | 56.8 | 24.5 | 67.6 | 50.0 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row DeepSeek-V4-Pro, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1552"
    },
    {
      "id": 1559,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "qwen-3.5-plus",
      "modelKind": "model",
      "name": "Qwen3.5-Plus",
      "label": "Qwen3.5-Plus",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 32.6,
      "valueLabel": "32.6",
      "display": "32.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-Plus | 72.4 | 81.7 | 57.9 | 23.8 | 66.2 | 55.9 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-Plus, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1559"
    },
    {
      "id": 1517,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "qwen-3.5-27b",
      "modelKind": "model",
      "name": "Qwen3.5-27B",
      "label": "Qwen3.5-27B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 31.5,
      "valueLabel": "31.5",
      "display": "31.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-27B | 69.4 | 78.2 | 55.7 | 22.4 | 67.6 | 51.5 | 31.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-27B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1517"
    },
    {
      "id": 1524,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "gpt-oss-120b",
      "modelKind": "model",
      "name": "GPT-OSS-120B",
      "label": "GPT-OSS-120B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 30.3,
      "valueLabel": "30.3",
      "display": "30.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-120B | 70.7 | 79.6 | 56.8 | 22.7 | 62.0 | 55.9 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-120B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1524"
    },
    {
      "id": 1510,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "qwen-3.5-35b-a3b",
      "modelKind": "model",
      "name": "Qwen3.5-35B-A3B",
      "label": "Qwen3.5-35B-A3B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 30.3,
      "valueLabel": "30.3",
      "display": "30.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-35B-A3B | 68.5 | 77.5 | 54.6 | 22.8 | 70.4 | 45.6 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-35B-A3B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1510"
    },
    {
      "id": 1545,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT-5.2",
      "label": "GPT-5.2",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 29.2,
      "valueLabel": "29.2",
      "display": "29.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5.2 | 68.1 | 78.2 | 52.5 | 25.7 | 63.4 | 42.6 | 29.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5.2, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1545"
    },
    {
      "id": 1461,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "lingshu-32b",
      "modelKind": "model",
      "name": "Lingshu-32B",
      "label": "Lingshu-32B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 25.8,
      "valueLabel": "25.8",
      "display": "25.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-32B | 59.5 | 63.7 | 53.0 | 10.7 | 60.6 | 54.4 | 25.8",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-32B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1461"
    },
    {
      "id": 1496,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "gpt-oss-20b",
      "modelKind": "model",
      "name": "GPT-OSS-20B",
      "label": "GPT-OSS-20B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 24.7,
      "valueLabel": "24.7",
      "display": "24.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-20B | 59.1 | 66.5 | 47.5 | 19.0 | 52.1 | 48.5 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-20B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1496"
    },
    {
      "id": 1503,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "qwen-3.5-9b",
      "modelKind": "model",
      "name": "Qwen3.5-9B",
      "label": "Qwen3.5-9B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 24.7,
      "valueLabel": "24.7",
      "display": "24.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-9B | 63.8 | 73.9 | 48.1 | 25.9 | 54.9 | 47.1 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-9B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1503"
    },
    {
      "id": 1454,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "medgemma-27b-text",
      "modelKind": "model",
      "name": "MedGemma-27B-Text",
      "label": "MedGemma-27B-Text",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 23.6,
      "valueLabel": "23.6",
      "display": "23.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-27B-Text | 61.2 | 67.6 | 51.4 | 16.2 | 76.1 | 32.4 | 23.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-27B-Text, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1454"
    },
    {
      "id": 1538,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude-Sonnet-4.6",
      "label": "Claude-Sonnet-4.6",
      "lab": "anthropic",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 21.3,
      "valueLabel": "21.3",
      "display": "21.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Claude-Sonnet-4.6 | 64.2 | 74.6 | 48.1 | 26.6 | 62.0 | 35.3 | 21.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Claude-Sonnet-4.6, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1538"
    },
    {
      "id": 1447,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "fleming-r1-32b",
      "modelKind": "model",
      "name": "Fleming-R1-32B",
      "label": "Fleming-R1-32B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 20.2,
      "valueLabel": "20.2",
      "display": "20.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-32B | 60.6 | 69.0 | 47.5 | 21.5 | 59.2 | 44.1 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-32B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1447"
    },
    {
      "id": 1531,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini-2.5-Pro",
      "label": "Gemini-2.5-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 20.2,
      "valueLabel": "20.2",
      "display": "20.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-2.5-Pro | 54.4 | 60.6 | 44.8 | 15.8 | 63.4 | 27.9 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-2.5-Pro, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1531"
    },
    {
      "id": 1489,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "llama-3.1-70b",
      "modelKind": "model",
      "name": "Llama-3.1-70B",
      "label": "Llama-3.1-70B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 16.9,
      "valueLabel": "16.9",
      "display": "16.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-70B | 55.7 | 61.3 | 47.0 | 14.3 | 63.4 | 32.4 | 16.9",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-70B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1489"
    },
    {
      "id": 1440,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "huatuogpt-o1-70b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-70B",
      "label": "HuatuoGPT-o1-70B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 14.6,
      "valueLabel": "14.6",
      "display": "14.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-70B | 55.2 | 63.7 | 42.1 | 21.7 | 63.4 | 23.5 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-70B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1440"
    },
    {
      "id": 1405,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "hulu-med-7b",
      "modelKind": "model",
      "name": "Hulu-Med-7B",
      "label": "Hulu-Med-7B",
      "lab": "zju-ai4h",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 14.6,
      "valueLabel": "14.6",
      "display": "14.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Hulu-Med-7B | 42.0 | 48.2 | 32.2 | 16.0 | 36.6 | 38.2 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Hulu-Med-7B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1405"
    },
    {
      "id": 1419,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "huatuogpt-o1-8b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-8B",
      "label": "HuatuoGPT-o1-8B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 13.5,
      "valueLabel": "13.5",
      "display": "13.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-8B | 44.3 | 50.0 | 35.5 | 14.5 | 49.3 | 20.6 | 13.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-8B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1419"
    },
    {
      "id": 1426,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "fleming-r1-7b",
      "modelKind": "model",
      "name": "Fleming-R1-7B",
      "label": "Fleming-R1-7B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 12.4,
      "valueLabel": "12.4",
      "display": "12.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-7B | 50.7 | 59.9 | 36.6 | 23.2 | 53.5 | 29.4 | 12.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-7B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1426"
    },
    {
      "id": 1433,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "baichuan-m2-32b",
      "modelKind": "model",
      "name": "Baichuan-M2-32B",
      "label": "Baichuan-M2-32B",
      "lab": "baichuan",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 11.2,
      "valueLabel": "11.2",
      "display": "11.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Baichuan-M2-32B | 47.8 | 54.6 | 37.2 | 17.4 | 49.3 | 30.9 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Baichuan-M2-32B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1433"
    },
    {
      "id": 1412,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "healthgpt-pro-4b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-4B",
      "label": "HealthGPT-Pro-4B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 11.2,
      "valueLabel": "11.2",
      "display": "11.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-4B | 36.0 | 37.7 | 33.3 | 4.3 | 36.6 | 41.2 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-4B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1412"
    },
    {
      "id": 1398,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "lingshu-7b",
      "modelKind": "model",
      "name": "Lingshu-7B",
      "label": "Lingshu-7B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 6.7,
      "valueLabel": "6.7",
      "display": "6.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 23,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-7B | 43.3 | 50.7 | 31.7 | 19.0 | 39.4 | 32.4 | 6.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-7B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1398"
    },
    {
      "id": 1475,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "gemma-3-27b",
      "modelKind": "model",
      "name": "Gemma-3-27B",
      "label": "Gemma-3-27B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 5.6,
      "valueLabel": "5.6",
      "display": "5.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-27B | 40.3 | 44.7 | 33.3 | 11.4 | 53.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-27B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1475"
    },
    {
      "id": 1384,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "healthgpt-pro-8b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-8B",
      "label": "HealthGPT-Pro-8B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 5.6,
      "valueLabel": "5.6",
      "display": "5.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-8B | 42.6 | 51.8 | 28.4 | 23.3 | 42.3 | 20.6 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-8B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1384"
    },
    {
      "id": 1482,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "llama-3.1-8b",
      "modelKind": "model",
      "name": "Llama-3.1-8B",
      "label": "Llama-3.1-8B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 5.6,
      "valueLabel": "5.6",
      "display": "5.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-8B | 40.0 | 44.4 | 33.3 | 11.0 | 54.9 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-8B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1482"
    },
    {
      "id": 1391,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "medgemma-4b",
      "modelKind": "model",
      "name": "MedGemma-4B",
      "label": "MedGemma-4B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 5.6,
      "valueLabel": "5.6",
      "display": "5.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-4B | 39.6 | 45.4 | 30.6 | 14.8 | 46.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-4B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1391"
    },
    {
      "id": 1468,
      "benchmark": "medpic-bench",
      "metric": "pair_accuracy",
      "model": "gemma-3-12b",
      "modelKind": "model",
      "name": "Gemma-3-12B",
      "label": "Gemma-3-12B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 3.4,
      "valueLabel": "3.4",
      "display": "3.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-12B | 39.6 | 44.0 | 32.8 | 11.2 | 57.7 | 7.4 | 3.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-12B, column Pair; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1468"
    },
    {
      "id": 1452,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "medgemma-27b-text",
      "modelKind": "model",
      "name": "MedGemma-27B-Text",
      "label": "MedGemma-27B-Text",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 76.1,
      "valueLabel": "76.1",
      "display": "76.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-27B-Text | 61.2 | 67.6 | 51.4 | 16.2 | 76.1 | 32.4 | 23.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-27B-Text, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1452"
    },
    {
      "id": 1571,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini-3.1-Pro",
      "label": "Gemini-3.1-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 74.6,
      "valueLabel": "74.6",
      "display": "74.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-3.1-Pro | 80.7 | 87.7 | 69.9 | 17.7 | 74.6 | 77.9 | 48.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-3.1-Pro, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1571"
    },
    {
      "id": 1564,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT-5",
      "label": "GPT-5",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 70.4,
      "valueLabel": "70.4",
      "display": "70.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5 | 75.6 | 83.5 | 63.4 | 20.1 | 70.4 | 61.8 | 38.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1564"
    },
    {
      "id": 1508,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "qwen-3.5-35b-a3b",
      "modelKind": "model",
      "name": "Qwen3.5-35B-A3B",
      "label": "Qwen3.5-35B-A3B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 70.4,
      "valueLabel": "70.4",
      "display": "70.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-35B-A3B | 68.5 | 77.5 | 54.6 | 22.8 | 70.4 | 45.6 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-35B-A3B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1508"
    },
    {
      "id": 1550,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek-V4-Pro",
      "label": "DeepSeek-V4-Pro",
      "lab": "deepseek",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 67.6,
      "valueLabel": "67.6",
      "display": "67.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "DeepSeek-V4-Pro | 71.7 | 81.3 | 56.8 | 24.5 | 67.6 | 50.0 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row DeepSeek-V4-Pro, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1550"
    },
    {
      "id": 1515,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "qwen-3.5-27b",
      "modelKind": "model",
      "name": "Qwen3.5-27B",
      "label": "Qwen3.5-27B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 67.6,
      "valueLabel": "67.6",
      "display": "67.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-27B | 69.4 | 78.2 | 55.7 | 22.4 | 67.6 | 51.5 | 31.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-27B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1515"
    },
    {
      "id": 1557,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "qwen-3.5-plus",
      "modelKind": "model",
      "name": "Qwen3.5-Plus",
      "label": "Qwen3.5-Plus",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 66.2,
      "valueLabel": "66.2",
      "display": "66.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-Plus | 72.4 | 81.7 | 57.9 | 23.8 | 66.2 | 55.9 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-Plus, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1557"
    },
    {
      "id": 1529,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini-2.5-Pro",
      "label": "Gemini-2.5-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 63.4,
      "valueLabel": "63.4",
      "display": "63.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-2.5-Pro | 54.4 | 60.6 | 44.8 | 15.8 | 63.4 | 27.9 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-2.5-Pro, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1529"
    },
    {
      "id": 1543,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT-5.2",
      "label": "GPT-5.2",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 63.4,
      "valueLabel": "63.4",
      "display": "63.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5.2 | 68.1 | 78.2 | 52.5 | 25.7 | 63.4 | 42.6 | 29.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5.2, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1543"
    },
    {
      "id": 1438,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "huatuogpt-o1-70b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-70B",
      "label": "HuatuoGPT-o1-70B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 63.4,
      "valueLabel": "63.4",
      "display": "63.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-70B | 55.2 | 63.7 | 42.1 | 21.7 | 63.4 | 23.5 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-70B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1438"
    },
    {
      "id": 1487,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "llama-3.1-70b",
      "modelKind": "model",
      "name": "Llama-3.1-70B",
      "label": "Llama-3.1-70B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 63.4,
      "valueLabel": "63.4",
      "display": "63.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-70B | 55.7 | 61.3 | 47.0 | 14.3 | 63.4 | 32.4 | 16.9",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-70B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1487"
    },
    {
      "id": 1536,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude-Sonnet-4.6",
      "label": "Claude-Sonnet-4.6",
      "lab": "anthropic",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 62,
      "valueLabel": "62.0",
      "display": "62.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Claude-Sonnet-4.6 | 64.2 | 74.6 | 48.1 | 26.6 | 62.0 | 35.3 | 21.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Claude-Sonnet-4.6, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1536"
    },
    {
      "id": 1522,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "gpt-oss-120b",
      "modelKind": "model",
      "name": "GPT-OSS-120B",
      "label": "GPT-OSS-120B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 62,
      "valueLabel": "62.0",
      "display": "62.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-120B | 70.7 | 79.6 | 56.8 | 22.7 | 62.0 | 55.9 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-120B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1522"
    },
    {
      "id": 1459,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "lingshu-32b",
      "modelKind": "model",
      "name": "Lingshu-32B",
      "label": "Lingshu-32B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 60.6,
      "valueLabel": "60.6",
      "display": "60.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-32B | 59.5 | 63.7 | 53.0 | 10.7 | 60.6 | 54.4 | 25.8",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-32B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1459"
    },
    {
      "id": 1445,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "fleming-r1-32b",
      "modelKind": "model",
      "name": "Fleming-R1-32B",
      "label": "Fleming-R1-32B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 59.2,
      "valueLabel": "59.2",
      "display": "59.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-32B | 60.6 | 69.0 | 47.5 | 21.5 | 59.2 | 44.1 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-32B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1445"
    },
    {
      "id": 1466,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "gemma-3-12b",
      "modelKind": "model",
      "name": "Gemma-3-12B",
      "label": "Gemma-3-12B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 57.7,
      "valueLabel": "57.7",
      "display": "57.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-12B | 39.6 | 44.0 | 32.8 | 11.2 | 57.7 | 7.4 | 3.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-12B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1466"
    },
    {
      "id": 1480,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "llama-3.1-8b",
      "modelKind": "model",
      "name": "Llama-3.1-8B",
      "label": "Llama-3.1-8B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 54.9,
      "valueLabel": "54.9",
      "display": "54.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-8B | 40.0 | 44.4 | 33.3 | 11.0 | 54.9 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-8B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1480"
    },
    {
      "id": 1501,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "qwen-3.5-9b",
      "modelKind": "model",
      "name": "Qwen3.5-9B",
      "label": "Qwen3.5-9B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 54.9,
      "valueLabel": "54.9",
      "display": "54.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-9B | 63.8 | 73.9 | 48.1 | 25.9 | 54.9 | 47.1 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-9B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1501"
    },
    {
      "id": 1424,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "fleming-r1-7b",
      "modelKind": "model",
      "name": "Fleming-R1-7B",
      "label": "Fleming-R1-7B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 53.5,
      "valueLabel": "53.5",
      "display": "53.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-7B | 50.7 | 59.9 | 36.6 | 23.2 | 53.5 | 29.4 | 12.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-7B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1424"
    },
    {
      "id": 1473,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "gemma-3-27b",
      "modelKind": "model",
      "name": "Gemma-3-27B",
      "label": "Gemma-3-27B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 53.5,
      "valueLabel": "53.5",
      "display": "53.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-27B | 40.3 | 44.7 | 33.3 | 11.4 | 53.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-27B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1473"
    },
    {
      "id": 1494,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "gpt-oss-20b",
      "modelKind": "model",
      "name": "GPT-OSS-20B",
      "label": "GPT-OSS-20B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 52.1,
      "valueLabel": "52.1",
      "display": "52.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-20B | 59.1 | 66.5 | 47.5 | 19.0 | 52.1 | 48.5 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-20B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1494"
    },
    {
      "id": 1431,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "baichuan-m2-32b",
      "modelKind": "model",
      "name": "Baichuan-M2-32B",
      "label": "Baichuan-M2-32B",
      "lab": "baichuan",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 49.3,
      "valueLabel": "49.3",
      "display": "49.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 22,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Baichuan-M2-32B | 47.8 | 54.6 | 37.2 | 17.4 | 49.3 | 30.9 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Baichuan-M2-32B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1431"
    },
    {
      "id": 1417,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "huatuogpt-o1-8b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-8B",
      "label": "HuatuoGPT-o1-8B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 49.3,
      "valueLabel": "49.3",
      "display": "49.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 22,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-8B | 44.3 | 50.0 | 35.5 | 14.5 | 49.3 | 20.6 | 13.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-8B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1417"
    },
    {
      "id": 1389,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "medgemma-4b",
      "modelKind": "model",
      "name": "MedGemma-4B",
      "label": "MedGemma-4B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 46.5,
      "valueLabel": "46.5",
      "display": "46.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-4B | 39.6 | 45.4 | 30.6 | 14.8 | 46.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-4B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1389"
    },
    {
      "id": 1382,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "healthgpt-pro-8b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-8B",
      "label": "HealthGPT-Pro-8B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 42.3,
      "valueLabel": "42.3",
      "display": "42.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-8B | 42.6 | 51.8 | 28.4 | 23.3 | 42.3 | 20.6 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-8B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1382"
    },
    {
      "id": 1396,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "lingshu-7b",
      "modelKind": "model",
      "name": "Lingshu-7B",
      "label": "Lingshu-7B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 39.4,
      "valueLabel": "39.4",
      "display": "39.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-7B | 43.3 | 50.7 | 31.7 | 19.0 | 39.4 | 32.4 | 6.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-7B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1396"
    },
    {
      "id": 1410,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "healthgpt-pro-4b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-4B",
      "label": "HealthGPT-Pro-4B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 36.6,
      "valueLabel": "36.6",
      "display": "36.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 27,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-4B | 36.0 | 37.7 | 33.3 | 4.3 | 36.6 | 41.2 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-4B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1410"
    },
    {
      "id": 1403,
      "benchmark": "medpic-bench",
      "metric": "activation",
      "model": "hulu-med-7b",
      "modelKind": "model",
      "name": "Hulu-Med-7B",
      "label": "Hulu-Med-7B",
      "lab": "zju-ai4h",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 36.6,
      "valueLabel": "36.6",
      "display": "36.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 27,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Hulu-Med-7B | 42.0 | 48.2 | 32.2 | 16.0 | 36.6 | 38.2 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Hulu-Med-7B, column Activation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1403"
    },
    {
      "id": 1572,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini-3.1-Pro",
      "label": "Gemini-3.1-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 77.9,
      "valueLabel": "77.9",
      "display": "77.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-3.1-Pro | 80.7 | 87.7 | 69.9 | 17.7 | 74.6 | 77.9 | 48.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-3.1-Pro, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1572"
    },
    {
      "id": 1565,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT-5",
      "label": "GPT-5",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 61.8,
      "valueLabel": "61.8",
      "display": "61.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5 | 75.6 | 83.5 | 63.4 | 20.1 | 70.4 | 61.8 | 38.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1565"
    },
    {
      "id": 1523,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "gpt-oss-120b",
      "modelKind": "model",
      "name": "GPT-OSS-120B",
      "label": "GPT-OSS-120B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 55.9,
      "valueLabel": "55.9",
      "display": "55.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-120B | 70.7 | 79.6 | 56.8 | 22.7 | 62.0 | 55.9 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-120B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1523"
    },
    {
      "id": 1558,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "qwen-3.5-plus",
      "modelKind": "model",
      "name": "Qwen3.5-Plus",
      "label": "Qwen3.5-Plus",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 55.9,
      "valueLabel": "55.9",
      "display": "55.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-Plus | 72.4 | 81.7 | 57.9 | 23.8 | 66.2 | 55.9 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-Plus, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1558"
    },
    {
      "id": 1460,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "lingshu-32b",
      "modelKind": "model",
      "name": "Lingshu-32B",
      "label": "Lingshu-32B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 54.4,
      "valueLabel": "54.4",
      "display": "54.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-32B | 59.5 | 63.7 | 53.0 | 10.7 | 60.6 | 54.4 | 25.8",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-32B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1460"
    },
    {
      "id": 1516,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "qwen-3.5-27b",
      "modelKind": "model",
      "name": "Qwen3.5-27B",
      "label": "Qwen3.5-27B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 51.5,
      "valueLabel": "51.5",
      "display": "51.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-27B | 69.4 | 78.2 | 55.7 | 22.4 | 67.6 | 51.5 | 31.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-27B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1516"
    },
    {
      "id": 1551,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek-V4-Pro",
      "label": "DeepSeek-V4-Pro",
      "lab": "deepseek",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 50,
      "valueLabel": "50.0",
      "display": "50.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "DeepSeek-V4-Pro | 71.7 | 81.3 | 56.8 | 24.5 | 67.6 | 50.0 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row DeepSeek-V4-Pro, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1551"
    },
    {
      "id": 1495,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "gpt-oss-20b",
      "modelKind": "model",
      "name": "GPT-OSS-20B",
      "label": "GPT-OSS-20B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 48.5,
      "valueLabel": "48.5",
      "display": "48.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-20B | 59.1 | 66.5 | 47.5 | 19.0 | 52.1 | 48.5 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-20B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1495"
    },
    {
      "id": 1502,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "qwen-3.5-9b",
      "modelKind": "model",
      "name": "Qwen3.5-9B",
      "label": "Qwen3.5-9B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 47.1,
      "valueLabel": "47.1",
      "display": "47.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-9B | 63.8 | 73.9 | 48.1 | 25.9 | 54.9 | 47.1 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-9B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1502"
    },
    {
      "id": 1509,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "qwen-3.5-35b-a3b",
      "modelKind": "model",
      "name": "Qwen3.5-35B-A3B",
      "label": "Qwen3.5-35B-A3B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 45.6,
      "valueLabel": "45.6",
      "display": "45.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-35B-A3B | 68.5 | 77.5 | 54.6 | 22.8 | 70.4 | 45.6 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-35B-A3B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1509"
    },
    {
      "id": 1446,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "fleming-r1-32b",
      "modelKind": "model",
      "name": "Fleming-R1-32B",
      "label": "Fleming-R1-32B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 44.1,
      "valueLabel": "44.1",
      "display": "44.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-32B | 60.6 | 69.0 | 47.5 | 21.5 | 59.2 | 44.1 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-32B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1446"
    },
    {
      "id": 1544,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT-5.2",
      "label": "GPT-5.2",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 42.6,
      "valueLabel": "42.6",
      "display": "42.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5.2 | 68.1 | 78.2 | 52.5 | 25.7 | 63.4 | 42.6 | 29.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5.2, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1544"
    },
    {
      "id": 1411,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "healthgpt-pro-4b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-4B",
      "label": "HealthGPT-Pro-4B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 41.2,
      "valueLabel": "41.2",
      "display": "41.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-4B | 36.0 | 37.7 | 33.3 | 4.3 | 36.6 | 41.2 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-4B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1411"
    },
    {
      "id": 1404,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "hulu-med-7b",
      "modelKind": "model",
      "name": "Hulu-Med-7B",
      "label": "Hulu-Med-7B",
      "lab": "zju-ai4h",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 38.2,
      "valueLabel": "38.2",
      "display": "38.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Hulu-Med-7B | 42.0 | 48.2 | 32.2 | 16.0 | 36.6 | 38.2 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Hulu-Med-7B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1404"
    },
    {
      "id": 1537,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude-Sonnet-4.6",
      "label": "Claude-Sonnet-4.6",
      "lab": "anthropic",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 35.3,
      "valueLabel": "35.3",
      "display": "35.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Claude-Sonnet-4.6 | 64.2 | 74.6 | 48.1 | 26.6 | 62.0 | 35.3 | 21.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Claude-Sonnet-4.6, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1537"
    },
    {
      "id": 1397,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "lingshu-7b",
      "modelKind": "model",
      "name": "Lingshu-7B",
      "label": "Lingshu-7B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 32.4,
      "valueLabel": "32.4",
      "display": "32.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-7B | 43.3 | 50.7 | 31.7 | 19.0 | 39.4 | 32.4 | 6.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-7B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1397"
    },
    {
      "id": 1488,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "llama-3.1-70b",
      "modelKind": "model",
      "name": "Llama-3.1-70B",
      "label": "Llama-3.1-70B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 32.4,
      "valueLabel": "32.4",
      "display": "32.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-70B | 55.7 | 61.3 | 47.0 | 14.3 | 63.4 | 32.4 | 16.9",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-70B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1488"
    },
    {
      "id": 1453,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "medgemma-27b-text",
      "modelKind": "model",
      "name": "MedGemma-27B-Text",
      "label": "MedGemma-27B-Text",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 32.4,
      "valueLabel": "32.4",
      "display": "32.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-27B-Text | 61.2 | 67.6 | 51.4 | 16.2 | 76.1 | 32.4 | 23.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-27B-Text, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1453"
    },
    {
      "id": 1432,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "baichuan-m2-32b",
      "modelKind": "model",
      "name": "Baichuan-M2-32B",
      "label": "Baichuan-M2-32B",
      "lab": "baichuan",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 30.9,
      "valueLabel": "30.9",
      "display": "30.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Baichuan-M2-32B | 47.8 | 54.6 | 37.2 | 17.4 | 49.3 | 30.9 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Baichuan-M2-32B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1432"
    },
    {
      "id": 1425,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "fleming-r1-7b",
      "modelKind": "model",
      "name": "Fleming-R1-7B",
      "label": "Fleming-R1-7B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 29.4,
      "valueLabel": "29.4",
      "display": "29.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-7B | 50.7 | 59.9 | 36.6 | 23.2 | 53.5 | 29.4 | 12.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-7B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1425"
    },
    {
      "id": 1530,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini-2.5-Pro",
      "label": "Gemini-2.5-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 27.9,
      "valueLabel": "27.9",
      "display": "27.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-2.5-Pro | 54.4 | 60.6 | 44.8 | 15.8 | 63.4 | 27.9 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-2.5-Pro, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1530"
    },
    {
      "id": 1439,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "huatuogpt-o1-70b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-70B",
      "label": "HuatuoGPT-o1-70B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 23.5,
      "valueLabel": "23.5",
      "display": "23.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 22,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-70B | 55.2 | 63.7 | 42.1 | 21.7 | 63.4 | 23.5 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-70B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1439"
    },
    {
      "id": 1383,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "healthgpt-pro-8b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-8B",
      "label": "HealthGPT-Pro-8B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 20.6,
      "valueLabel": "20.6",
      "display": "20.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 23,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-8B | 42.6 | 51.8 | 28.4 | 23.3 | 42.3 | 20.6 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-8B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1383"
    },
    {
      "id": 1418,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "huatuogpt-o1-8b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-8B",
      "label": "HuatuoGPT-o1-8B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 20.6,
      "valueLabel": "20.6",
      "display": "20.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 23,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-8B | 44.3 | 50.0 | 35.5 | 14.5 | 49.3 | 20.6 | 13.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-8B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1418"
    },
    {
      "id": 1474,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "gemma-3-27b",
      "modelKind": "model",
      "name": "Gemma-3-27B",
      "label": "Gemma-3-27B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 10.3,
      "valueLabel": "10.3",
      "display": "10.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-27B | 40.3 | 44.7 | 33.3 | 11.4 | 53.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-27B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1474"
    },
    {
      "id": 1481,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "llama-3.1-8b",
      "modelKind": "model",
      "name": "Llama-3.1-8B",
      "label": "Llama-3.1-8B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 10.3,
      "valueLabel": "10.3",
      "display": "10.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-8B | 40.0 | 44.4 | 33.3 | 11.0 | 54.9 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-8B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1481"
    },
    {
      "id": 1390,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "medgemma-4b",
      "modelKind": "model",
      "name": "MedGemma-4B",
      "label": "MedGemma-4B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 10.3,
      "valueLabel": "10.3",
      "display": "10.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-4B | 39.6 | 45.4 | 30.6 | 14.8 | 46.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-4B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1390"
    },
    {
      "id": 1467,
      "benchmark": "medpic-bench",
      "metric": "deactivation",
      "model": "gemma-3-12b",
      "modelKind": "model",
      "name": "Gemma-3-12B",
      "label": "Gemma-3-12B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 7.4,
      "valueLabel": "7.4",
      "display": "7.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-12B | 39.6 | 44.0 | 32.8 | 11.2 | 57.7 | 7.4 | 3.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-12B, column Deactivation; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1467"
    },
    {
      "id": 1535,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude-Sonnet-4.6",
      "label": "Claude-Sonnet-4.6",
      "lab": "anthropic",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 26.6,
      "valueLabel": "26.6",
      "display": "26.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Claude-Sonnet-4.6 | 64.2 | 74.6 | 48.1 | 26.6 | 62.0 | 35.3 | 21.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Claude-Sonnet-4.6, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1535"
    },
    {
      "id": 1500,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "qwen-3.5-9b",
      "modelKind": "model",
      "name": "Qwen3.5-9B",
      "label": "Qwen3.5-9B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 25.9,
      "valueLabel": "25.9",
      "display": "25.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-9B | 63.8 | 73.9 | 48.1 | 25.9 | 54.9 | 47.1 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-9B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1500"
    },
    {
      "id": 1542,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT-5.2",
      "label": "GPT-5.2",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 25.7,
      "valueLabel": "25.7",
      "display": "25.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5.2 | 68.1 | 78.2 | 52.5 | 25.7 | 63.4 | 42.6 | 29.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5.2, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1542"
    },
    {
      "id": 1549,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek-V4-Pro",
      "label": "DeepSeek-V4-Pro",
      "lab": "deepseek",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 24.5,
      "valueLabel": "24.5",
      "display": "24.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "DeepSeek-V4-Pro | 71.7 | 81.3 | 56.8 | 24.5 | 67.6 | 50.0 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row DeepSeek-V4-Pro, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1549"
    },
    {
      "id": 1556,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "qwen-3.5-plus",
      "modelKind": "model",
      "name": "Qwen3.5-Plus",
      "label": "Qwen3.5-Plus",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 23.8,
      "valueLabel": "23.8",
      "display": "23.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-Plus | 72.4 | 81.7 | 57.9 | 23.8 | 66.2 | 55.9 | 32.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-Plus, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1556"
    },
    {
      "id": 1381,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "healthgpt-pro-8b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-8B",
      "label": "HealthGPT-Pro-8B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 23.3,
      "valueLabel": "23.3",
      "display": "23.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-8B | 42.6 | 51.8 | 28.4 | 23.3 | 42.3 | 20.6 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-8B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1381"
    },
    {
      "id": 1423,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "fleming-r1-7b",
      "modelKind": "model",
      "name": "Fleming-R1-7B",
      "label": "Fleming-R1-7B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 23.2,
      "valueLabel": "23.2",
      "display": "23.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-7B | 50.7 | 59.9 | 36.6 | 23.2 | 53.5 | 29.4 | 12.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-7B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1423"
    },
    {
      "id": 1507,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "qwen-3.5-35b-a3b",
      "modelKind": "model",
      "name": "Qwen3.5-35B-A3B",
      "label": "Qwen3.5-35B-A3B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 22.8,
      "valueLabel": "22.8",
      "display": "22.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-35B-A3B | 68.5 | 77.5 | 54.6 | 22.8 | 70.4 | 45.6 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-35B-A3B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1507"
    },
    {
      "id": 1521,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "gpt-oss-120b",
      "modelKind": "model",
      "name": "GPT-OSS-120B",
      "label": "GPT-OSS-120B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 22.7,
      "valueLabel": "22.7",
      "display": "22.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-120B | 70.7 | 79.6 | 56.8 | 22.7 | 62.0 | 55.9 | 30.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-120B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1521"
    },
    {
      "id": 1514,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "qwen-3.5-27b",
      "modelKind": "model",
      "name": "Qwen3.5-27B",
      "label": "Qwen3.5-27B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 22.4,
      "valueLabel": "22.4",
      "display": "22.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Qwen3.5-27B | 69.4 | 78.2 | 55.7 | 22.4 | 67.6 | 51.5 | 31.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Qwen3.5-27B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1514"
    },
    {
      "id": 1437,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "huatuogpt-o1-70b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-70B",
      "label": "HuatuoGPT-o1-70B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 21.7,
      "valueLabel": "21.7",
      "display": "21.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-70B | 55.2 | 63.7 | 42.1 | 21.7 | 63.4 | 23.5 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-70B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1437"
    },
    {
      "id": 1444,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "fleming-r1-32b",
      "modelKind": "model",
      "name": "Fleming-R1-32B",
      "label": "Fleming-R1-32B",
      "lab": "ubiquant",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 21.5,
      "valueLabel": "21.5",
      "display": "21.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Fleming-R1-32B | 60.6 | 69.0 | 47.5 | 21.5 | 59.2 | 44.1 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Fleming-R1-32B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1444"
    },
    {
      "id": 1563,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT-5",
      "label": "GPT-5",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 20.1,
      "valueLabel": "20.1",
      "display": "20.1",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-5 | 75.6 | 83.5 | 63.4 | 20.1 | 70.4 | 61.8 | 38.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-5, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1563"
    },
    {
      "id": 1493,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "gpt-oss-20b",
      "modelKind": "model",
      "name": "GPT-OSS-20B",
      "label": "GPT-OSS-20B",
      "lab": "openai",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 19,
      "valueLabel": "19.0",
      "display": "19.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "GPT-OSS-20B | 59.1 | 66.5 | 47.5 | 19.0 | 52.1 | 48.5 | 24.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row GPT-OSS-20B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1493"
    },
    {
      "id": 1395,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "lingshu-7b",
      "modelKind": "model",
      "name": "Lingshu-7B",
      "label": "Lingshu-7B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 19,
      "valueLabel": "19.0",
      "display": "19.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-7B | 43.3 | 50.7 | 31.7 | 19.0 | 39.4 | 32.4 | 6.7",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-7B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1395"
    },
    {
      "id": 1570,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini-3.1-Pro",
      "label": "Gemini-3.1-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 17.7,
      "valueLabel": "17.7",
      "display": "17.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-3.1-Pro | 80.7 | 87.7 | 69.9 | 17.7 | 74.6 | 77.9 | 48.3",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-3.1-Pro, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1570"
    },
    {
      "id": 1430,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "baichuan-m2-32b",
      "modelKind": "model",
      "name": "Baichuan-M2-32B",
      "label": "Baichuan-M2-32B",
      "lab": "baichuan",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 17.4,
      "valueLabel": "17.4",
      "display": "17.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Baichuan-M2-32B | 47.8 | 54.6 | 37.2 | 17.4 | 49.3 | 30.9 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Baichuan-M2-32B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1430"
    },
    {
      "id": 1451,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "medgemma-27b-text",
      "modelKind": "model",
      "name": "MedGemma-27B-Text",
      "label": "MedGemma-27B-Text",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 16.2,
      "valueLabel": "16.2",
      "display": "16.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-27B-Text | 61.2 | 67.6 | 51.4 | 16.2 | 76.1 | 32.4 | 23.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-27B-Text, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1451"
    },
    {
      "id": 1402,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "hulu-med-7b",
      "modelKind": "model",
      "name": "Hulu-Med-7B",
      "label": "Hulu-Med-7B",
      "lab": "zju-ai4h",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 16,
      "valueLabel": "16.0",
      "display": "16.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Hulu-Med-7B | 42.0 | 48.2 | 32.2 | 16.0 | 36.6 | 38.2 | 14.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Hulu-Med-7B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1402"
    },
    {
      "id": 1528,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini-2.5-Pro",
      "label": "Gemini-2.5-Pro",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 15.8,
      "valueLabel": "15.8",
      "display": "15.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemini-2.5-Pro | 54.4 | 60.6 | 44.8 | 15.8 | 63.4 | 27.9 | 20.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemini-2.5-Pro, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1528"
    },
    {
      "id": 1388,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "medgemma-4b",
      "modelKind": "model",
      "name": "MedGemma-4B",
      "label": "MedGemma-4B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 14.8,
      "valueLabel": "14.8",
      "display": "14.8",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "MedGemma-4B | 39.6 | 45.4 | 30.6 | 14.8 | 46.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row MedGemma-4B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1388"
    },
    {
      "id": 1416,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "huatuogpt-o1-8b",
      "modelKind": "model",
      "name": "HuatuoGPT-o1-8B",
      "label": "HuatuoGPT-o1-8B",
      "lab": "freedom-intelligence",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 14.5,
      "valueLabel": "14.5",
      "display": "14.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HuatuoGPT-o1-8B | 44.3 | 50.0 | 35.5 | 14.5 | 49.3 | 20.6 | 13.5",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HuatuoGPT-o1-8B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1416"
    },
    {
      "id": 1486,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "llama-3.1-70b",
      "modelKind": "model",
      "name": "Llama-3.1-70B",
      "label": "Llama-3.1-70B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 14.3,
      "valueLabel": "14.3",
      "display": "14.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-70B | 55.7 | 61.3 | 47.0 | 14.3 | 63.4 | 32.4 | 16.9",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-70B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1486"
    },
    {
      "id": 1472,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "gemma-3-27b",
      "modelKind": "model",
      "name": "Gemma-3-27B",
      "label": "Gemma-3-27B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 11.4,
      "valueLabel": "11.4",
      "display": "11.4",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-27B | 40.3 | 44.7 | 33.3 | 11.4 | 53.5 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-27B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1472"
    },
    {
      "id": 1465,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "gemma-3-12b",
      "modelKind": "model",
      "name": "Gemma-3-12B",
      "label": "Gemma-3-12B",
      "lab": "google",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 11.2,
      "valueLabel": "11.2",
      "display": "11.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Gemma-3-12B | 39.6 | 44.0 | 32.8 | 11.2 | 57.7 | 7.4 | 3.4",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Gemma-3-12B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1465"
    },
    {
      "id": 1479,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "llama-3.1-8b",
      "modelKind": "model",
      "name": "Llama-3.1-8B",
      "label": "Llama-3.1-8B",
      "lab": "meta",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 11,
      "valueLabel": "11.0",
      "display": "11.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Llama-3.1-8B | 40.0 | 44.4 | 33.3 | 11.0 | 54.9 | 10.3 | 5.6",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Llama-3.1-8B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1479"
    },
    {
      "id": 1458,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "lingshu-32b",
      "modelKind": "model",
      "name": "Lingshu-32B",
      "label": "Lingshu-32B",
      "lab": "alibaba",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 10.7,
      "valueLabel": "10.7",
      "display": "10.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "Lingshu-32B | 59.5 | 63.7 | 53.0 | 10.7 | 60.6 | 54.4 | 25.8",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row Lingshu-32B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1458"
    },
    {
      "id": 1409,
      "benchmark": "medpic-bench",
      "metric": "published_gap",
      "model": "healthgpt-pro-4b",
      "modelKind": "model",
      "name": "HealthGPT-Pro-4B",
      "label": "HealthGPT-Pro-4B",
      "lab": "zju4healthcare",
      "variant": "zero-shot; independent questions; exact option-set match",
      "value": 4.3,
      "valueLabel": "4.3",
      "display": "4.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": null,
      "rowsOnBoard": 28,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 1223,
      "sourceUrl": "https://arxiv.org/html/2608.03028v1",
      "quote": "HealthGPT-Pro-4B | 36.0 | 37.7 | 33.3 | 4.3 | 36.6 | 41.2 | 11.2",
      "locator": "arXiv:2608.03028v1, Section 4, Table 2 (#S4.T2), row HealthGPT-Pro-4B, column Δ_GF−CF; row order: Model | Overall | GF | CF | Δ_GF−CF | Activation | Deactivation | Pair",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medpic-bench#r-1409"
    },
    {
      "id": 548,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gpt-5.6-sol",
      "modelKind": "model",
      "name": "GPT-5.6 Sol",
      "label": null,
      "lab": "openai",
      "variant": "Qwen-run comparison in the Qwen3.8-Max launch post",
      "value": 81.5,
      "valueLabel": "81.5",
      "display": "81.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 22,
      "measured": null,
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 152,
      "sourceUrl": "https://qwen.ai/blog?id=qwen3.8",
      "quote": "| MedXpertQA-MM | 71.7 | 80.0 | 80.7 | 81.5 | 71.0 | 80.4 |",
      "locator": "Full Benchmark Table, second (multimodal) table, row MedXpertQA-MM; columns Opus4.8 / Fable5 / Gemini3.1-Pro / GPT5.6-Sol / Qwen3.7-Plus / Qwen3.8-Max",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-548"
    },
    {
      "id": 156,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini 3.1 Pro",
      "label": null,
      "lab": "google",
      "variant": "Meta's Muse Spark launch table (Meta reports the better of vendor self-reports and its own reproduction)",
      "value": 81.3,
      "valueLabel": "81.3",
      "display": "81.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 71,
      "sourceUrl": "https://ai.meta.com/blog/introducing-muse-spark-msl/",
      "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
      "locator": "Launch-post benchmark table image, HEALTH section, row MedXpertQA (MM), column Gemini 3.1 Pro High; the same table is page 5 of the Eval Methodology PDF; protocol p. 2: 'MedXpertQA Text/Multimodal: ... The multimodal variant contains 2,000 multimodal medical questions with clinical images (X-rays, histology, dermatology, etc.) and 5 answer choices (A-E). For grading, we use gpt-oss-120b to parse the predicted answer letter from free-form text.'",
      "corroborating": [
        {
          "source": 74,
          "role": "corroborating",
          "scoreDisplay": "81.3",
          "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
          "locator": "p. 5, benchmark table image, HEALTH section, row MedXpertQA (MM), column Gemini 3.1 Pro High"
        },
        {
          "source": 24,
          "role": "mirror",
          "scoreDisplay": "81.3%",
          "quote": "1\nGemini 3.1 Pro [/models/gemini-3-1-pro]Google · Closed\n\n81.3%",
          "locator": "BENCHMARK SCORE TABLE (8 MODELS), rank 1; the page says 'We mirror the published score view for MedXpertQA (MM)' and 'Updated September 4, 2026', citing Meta's Muse Spark Eval Methodology"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-156"
    },
    {
      "id": 157,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "qwen3.8-max",
      "modelKind": "model",
      "name": "Qwen3.8 Max",
      "label": null,
      "lab": "alibaba",
      "variant": "Alibaba's own Qwen3.8 launch table; protocol not stated",
      "value": 80.4,
      "valueLabel": "80.4",
      "display": "80.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 22,
      "measured": "2026-08",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 152,
      "sourceUrl": "https://qwen.ai/blog?id=qwen3.8",
      "quote": "| MedXpertQA-MM | 71.7 | 80.0 | 80.7 | 81.5 | 71.0 | 80.4 |",
      "locator": "Multimodal Benchmarks table, Multimodal Reasoning section, row MedXpertQA-MM, column Qwen3.8-Max; header row: |     | Opus4.8 | Fable5 | Gemini3.1-Pro | GPT5.6-Sol | Qwen3.7-Plus | Qwen3.8-Max |",
      "corroborating": [
        {
          "source": 24,
          "role": "mirror",
          "scoreDisplay": "80.4%",
          "quote": "2\nQwen3.8 Max [/models/qwen3-8-max]Alibaba · Open weight\n\n80.4%",
          "locator": "BENCHMARK SCORE TABLE (8 MODELS), rank 2; the page says 'We mirror the published score view for MedXpertQA (MM)' and 'Updated September 4, 2026', citing Meta's Muse Spark Eval Methodology"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-157"
    },
    {
      "id": 547,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "claude-fable-5",
      "modelKind": "model",
      "name": "Claude Fable 5",
      "label": null,
      "lab": "anthropic",
      "variant": "Qwen-run comparison in the Qwen3.8-Max launch post",
      "value": 80,
      "valueLabel": "80.0",
      "display": "80.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 22,
      "measured": null,
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 152,
      "sourceUrl": "https://qwen.ai/blog?id=qwen3.8",
      "quote": "| MedXpertQA-MM | 71.7 | 80.0 | 80.7 | 81.5 | 71.0 | 80.4 |",
      "locator": "Full Benchmark Table, second (multimodal) table, row MedXpertQA-MM; columns Opus4.8 / Fable5 / Gemini3.1-Pro / GPT5.6-Sol / Qwen3.7-Plus / Qwen3.8-Max",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-547"
    },
    {
      "id": 158,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "muse-spark",
      "modelKind": "model",
      "name": "Muse Spark",
      "label": null,
      "lab": "meta",
      "variant": "Meta's Muse Spark launch table (Meta reports the better of vendor self-reports and its own reproduction)",
      "value": 78.4,
      "valueLabel": "78.4",
      "display": "78.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 71,
      "sourceUrl": "https://ai.meta.com/blog/introducing-muse-spark-msl/",
      "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
      "locator": "Launch-post benchmark table image, HEALTH section, row MedXpertQA (MM), column Muse Spark Thinking; the same table is page 5 of the Eval Methodology PDF; protocol p. 2: 'MedXpertQA Text/Multimodal: ... The multimodal variant contains 2,000 multimodal medical questions with clinical images (X-rays, histology, dermatology, etc.) and 5 answer choices (A-E). For grading, we use gpt-oss-120b to parse the predicted answer letter from free-form text.'",
      "corroborating": [
        {
          "source": 74,
          "role": "corroborating",
          "scoreDisplay": "78.4",
          "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
          "locator": "p. 5, benchmark table image, HEALTH section, row MedXpertQA (MM), column Muse Spark Thinking"
        },
        {
          "source": 24,
          "role": "mirror",
          "scoreDisplay": "78.4%",
          "quote": "3\nMuse Spark [/models/muse-spark]Meta · Closed\n\n78.4%",
          "locator": "BENCHMARK SCORE TABLE (8 MODELS), rank 3; the page says 'We mirror the published score view for MedXpertQA (MM)' and 'Updated September 4, 2026', citing Meta's Muse Spark Eval Methodology"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-158"
    },
    {
      "id": 159,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT-5.4",
      "label": null,
      "lab": "openai",
      "variant": "Meta's Muse Spark launch table (Meta reports the better of vendor self-reports and its own reproduction)",
      "value": 77.1,
      "valueLabel": "77.1",
      "display": "77.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 71,
      "sourceUrl": "https://ai.meta.com/blog/introducing-muse-spark-msl/",
      "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
      "locator": "Launch-post benchmark table image, HEALTH section, row MedXpertQA (MM), column GPT 5.4 Xhigh; the same table is page 5 of the Eval Methodology PDF; protocol p. 2: 'MedXpertQA Text/Multimodal: ... The multimodal variant contains 2,000 multimodal medical questions with clinical images (X-rays, histology, dermatology, etc.) and 5 answer choices (A-E). For grading, we use gpt-oss-120b to parse the predicted answer letter from free-form text.'",
      "corroborating": [
        {
          "source": 74,
          "role": "corroborating",
          "scoreDisplay": "77.1",
          "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
          "locator": "p. 5, benchmark table image, HEALTH section, row MedXpertQA (MM), column GPT 5.4 Xhigh"
        },
        {
          "source": 24,
          "role": "mirror",
          "scoreDisplay": "77.1%",
          "quote": "4\nGPT-5.4 [/models/gpt-5-4]OpenAI · Closed\n\n77.1%",
          "locator": "BENCHMARK SCORE TABLE (8 MODELS), rank 4; the page says 'We mirror the published score view for MedXpertQA (MM)' and 'Updated September 4, 2026', citing Meta's Muse Spark Eval Methodology"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-159"
    },
    {
      "id": 1823,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gemini-3-pro",
      "modelKind": "model",
      "name": "Gemini-3 Pro",
      "label": "Gemini-3 Pro",
      "lab": "google",
      "variant": "Qwen3.5 model card comparison; source-specific evaluation, not harmonized across vendors",
      "value": 76,
      "valueLabel": "76.0",
      "display": "76.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 22,
      "measured": "2026-02",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 318,
      "sourceUrl": "https://huggingface.co/Qwen/Qwen3.5-397B-A17B",
      "quote": " | GPT5.2 | Claude 4.5 Opus | Gemini-3 Pro | Qwen3-VL-235B-A22B | K2.5-1T-A32B | Qwen3.5-397B-A17B\nMedXpertQA-MM | 73.3 | 63.6 | 76.0 | 47.6 | 65.3 | 70.0",
      "locator": "Benchmark Results > Vision Language > Medical VQA; MedXpertQA-MM row, Gemini-3 Pro column.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-1823"
    },
    {
      "id": 550,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gpt-5.2",
      "modelKind": "model",
      "name": "GPT-5.2",
      "label": null,
      "lab": "openai",
      "variant": "Qwen-run comparison in the Qwen3.5-397B-A17B model card",
      "value": 73.3,
      "valueLabel": "73.3",
      "display": "73.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 22,
      "measured": null,
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 318,
      "sourceUrl": "https://huggingface.co/Qwen/Qwen3.5-397B-A17B",
      "quote": "MedXpertQA-MM        73.3     63.6              76.0           47.6                 65.3           70.0",
      "locator": "Benchmark Results > Vision Language > Medical VQA, row MedXpertQA-MM; columns GPT5.2 / Claude 4.5 Opus / Gemini-3 Pro / Qwen3-VL-235B-A22B / K2.5-1T-A32B / Qwen3.5-397B-A17B",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-550"
    },
    {
      "id": 546,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "claude-opus-4.8",
      "modelKind": "model",
      "name": "Claude Opus 4.8",
      "label": null,
      "lab": "anthropic",
      "variant": "Qwen-run comparison in the Qwen3.8-Max launch post",
      "value": 71.7,
      "valueLabel": "71.7",
      "display": "71.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 22,
      "measured": null,
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 152,
      "sourceUrl": "https://qwen.ai/blog?id=qwen3.8",
      "quote": "| MedXpertQA-MM | 71.7 | 80.0 | 80.7 | 81.5 | 71.0 | 80.4 |",
      "locator": "Full Benchmark Table, second (multimodal) table, row MedXpertQA-MM; columns Opus4.8 / Fable5 / Gemini3.1-Pro / GPT5.6-Sol / Qwen3.7-Plus / Qwen3.8-Max",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-546"
    },
    {
      "id": 160,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "qwen3.7-plus",
      "modelKind": "model",
      "name": "Qwen3.7 Plus",
      "label": null,
      "lab": "alibaba",
      "variant": "Alibaba's own Qwen3.7 Plus launch table; protocol not stated",
      "value": 71,
      "valueLabel": "71.0",
      "display": "71.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 22,
      "measured": "2026-05",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 205,
      "sourceUrl": "https://qwen.ai/blog?id=qwen3.7-plus",
      "quote": "| MedXpertQA-MM | 77.3 | 64.4 | 80.7 | 68.7 | 71.0 |",
      "locator": "Multimodal Benchmarks table, Multimodal Reasoning section, row MedXpertQA-MM, column Qwen3.7-Plus; header row: |     | GPT-5.4 (xhigh) | Opus-4.6 Max | Gemini-3.1 Pro | Qwen3.6-Plus | Qwen3.7-Plus |",
      "corroborating": [
        {
          "source": 152,
          "role": "corroborating",
          "scoreDisplay": "71.0",
          "quote": "| MedXpertQA-MM | 71.7 | 80.0 | 80.7 | 81.5 | 71.0 | 80.4 |",
          "locator": "Qwen3.8 launch post, Multimodal Benchmarks table, row MedXpertQA-MM, column Qwen3.7-Plus (same value carried forward)"
        },
        {
          "source": 24,
          "role": "mirror",
          "scoreDisplay": "71.0%",
          "quote": "5\nQwen3.7 Plus [/models/qwen3-7-plus]Alibaba · Closed\n\n71.0%",
          "locator": "BENCHMARK SCORE TABLE (8 MODELS), rank 5; the page says 'We mirror the published score view for MedXpertQA (MM)' and 'Updated September 4, 2026', citing Meta's Muse Spark Eval Methodology"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-160"
    },
    {
      "id": 552,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "qwen3.5-397b-a17b",
      "modelKind": "model",
      "name": "Qwen3.5 397B A17B",
      "label": null,
      "lab": "alibaba",
      "variant": "self-reported in the Qwen3.5-397B-A17B model card",
      "value": 70,
      "valueLabel": "70.0",
      "display": "70.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 22,
      "measured": null,
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 318,
      "sourceUrl": "https://huggingface.co/Qwen/Qwen3.5-397B-A17B",
      "quote": "MedXpertQA-MM        73.3     63.6              76.0           47.6                 65.3           70.0",
      "locator": "Benchmark Results > Vision Language > Medical VQA, row MedXpertQA-MM; columns GPT5.2 / Claude 4.5 Opus / Gemini-3 Pro / Qwen3-VL-235B-A22B / K2.5-1T-A32B / Qwen3.5-397B-A17B",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-552"
    },
    {
      "id": 549,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "qwen3.6-plus",
      "modelKind": "model",
      "name": "Qwen3.6 Plus",
      "label": null,
      "lab": "alibaba",
      "variant": "Qwen-run comparison in the Qwen3.7-Plus launch post",
      "value": 68.7,
      "valueLabel": "68.7",
      "display": "68.7",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 22,
      "measured": null,
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 205,
      "sourceUrl": "https://qwen.ai/blog?id=qwen3.7-plus",
      "quote": "| MedXpertQA-MM | 77.3 | 64.4 | 80.7 | 68.7 | 71.0 |",
      "locator": "Multimodal Benchmarks table, row MedXpertQA-MM; columns GPT-5.4 (xhigh) / Opus-4.6 Max / Gemini-3.1 Pro / Qwen3.6-Plus / Qwen3.7-Plus",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-549"
    },
    {
      "id": 161,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "grok-4.20",
      "modelKind": "model",
      "name": "Grok 4.20",
      "label": null,
      "lab": "xai",
      "variant": "Meta's Muse Spark launch table (Meta reports the better of vendor self-reports and its own reproduction)",
      "value": 65.8,
      "valueLabel": "65.8",
      "display": "65.8%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 71,
      "sourceUrl": "https://ai.meta.com/blog/introducing-muse-spark-msl/",
      "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
      "locator": "Launch-post benchmark table image, HEALTH section, row MedXpertQA (MM), column Grok 4.2 Reasoning; the same table is page 5 of the Eval Methodology PDF; protocol p. 2: 'MedXpertQA Text/Multimodal: ... The multimodal variant contains 2,000 multimodal medical questions with clinical images (X-rays, histology, dermatology, etc.) and 5 answer choices (A-E). For grading, we use gpt-oss-120b to parse the predicted answer letter from free-form text.'",
      "corroborating": [
        {
          "source": 74,
          "role": "corroborating",
          "scoreDisplay": "65.8",
          "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
          "locator": "p. 5, benchmark table image, HEALTH section, row MedXpertQA (MM), column Grok 4.2 Reasoning"
        },
        {
          "source": 24,
          "role": "mirror",
          "scoreDisplay": "65.8%",
          "quote": "6\nGrok 4.20 [/models/grok-4-20-beta]xAI · Closed\n\n65.8%",
          "locator": "BENCHMARK SCORE TABLE (8 MODELS), rank 6; the page says 'We mirror the published score view for MedXpertQA (MM)' and 'Updated September 4, 2026', citing Meta's Muse Spark Eval Methodology"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-161"
    },
    {
      "id": 551,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "kimi-k2.5",
      "modelKind": "model",
      "name": "Kimi K2.5",
      "label": null,
      "lab": "moonshot",
      "variant": "Qwen-run comparison in the Qwen3.5-397B-A17B model card (K2.5-1T-A32B column)",
      "value": 65.3,
      "valueLabel": "65.3",
      "display": "65.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 22,
      "measured": null,
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 318,
      "sourceUrl": "https://huggingface.co/Qwen/Qwen3.5-397B-A17B",
      "quote": "MedXpertQA-MM        73.3     63.6              76.0           47.6                 65.3           70.0",
      "locator": "Benchmark Results > Vision Language > Medical VQA, row MedXpertQA-MM; columns GPT5.2 / Claude 4.5 Opus / Gemini-3 Pro / Qwen3-VL-235B-A22B / K2.5-1T-A32B / Qwen3.5-397B-A17B",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-551"
    },
    {
      "id": 162,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude Opus 4.6",
      "label": null,
      "lab": "anthropic",
      "variant": "Meta's Muse Spark launch table (Meta reports the better of vendor self-reports and its own reproduction)",
      "value": 64.8,
      "valueLabel": "64.8",
      "display": "64.8%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 71,
      "sourceUrl": "https://ai.meta.com/blog/introducing-muse-spark-msl/",
      "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
      "locator": "Launch-post benchmark table image, HEALTH section, row MedXpertQA (MM), column Opus 4.6 Max; the same table is page 5 of the Eval Methodology PDF; protocol p. 2: 'MedXpertQA Text/Multimodal: ... The multimodal variant contains 2,000 multimodal medical questions with clinical images (X-rays, histology, dermatology, etc.) and 5 answer choices (A-E). For grading, we use gpt-oss-120b to parse the predicted answer letter from free-form text.'",
      "corroborating": [
        {
          "source": 74,
          "role": "corroborating",
          "scoreDisplay": "64.8",
          "quote": "MedXpertQA (MM) | Medical Multiple Choice | 78.4 | 64.8 | 81.3 | 77.1 | 65.8 (image table row; columns Muse Spark Thinking, Opus 4.6 Max, Gemini 3.1 Pro High, GPT 5.4 Xhigh, Grok 4.2 Reasoning)",
          "locator": "p. 5, benchmark table image, HEALTH section, row MedXpertQA (MM), column Opus 4.6 Max"
        },
        {
          "source": 24,
          "role": "mirror",
          "scoreDisplay": "64.8%",
          "quote": "7\nClaude Opus 4.6 [/models/claude-opus-4-6]Anthropic · Closed\n\n64.8%",
          "locator": "BENCHMARK SCORE TABLE (8 MODELS), rank 7; the page says 'We mirror the published score view for MedXpertQA (MM)' and 'Updated September 4, 2026', citing Meta's Muse Spark Eval Methodology"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-162"
    },
    {
      "id": 1824,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "claude-opus-4.5",
      "modelKind": "model",
      "name": "Claude 4.5 Opus",
      "label": "Claude 4.5 Opus",
      "lab": "anthropic",
      "variant": "Qwen3.5 model card comparison; source-specific evaluation, not harmonized across vendors",
      "value": 63.6,
      "valueLabel": "63.6",
      "display": "63.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 22,
      "measured": "2026-02",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 318,
      "sourceUrl": "https://huggingface.co/Qwen/Qwen3.5-397B-A17B",
      "quote": " | GPT5.2 | Claude 4.5 Opus | Gemini-3 Pro | Qwen3-VL-235B-A22B | K2.5-1T-A32B | Qwen3.5-397B-A17B\nMedXpertQA-MM | 73.3 | 63.6 | 76.0 | 47.6 | 65.3 | 70.0",
      "locator": "Benchmark Results > Vision Language > Medical VQA; MedXpertQA-MM row, Claude 4.5 Opus column.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-1824"
    },
    {
      "id": 1825,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gemma-4-31b",
      "modelKind": "model",
      "name": "Gemma 4 31B",
      "label": null,
      "lab": "google",
      "variant": "Google model card; MedXPertQA MM row; vendor-reported; protocol differs from other source families",
      "value": 61.3,
      "valueLabel": "61.3",
      "display": "61.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 202,
      "sourceUrl": "https://ai.google.dev/gemma/docs/core/model_card_4",
      "quote": " | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think)\nMedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | -",
      "locator": "Evaluation Results, MedXPertQA MM row, Gemma 4 31B column.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-1825"
    },
    {
      "id": 1826,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gemma-4-26b-a4b",
      "modelKind": "model",
      "name": "Gemma 4 26B A4B",
      "label": null,
      "lab": "google",
      "variant": "Google model card; MedXPertQA MM row; vendor-reported; protocol differs from other source families",
      "value": 58.1,
      "valueLabel": "58.1",
      "display": "58.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 202,
      "sourceUrl": "https://ai.google.dev/gemma/docs/core/model_card_4",
      "quote": " | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think)\nMedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | -",
      "locator": "Evaluation Results, MedXPertQA MM row, Gemma 4 26B A4B column.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-1826"
    },
    {
      "id": 163,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gemma-4-12b",
      "modelKind": "model",
      "name": "Gemma 4 12B",
      "label": null,
      "lab": "google",
      "variant": "Google's Gemma 4 model card, Unified 12B; protocol not stated",
      "value": 48.7,
      "valueLabel": "48.7",
      "display": "48.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 202,
      "sourceUrl": "https://ai.google.dev/gemma/docs/core/model_card_4",
      "quote": "| MedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | \\-  |",
      "locator": "Benchmark Results table, Vision section, row MedXPertQA MM, column Gemma 4 12B Unified; header row: |     | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) |",
      "corroborating": [
        {
          "source": 212,
          "role": "corroborating",
          "scoreDisplay": "48.7",
          "quote": "MedXPertQA MM 61.3 58.1 48.7 28.7 23.5 -",
          "locator": "Gemma 4 Technical Report p. 6, Table 6 (vision benchmarks, thinking), row MedXPertQA MM, column 12B"
        },
        {
          "source": 24,
          "role": "mirror",
          "scoreDisplay": "48.7%",
          "quote": "8\nGemma 4 12B [/models/gemma-4-12b]Google · Open weight\n\n48.7%",
          "locator": "BENCHMARK SCORE TABLE (8 MODELS), rank 8; the page says 'We mirror the published score view for MedXpertQA (MM)' and 'Updated September 4, 2026', citing Meta's Muse Spark Eval Methodology"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-163"
    },
    {
      "id": 1827,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "qwen3-vl-235b-a22b",
      "modelKind": "model",
      "name": "Qwen3-VL-235B-A22B",
      "label": "Qwen3-VL-235B-A22B",
      "lab": "alibaba",
      "variant": "Qwen3.5 model card comparison; source-specific evaluation, not harmonized across vendors",
      "value": 47.6,
      "valueLabel": "47.6",
      "display": "47.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 22,
      "measured": "2026-02",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 318,
      "sourceUrl": "https://huggingface.co/Qwen/Qwen3.5-397B-A17B",
      "quote": " | GPT5.2 | Claude 4.5 Opus | Gemini-3 Pro | Qwen3-VL-235B-A22B | K2.5-1T-A32B | Qwen3.5-397B-A17B\nMedXpertQA-MM | 73.3 | 63.6 | 76.0 | 47.6 | 65.3 | 70.0",
      "locator": "Benchmark Results > Vision Language > Medical VQA; MedXpertQA-MM row, Qwen3-VL-235B-A22B column.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-1827"
    },
    {
      "id": 1828,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gemma-4-e4b",
      "modelKind": "model",
      "name": "Gemma 4 E4B",
      "label": null,
      "lab": "google",
      "variant": "Google model card; MedXPertQA MM row; vendor-reported; protocol differs from other source families",
      "value": 28.7,
      "valueLabel": "28.7",
      "display": "28.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 202,
      "sourceUrl": "https://ai.google.dev/gemma/docs/core/model_card_4",
      "quote": " | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think)\nMedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | -",
      "locator": "Evaluation Results, MedXPertQA MM row, Gemma 4 E4B column.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-1828"
    },
    {
      "id": 1829,
      "benchmark": "medxpertqa-mm",
      "metric": null,
      "model": "gemma-4-e2b",
      "modelKind": "model",
      "name": "Gemma 4 E2B",
      "label": null,
      "lab": "google",
      "variant": "Google model card; MedXPertQA MM row; vendor-reported; protocol differs from other source families",
      "value": 23.5,
      "valueLabel": "23.5",
      "display": "23.5%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 22,
      "rowsOnBoard": 22,
      "measured": "2026-04",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 202,
      "sourceUrl": "https://ai.google.dev/gemma/docs/core/model_card_4",
      "quote": " | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think)\nMedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | -",
      "locator": "Evaluation Results, MedXPertQA MM row, Gemma 4 E2B column.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medxpertqa-mm#r-1829"
    },
    {
      "id": 106,
      "benchmark": "mast",
      "metric": null,
      "model": "gpt-5.6-sol",
      "modelKind": "model",
      "name": "GPT-5.6 Sol",
      "label": null,
      "lab": "openai",
      "variant": "MAST in preview; 'exact scores may change'",
      "value": 60.2,
      "valueLabel": "60.2",
      "display": "60.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 8,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 17,
      "sourceUrl": "https://arise-ai.org/mast",
      "quote": "1   GPT-5.6 Sol         OpenAI            60.2%",
      "locator": "arise-ai.org/mast, 'Which AI can you trust for medical questions?' General tab, composite score table (8 of 11 models shown; 'Last updated August 15, 2026')",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/mast#r-106"
    },
    {
      "id": 107,
      "benchmark": "mast",
      "metric": null,
      "model": "kimi-k3",
      "modelKind": "model",
      "name": "Kimi K3",
      "label": null,
      "lab": "moonshot",
      "variant": "",
      "value": 60.1,
      "valueLabel": "60.1",
      "display": "60.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 8,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 17,
      "sourceUrl": "https://arise-ai.org/mast",
      "quote": "2   Kimi K3             Moonshot AI       60.1%",
      "locator": "arise-ai.org/mast, 'Which AI can you trust for medical questions?' General tab, composite score table (8 of 11 models shown; 'Last updated August 15, 2026')",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/mast#r-107"
    },
    {
      "id": 108,
      "benchmark": "mast",
      "metric": null,
      "model": "gemini-3.6-flash",
      "modelKind": "model",
      "name": "Gemini 3.6 Flash",
      "label": null,
      "lab": "google",
      "variant": "",
      "value": 59.3,
      "valueLabel": "59.3",
      "display": "59.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 8,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 17,
      "sourceUrl": "https://arise-ai.org/mast",
      "quote": "3   Gemini 3.6 Flash    Google            59.3%",
      "locator": "arise-ai.org/mast, 'Which AI can you trust for medical questions?' General tab, composite score table (8 of 11 models shown; 'Last updated August 15, 2026')",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/mast#r-108"
    },
    {
      "id": 109,
      "benchmark": "mast",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini 3.1 Pro",
      "label": null,
      "lab": "google",
      "variant": "",
      "value": 58.9,
      "valueLabel": "58.9",
      "display": "58.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 8,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 17,
      "sourceUrl": "https://arise-ai.org/mast",
      "quote": "4   Gemini 3.1 Pro      Google            58.9%",
      "locator": "arise-ai.org/mast, 'Which AI can you trust for medical questions?' General tab, composite score table (8 of 11 models shown; 'Last updated August 15, 2026')",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/mast#r-109"
    },
    {
      "id": 110,
      "benchmark": "mast",
      "metric": null,
      "model": "qwen3.5-397b-a17b",
      "modelKind": "model",
      "name": "Qwen3.5 397B A17B",
      "label": null,
      "lab": "alibaba",
      "variant": "",
      "value": 57.9,
      "valueLabel": "57.9",
      "display": "57.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 8,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 17,
      "sourceUrl": "https://arise-ai.org/mast",
      "quote": "5   Qwen3.5 397B A17B   Alibaba           57.9%",
      "locator": "arise-ai.org/mast, 'Which AI can you trust for medical questions?' General tab, composite score table (8 of 11 models shown; 'Last updated August 15, 2026')",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/mast#r-110"
    },
    {
      "id": 111,
      "benchmark": "mast",
      "metric": null,
      "model": "claude-opus-5",
      "modelKind": "model",
      "name": "Claude Opus 5",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 57.1,
      "valueLabel": "57.1",
      "display": "57.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 8,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 17,
      "sourceUrl": "https://arise-ai.org/mast",
      "quote": "6   Claude Opus 5       Anthropic         57.1%",
      "locator": "arise-ai.org/mast, 'Which AI can you trust for medical questions?' General tab, composite score table (8 of 11 models shown; 'Last updated August 15, 2026')",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/mast#r-111"
    },
    {
      "id": 112,
      "benchmark": "mast",
      "metric": null,
      "model": "claude-sonnet-5",
      "modelKind": "model",
      "name": "Claude Sonnet 5",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 56.6,
      "valueLabel": "56.6",
      "display": "56.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 8,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 17,
      "sourceUrl": "https://arise-ai.org/mast",
      "quote": "7   Claude Sonnet 5     Anthropic         56.6%",
      "locator": "arise-ai.org/mast, 'Which AI can you trust for medical questions?' General tab, composite score table (8 of 11 models shown; 'Last updated August 15, 2026')",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/mast#r-112"
    },
    {
      "id": 113,
      "benchmark": "mast",
      "metric": null,
      "model": "grok-4.3",
      "modelKind": "model",
      "name": "Grok 4.3",
      "label": null,
      "lab": "xai",
      "variant": "",
      "value": 53.7,
      "valueLabel": "53.7",
      "display": "53.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 8,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 17,
      "sourceUrl": "https://arise-ai.org/mast",
      "quote": "8   Grok 4.3            xAI               53.7%",
      "locator": "arise-ai.org/mast, 'Which AI can you trust for medical questions?' General tab, composite score table (8 of 11 models shown; 'Last updated August 15, 2026')",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/mast#r-113"
    },
    {
      "id": 114,
      "benchmark": "medhelm",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini 3.1 Pro (Preview)",
      "label": "Gemini 3.1 Pro (Preview)",
      "lab": "google",
      "variant": "",
      "value": 0.652,
      "valueLabel": "0.652",
      "display": "0.652",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "1 Gemini 3.1 Pro (Preview) Google 0.652",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.6520833333333333",
          "quote": "[\"Gemini 3.1 Pro (Preview)\", \"Mean win rate\": 0.6520833333333333]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-114"
    },
    {
      "id": 115,
      "benchmark": "medhelm",
      "metric": null,
      "model": "gemini-3.5-flash",
      "modelKind": "model",
      "name": "Gemini 3.5 Flash",
      "label": null,
      "lab": "google",
      "variant": "",
      "value": 0.642,
      "valueLabel": "0.642",
      "display": "0.642",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "2 Gemini-3.5-flash Google 0.642",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.6416666666666667",
          "quote": "[\"Gemini-3.5-flash\", \"Mean win rate\": 0.6416666666666667]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-115"
    },
    {
      "id": 116,
      "benchmark": "medhelm",
      "metric": null,
      "model": "muse-spark",
      "modelKind": "model",
      "name": "Muse Spark (2026-04-08)",
      "label": "Muse Spark (2026-04-08)",
      "lab": "meta",
      "variant": "",
      "value": 0.621,
      "valueLabel": "0.621",
      "display": "0.621",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "3 Muse Spark (2026-04-08) Meta 0.621",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.6208333333333333",
          "quote": "[\"Muse Spark (2026-04-08)\", \"Mean win rate\": 0.6208333333333333]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-116"
    },
    {
      "id": 117,
      "benchmark": "medhelm",
      "metric": null,
      "model": "gpt-5.4-mini",
      "modelKind": "model",
      "name": "GPT-5.4 mini",
      "label": null,
      "lab": "openai",
      "variant": "",
      "value": 0.552,
      "valueLabel": "0.552",
      "display": "0.552",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "4 GPT-5.4 mini OpenAI 0.552",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.5520833333333334",
          "quote": "[\"GPT-5.4 mini\", \"Mean win rate\": 0.5520833333333334]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-117"
    },
    {
      "id": 118,
      "benchmark": "medhelm",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT-5.4 (2026-03-05)",
      "label": "GPT-5.4 (2026-03-05)",
      "lab": "openai",
      "variant": "",
      "value": 0.538,
      "valueLabel": "0.538",
      "display": "0.538",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "5 GPT-5.4 (2026-03-05) OpenAI 0.538",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.5375",
          "quote": "[\"GPT-5.4 (2026-03-05)\", \"Mean win rate\": 0.5375]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-118"
    },
    {
      "id": 119,
      "benchmark": "medhelm",
      "metric": null,
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini 2.5 Pro",
      "label": null,
      "lab": "google",
      "variant": "",
      "value": 0.529,
      "valueLabel": "0.529",
      "display": "0.529",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "6 Gemini 2.5 Pro (05-06 preview) Google 0.529",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.5291666666666667",
          "quote": "[\"Gemini 2.5 Pro (05-06 preview)\", \"Mean win rate\": 0.5291666666666667]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-119"
    },
    {
      "id": 120,
      "benchmark": "medhelm",
      "metric": null,
      "model": "deepseek-r1",
      "modelKind": "model",
      "name": "DeepSeek R1",
      "label": null,
      "lab": "deepseek",
      "variant": "",
      "value": 0.485,
      "valueLabel": "0.485",
      "display": "0.485",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "7 DeepSeek R1 DeepSeek 0.485",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.48541666666666666",
          "quote": "[\"DeepSeek R1\", \"Mean win rate\": 0.48541666666666666]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-120"
    },
    {
      "id": 121,
      "benchmark": "medhelm",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude 4.6 Opus",
      "label": "Claude 4.6 Opus",
      "lab": "anthropic",
      "variant": "",
      "value": 0.456,
      "valueLabel": "0.456",
      "display": "0.456",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "8 Claude 4.6 Opus Anthropic 0.456",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.45625",
          "quote": "[\"Claude 4.6 Opus\", \"Mean win rate\": 0.45625]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-121"
    },
    {
      "id": 122,
      "benchmark": "medhelm",
      "metric": null,
      "model": "claude-3.7-sonnet",
      "modelKind": "model",
      "name": "Claude 3.7 Sonnet",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 0.45,
      "valueLabel": "0.450",
      "display": "0.45",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "9 Claude 3.7 Sonnet (20250219) Anthropic 0.45",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.45",
          "quote": "[\"Claude 3.7 Sonnet (20250219)\", \"Mean win rate\": 0.45]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-122"
    },
    {
      "id": 123,
      "benchmark": "medhelm",
      "metric": null,
      "model": "gemini-2.0-flash",
      "modelKind": "model",
      "name": "Gemini 2.0 Flash",
      "label": null,
      "lab": "google",
      "variant": "",
      "value": 0.342,
      "valueLabel": "0.342",
      "display": "0.342",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 10,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 18,
      "sourceUrl": "https://medhelm.org/",
      "quote": "10 Gemini 2.0 Flash Google 0.342",
      "locator": "medhelm.org home, 'Current leaders  Mean win rate  v5.0.0' table ('10 of 11 models · Updated 14 May 2026')",
      "corroborating": [
        {
          "source": 83,
          "role": "corroborating",
          "scoreDisplay": "0.3416666666666667",
          "quote": "[\"Gemini 2.0 Flash\", \"Mean win rate\": 0.3416666666666667]",
          "locator": "releases/v5.0.0/groups/medhelm_scenarios.json, table 'Accuracy', column 'Mean win rate'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/medhelm#r-123"
    },
    {
      "id": 1817,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "lisa-2.5",
      "modelKind": "product",
      "name": "LiSA 2.5",
      "label": null,
      "lab": "amboss",
      "variant": "First Do NOHARM v2 overall; preview; RAG clinical product; run date unpublished",
      "value": 86.2,
      "valueLabel": "86.2",
      "display": "86.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 17,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 1293,
      "sourceUrl": "https://www.arise-ai.org/mast/technical",
      "quote": "First Do NOHARM v2 overall metric across 19 models\n1LiSA 2.5RAGAMBOSS\n86.2%",
      "locator": "First Do NOHARM v2, overall leaderboard; LiSA 2.5 row; displayed 2026-09-30.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-1817"
    },
    {
      "id": 1818,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "doximity-ask-6.1",
      "modelKind": "product",
      "name": "Doximity Ask 6.1",
      "label": null,
      "lab": "doximity",
      "variant": "First Do NOHARM v2 overall; preview; RAG clinical product; run date unpublished",
      "value": 84.5,
      "valueLabel": "84.5",
      "display": "84.5%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 17,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 1293,
      "sourceUrl": "https://www.arise-ai.org/mast/technical",
      "quote": "First Do NOHARM v2 overall metric across 19 models\n2Doximity Ask 6.1RAGDoximity\n84.5%",
      "locator": "First Do NOHARM v2, overall leaderboard; Doximity Ask 6.1 row; displayed 2026-09-30.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-1818"
    },
    {
      "id": 1819,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "openevidence",
      "modelKind": "product",
      "name": "OpenEvidence",
      "label": null,
      "lab": "openevidence",
      "variant": "First Do NOHARM v2 overall; preview; RAG clinical product; run date unpublished",
      "value": 80,
      "valueLabel": "80.0",
      "display": "80.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 17,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 1293,
      "sourceUrl": "https://www.arise-ai.org/mast/technical",
      "quote": "First Do NOHARM v2 overall metric across 19 models\n3OpenEvidenceRAGOpenEvidence\n80.0%",
      "locator": "First Do NOHARM v2, overall leaderboard; OpenEvidence row; displayed 2026-09-30.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-1819"
    },
    {
      "id": 1820,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "glass-5.6-max",
      "modelKind": "product",
      "name": "Glass 5.6 Max",
      "label": null,
      "lab": "glass-health",
      "variant": "First Do NOHARM v2 overall; preview; RAG clinical product; run date unpublished",
      "value": 79.7,
      "valueLabel": "79.7",
      "display": "79.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 17,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 1293,
      "sourceUrl": "https://www.arise-ai.org/mast/technical",
      "quote": "First Do NOHARM v2 overall metric across 19 models\n4Glass 5.6 MaxRAGGlass Health\n79.7%",
      "locator": "First Do NOHARM v2, overall leaderboard; Glass 5.6 Max row; displayed 2026-09-30.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-1820"
    },
    {
      "id": 288,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "muse-spark-1.1",
      "modelKind": "model",
      "name": "Muse Spark 1.1",
      "label": null,
      "lab": "meta",
      "variant": "",
      "value": 79.7,
      "valueLabel": "79.7",
      "display": "79.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "5Muse Spark 1.1Meta\n79.7%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-288"
    },
    {
      "id": 124,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "claude-opus-5",
      "modelKind": "model",
      "name": "Claude Opus 5",
      "label": null,
      "lab": "anthropic",
      "variant": "v2 run on ARISE; 19 models on the board",
      "value": 74.6,
      "valueLabel": "74.6",
      "display": "74.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "6Claude Opus 5Anthropic\n74.6%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view), plus Model Leaderboard SAFETY column",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-124"
    },
    {
      "id": 125,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "kimi-k3",
      "modelKind": "model",
      "name": "Kimi K3",
      "label": null,
      "lab": "moonshot",
      "variant": "",
      "value": 74,
      "valueLabel": "74.0",
      "display": "74.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "7Kimi K3OSSMoonshot AI\n74.0%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view), plus Model Leaderboard SAFETY column",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-125"
    },
    {
      "id": 126,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "gpt-5.6-sol",
      "modelKind": "model",
      "name": "GPT-5.6 Sol",
      "label": null,
      "lab": "openai",
      "variant": "",
      "value": 70.1,
      "valueLabel": "70.1",
      "display": "70.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "8GPT-5.6 SolOpenAI\n70.1%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view), plus Model Leaderboard SAFETY column",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-126"
    },
    {
      "id": 127,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "gpt-5.5",
      "modelKind": "model",
      "name": "GPT-5.5",
      "label": null,
      "lab": "openai",
      "variant": "",
      "value": 70,
      "valueLabel": "70.0",
      "display": "70.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "9GPT-5.5OpenAI\n70.0%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view), plus Model Leaderboard SAFETY column",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-127"
    },
    {
      "id": 294,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "gpt-5",
      "modelKind": "model",
      "name": "GPT-5",
      "label": null,
      "lab": "openai",
      "variant": "from the Model Leaderboard SAFETY column (NOHARM v2 F1 weighted, shown with CI); not in the Latest Flagships ranking",
      "value": 68.6,
      "valueLabel": "68.6",
      "display": "68.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "10   GPT-5                 72.6%±2.3   68.6%±4.5   80.3%±4.4   30.1%±9.0   44.2%±2.5   45.4%±1.3    73.1%±3.9    73.7%±2.7    46.6%±0.0",
      "locator": "arise-ai.org/mast/technical, Model Leaderboard (Top 10 shown), row 10, SAFETY column",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-294"
    },
    {
      "id": 289,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "claude-fable-5",
      "modelKind": "model",
      "name": "Claude Fable 5",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 65,
      "valueLabel": "65.0",
      "display": "65.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "10Claude Fable 5Anthropic\n65.0%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-289"
    },
    {
      "id": 128,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini 3.1 Pro",
      "label": null,
      "lab": "google",
      "variant": "",
      "value": 62.6,
      "valueLabel": "62.6",
      "display": "62.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "11Gemini 3.1 ProGoogle\n62.6%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view), plus Model Leaderboard SAFETY column",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-128"
    },
    {
      "id": 290,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini 2.5 Pro",
      "label": null,
      "lab": "google",
      "variant": "",
      "value": 61.9,
      "valueLabel": "61.9",
      "display": "61.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "12Gemini 2.5 ProGoogle\n61.9%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-290"
    },
    {
      "id": 291,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "qwen3.5-397b-a17b",
      "modelKind": "model",
      "name": "Qwen3.5 397B A17B",
      "label": null,
      "lab": "alibaba",
      "variant": "",
      "value": 61.1,
      "valueLabel": "61.1",
      "display": "61.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "13Qwen3.5 397B A17BOSSAlibaba\n61.1%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-291"
    },
    {
      "id": 292,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "kimi-k2.6",
      "modelKind": "model",
      "name": "Kimi K2.6",
      "label": null,
      "lab": "moonshot",
      "variant": "",
      "value": 59.1,
      "valueLabel": "59.1",
      "display": "59.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "14Kimi K2.6OSSMoonshot AI\n59.1%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-292"
    },
    {
      "id": 1821,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "glm-5.1",
      "modelKind": "model",
      "name": "GLM 5.1",
      "label": null,
      "lab": "zhipu",
      "variant": "First Do NOHARM v2 overall; preview; open-weight model; run date unpublished",
      "value": 57.9,
      "valueLabel": "57.9",
      "display": "57.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 17,
      "measured": "2026-09",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 1293,
      "sourceUrl": "https://www.arise-ai.org/mast/technical",
      "quote": "First Do NOHARM v2 overall metric across 19 models\n15GLM 5.1OSSZ.ai\n57.9%",
      "locator": "First Do NOHARM v2, overall leaderboard; GLM 5.1 row; displayed 2026-09-30.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-1821"
    },
    {
      "id": 293,
      "benchmark": "first-do-noharm",
      "metric": null,
      "model": "deepseek-r1",
      "modelKind": "model",
      "name": "DeepSeek R1",
      "label": null,
      "lab": "deepseek",
      "variant": "",
      "value": 55.8,
      "valueLabel": "55.8",
      "display": "55.8%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 17,
      "measured": "2026-08",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 19,
      "sourceUrl": "https://arise-ai.org/mast/technical",
      "quote": "16DeepSeek R1OSSDeepSeek\n55.8%",
      "locator": "arise-ai.org/mast/technical, 'First Do NOHARM v2 overall metric across 19 models' ranking (Latest Flagships view)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/first-do-noharm#r-293"
    },
    {
      "id": 1830,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-opus-5.5",
      "modelKind": "model",
      "name": "Claude Opus 5.5 (max)",
      "label": "Claude Opus 5.5 (max)",
      "lab": "anthropic",
      "variant": "Anthropic harness; 100 tasks; pass@1; max effort; Opus 5 rubric grader; safety classifiers enabled",
      "value": 68.4,
      "valueLabel": "68.4",
      "display": "68.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 21,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "PhysicianBench is a public benchmark of 100 physician tasks carried out in an EHR. At max effort, Claude Sonnet 5.5 passes 63.2% of attempts, well above Claude Sonnet 5 (37.4%), level with Claude Fable 5.1 (61.0%), about 6 points above Claude Opus 5 (57.6%) and about 5 points below Claude Opus 5.5 (68.4%).",
      "locator": "pp. 138–139, Section 8.15.3; PhysicianBench pass@1, Claude Opus 5.5 (max).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1830"
    },
    {
      "id": 1831,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-sonnet-5.5",
      "modelKind": "model",
      "name": "Claude Sonnet 5.5 (max)",
      "label": "Claude Sonnet 5.5 (max)",
      "lab": "anthropic",
      "variant": "Anthropic harness; 100 tasks; pass@1; max effort; Opus 5 rubric grader; safety classifiers enabled",
      "value": 63.2,
      "valueLabel": "63.2",
      "display": "63.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 21,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "PhysicianBench is a public benchmark of 100 physician tasks carried out in an EHR. At max effort, Claude Sonnet 5.5 passes 63.2% of attempts, well above Claude Sonnet 5 (37.4%), level with Claude Fable 5.1 (61.0%), about 6 points above Claude Opus 5 (57.6%) and about 5 points below Claude Opus 5.5 (68.4%).",
      "locator": "pp. 138–139, Section 8.15.3; PhysicianBench pass@1, Claude Sonnet 5.5 (max).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1831"
    },
    {
      "id": 1832,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-fable-5.1",
      "modelKind": "model",
      "name": "Claude Fable 5.1 (max)",
      "label": "Claude Fable 5.1 (max)",
      "lab": "anthropic",
      "variant": "Anthropic harness; 100 tasks; pass@1; max effort; Opus 5 rubric grader; safety classifiers enabled",
      "value": 61,
      "valueLabel": "61.0",
      "display": "61.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 21,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "PhysicianBench is a public benchmark of 100 physician tasks carried out in an EHR. At max effort, Claude Sonnet 5.5 passes 63.2% of attempts, well above Claude Sonnet 5 (37.4%), level with Claude Fable 5.1 (61.0%), about 6 points above Claude Opus 5 (57.6%) and about 5 points below Claude Opus 5.5 (68.4%).",
      "locator": "pp. 138–139, Section 8.15.3; PhysicianBench pass@1, Claude Fable 5.1 (max).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1832"
    },
    {
      "id": 1833,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-opus-5",
      "modelKind": "model",
      "name": "Claude Opus 5 (max)",
      "label": "Claude Opus 5 (max)",
      "lab": "anthropic",
      "variant": "Anthropic harness; 100 tasks; pass@1; max effort; Opus 5 rubric grader; safety classifiers enabled",
      "value": 57.6,
      "valueLabel": "57.6",
      "display": "57.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 21,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "PhysicianBench is a public benchmark of 100 physician tasks carried out in an EHR. At max effort, Claude Sonnet 5.5 passes 63.2% of attempts, well above Claude Sonnet 5 (37.4%), level with Claude Fable 5.1 (61.0%), about 6 points above Claude Opus 5 (57.6%) and about 5 points below Claude Opus 5.5 (68.4%).",
      "locator": "pp. 138–139, Section 8.15.3; PhysicianBench pass@1, Claude Opus 5 (max).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1833"
    },
    {
      "id": 1834,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-sonnet-5.5",
      "modelKind": "model",
      "name": "Claude Sonnet 5.5 (xhigh)",
      "label": "Claude Sonnet 5.5 (xhigh)",
      "lab": "anthropic",
      "variant": "Anthropic harness; 100 tasks; pass@1; xhigh effort; Opus 5 rubric grader; safety classifiers enabled",
      "value": 56.4,
      "valueLabel": "56.4",
      "display": "56.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 21,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "Sonnet 5.5 | PhysicianBench (pass@1) | xhigh 56.4%",
      "locator": "p. 138, Figure 8.15.B, right panel PhysicianBench (pass@1); orange Sonnet 5.5 xhigh label (visually read printed labels).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1834"
    },
    {
      "id": 1835,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-sonnet-5.5",
      "modelKind": "model",
      "name": "Claude Sonnet 5.5 (high)",
      "label": "Claude Sonnet 5.5 (high)",
      "lab": "anthropic",
      "variant": "Anthropic harness; 100 tasks; pass@1; high effort; Opus 5 rubric grader; safety classifiers enabled",
      "value": 47.6,
      "valueLabel": "47.6",
      "display": "47.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 21,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "Sonnet 5.5 | PhysicianBench (pass@1) | high 47.6%",
      "locator": "p. 138, Figure 8.15.B, right panel PhysicianBench (pass@1); orange Sonnet 5.5 high label (visually read printed labels).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1835"
    },
    {
      "id": 167,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "gpt-5.5",
      "modelKind": "model",
      "name": "GPT-5.5",
      "label": null,
      "lab": "openai",
      "variant": "pass@1; Pass^3 28.0",
      "value": 46.3,
      "valueLabel": "46.3",
      "display": "46.3 ± 1.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "GPT-5.5 46.3 ± 1.2 57.4 28.0 41.9",
      "locator": "p. 8, Table 2 (columns Pass@1, Pass@3, Pass^3, #Turns)",
      "corroborating": [
        {
          "source": 26,
          "role": "corroborating",
          "scoreDisplay": "46.3 ± 1.2",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-167"
    },
    {
      "id": 1836,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-sonnet-5",
      "modelKind": "model",
      "name": "Claude Sonnet 5 (max)",
      "label": "Claude Sonnet 5 (max)",
      "lab": "anthropic",
      "variant": "Anthropic harness; 100 tasks; pass@1; max effort; Opus 5 rubric grader; safety classifiers enabled",
      "value": 37.4,
      "valueLabel": "37.4",
      "display": "37.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 21,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "PhysicianBench is a public benchmark of 100 physician tasks carried out in an EHR. At max effort, Claude Sonnet 5.5 passes 63.2% of attempts, well above Claude Sonnet 5 (37.4%), level with Claude Fable 5.1 (61.0%), about 6 points above Claude Opus 5 (57.6%) and about 5 points below Claude Opus 5.5 (68.4%).",
      "locator": "pp. 138–139, Section 8.15.3; PhysicianBench pass@1, Claude Sonnet 5 (max).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1836"
    },
    {
      "id": 168,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude Opus 4.6",
      "label": null,
      "lab": "anthropic",
      "variant": "Pass^3 18.0",
      "value": 31.7,
      "valueLabel": "31.7",
      "display": "31.7 ± 2.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Claude Opus 4.6 31.7 ± 2.3 41.5 18.0 25.2",
      "locator": "p. 8, Table 2 (columns Pass@1, Pass@3, Pass^3, #Turns)",
      "corroborating": [
        {
          "source": 26,
          "role": "corroborating",
          "scoreDisplay": "31.7 ± 2.3",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-168"
    },
    {
      "id": 1837,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-sonnet-5.5",
      "modelKind": "model",
      "name": "Claude Sonnet 5.5 (medium)",
      "label": "Claude Sonnet 5.5 (medium)",
      "lab": "anthropic",
      "variant": "Anthropic harness; 100 tasks; pass@1; medium effort; Opus 5 rubric grader; safety classifiers enabled",
      "value": 30,
      "valueLabel": "30.0",
      "display": "30.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 21,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "Sonnet 5.5 | PhysicianBench (pass@1) | medium 30.0%",
      "locator": "p. 138, Figure 8.15.B, right panel PhysicianBench (pass@1); orange Sonnet 5.5 medium label (visually read printed labels).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1837"
    },
    {
      "id": 169,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-opus-4.7",
      "modelKind": "model",
      "name": "Claude Opus 4.7",
      "label": null,
      "lab": "anthropic",
      "variant": "Pass^3 18.0",
      "value": 29.3,
      "valueLabel": "29.3",
      "display": "29.3 ± 2.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Claude Opus 4.7 29.3 ± 2.5 37.9 18.0 16.2",
      "locator": "p. 8, Table 2 (columns Pass@1, Pass@3, Pass^3, #Turns)",
      "corroborating": [
        {
          "source": 26,
          "role": "corroborating",
          "scoreDisplay": "29.3 ± 2.5",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-169"
    },
    {
      "id": 170,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT-5.4",
      "label": null,
      "lab": "openai",
      "variant": "",
      "value": 27.7,
      "valueLabel": "27.7",
      "display": "27.7 ± 1.5",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "GPT-5.4 27.7 ± 1.5 37.7 13.0 39.8",
      "locator": "p. 8, Table 2 (columns Pass@1, Pass@3, Pass^3, #Turns)",
      "corroborating": [
        {
          "source": 26,
          "role": "corroborating",
          "scoreDisplay": "27.7 ± 1.5",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-170"
    },
    {
      "id": 1838,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-sonnet-5.5",
      "modelKind": "model",
      "name": "Claude Sonnet 5.5 (low)",
      "label": "Claude Sonnet 5.5 (low)",
      "lab": "anthropic",
      "variant": "Anthropic harness; 100 tasks; pass@1; low effort; Opus 5 rubric grader; safety classifiers enabled",
      "value": 27.2,
      "valueLabel": "27.2",
      "display": "27.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 21,
      "measured": "2026-09",
      "reportedBy": "vendor",
      "confidence": "verified",
      "source": 1287,
      "sourceUrl": "https://www.anthropic.com/claude-sonnet-5-5-system-card",
      "quote": "Sonnet 5.5 | PhysicianBench (pass@1) | low 27.2%",
      "locator": "p. 138, Figure 8.15.B, right panel PhysicianBench (pass@1); orange Sonnet 5.5 low label (visually read printed labels).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1838"
    },
    {
      "id": 171,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude Sonnet 4.6",
      "label": null,
      "lab": "anthropic",
      "variant": "",
      "value": 23,
      "valueLabel": "23.0",
      "display": "23.0 ± 2.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Claude Sonnet 4.6 23.0 ± 2.6 33.2 9.0 22.3",
      "locator": "p. 8, Table 2 (columns Pass@1, Pass@3, Pass^3, #Turns)",
      "corroborating": [
        {
          "source": 26,
          "role": "corroborating",
          "scoreDisplay": "23.0 ± 2.6",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-171"
    },
    {
      "id": 1839,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "DeepSeek V4-Pro",
      "label": "DeepSeek V4-Pro",
      "lab": "deepseek",
      "variant": "Pass@1 over 3 runs; Pass^3 6.0; shared FHIR tool harness; up to 100 turns; high reasoning when supported",
      "value": 18.7,
      "valueLabel": "18.7",
      "display": "18.7 ± 2.9",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Model | Pass@1 | Pass@3 | Pass^3 | #Turns\nDeepSeek V4-Pro | 18.7 ± 2.9 | 27.9 | 6.0 | 35.3",
      "locator": "arXiv HTML 2605.02240v1, Section 5.2, Table 2; DeepSeek V4-Pro row, Pass@1 column (PDF p. 8).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1839"
    },
    {
      "id": 172,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "kimi-k2.6",
      "modelKind": "model",
      "name": "Kimi-K2.6",
      "label": "Kimi-K2.6",
      "lab": "moonshot",
      "variant": "open source",
      "value": 17,
      "valueLabel": "17.0",
      "display": "17.0 ± 2.6",
      "lo": null,
      "hi": null,
      "rankOnBoard": 16,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Kimi-K2.6 17.0 ± 2.6 26.3 5.0 42.4",
      "locator": "p. 8, Table 2 (columns Pass@1, Pass@3, Pass^3, #Turns)",
      "corroborating": [
        {
          "source": 26,
          "role": "corroborating",
          "scoreDisplay": "17.0 ± 2.6",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-172"
    },
    {
      "id": 1840,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "mimo-v2.5-pro",
      "modelKind": "model",
      "name": "MiMo-v2.5-Pro",
      "label": "MiMo-v2.5-Pro",
      "lab": "xiaomi",
      "variant": "Pass@1 over 3 runs; Pass^3 6.0; shared FHIR tool harness; up to 100 turns; high reasoning when supported",
      "value": 16.7,
      "valueLabel": "16.7",
      "display": "16.7 ± 4.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Model | Pass@1 | Pass@3 | Pass^3 | #Turns\nMiMo-v2.5-Pro | 16.7 ± 4.0 | 23.6 | 6.0 | 29.5",
      "locator": "arXiv HTML 2605.02240v1, Section 5.2, Table 2; MiMo-v2.5-Pro row, Pass@1 column (PDF p. 8).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1840"
    },
    {
      "id": 173,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "qwen3.6-plus",
      "modelKind": "model",
      "name": "Qwen3.6-Plus",
      "label": "Qwen3.6-Plus",
      "lab": "alibaba",
      "variant": "",
      "value": 13.7,
      "valueLabel": "13.7",
      "display": "13.7 ± 4.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Qwen3.6-Plus 13.7 ± 4.0 22.6 2.0 28.0",
      "locator": "p. 8, Table 2 (columns Pass@1, Pass@3, Pass^3, #Turns)",
      "corroborating": [
        {
          "source": 26,
          "role": "corroborating",
          "scoreDisplay": "13.7 ± 4.0",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-173"
    },
    {
      "id": 1841,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "minimax-m2.7",
      "modelKind": "model",
      "name": "MiniMax M2.7",
      "label": "MiniMax M2.7",
      "lab": "minimax",
      "variant": "Pass@1 over 3 runs; Pass^3 1.0; shared FHIR tool harness; up to 100 turns; high reasoning when supported",
      "value": 8.7,
      "valueLabel": "8.7",
      "display": "8.7 ± 1.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Model | Pass@1 | Pass@3 | Pass^3 | #Turns\nMiniMax M2.7 | 8.7 ± 1.2 | 15.9 | 1.0 | 29.7",
      "locator": "arXiv HTML 2605.02240v1, Section 5.2, Table 2; MiniMax M2.7 row, Pass@1 column (PDF p. 8).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-1841"
    },
    {
      "id": 174,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini Pro 3.1",
      "label": "Gemini Pro 3.1",
      "lab": "google",
      "variant": "",
      "value": 6,
      "valueLabel": "6.0",
      "display": "6.0 ± 1.0",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Gemini Pro 3.1 6.0 ± 1.0 9.3 3.0 30.4",
      "locator": "p. 8, Table 2 (columns Pass@1, Pass@3, Pass^3, #Turns)",
      "corroborating": [
        {
          "source": 26,
          "role": "corroborating",
          "scoreDisplay": "6.0 ± 1.0",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-174"
    },
    {
      "id": 295,
      "benchmark": "physicianbench",
      "metric": null,
      "model": "grok-4.20",
      "modelKind": "model",
      "name": "Grok-4.20",
      "label": "Grok-4.20",
      "lab": "xai",
      "variant": "",
      "value": 5.3,
      "valueLabel": "5.3",
      "display": "5.3 ± 3.2",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 21,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 94,
      "sourceUrl": "https://arxiv.org/pdf/2605.02240",
      "quote": "Grok-4.20 5.3 ± 3.2 9.7 1.0 16.7",
      "locator": "p. 8, Table 2 (Proprietary Models block)",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/physicianbench#r-295"
    },
    {
      "id": 175,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT-5.4 (high reasoning)",
      "label": "GPT-5.4 (high reasoning)",
      "lab": "openai",
      "variant": "average over 12 intent columns; run as human-validation configuration, not in the headline 12-model table",
      "value": 0.65,
      "valueLabel": "0.650",
      "display": "0.65",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "GPT-5.4 (high) 0.85 0.36 0.78 0.34 0.8 0.37 0.93 0.76 0.91 0.49 0.84 0.36 0.65",
      "locator": "p. 15, Table 10 (Strong commercial model results), Avg. column",
      "corroborating": [
        {
          "source": 27,
          "role": "corroborating",
          "scoreDisplay": "0.65",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-175"
    },
    {
      "id": 176,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini 3.1 Pro",
      "label": null,
      "lab": "google",
      "variant": "validation configuration",
      "value": 0.63,
      "valueLabel": "0.630",
      "display": "0.63",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Gemini 3.1 Pro 0.87 0.32 0.67 0.38 0.84 0.37 0.92 0.63 0.92 0.44 0.83 0.34 0.63",
      "locator": "p. 15, Table 10 (Strong commercial model results), Avg. column",
      "corroborating": [
        {
          "source": 27,
          "role": "corroborating",
          "scoreDisplay": "0.63",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-176"
    },
    {
      "id": 177,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "kimi-k2.5",
      "modelKind": "model",
      "name": "Kimi-K2.5",
      "label": "Kimi-K2.5",
      "lab": "moonshot",
      "variant": "headline 12-model evaluation, top open-weight",
      "value": 0.62,
      "valueLabel": "0.620",
      "display": "0.62",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Kimi-K2.5 0.89 0.34 0.8 0.27 0.73 0.35 0.92 0.72 0.89 0.42 0.84 0.29 0.62",
      "locator": "p. 6, Table 3 (Evaluation Results on the EHR-Complex Test Set), Avg. column",
      "corroborating": [
        {
          "source": 27,
          "role": "corroborating",
          "scoreDisplay": "0.62",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-177"
    },
    {
      "id": 178,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "qwen3.5-397b-a17b",
      "modelKind": "model",
      "name": "Qwen3.5-397B",
      "label": "Qwen3.5-397B",
      "lab": "alibaba",
      "variant": "headline evaluation",
      "value": 0.62,
      "valueLabel": "0.620",
      "display": "0.62",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Qwen3.5-397B 0.88 0.39 0.72 0.3 0.8 0.38 0.91 0.63 0.91 0.45 0.78 0.32 0.62",
      "locator": "p. 6, Table 3 (Evaluation Results on the EHR-Complex Test Set), Avg. column",
      "corroborating": [
        {
          "source": 27,
          "role": "corroborating",
          "scoreDisplay": "0.62",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-178"
    },
    {
      "id": 1842,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "deepseek-v3.2-exp",
      "modelKind": "model",
      "name": "DeepSeek-V3.2-Exp",
      "label": "DeepSeek-V3.2-Exp",
      "lab": "deepseek",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.59,
      "valueLabel": "0.590",
      "display": "0.59",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nDeepSeek-V3.2-Exp | 0.83 | 0.36 | 0.75 | 0.27 | 0.7 | 0.3 | 0.88 | 0.65 | 0.89 | 0.44 | 0.77 | 0.26 | 0.59",
      "locator": "arXiv HTML 2606.23301v1, Table 3, DeepSeek-V3.2-Exp row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1842"
    },
    {
      "id": 179,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT-5.4 (low reasoning)",
      "label": "GPT-5.4 (low reasoning)",
      "lab": "openai",
      "variant": "validation configuration",
      "value": 0.58,
      "valueLabel": "0.580",
      "display": "0.58",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "GPT-5.4 (low) 0.81 0.32 0.65 0.26 0.73 0.31 0.88 0.66 0.86 0.43 0.8 0.29 0.58",
      "locator": "p. 15, Table 10 (Strong commercial model results), Avg. column",
      "corroborating": [
        {
          "source": 27,
          "role": "corroborating",
          "scoreDisplay": "0.58",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-179"
    },
    {
      "id": 1843,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "deepseek-v3.1",
      "modelKind": "model",
      "name": "DeepSeek-V3.1",
      "label": "DeepSeek-V3.1",
      "lab": "deepseek",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.56,
      "valueLabel": "0.560",
      "display": "0.56",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nDeepSeek-V3.1 | 0.81 | 0.33 | 0.7 | 0.27 | 0.65 | 0.24 | 0.89 | 0.68 | 0.82 | 0.39 | 0.72 | 0.21 | 0.56",
      "locator": "arXiv HTML 2606.23301v1, Table 3, DeepSeek-V3.1 row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1843"
    },
    {
      "id": 1844,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "qwen3-32b-sft",
      "modelKind": "model",
      "name": "Qwen3-32B-SFT",
      "label": "Qwen3-32B-SFT",
      "lab": "ant-group",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns; fine-tuned on trajectories from EHR-Complex training set",
      "value": 0.55,
      "valueLabel": "0.550",
      "display": "0.55",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nQwen3-32B-SFT | 0.83 | 0.36 | 0.55 | 0.29 | 0.72 | 0.3 | 0.86 | 0.55 | 0.8 | 0.34 | 0.69 | 0.26 | 0.55",
      "locator": "arXiv HTML 2606.23301v1, Table 3, Qwen3-32B-SFT row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1844"
    },
    {
      "id": 1845,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "qwen3-235b",
      "modelKind": "model",
      "name": "Qwen3-235B",
      "label": "Qwen3-235B",
      "lab": "alibaba",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.53,
      "valueLabel": "0.530",
      "display": "0.53",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nQwen3-235B | 0.75 | 0.27 | 0.65 | 0.26 | 0.72 | 0.25 | 0.91 | 0.55 | 0.8 | 0.36 | 0.7 | 0.21 | 0.53",
      "locator": "arXiv HTML 2606.23301v1, Table 3, Qwen3-235B row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1845"
    },
    {
      "id": 1846,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "gpt-4.1-mini",
      "modelKind": "model",
      "name": "GPT-4.1 mini",
      "label": "GPT-4.1 mini",
      "lab": "openai",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.49,
      "valueLabel": "0.490",
      "display": "0.49",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nGPT-4.1 mini | 0.75 | 0.27 | 0.6 | 0.22 | 0.67 | 0.21 | 0.88 | 0.6 | 0.65 | 0.3 | 0.59 | 0.17 | 0.49",
      "locator": "arXiv HTML 2606.23301v1, Table 3, GPT-4.1 mini row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1846"
    },
    {
      "id": 1847,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "gpt-4.1",
      "modelKind": "model",
      "name": "GPT-4.1",
      "label": "GPT-4.1",
      "lab": "openai",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.47,
      "valueLabel": "0.470",
      "display": "0.47",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nGPT-4.1 | 0.76 | 0.21 | 0.55 | 0.16 | 0.59 | 0.17 | 0.89 | 0.5 | 0.72 | 0.26 | 0.63 | 0.18 | 0.47",
      "locator": "arXiv HTML 2606.23301v1, Table 3, GPT-4.1 row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1847"
    },
    {
      "id": 1848,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "qwen3-14b-sft",
      "modelKind": "model",
      "name": "Qwen3-14B-SFT",
      "label": "Qwen3-14B-SFT",
      "lab": "ant-group",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns; fine-tuned on trajectories from EHR-Complex training set",
      "value": 0.45,
      "valueLabel": "0.450",
      "display": "0.45",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nQwen3-14B-SFT | 0.69 | 0.22 | 0.43 | 0.15 | 0.6 | 0.19 | 0.84 | 0.51 | 0.74 | 0.22 | 0.63 | 0.18 | 0.45",
      "locator": "arXiv HTML 2606.23301v1, Table 3, Qwen3-14B-SFT row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1848"
    },
    {
      "id": 180,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude Sonnet 4.6",
      "label": null,
      "lab": "anthropic",
      "variant": "validation configuration",
      "value": 0.36,
      "valueLabel": "0.360",
      "display": "0.36",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Claude Sonnet 4.6 0.59 0.21 0.45 0.12 0.45 0.12 0.83 0.2 0.49 0.33 0.4 0.11 0.36",
      "locator": "p. 15, Table 10 (Strong commercial model results), Avg. column",
      "corroborating": [
        {
          "source": 27,
          "role": "corroborating",
          "scoreDisplay": "0.36",
          "quote": null,
          "locator": "arXiv abs page (landing page for the PDF)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-180"
    },
    {
      "id": 1849,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "qwen3-32b",
      "modelKind": "model",
      "name": "Qwen3-32B",
      "label": "Qwen3-32B",
      "lab": "alibaba",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.36,
      "valueLabel": "0.360",
      "display": "0.36",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nQwen3-32B | 0.51 | 0.2 | 0.3 | 0.24 | 0.47 | 0.2 | 0.73 | 0.35 | 0.5 | 0.21 | 0.42 | 0.15 | 0.36",
      "locator": "arXiv HTML 2606.23301v1, Table 3, Qwen3-32B row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1849"
    },
    {
      "id": 1851,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "gemini-2.5-pro",
      "modelKind": "model",
      "name": "Gemini 2.5 Pro",
      "label": "Gemini 2.5 Pro",
      "lab": "google",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.31,
      "valueLabel": "0.310",
      "display": "0.31",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nGemini 2.5 Pro | 0.44 | 0.19 | 0.18 | 0.2 | 0.43 | 0.15 | 0.59 | 0.38 | 0.38 | 0.27 | 0.34 | 0.15 | 0.31",
      "locator": "arXiv HTML 2606.23301v1, Table 3, Gemini 2.5 Pro row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1851"
    },
    {
      "id": 1850,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "gpt-4o",
      "modelKind": "model",
      "name": "GPT-4o",
      "label": "GPT-4o",
      "lab": "openai",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.31,
      "valueLabel": "0.310",
      "display": "0.31",
      "lo": null,
      "hi": null,
      "rankOnBoard": 15,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nGPT-4o | 0.52 | 0.1 | 0.45 | 0.26 | 0.33 | 0.07 | 0.53 | 0.33 | 0.46 | 0.19 | 0.38 | 0.08 | 0.31",
      "locator": "arXiv HTML 2606.23301v1, Table 3, GPT-4o row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1850"
    },
    {
      "id": 1852,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "qwen3-14b",
      "modelKind": "model",
      "name": "Qwen3-14B",
      "label": "Qwen3-14B",
      "lab": "alibaba",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.3,
      "valueLabel": "0.300",
      "display": "0.3",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nQwen3-14B | 0.44 | 0.15 | 0.21 | 0.18 | 0.43 | 0.15 | 0.63 | 0.33 | 0.4 | 0.19 | 0.39 | 0.1 | 0.3",
      "locator": "arXiv HTML 2606.23301v1, Table 3, Qwen3-14B row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1852"
    },
    {
      "id": 1853,
      "benchmark": "ehr-complex",
      "metric": null,
      "model": "qwen3-4b",
      "modelKind": "model",
      "name": "Qwen3-4B",
      "label": "Qwen3-4B",
      "lab": "alibaba",
      "variant": "Table 3; macro-average across 12 intent/scope columns; temperature 0; up to 50 SQL/Python interaction turns",
      "value": 0.16,
      "valueLabel": "0.160",
      "display": "0.16",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 18,
      "measured": "2026-06",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 109,
      "sourceUrl": "https://arxiv.org/pdf/2606.23301",
      "quote": "Model | Demographics | Vitals | Medications | Cost | Labs | Diagnoses | Avg.\nQwen3-4B | 0.24 | 0.07 | 0.28 | 0.11 | 0.18 | 0.01 | 0.48 | 0.12 | 0.17 | 0.06 | 0.16 | 0.03 | 0.16",
      "locator": "arXiv HTML 2606.23301v1, Table 3, Qwen3-4B row, final Avg. column (PDF p. 6).",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/ehr-complex#r-1853"
    },
    {
      "id": 129,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "claude-opus-5",
      "modelKind": "model",
      "name": "Claude Code (Opus 5)",
      "label": "Claude Code (Opus 5)",
      "lab": "anthropic",
      "variant": "$3.3/task; harness+model evaluated jointly",
      "value": 55,
      "valueLabel": "55",
      "display": "55%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "1 Claude Code (Opus 5) 55% $3.3",
      "locator": "Leaderboard table (homepage), rank 1, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "55%",
          "quote": "1 Claude Code (Opus 5) 55%",
          "locator": "Detailed results table, rank 1"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-129"
    },
    {
      "id": 130,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "gpt-5.6-sol",
      "modelKind": "model",
      "name": "Codex (GPT-5.6-sol)",
      "label": "Codex (GPT-5.6-sol)",
      "lab": "openai",
      "variant": "$5.2/task",
      "value": 45,
      "valueLabel": "45",
      "display": "45%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "2 Codex (GPT-5.6-sol) 45% $5.2",
      "locator": "Leaderboard table (homepage), rank 2, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "45%",
          "quote": "2 Codex (GPT-5.6-sol) 45%",
          "locator": "Detailed results table, rank 2"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-130"
    },
    {
      "id": 131,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "gpt-5.5",
      "modelKind": "model",
      "name": "Codex (GPT 5.5)",
      "label": "Codex (GPT 5.5)",
      "lab": "openai",
      "variant": "$2.8/task",
      "value": 42,
      "valueLabel": "42",
      "display": "42%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "3 Codex (GPT 5.5) 42% $2.8",
      "locator": "Leaderboard table (homepage), rank 3, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "42%",
          "quote": "3 Codex (GPT 5.5) 42%",
          "locator": "Detailed results table, rank 3"
        },
        {
          "source": 46,
          "role": "corroborating",
          "scoreDisplay": "42%",
          "quote": "Codex GPT-5.5 ... 42% $2.8 15 min",
          "locator": "p. 11, Figure 4 (pooled task success rate, ten agents)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-131"
    },
    {
      "id": 132,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "claude-opus-4.8",
      "modelKind": "model",
      "name": "Copilot (Opus 4.8)",
      "label": "Copilot (Opus 4.8)",
      "lab": "anthropic",
      "variant": "$3.1/task",
      "value": 36,
      "valueLabel": "36",
      "display": "36%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "4 Copilot (Opus 4.8) 36% $3.1",
      "locator": "Leaderboard table (homepage), rank 4, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "36%",
          "quote": "4 Copilot (Opus 4.8) 36%",
          "locator": "Detailed results table, rank 4"
        },
        {
          "source": 46,
          "role": "corroborating",
          "scoreDisplay": "36%",
          "quote": "Copilot Opus 4.8 ... 36% $3.1 18 min",
          "locator": "p. 11, Figure 4 (pooled task success rate, ten agents)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-132"
    },
    {
      "id": 133,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "gpt-5.5",
      "modelKind": "model",
      "name": "Copilot (GPT 5.5)",
      "label": "Copilot (GPT 5.5)",
      "lab": "openai",
      "variant": "$2.6/task",
      "value": 35,
      "valueLabel": "35",
      "display": "35%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "5 Copilot (GPT 5.5) 35% $2.6",
      "locator": "Leaderboard table (homepage), rank 5, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "35%",
          "quote": "5 Copilot (GPT 5.5) 35%",
          "locator": "Detailed results table, rank 5"
        },
        {
          "source": 46,
          "role": "corroborating",
          "scoreDisplay": "35%",
          "quote": "Copilot GPT-5.5 ... 35% $2.6 18 min",
          "locator": "p. 11, Figure 4 (pooled task success rate, ten agents)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-133"
    },
    {
      "id": 134,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "claude-opus-4.8",
      "modelKind": "model",
      "name": "Claude Code (Opus 4.8)",
      "label": "Claude Code (Opus 4.8)",
      "lab": "anthropic",
      "variant": "$4.0/task",
      "value": 32,
      "valueLabel": "32",
      "display": "32%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "6 Claude Code (Opus 4.8) 32% $4.0",
      "locator": "Leaderboard table (homepage), rank 6, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "32%",
          "quote": "6 Claude Code (Opus 4.8) 32%",
          "locator": "Detailed results table, rank 6"
        },
        {
          "source": 46,
          "role": "corroborating",
          "scoreDisplay": "32%",
          "quote": "Claude Code Opus 4.8 ... 32% $4.0 16 min",
          "locator": "p. 11, Figure 4 (pooled task success rate, ten agents)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-134"
    },
    {
      "id": 321,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "Codex (GPT 5.4)",
      "label": "Codex (GPT 5.4)",
      "lab": "openai",
      "variant": "$1.3/task",
      "value": 28,
      "valueLabel": "28",
      "display": "28%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "7 Codex (GPT 5.4) 28% $1.3",
      "locator": "Leaderboard table (homepage), rank 7, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "28%",
          "quote": "7 Codex (GPT 5.4) 28%",
          "locator": "Detailed results table, rank 7"
        },
        {
          "source": 46,
          "role": "corroborating",
          "scoreDisplay": "28%",
          "quote": "Codex GPT-5.4 ... 28% $1.3 18 min",
          "locator": "p. 11, Figure 4 (pooled task success rate, ten agents)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-321"
    },
    {
      "id": 322,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "claude-opus-4.7",
      "modelKind": "model",
      "name": "Claude Code (Opus 4.7)",
      "label": "Claude Code (Opus 4.7)",
      "lab": "anthropic",
      "variant": "$4.8/task",
      "value": 27,
      "valueLabel": "27",
      "display": "27%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 8,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "8 Claude Code (Opus 4.7) 27% $4.8",
      "locator": "Leaderboard table (homepage), rank 8, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "27%",
          "quote": "8 Claude Code (Opus 4.7) 27%",
          "locator": "Detailed results table, rank 8"
        },
        {
          "source": 46,
          "role": "corroborating",
          "scoreDisplay": "27%",
          "quote": "Claude Code Opus 4.7 ... 27% $4.8 16 min",
          "locator": "p. 11, Figure 4 (pooled task success rate, ten agents)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-322"
    },
    {
      "id": 1822,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "gpt-5.3-codex",
      "modelKind": "model",
      "name": "Codex (GPT 5.3)",
      "label": "Codex (GPT 5.3)",
      "lab": "openai",
      "variant": "$1.0/task; Codex harness; mean success across 3 attempts × 54 tasks",
      "value": 22,
      "valueLabel": "22",
      "display": "22%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "Agent | Success Rate | cost/task\nCodex (GPT 5.3)\n22%\n$1.0",
      "locator": "Homepage leaderboard, rank 9, Success Rate and cost/task; displayed 2026-09-30.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-1822"
    },
    {
      "id": 323,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude Code (Opus 4.6)",
      "label": "Claude Code (Opus 4.6)",
      "lab": "anthropic",
      "variant": "$4.1/task",
      "value": 19,
      "valueLabel": "19",
      "display": "19%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "10 Claude Code (Opus 4.6) 19% $4.1",
      "locator": "Leaderboard table (homepage), rank 10, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "19%",
          "quote": "10 Claude Code (Opus 4.6) 19%",
          "locator": "Detailed results table, rank 10"
        },
        {
          "source": 46,
          "role": "corroborating",
          "scoreDisplay": "19%",
          "quote": "Claude Code Opus 4.6 ... 19% $4.1 22 min",
          "locator": "p. 11, Figure 4 (pooled task success rate, ten agents)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-323"
    },
    {
      "id": 324,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "Claude Code (Sonnet 4.6)",
      "label": "Claude Code (Sonnet 4.6)",
      "lab": "anthropic",
      "variant": "$2.9/task",
      "value": 17,
      "valueLabel": "17",
      "display": "17%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "11 Claude Code (Sonnet 4.6) 17% $2.9",
      "locator": "Leaderboard table (homepage), rank 11, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "17%",
          "quote": "11 Claude Code (Sonnet 4.6) 17%",
          "locator": "Detailed results table, rank 11"
        },
        {
          "source": 46,
          "role": "corroborating",
          "scoreDisplay": "17%",
          "quote": "Claude Code Sonnet 4.6 ... 17% $2.9 24 min",
          "locator": "p. 11, Figure 4 (pooled task success rate, ten agents)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-324"
    },
    {
      "id": 325,
      "benchmark": "healthagentbench",
      "metric": null,
      "model": "gpt-5.4-mini",
      "modelKind": "model",
      "name": "Codex (GPT 5.4 Mini)",
      "label": "Codex (GPT 5.4 Mini)",
      "lab": "openai",
      "variant": "$0.6/task",
      "value": 16,
      "valueLabel": "16",
      "display": "16%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 12,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 20,
      "sourceUrl": "https://microsoft.github.io/HealthAgentBench/",
      "quote": "12 Codex (GPT 5.4 Mini) 16% $0.6",
      "locator": "Leaderboard table (homepage), rank 12, Success Rate column",
      "corroborating": [
        {
          "source": 64,
          "role": "corroborating",
          "scoreDisplay": "16%",
          "quote": "12 Codex (GPT 5.4 Mini) 16%",
          "locator": "Detailed results table, rank 12"
        },
        {
          "source": 46,
          "role": "corroborating",
          "scoreDisplay": "16%",
          "quote": "Codex GPT-5.4-mini ... 16% $0.6 16 min",
          "locator": "p. 11, Figure 4 (pooled task success rate, ten agents)"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthagentbench#r-325"
    },
    {
      "id": 135,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-opus-5",
      "modelKind": "model",
      "name": "erius + claude-opus-5",
      "label": "erius + claude-opus-5",
      "lab": "anthropic",
      "variant": "community-submitted harness config validated by automated workspace judge",
      "value": 54.7,
      "valueLabel": "54.7",
      "display": "54.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 43,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "01 | erius submitted by Michael Johnson (MJ) | claude-opus-5 | Proprietary | 54.7% | 72.0% | 36.0% | 56.0% | 2026-07-26",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 01, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-26; accessed 2026-09-30.",
      "corroborating": [
        {
          "source": 1387,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-opus-5",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-135"
    },
    {
      "id": 137,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-opus-5",
      "modelKind": "model",
      "name": "claude-code + claude-opus-5",
      "label": "claude-code + claude-opus-5",
      "lab": "anthropic",
      "variant": "",
      "value": 37.3,
      "valueLabel": "37.3",
      "display": "37.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "03 | claude-code | claude-opus-5 | Proprietary | 37.3% | 20.0% | 32.0% | 60.0% | 2026-07-24",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 03, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-24; accessed 2026-09-30. Linked submission provenance: run 2026-07-24T19:08:02Z to 2026-07-24T23:22:36Z; submitted_at 2026-08-12T20:20:00Z.",
      "corroborating": [
        {
          "source": 1389,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-opus-5",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-137"
    },
    {
      "id": 136,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-opus-4.8",
      "modelKind": "model",
      "name": "erius + claude-opus-4-8",
      "label": "erius + claude-opus-4-8",
      "lab": "anthropic",
      "variant": "",
      "value": 37.3,
      "valueLabel": "37.3",
      "display": "37.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 43,
      "measured": "2026-08",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "02 | erius submitted by Michael Johnson (MJ) | claude-opus-4-8 | Proprietary | 37.3% | 40.0% | 16.0% | 56.0% | 2026-06-05",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 02, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-06-05; accessed 2026-09-30.",
      "corroborating": [
        {
          "source": 1388,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-opus-4-8",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-136"
    },
    {
      "id": 138,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-opus-4.8",
      "modelKind": "model",
      "name": "claude-code + claude-opus-4-8",
      "label": "claude-code + claude-opus-4-8",
      "lab": "anthropic",
      "variant": "",
      "value": 33.3,
      "valueLabel": "33.3",
      "display": "33.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "04 | claude-code | claude-opus-4-8 | Proprietary | 33.3% | 32.0% | 28.0% | 40.0% | 2026-05-28",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 04, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-28; accessed 2026-09-30. Linked submission provenance: run 2026-05-28T17:19:15Z to 2026-05-28T20:48:59Z; submitted_at 2026-05-28T20:53:26Z.",
      "corroborating": [
        {
          "source": 1390,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-opus-4-8",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-138"
    },
    {
      "id": 139,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "claude-code + claude-opus-4-6",
      "label": "claude-code + claude-opus-4-6",
      "lab": "anthropic",
      "variant": "",
      "value": 28,
      "valueLabel": "28.0",
      "display": "28.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "05 | claude-code | claude-opus-4-6 | Proprietary | 28.0% | 20.0% | 36.0% | 28.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 05, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-12T18:55:45Z to 2026-05-12T18:55:46Z; submitted_at 2026-05-12T22:39:33Z.",
      "corroborating": [
        {
          "source": 1391,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-opus-4-6",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-139"
    },
    {
      "id": 140,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-sonnet-4.6",
      "modelKind": "model",
      "name": "claude-code + claude-sonnet-4-6",
      "label": "claude-code + claude-sonnet-4-6",
      "lab": "anthropic",
      "variant": "",
      "value": 26.2,
      "valueLabel": "26.2",
      "display": "26.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 43,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "06 | claude-code | claude-sonnet-4-6 | Proprietary | 26.2% | 24.0% | 34.7% | 20.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 06, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-04-29T14:43:27Z to 2026-04-30T15:00:19Z; submitted_at 2026-04-30T15:00:19Z.",
      "corroborating": [
        {
          "source": 1392,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-sonnet-4-6",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-140"
    },
    {
      "id": 141,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "gpt-5.6-sol",
      "modelKind": "model",
      "name": "codex + gpt-5.6-sol",
      "label": "codex + gpt-5.6-sol",
      "lab": "openai",
      "variant": "",
      "value": 25.3,
      "valueLabel": "25.3",
      "display": "25.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "07 | codex | gpt-5.6-sol | Proprietary | 25.3% | 36.0% | 28.0% | 12.0% | 2026-07-24",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 07, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-24; accessed 2026-09-30. Linked submission provenance: run 2026-07-22T02:41:32.718905Z to 2026-07-22T04:52:39.419746Z; submitted_at 2026-07-24T23:01:25Z.",
      "corroborating": [
        {
          "source": 1393,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openai/gpt-5.6-sol",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-141"
    },
    {
      "id": 142,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "kimi-k3",
      "modelKind": "model",
      "name": "openai-agents + kimi-k3",
      "label": "openai-agents + kimi-k3",
      "lab": "moonshot",
      "variant": "",
      "value": 25.3,
      "valueLabel": "25.3",
      "display": "25.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "08 | openai-agents | kimi-k3 | Open-source | 25.3% | 28.0% | 32.0% | 16.0% | 2026-07-24",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 08, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-24; accessed 2026-09-30. Linked submission provenance: run 2026-07-22T08:03:23.788878Z to 2026-07-22T14:22:38.269923Z; submitted_at 2026-08-12T20:20:00Z.",
      "corroborating": [
        {
          "source": 1394,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "moonshotai/kimi-k3",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-142"
    },
    {
      "id": 143,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-opus-4.7",
      "modelKind": "model",
      "name": "claude-code + claude-opus-4-7",
      "label": "claude-code + claude-opus-4-7",
      "lab": "anthropic",
      "variant": "",
      "value": 24.4,
      "valueLabel": "24.4",
      "display": "24.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 9,
      "rowsOnBoard": 43,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "09 | claude-code | claude-opus-4-7 | Proprietary | 24.4% | 24.0% | 17.3% | 32.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 09, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-04-29T06:06:32Z to 2026-04-30T10:00:03Z; submitted_at 2026-04-30T10:00:03Z.",
      "corroborating": [
        {
          "source": 1395,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-opus-4-7",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-143"
    },
    {
      "id": 144,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-fable-5",
      "modelKind": "model",
      "name": "claude-code + claude-fable-5",
      "label": "claude-code + claude-fable-5",
      "lab": "anthropic",
      "variant": "",
      "value": 24,
      "valueLabel": "24.0",
      "display": "24.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 10,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "10 | claude-code | claude-fable-5 | Proprietary | 24.0% | 24.0% | 24.0% | 24.0% | 2026-07-22",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 10, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-22; accessed 2026-09-30. Linked submission provenance: run 2026-07-22T07:16:27.207645Z to 2026-07-22T10:25:29.658582Z; submitted_at 2026-07-22T23:50:25Z.",
      "corroborating": [
        {
          "source": 1396,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-fable-5",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-144"
    },
    {
      "id": 2292,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "medguard",
      "modelKind": "product",
      "name": "hermes + MedGuard",
      "label": "hermes + MedGuard",
      "lab": "medguard",
      "variant": "All Domains pass@1; hermes harness; community submission",
      "value": 22.7,
      "valueLabel": "22.7",
      "display": "22.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 11,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "third_party",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "11 | hermes submitted by cuilinke | MedGuard | Open-source | 22.7% | 4.0% | 4.0% | 60.0% | 2026-07-06",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 11, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-06; accessed 2026-09-30. Linked submission provenance: run 2026-07-01T06:59:37Z to 2026-07-01T08:17:44Z; submitted_at 2026-07-06T09:10:18Z.",
      "corroborating": [
        {
          "source": 1356,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "MedGuard",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2292"
    },
    {
      "id": 326,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "gpt-5.5",
      "modelKind": "model",
      "name": "codex + gpt-5.5",
      "label": "codex + gpt-5.5",
      "lab": "openai",
      "variant": "",
      "value": 20.9,
      "valueLabel": "20.9",
      "display": "20.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 12,
      "rowsOnBoard": 43,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "12 | codex | gpt-5.5 | Proprietary | 20.9% | 29.3% | 32.0% | 1.3% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 12, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-04-29T06:06:32Z to 2026-04-30T09:41:04Z; submitted_at 2026-04-30T09:41:04Z.",
      "corroborating": [
        {
          "source": 1397,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openai/gpt-5.5",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-326"
    },
    {
      "id": 327,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-sonnet-5",
      "modelKind": "model",
      "name": "claude-code + claude-sonnet-5",
      "label": "claude-code + claude-sonnet-5",
      "lab": "anthropic",
      "variant": "",
      "value": 20,
      "valueLabel": "20.0",
      "display": "20.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 13,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "13 | claude-code | claude-sonnet-5 | Proprietary | 20.0% | 24.0% | 24.0% | 12.0% | 2026-07-06",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 13, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-06; accessed 2026-09-30. Linked submission provenance: run 2026-07-02T04:22:04Z to 2026-07-02T04:31:46Z; submitted_at 2026-07-06T05:23:12Z.",
      "corroborating": [
        {
          "source": 1398,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-sonnet-5",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-327"
    },
    {
      "id": 2294,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "glm-5.1",
      "modelKind": "model",
      "name": "hermes + glm-5.1",
      "label": "hermes + glm-5.1",
      "lab": "zhipu",
      "variant": "All Domains pass@1; hermes harness",
      "value": 18.7,
      "valueLabel": "18.7",
      "display": "18.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "15 | hermes | glm-5.1 | Open-source | 18.7% | 10.7% | 34.7% | 10.7% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 15, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T07:01:48Z to 2026-05-04T05:47:30Z; submitted_at 2026-05-04T05:47:30Z.",
      "corroborating": [
        {
          "source": 1358,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/z-ai/glm-5.1",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2294"
    },
    {
      "id": 2293,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "glm-5.1",
      "modelKind": "model",
      "name": "openai-agents + glm-5.1",
      "label": "openai-agents + glm-5.1",
      "lab": "zhipu",
      "variant": "All Domains pass@1; openai-agents harness",
      "value": 18.7,
      "valueLabel": "18.7",
      "display": "18.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "14 | openai-agents | glm-5.1 | Open-source | 18.7% | 18.7% | 33.3% | 4.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 14, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T08:41:54Z to 2026-05-04T07:03:18Z; submitted_at 2026-05-04T07:03:18Z.",
      "corroborating": [
        {
          "source": 1357,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "z-ai/glm-5.1",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2293"
    },
    {
      "id": 2295,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "glm-5.2",
      "modelKind": "model",
      "name": "openai-agents + glm-5.2",
      "label": "openai-agents + glm-5.2",
      "lab": "zhipu",
      "variant": "All Domains pass@1; openai-agents harness",
      "value": 18.7,
      "valueLabel": "18.7",
      "display": "18.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 14,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "16 | openai-agents | glm-5.2 | Open-source | 18.7% | 20.0% | 32.0% | 4.0% | 2026-07-06",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 16, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-06; accessed 2026-09-30. Linked submission provenance: run 2026-07-02T04:22:04Z to 2026-07-02T04:48:05Z; submitted_at 2026-07-06T05:23:05Z.",
      "corroborating": [
        {
          "source": 1359,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "z-ai/glm-5.2",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2295"
    },
    {
      "id": 2296,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-opus-4.7",
      "modelKind": "model",
      "name": "openclaw + claude-opus-4-7",
      "label": "openclaw + claude-opus-4-7",
      "lab": "anthropic",
      "variant": "All Domains pass@1; openclaw harness",
      "value": 17.3,
      "valueLabel": "17.3",
      "display": "17.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 17,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "17 | openclaw | claude-opus-4-7 | Proprietary | 17.3% | 18.7% | 13.3% | 20.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 17, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-04T13:50:05Z to 2026-05-04T15:47:22Z; submitted_at 2026-05-04T15:47:22Z.",
      "corroborating": [
        {
          "source": 1360,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-opus-4-7",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2296"
    },
    {
      "id": 2297,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "glm-5.1",
      "modelKind": "model",
      "name": "openclaw + glm-5.1",
      "label": "openclaw + glm-5.1",
      "lab": "zhipu",
      "variant": "All Domains pass@1; openclaw harness",
      "value": 16.9,
      "valueLabel": "16.9",
      "display": "16.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 18,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "18 | openclaw | glm-5.1 | Open-source | 16.9% | 13.3% | 26.7% | 10.7% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 18, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-02T09:10:57Z to 2026-05-04T02:49:29Z; submitted_at 2026-05-04T02:49:29Z.",
      "corroborating": [
        {
          "source": 1361,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/z-ai/glm-5.1",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2297"
    },
    {
      "id": 2298,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "qwen-3.6-max",
      "modelKind": "model",
      "name": "hermes + qwen-3.6-max",
      "label": "hermes + qwen-3.6-max",
      "lab": "alibaba",
      "variant": "All Domains pass@1; hermes harness; Qwen3.6-Max preview endpoint",
      "value": 16.4,
      "valueLabel": "16.4",
      "display": "16.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 19,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "19 | hermes | qwen-3.6-max | Open-source | 16.4% | 9.3% | 26.7% | 13.3% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 19, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T07:32:36Z to 2026-05-04T06:18:19Z; submitted_at 2026-05-04T06:18:19Z.",
      "corroborating": [
        {
          "source": 1362,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/qwen/qwen3-6-max-preview",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2298"
    },
    {
      "id": 2299,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "codex + gpt-5.4",
      "label": "codex + gpt-5.4",
      "lab": "openai",
      "variant": "All Domains pass@1; codex harness",
      "value": 16,
      "valueLabel": "16.0",
      "display": "16.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 20,
      "rowsOnBoard": 43,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "20 | codex | gpt-5.4 | Proprietary | 16.0% | 24.0% | 17.3% | 6.7% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 20, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-04-29T19:36:29Z to 2026-04-30T22:58:31Z; submitted_at 2026-04-30T22:58:31Z.",
      "corroborating": [
        {
          "source": 1363,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openai/gpt-5.4",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2299"
    },
    {
      "id": 2301,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "kimi-k2.6",
      "modelKind": "model",
      "name": "hermes + kimi-k2.6",
      "label": "hermes + kimi-k2.6",
      "lab": "moonshot",
      "variant": "All Domains pass@1; hermes harness",
      "value": 15.6,
      "valueLabel": "15.6",
      "display": "15.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "22 | hermes | kimi-k2.6 | Open-source | 15.6% | 18.7% | 21.3% | 6.7% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 22, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T07:19:12Z to 2026-05-04T06:35:44Z; submitted_at 2026-05-04T06:35:44Z.",
      "corroborating": [
        {
          "source": 1365,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/moonshotai/kimi-k2.6",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2301"
    },
    {
      "id": 2300,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "qwen-3.6-max",
      "modelKind": "model",
      "name": "openai-agents + qwen-3.6-max",
      "label": "openai-agents + qwen-3.6-max",
      "lab": "alibaba",
      "variant": "All Domains pass@1; openai-agents harness; Qwen3.6-Max preview endpoint",
      "value": 15.6,
      "valueLabel": "15.6",
      "display": "15.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 21,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "21 | openai-agents | qwen-3.6-max | Open-source | 15.6% | 16.0% | 26.7% | 4.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 21, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T09:19:32Z to 2026-05-04T07:25:50Z; submitted_at 2026-05-04T07:25:50Z.",
      "corroborating": [
        {
          "source": 1364,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "qwen/qwen3-6-max-preview",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2300"
    },
    {
      "id": 2302,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "kimi-k2.6",
      "modelKind": "model",
      "name": "openai-agents + kimi-k2.6",
      "label": "openai-agents + kimi-k2.6",
      "lab": "moonshot",
      "variant": "All Domains pass@1; openai-agents harness",
      "value": 15.1,
      "valueLabel": "15.1",
      "display": "15.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 23,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "23 | openai-agents | kimi-k2.6 | Open-source | 15.1% | 17.3% | 25.3% | 2.7% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 23, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T09:00:39Z to 2026-05-04T07:47:06Z; submitted_at 2026-05-04T07:47:06Z.",
      "corroborating": [
        {
          "source": 1366,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "moonshotai/kimi-k2.6",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2302"
    },
    {
      "id": 2303,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "openai-agents + deepseek-v4-pro",
      "label": "openai-agents + deepseek-v4-pro",
      "lab": "deepseek",
      "variant": "All Domains pass@1; openai-agents harness",
      "value": 14.2,
      "valueLabel": "14.2",
      "display": "14.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 24,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "24 | openai-agents | deepseek-v4-pro | Open-source | 14.2% | 10.7% | 28.0% | 4.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 24, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T08:35:38Z to 2026-05-04T06:59:15Z; submitted_at 2026-05-04T06:59:15Z.",
      "corroborating": [
        {
          "source": 1367,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "deepseek/deepseek-v4-pro",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2303"
    },
    {
      "id": 2304,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "hermes + deepseek-v4-pro",
      "label": "hermes + deepseek-v4-pro",
      "lab": "deepseek",
      "variant": "All Domains pass@1; hermes harness",
      "value": 13.8,
      "valueLabel": "13.8",
      "display": "13.8%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 25,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "25 | hermes | deepseek-v4-pro | Open-source | 13.8% | 8.0% | 25.3% | 8.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 25, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T06:28:45Z to 2026-05-04T05:51:44Z; submitted_at 2026-05-04T05:51:44Z.",
      "corroborating": [
        {
          "source": 1368,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/deepseek/deepseek-v4-pro",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2304"
    },
    {
      "id": 2306,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "gpt-5.6-luna",
      "modelKind": "model",
      "name": "codex + gpt-5.6-luna",
      "label": "codex + gpt-5.6-luna",
      "lab": "openai",
      "variant": "All Domains pass@1; codex harness",
      "value": 13.3,
      "valueLabel": "13.3",
      "display": "13.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "27 | codex | gpt-5.6-luna | Proprietary | 13.3% | 20.0% | 16.0% | 4.0% | 2026-07-24",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 27, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-24; accessed 2026-09-30. Linked submission provenance: run 2026-07-22T06:23:21.720425Z to 2026-07-22T08:02:34.258993Z; submitted_at 2026-07-24T23:01:25Z.",
      "corroborating": [
        {
          "source": 1370,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openai/gpt-5.6-luna",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2306"
    },
    {
      "id": 2305,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "gpt-5.6-terra",
      "modelKind": "model",
      "name": "codex + gpt-5.6-terra",
      "label": "codex + gpt-5.6-terra",
      "lab": "openai",
      "variant": "All Domains pass@1; codex harness",
      "value": 13.3,
      "valueLabel": "13.3",
      "display": "13.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 26,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "26 | codex | gpt-5.6-terra | Proprietary | 13.3% | 12.0% | 20.0% | 8.0% | 2026-07-24",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 26, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-24; accessed 2026-09-30. Linked submission provenance: run 2026-07-22T04:52:42.763467Z to 2026-07-22T06:23:17.742720Z; submitted_at 2026-07-24T23:01:25Z.",
      "corroborating": [
        {
          "source": 1369,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openai/gpt-5.6-terra",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2305"
    },
    {
      "id": 2307,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "gemini-3-flash",
      "modelKind": "model",
      "name": "gemini-cli + gemini-3-flash",
      "label": "gemini-cli + gemini-3-flash",
      "lab": "google",
      "variant": "All Domains pass@1; gemini-cli harness",
      "value": 12.5,
      "valueLabel": "12.5",
      "display": "12.5%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 28,
      "rowsOnBoard": 43,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "28 | gemini-cli | gemini-3-flash | Proprietary | 12.5% | 18.7% | 18.7% | 0.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 28, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-04-30T09:24:38Z to 2026-04-30T20:11:40Z; submitted_at 2026-04-30T20:11:40Z.",
      "corroborating": [
        {
          "source": 1371,
          "role": "conflicting",
          "scoreDisplay": null,
          "quote": "0.12444444444444443",
          "locator": "results.overall.pass_at_1 for submission.model google/gemini-3-flash-preview; fraction scale (not percent); retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2307"
    },
    {
      "id": 2309,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "glm-5.1",
      "modelKind": "model",
      "name": "deepagents + glm-5.1",
      "label": "deepagents + glm-5.1",
      "lab": "zhipu",
      "variant": "All Domains pass@1; deepagents harness",
      "value": 11.1,
      "valueLabel": "11.1",
      "display": "11.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 29,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "30 | deepagents | glm-5.1 | Open-source | 11.1% | 17.3% | 10.7% | 5.3% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 30, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T21:51:53Z to 2026-05-04T13:10:34Z; submitted_at 2026-05-04T13:10:34Z.",
      "corroborating": [
        {
          "source": 1373,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/z-ai/glm-5.1",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2309"
    },
    {
      "id": 2308,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "openclaw + deepseek-v4-pro",
      "label": "openclaw + deepseek-v4-pro",
      "lab": "deepseek",
      "variant": "All Domains pass@1; openclaw harness",
      "value": 11.1,
      "valueLabel": "11.1",
      "display": "11.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 29,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "29 | openclaw | deepseek-v4-pro | Open-source | 11.1% | 14.7% | 12.0% | 6.7% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 29, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-02T09:01:51Z to 2026-05-04T03:00:01Z; submitted_at 2026-05-04T03:00:01Z.",
      "corroborating": [
        {
          "source": 1372,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/deepseek/deepseek-v4-pro",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2308"
    },
    {
      "id": 2310,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "deepseek-v4-pro",
      "modelKind": "model",
      "name": "deepagents + deepseek-v4-pro",
      "label": "deepagents + deepseek-v4-pro",
      "lab": "deepseek",
      "variant": "All Domains pass@1; deepagents harness",
      "value": 10.7,
      "valueLabel": "10.7",
      "display": "10.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 31,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "31 | deepagents | deepseek-v4-pro | Open-source | 10.7% | 14.7% | 10.7% | 6.7% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 31, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T07:35:56Z to 2026-05-05T01:34:20Z; submitted_at 2026-05-05T01:34:20Z.",
      "corroborating": [
        {
          "source": 1374,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/deepseek/deepseek-v4-pro",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2310"
    },
    {
      "id": 2311,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "kimi-k2.6",
      "modelKind": "model",
      "name": "openclaw + kimi-k2.6",
      "label": "openclaw + kimi-k2.6",
      "lab": "moonshot",
      "variant": "All Domains pass@1; openclaw harness",
      "value": 10.2,
      "valueLabel": "10.2",
      "display": "10.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 32,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "32 | openclaw | kimi-k2.6 | Open-source | 10.2% | 12.0% | 18.7% | 0.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 32, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T06:28:45Z to 2026-05-04T05:50:33Z; submitted_at 2026-05-04T05:50:33Z.",
      "corroborating": [
        {
          "source": 1375,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/moonshotai/kimi-k2.6",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2311"
    },
    {
      "id": 2312,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "qwen-3.6-max",
      "modelKind": "model",
      "name": "deepagents + qwen-3.6-max",
      "label": "deepagents + qwen-3.6-max",
      "lab": "alibaba",
      "variant": "All Domains pass@1; deepagents harness; Qwen3.6-Max preview endpoint",
      "value": 9.3,
      "valueLabel": "9.3",
      "display": "9.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 33,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "33 | deepagents | qwen-3.6-max | Open-source | 9.3% | 12.0% | 10.7% | 5.3% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 33, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T22:18:28Z to 2026-05-04T13:19:53Z; submitted_at 2026-05-04T13:19:53Z.",
      "corroborating": [
        {
          "source": 1376,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/qwen/qwen3-6-max-preview",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2312"
    },
    {
      "id": 2313,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "gpt-5.4-mini",
      "modelKind": "model",
      "name": "codex + gpt-5.4-mini",
      "label": "codex + gpt-5.4-mini",
      "lab": "openai",
      "variant": "All Domains pass@1; codex harness",
      "value": 8.4,
      "valueLabel": "8.4",
      "display": "8.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 34,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "34 | codex | gpt-5.4-mini | Proprietary | 8.4% | 10.7% | 13.3% | 1.3% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 34, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-04-29T19:36:29Z to 2026-05-01T03:47:25Z; submitted_at 2026-05-01T03:47:25Z.",
      "corroborating": [
        {
          "source": 1377,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openai/gpt-5.4-mini",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2313"
    },
    {
      "id": 2314,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "inkling",
      "modelKind": "model",
      "name": "openai-agents + TML Inkling 256K",
      "label": "openai-agents + TML Inkling 256K",
      "lab": "thinking-machines",
      "variant": "All Domains pass@1; openai-agents; Tinker 256K, high reasoning, 50-turn limit",
      "value": 8,
      "valueLabel": "8.0",
      "display": "8.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 35,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "35 | openai-agents | TML Inkling 256K | Open-source | 8.0% | 4.0% | 16.0% | 4.0% | 2026-07-24",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 35, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-24; accessed 2026-09-30. Linked submission provenance: run 2026-07-22T14:25:50.976659Z to 2026-07-22T16:53:02.466832Z; submitted_at 2026-07-24T23:02:07Z.",
      "corroborating": [
        {
          "source": 1378,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "thinkingmachines/Inkling:peft:262144",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2314"
    },
    {
      "id": 2315,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "claude-haiku-4.5",
      "modelKind": "model",
      "name": "claude-code + claude-haiku-4-5",
      "label": "claude-code + claude-haiku-4-5",
      "lab": "anthropic",
      "variant": "All Domains pass@1; claude-code harness",
      "value": 6.2,
      "valueLabel": "6.2",
      "display": "6.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 36,
      "rowsOnBoard": 43,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "37 | claude-code | claude-haiku-4-5 | Proprietary | 6.2% | 0.0% | 14.7% | 4.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 37, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-04-29T19:36:29Z to 2026-04-30T19:34:41Z; submitted_at 2026-04-30T19:34:41Z.",
      "corroborating": [
        {
          "source": 1379,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "anthropic/claude-haiku-4-5",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2315"
    },
    {
      "id": 2316,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "grok-4.3",
      "modelKind": "model",
      "name": "openai-agents + grok-4.3",
      "label": "openai-agents + grok-4.3",
      "lab": "xai",
      "variant": "All Domains pass@1; openai-agents harness",
      "value": 5.8,
      "valueLabel": "5.8",
      "display": "5.8%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 37,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "38 | openai-agents | grok-4.3 | Open-source | 5.8% | 0.0% | 16.0% | 1.3% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 38, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T09:26:38Z to 2026-05-04T07:18:48Z; submitted_at 2026-05-04T07:18:48Z.",
      "corroborating": [
        {
          "source": 1380,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "x-ai/grok-4.3",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2316"
    },
    {
      "id": 2317,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "qwen-3.6-max",
      "modelKind": "model",
      "name": "openclaw + qwen-3.6-max",
      "label": "openclaw + qwen-3.6-max",
      "lab": "alibaba",
      "variant": "All Domains pass@1; openclaw harness; Qwen3.6-Max preview endpoint",
      "value": 4.9,
      "valueLabel": "4.9",
      "display": "4.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 38,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "39 | openclaw | qwen-3.6-max | Open-source | 4.9% | 10.7% | 4.0% | 0.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 39, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-02T09:26:43Z to 2026-05-04T03:15:50Z; submitted_at 2026-05-04T03:15:50Z.",
      "corroborating": [
        {
          "source": 1381,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/qwen/qwen3-6-max-preview",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2317"
    },
    {
      "id": 2318,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "grok-4.3",
      "modelKind": "model",
      "name": "hermes + grok-4.3",
      "label": "hermes + grok-4.3",
      "lab": "xai",
      "variant": "All Domains pass@1; hermes harness",
      "value": 4.4,
      "valueLabel": "4.4",
      "display": "4.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 39,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "40 | hermes | grok-4.3 | Open-source | 4.4% | 0.0% | 13.3% | 0.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 40, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T07:34:26Z to 2026-05-04T06:20:37Z; submitted_at 2026-05-04T06:20:37Z.",
      "corroborating": [
        {
          "source": 1382,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/x-ai/grok-4.3",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2318"
    },
    {
      "id": 2319,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "kimi-k2.6",
      "modelKind": "model",
      "name": "deepagents + kimi-k2.6",
      "label": "deepagents + kimi-k2.6",
      "lab": "moonshot",
      "variant": "All Domains pass@1; deepagents harness",
      "value": 3.1,
      "valueLabel": "3.1",
      "display": "3.1%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 40,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "41 | deepagents | kimi-k2.6 | Open-source | 3.1% | 8.0% | 1.3% | 0.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 41, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T21:58:07Z to 2026-05-04T13:39:21Z; submitted_at 2026-05-04T13:39:21Z.",
      "corroborating": [
        {
          "source": 1383,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/moonshotai/kimi-k2.6",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2319"
    },
    {
      "id": 2320,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "grok-4.3",
      "modelKind": "model",
      "name": "deepagents + grok-4.3",
      "label": "deepagents + grok-4.3",
      "lab": "xai",
      "variant": "All Domains pass@1; deepagents harness",
      "value": 2.2,
      "valueLabel": "2.2",
      "display": "2.2%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 41,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "42 | deepagents | grok-4.3 | Open-source | 2.2% | 0.0% | 5.3% | 1.3% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 42, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-03T22:19:46Z to 2026-05-04T13:19:20Z; submitted_at 2026-05-04T13:19:20Z.",
      "corroborating": [
        {
          "source": 1384,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/x-ai/grok-4.3",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2320"
    },
    {
      "id": 2321,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "grok-4.3",
      "modelKind": "model",
      "name": "openclaw + grok-4.3",
      "label": "openclaw + grok-4.3",
      "lab": "xai",
      "variant": "All Domains pass@1; openclaw harness",
      "value": 0.4,
      "valueLabel": "0.4",
      "display": "0.4%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 42,
      "rowsOnBoard": 43,
      "measured": "2026-05",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "43 | openclaw | grok-4.3 | Open-source | 0.4% | 1.3% | 0.0% | 0.0% | 2026-05-01",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 43, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-05-01; accessed 2026-09-30. Linked submission provenance: run 2026-05-02T09:34:46Z to 2026-05-04T00:03:58Z; submitted_at 2026-05-04T00:03:58Z.",
      "corroborating": [
        {
          "source": 1385,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "openrouter/x-ai/grok-4.3",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2321"
    },
    {
      "id": 2322,
      "benchmark": "chi-bench",
      "metric": null,
      "model": "nvidia-nemotron-3-ultra-550b-a55b",
      "modelKind": "model",
      "name": "openai-agents + Nemotron 3 Ultra 256K",
      "label": "openai-agents + Nemotron 3 Ultra 256K",
      "lab": "nvidia",
      "variant": "All Domains pass@1; openai-agents; Tinker 256K",
      "value": 0,
      "valueLabel": "0.0",
      "display": "0.0%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 43,
      "rowsOnBoard": 43,
      "measured": "2026-07",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 21,
      "sourceUrl": "https://actava.ai/benchmarks/leaderboards",
      "quote": "44 | openai-agents | Nemotron 3 Ultra 256K | Open-source | 0.0% | 0.0% | 0.0% | 0.0% | 2026-07-24",
      "locator": "CHI-Bench v1.0.0, All Domains, rank 44, Agent/Model and Accuracy columns; PA/UM/CM follow; board last updated 2026-08-12; board Date column 2026-07-24; accessed 2026-09-30. Linked submission provenance: run 2026-07-22T22:31:29.302007Z to 2026-07-22T23:37:41.111758Z; submitted_at 2026-08-12T20:20:00Z.",
      "corroborating": [
        {
          "source": 1386,
          "role": "corroborating",
          "scoreDisplay": null,
          "quote": "nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16:peft:262144",
          "locator": "submission.model; provenance.started_at / finished_at; results.overall.pass_at_1; retrieved 2026-09-30"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/chi-bench#r-2322"
    },
    {
      "id": 328,
      "benchmark": "healthadminbench",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude Opus 4.6 (computer-use agent)",
      "label": "Claude Opus 4.6 (computer-use agent)",
      "lab": "anthropic",
      "variant": "screenshot-only, detailed prompting; native CUA harness; subtask rate 78.4%",
      "value": 36.3,
      "valueLabel": "36.3",
      "display": "36.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 1,
      "rowsOnBoard": 7,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 138,
      "sourceUrl": "https://arxiv.org/pdf/2604.09937",
      "quote": "Claude Opus 4.6 CUA | 36.3%",
      "locator": "p. 8, Figure 3(a), Task Success Rate, bar \"Claude Opus 4.6 CUA\"; section 4, p. 7 gives screenshot-only, Task Description + Portal Guidance; arXiv 2604.09937v1 dated 2026-04-10; checked 2026-09-30.",
      "corroborating": [
        {
          "source": 29,
          "role": "corroborating",
          "scoreDisplay": "36.3%",
          "quote": "In our most realistic set-up (screenshot only observation, detailed prompting), the best-performing agent, Claude Opus 4.6 CUA, achieved only a 36.3% task success rate.",
          "locator": "Section 'LLMs struggle with long-horizon tasks'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthadminbench#r-328"
    },
    {
      "id": 188,
      "benchmark": "healthadminbench",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT-5.4 (computer-use agent)",
      "label": "GPT-5.4 (computer-use agent)",
      "lab": "openai",
      "variant": "screenshot-only, detailed prompting; subtask rate 82.8%",
      "value": 26.7,
      "valueLabel": "26.7",
      "display": "26.7%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 2,
      "rowsOnBoard": 7,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 138,
      "sourceUrl": "https://arxiv.org/pdf/2604.09937",
      "quote": "GPT-5.4 CUA | 26.7%",
      "locator": "p. 8, Figure 3(a), Task Success Rate, bar \"GPT-5.4 CUA\"; section 4, p. 7 gives screenshot-only, Task Description + Portal Guidance; arXiv 2604.09937v1 dated 2026-04-10; checked 2026-09-30.",
      "corroborating": [
        {
          "source": 29,
          "role": "corroborating",
          "scoreDisplay": "26.7%",
          "quote": "GPT-5.4 CUA came in a distant second at 26.7%, followed by the open-source Kimi K2.5 model at 15.6%, then Qwen 3.5 at 13.3%, and finally Gemini 3.1 Pro at 11.9%.",
          "locator": "Section 'LLMs struggle with long-horizon tasks'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthadminbench#r-188"
    },
    {
      "id": 189,
      "benchmark": "healthadminbench",
      "metric": null,
      "model": "kimi-k2.5",
      "modelKind": "model",
      "name": "Kimi K2.5",
      "label": null,
      "lab": "moonshot",
      "variant": "screenshot-only, detailed prompting",
      "value": 15.6,
      "valueLabel": "15.6",
      "display": "15.6%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 3,
      "rowsOnBoard": 7,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 138,
      "sourceUrl": "https://arxiv.org/pdf/2604.09937",
      "quote": "Kimi K2.5 | 15.6%",
      "locator": "p. 8, Figure 3(a), Task Success Rate, bar \"Kimi K2.5\"; section 4, p. 7 gives screenshot-only, Task Description + Portal Guidance; arXiv 2604.09937v1 dated 2026-04-10; checked 2026-09-30.",
      "corroborating": [
        {
          "source": 29,
          "role": "corroborating",
          "scoreDisplay": "15.6%",
          "quote": "GPT-5.4 CUA came in a distant second at 26.7%, followed by the open-source Kimi K2.5 model at 15.6%, then Qwen 3.5 at 13.3%, and finally Gemini 3.1 Pro at 11.9%.",
          "locator": "Section 'LLMs struggle with long-horizon tasks'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthadminbench#r-189"
    },
    {
      "id": 330,
      "benchmark": "healthadminbench",
      "metric": null,
      "model": "claude-opus-4.6",
      "modelKind": "model",
      "name": "Claude Opus 4.6 (standardized harness)",
      "label": "Claude Opus 4.6 (standardized harness)",
      "lab": "anthropic",
      "variant": "screenshot-only, detailed prompting; authors' standardized harness, no native CUA",
      "value": 14.8,
      "valueLabel": "14.8",
      "display": "14.8%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 4,
      "rowsOnBoard": 7,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 138,
      "sourceUrl": "https://arxiv.org/pdf/2604.09937",
      "quote": "Claude Opus 4.6 | 14.8%",
      "locator": "p. 8, Figure 3(a), Task Success Rate, bar \"Claude Opus 4.6\"; section 4, p. 7 gives screenshot-only, Task Description + Portal Guidance; arXiv 2604.09937v1 dated 2026-04-10; checked 2026-09-30.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthadminbench#r-330"
    },
    {
      "id": 190,
      "benchmark": "healthadminbench",
      "metric": null,
      "model": "qwen-3.5",
      "modelKind": "model",
      "name": "Qwen 3.5",
      "label": null,
      "lab": "alibaba",
      "variant": "screenshot-only, detailed prompting",
      "value": 13.3,
      "valueLabel": "13.3",
      "display": "13.3%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 5,
      "rowsOnBoard": 7,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 138,
      "sourceUrl": "https://arxiv.org/pdf/2604.09937",
      "quote": "Qwen 3.5 | 13.3%",
      "locator": "p. 8, Figure 3(a), Task Success Rate, bar \"Qwen 3.5\"; section 4, p. 7 gives screenshot-only, Task Description + Portal Guidance; arXiv 2604.09937v1 dated 2026-04-10; checked 2026-09-30.",
      "corroborating": [
        {
          "source": 29,
          "role": "corroborating",
          "scoreDisplay": "13.3%",
          "quote": "GPT-5.4 CUA came in a distant second at 26.7%, followed by the open-source Kimi K2.5 model at 15.6%, then Qwen 3.5 at 13.3%, and finally Gemini 3.1 Pro at 11.9%.",
          "locator": "Section 'LLMs struggle with long-horizon tasks'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthadminbench#r-190"
    },
    {
      "id": 191,
      "benchmark": "healthadminbench",
      "metric": null,
      "model": "gemini-3.1-pro",
      "modelKind": "model",
      "name": "Gemini 3.1 Pro",
      "label": null,
      "lab": "google",
      "variant": "screenshot-only, detailed prompting",
      "value": 11.9,
      "valueLabel": "11.9",
      "display": "11.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 6,
      "rowsOnBoard": 7,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 138,
      "sourceUrl": "https://arxiv.org/pdf/2604.09937",
      "quote": "Gemini 3.1 Pro | 11.9%",
      "locator": "p. 8, Figure 3(a), Task Success Rate, bar \"Gemini 3.1 Pro\"; section 4, p. 7 gives screenshot-only, Task Description + Portal Guidance; arXiv 2604.09937v1 dated 2026-04-10; checked 2026-09-30.",
      "corroborating": [
        {
          "source": 29,
          "role": "corroborating",
          "scoreDisplay": "11.9%",
          "quote": "GPT-5.4 CUA came in a distant second at 26.7%, followed by the open-source Kimi K2.5 model at 15.6%, then Qwen 3.5 at 13.3%, and finally Gemini 3.1 Pro at 11.9%.",
          "locator": "Section 'LLMs struggle with long-horizon tasks'"
        }
      ],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthadminbench#r-191"
    },
    {
      "id": 332,
      "benchmark": "healthadminbench",
      "metric": null,
      "model": "gpt-5.4",
      "modelKind": "model",
      "name": "GPT-5.4 (standardized harness)",
      "label": "GPT-5.4 (standardized harness)",
      "lab": "openai",
      "variant": "screenshot-only, detailed prompting; authors' standardized harness, no native CUA",
      "value": 5.9,
      "valueLabel": "5.9",
      "display": "5.9%",
      "lo": null,
      "hi": null,
      "rankOnBoard": 7,
      "rowsOnBoard": 7,
      "measured": "2026-04",
      "reportedBy": "benchmark_owner",
      "confidence": "verified",
      "source": 138,
      "sourceUrl": "https://arxiv.org/pdf/2604.09937",
      "quote": "GPT-5.4 | 5.9%",
      "locator": "p. 8, Figure 3(a), Task Success Rate, bar \"GPT-5.4\"; section 4, p. 7 gives screenshot-only, Task Description + Portal Guidance; arXiv 2604.09937v1 dated 2026-04-10; checked 2026-09-30.",
      "corroborating": [],
      "url": "https://clinicalbenchmarks.ai/benchmarks/healthadminbench#r-332"
    }
  ]
}
