{
  "date": "2 October 2026",
  "retrieved_at": "2026-10-02",
  "speed": {
    "source": "/evidence/capability-price-speed-2026-10-02.json",
    "panels": [
      {
        "title": "Median latency, lower is better",
        "subtitle": "Medium text · one question · warm HTTP/2 · median ms ↓",
        "rows": [
          {
            "name": "s1-pro · EU",
            "kind": "rune",
            "value": 199.6,
            "p95": 749.4,
            "samples": 30,
            "successes": 30
          },
          {
            "name": "s1-fast · EU",
            "kind": "rune",
            "value": 155.1,
            "p95": 286.7,
            "samples": 30,
            "successes": 30
          },
          {
            "name": "Jev 1.13.0",
            "kind": "jev",
            "value": 233.6,
            "p95": 340.2,
            "samples": 30,
            "successes": 30
          }
        ],
        "note": "Measured from Nuremberg, Germany, 2 October 2026. 33 rotated rounds on identical medium synthetic support tickets, one question, HTTP/2 persistent clients; first 3 rounds excluded as warm-up; 30 measured calls per target. p50=sample median; p95=nearest rank ceil(0.95*n). End-to-end successful-response latency; every failure retained. s1-pro has a lower median but a higher p95 than Jev. Small sample; results vary with workload and network."
      }
    ]
  },
  "price": {
    "source": "https://system1models.ai/pricing",
    "rows": [
      {
        "name": "s1-fast · Peer-to-Peer",
        "kind": "rune",
        "value": 0.032
      },
      {
        "name": "s1-fast · EU",
        "kind": "rune",
        "value": 0.034
      },
      {
        "name": "s1-pro · Peer-to-Peer",
        "kind": "rune",
        "value": 0.038
      },
      {
        "name": "s1-pro · EU",
        "kind": "rune",
        "value": 0.04
      },
      {
        "name": "Jev 1.13.0",
        "kind": "jev",
        "value": 0.042
      }
    ],
    "jev_source": "https://typesafe.ai/blog/introducing-system-one-models-and-jev",
    "note": "Peer-to-Peer rates updated to the 3 October 2026 price book (S1-LAUNCH-3); the s1-pro Peer-to-Peer cost per decision is re-estimated at the new list rate from the same measured tokens."
  },
  "decisions": {
    "source": "/evidence/capability-price-speed-2026-10-02.json",
    "rows": [
      {
        "name": "s1-pro · Peer-to-Peer",
        "kind": "rune",
        "value": 0.008707066666666666
      },
      {
        "name": "s1-pro · EU",
        "kind": "rune",
        "value": 0.00932
      },
      {
        "name": "Jev 1.13.0",
        "kind": "jev",
        "value": 0.010924199999999998
      }
    ],
    "note": "2 October 2026. Medium text, 3 questions per call, from Finland. Mean billable input tokens × USD list rate / 3 decisions × 1,000. EU/Jev 10/10 successful medium calls; Peer-to-Peer 5/10, estimates cover successful calls only. Internal trial requests were not paid debits. Across all S/M/L cells: EU/Jev 30/30, Peer-to-Peer 14/30 in Finland and 12/30 in Virginia. Peer-to-Peer bundles are best-effort and may return retryable HTTP 503. Shared state billing reduces cost; large bundles can be slower than Jev."
  },
  "measurements": {
    "method": "Public synthetic text; real customer API end-to-end latency, successful-response quantiles; failures tracked separately; no retained customer payloads. p95 uses nearest-rank index round(0.95*(n-1)).",
    "raw_receipts": [
      {
        "file": "morning_warm.jsonl",
        "sha256": "bc241b1f60d6d61d6e18a9fb4e07f832d24ff2cbce5cd5f45427b6d8af3f4f63"
      },
      {
        "file": "rune100_sandy.jsonl",
        "sha256": "570f0abcf26fd20a85dc77f35113ebfa003fafbe6af66404d25876d7f4adf87f"
      },
      {
        "file": "us_rune_warm.jsonl",
        "sha256": "307cf715c86319ec32ca2d8a99333d78afed6d9e3f543e47af301ad75b7ea519"
      },
      {
        "file": "sandy_mq_warm.jsonl",
        "sha256": "0c7d6941c1da515ffcde1db99838a8ce3059ad61c2c4c7b27c3e3a12982db8a7"
      },
      {
        "file": "us_mq_warm.jsonl",
        "sha256": "27b143041e2aebb9c7b3f7ed545e7949c5bc2239df1d0da056f07ccf2f959cdc"
      }
    ],
    "germany": {
      "rows": [
        {
          "name": "s1-pro · EU",
          "kind": "rune",
          "value": 199.6,
          "p95": 749.4,
          "samples": 30,
          "successes": 30
        },
        {
          "name": "s1-fast · EU",
          "kind": "rune",
          "value": 155.1,
          "p95": 286.7,
          "samples": 30,
          "successes": 30
        },
        {
          "name": "Jev 1.13.0",
          "kind": "jev",
          "value": 233.6,
          "p95": 340.2,
          "samples": 30,
          "successes": 30
        }
      ],
      "raw_sha256": "2d38f2c78ca50a785fa65d19dc6c41f7198669a9e37f22898f16b460cb9b5edd",
      "warmup_excluded_per_target": 3,
      "paired_payloads": 33,
      "method": "33 rotated rounds on identical medium synthetic support tickets, one question, HTTP/2 persistent clients; first 3 rounds excluded as warm-up; 30 measured calls per target. p50=sample median; p95=nearest rank ceil(0.95*n). End-to-end successful-response latency; every failure retained.",
      "measured_from": "Nuremberg, Germany",
      "date": "2026-10-02",
      "source": "/evidence/nuremberg-latency-2026-10-02.json"
    }
  },
  "decision": {
    "title": "Decision Index",
    "metric": "Balanced, chance-corrected index / 100 ↑",
    "version": "0.2.1",
    "source": "https://multimodalart-jev-decision-index.static.hf.space/index.html",
    "data_source": "https://multimodalart-jev-decision-index.static.hf.space/data/index.json",
    "metric_key": "balanced_skill",
    "rows": [
      {
        "name": "Jev 1.13.0",
        "value": 57.91,
        "kind": "jev",
        "rank": 1,
        "key": "jev"
      },
      {
        "name": "Surogate Rune 26B-A4B v3",
        "value": 57.44,
        "kind": "rune",
        "rank": 2,
        "key": "rune-26b-a4b-v3"
      },
      {
        "name": "Decider chat · Gemma-4-31B",
        "value": 57.33,
        "kind": "other",
        "rank": 3,
        "key": "decider-chat-gemma4-31b"
      },
      {
        "name": "pplx-decider-v1-27b",
        "value": 56.4,
        "kind": "other",
        "rank": 4,
        "key": "autojev-27b"
      },
      {
        "name": "simple-jev · Qwen3.8-27B (featherless)",
        "value": 55.74,
        "kind": "other",
        "rank": 5,
        "key": "simple-jev-qwen3.8-27b"
      },
      {
        "name": "frontier-infra Jebadiah 27B",
        "value": 54.67,
        "kind": "other",
        "rank": 6,
        "key": "jebadiah-27b"
      },
      {
        "name": "Eikos-27B-FP8 Qwen3.8-27B LoRA",
        "value": 53.13,
        "kind": "other",
        "rank": 7,
        "key": "eikos-27b-fp8"
      },
      {
        "name": "reflex Qwen3.8-27B-FP8 (wide choice)",
        "value": 52.16,
        "kind": "other",
        "rank": 8,
        "key": "reflex-27b-v2"
      },
      {
        "name": "Decider chat · Qwen3.6-27B",
        "value": 51.35,
        "kind": "other",
        "rank": 9,
        "key": "decider-chat-qwen3.6-27b"
      },
      {
        "name": "Winnow-12B",
        "value": 50.02,
        "kind": "other",
        "rank": 10,
        "key": "winnow-12b-q8"
      }
    ],
    "note": "Public default balanced index; equal weight across five areas. Rows retain the source order and use sequential display ranks, including tied scores. Jev is the reference API; other entries are tested model implementations. Reference results are not a hosted System1 measurement."
  },
  "jevbench": {
    "title": "JevBench Capability Score",
    "metric": "Mean of Intelligence and Calibration / 100 ↑",
    "version": "1.5.5",
    "source": "https://benchmarkheaven.com/jev-models",
    "data_source": "https://benchmarkheaven.com/api/jevbench/v1.5.5",
    "rows": [
      {
        "name": "Jev 1.13.0",
        "value": 80.01,
        "kind": "jev",
        "rank": 1,
        "key": "jev-1.13.0"
      },
      {
        "name": "Winnow-12B Q8",
        "value": 79.25,
        "kind": "other",
        "rank": 2,
        "key": "winnow-12b"
      },
      {
        "name": "Cygnet",
        "value": 79.05,
        "kind": "other",
        "rank": 3,
        "key": "cygnet"
      },
      {
        "name": "Surogate Rune 26B-A4B v3",
        "value": 79.02,
        "kind": "rune",
        "rank": 4,
        "key": "surogate-rune-26b-a4b-v3-rtxpro6000-a2"
      },
      {
        "name": "Jev-Omni",
        "value": 76.54,
        "kind": "other",
        "rank": 5,
        "key": "jev-omni"
      },
      {
        "name": "djev",
        "value": 76.37,
        "kind": "other",
        "rank": 6,
        "key": "djev"
      },
      {
        "name": "JevK5 v0.3",
        "value": 72.31,
        "kind": "other",
        "rank": 7,
        "key": "jevk5-v0.3-4b"
      },
      {
        "name": "Plumb-4B",
        "value": 71.65,
        "kind": "other",
        "rank": 8,
        "key": "plumb-4b"
      },
      {
        "name": "Decision 4B v1.2",
        "value": 71.11,
        "kind": "other",
        "rank": 9,
        "key": "decision-4b-v12"
      },
      {
        "name": "Imajev-4B",
        "value": 70.8,
        "kind": "other",
        "rank": 10,
        "key": "imajev-4b-rtx5090-a2"
      }
    ],
    "cost_cap_usd_per_1000_decisions": 0.06459465517241379,
    "median_latency_cap_seconds": 1.2329566404223442,
    "note": "Only models inside the cost and median latency caps (each 2× Jev 1.13.0) are ranked. Benchmark run by the founder of System1 Models. Tested reference engines; the hosted System1 engine has not been scored in this release."
  },
  "sources": [
    {
      "url": "https://multimodalart-jev-decision-index.static.hf.space/data/index.json",
      "snapshot": "capability-2026-10-02-decision-index-data-index.json.gz",
      "sha256": "37526dd3f3d8f06e37722ef749344a7c877ed31260bad37de2e348cca1220d50",
      "retrieved_at": "2026-10-02T16:26:00.966946+00:00"
    },
    {
      "url": "https://benchmarkheaven.com/api/jevbench/v1.5.5",
      "snapshot": "capability-2026-10-02-jevbench-v1.5.5-api.json.gz",
      "sha256": "591e56fe98b5122f1a47ed8c0945c4ba2e848e5d0dcc09ffbfc5967bedeafd25",
      "retrieved_at": "2026-10-02T16:27:57.832723+00:00"
    },
    {
      "url": "https://benchmarkheaven.com/jev-models",
      "snapshot": "capability-2026-10-02-jev-models.html.gz",
      "sha256": "bbde355fa75015f9669bed0881b059242d2e778b3fb9876795289aa6339132f8",
      "retrieved_at": "2026-10-02T16:24:59.996105+00:00"
    },
    {
      "url": "https://benchmarkheaven.com/jev-models",
      "snapshot": "capability-2026-10-02-jev-models-points-raw.json.gz",
      "sha256": "7011ff445463766381fc0ec83af5d85bb1365fe6b920100c25774d1506efb2bb",
      "retrieved_at": "2026-10-02T16:26:37.746246+00:00"
    }
  ],
  "rollout": {
    "checked_at": "2026-10-02T18:59:39Z",
    "main_eu_model": "Surogate Rune 26B-A4B v3",
    "provision_rollout_percent": 100,
    "fallbacks": {
      "text": "Winnow-12B Q8",
      "image": "Gemma 4 12B"
    },
    "global": "Rune when spare queue/admission capacity permits; compatible single-question fallback, bundles best-effort."
  }
}
