Modelle · Text, Bilder und Routing

Für jede Entscheidung das passende Modell.

Surogate Rune 26B-A4B v3 ist das primäre EU-Modell hinter s1-pro und s1-vision. Wähle s1-fast für kurze Textentscheidungen oder den CPU-Auto-Router zur Auswahl eines LLM. Peer-to-Peer bietet den niedrigsten Startpreis; im EU-Tier bleibt die Inferenz in der EU. Die Modellreferenz-Benchmarks unten beschreiben die getesteten Referenzimplementierungen; eine Aktualisierung der gehosteten Capability-Werte steht aus.

Modellprogramm

s1-fast

Plumb-4B · kurzer Text

Kurzer Text, niedrige Latenz. Läuft auf einer gebündelten Engine; Wahrscheinlichkeiten identischer Anfragen können sich geringfügig unterscheiden.

s1-vision

Rune · EU · ein Bild

Entscheidungen mit einem Bild.

s1-llm-auto-router

CPU

Klassifiziert Kategorie, Schwierigkeit und Tragweite für Ihren LLM-Router.

Wenn Rune nicht verfügbar ist, greift s1-pro-Text auf Winnow-12B Q8 zurück; in der EU-Stufe und bei Peer-to-Peer ohne Opt-in zur weltweiten Verarbeitung hat s1-vision kein Ausweichmodell und liefert eine wiederholbare 503-Antwort; Peer-to-Peer-Schlüssel mit Opt-in zur weltweiten Verarbeitung können bei ausgelasteter Kapazität von weltweiten On-Demand-GPUs mit der Gemma-4-12B-Bildimplementierung bedient werden. Auf Peer-to-Peer läuft Rune, wenn freie Queue-/Admission-Kapazität es erlaubt, mit kompatiblem Einzelfragen-Fallback; Bundles sind Best-Effort und können wiederholbare HTTP-503-Antworten liefern. Gesamte Modellliste: /models · Lizenz.

Eingabegrenzen

Wie viel in eine Anfrage passt

Die Grenzen gelten je Anfrage und werden mit dem Tokenizer des gewählten Modells gezählt, nachdem State, Frageanweisungen und Antwortoptionen zusammengesetzt sind. Code, Zahlen und IDs brauchen mehr Tokens pro Zeichen als normaler Text. Die Antwort ist eine typisierte Entscheidung, daher gibt es kein separates Ausgabebudget. Beim State gilt: höchstens 16 KiB serialisiertes JSON bei s1-fast und 250 KiB bei s1-pro und s1-vision; die Anfrage insgesamt höchstens 6 MiB.

ModellMaximale Eingabe je AnfrageÜber der Grenze
s1-fast4.096 TokensHTTP 400 invalid_request; nichts wird gekürzt oder abgerechnet
s1-pro32.000 Tokens, alle Fragen der Anfrage zusammenHTTP 400 invalid_request; nichts wird gekürzt oder abgerechnet
s1-vision32.000 Tokens einschließlich Bild (ein 64×64-Testbild belegte etwa 250 Tokens; größere Bilder mehr)HTTP 400 invalid_request; nichts wird gekürzt oder abgerechnet
s1-llm-auto-routerLiest höchstens 512 Tokens: die ersten 600 Zeichen von context (falls vorhanden), dann den request, gekürzt auf insgesamt 512Angenommen; der Rest wird ignoriert und nicht abgerechnet

Anfragen mit mehr als 16 KiB State bedient immer der EU-Rune-Knoten . Anfragen zwischen 4.096 Tokens und dieser Größe bedient Rune im EU-Tier; bei Peer-to-Peer oder während eines EU-Fallbacks kann ein Knoten mit 4.096 Tokens sie mit HTTP 400 ablehnen (nicht abgerechnet) – dann im EU-Tier erneut senden. Anfragen mit mehr als 16 KiB State können kurz in der Warteschlange stehen: ist die Kapazität für lange Eingaben belegt, antwortet die API mit HTTP 429 und Retry-After: 3; die Anfrage wird dann nicht abgerechnet, einfach erneut senden. Gemessen am 7. Oktober 2026 auf einem eigenen Test-Pod (nicht an der Produktions-API, eine Anfrage ohne Last): etwa 0,4 s bei 8.000, 0,9 s bei 16.000 und 2,3 s bei 32.000 Tokens. Messwerte.

Frühere Messung an der Produktions-API am 6. Oktober 2026 (damals galten 4.096 Tokens je Modell): Anfragen mit 4.095 Tokens (s1-fast) bzw. 4.094 Tokens (s1-pro) wurden angenommen, nur wenige Tokens längere abgelehnt. Messwerte der früheren Messung.

Fähigkeit, Preis und Geschwindigkeit

Rune liegt bei beiden öffentlichen Referenzbenchmarks nahe an Jev. Unsere EU-Eingabepreise liegen unter Jevs Listenpreis. Vergleiche die gemessene Latenz im Diagramm unten. Surogate Rune 26B-A4B v3 ist das Hauptmodell in der EU und dient als s1-pro für kalibrierte Textentscheidungen. Die folgenden Indizes sind öffentliche Referenzergebnisse — keine gehosteten Decision-Models-Scores — und JevBench wird vom Gründer von Decision Models betrieben. Methode und Rohdaten: /benchmarks · Artefakt (JSON) herunterladen.

Decision Index

Balanced, chance-corrected index / 100 ↑ · v0.2.1

Stand: Decision Index v0.2.1, 2. Oktober 2026 · aktuelles Ranking ansehen

  1. #1Jev 1.13.057.91
  2. #2Ours – s1-pro (Surogate Rune 26B-A4B v3)57.44
  3. #3Decider chat · Gemma-4-31B57.33
  4. #4pplx-decider-v1-27b56.40
  5. #5simple-jev · Qwen3.8-27B (featherless)55.74
  6. #6frontier-infra Jebadiah 27B54.67
  7. #7Eikos-27B-FP8 Qwen3.8-27B LoRA53.13
  8. #8reflex Qwen3.8-27B-FP8 (wide choice)52.16
  9. #9Decider chat · Qwen3.6-27B51.35
  10. #10Winnow-12B50.02

Ours – s1-pro · reference modelJev 1.13.0 (Referenz-API)Andere getestete Modelle

Skala 0–100

Quelle: Decision Index · Daten · abgerufen 2 October 2026

Anmerkungen (EN)

Public default balanced index; equal weight across five areas. Rows retain the source order and use sequential display ranks, including tied scores. Jev is the reference API; other entries are tested model implementations. Reference results are not a hosted System1 measurement.

JevBench Capability Score

Mean of Intelligence and Calibration / 100 ↑ · v1.5.5 · gerankt innerhalb der Caps

Stand: JevBench Capability Score v1.5.5, 2. Oktober 2026 · aktuelles Ranking ansehen

  1. #1Jev 1.13.080.01
  2. #2Winnow-12B Q879.25
  3. #3Cygnet79.05
  4. #4Ours – s1-pro (Surogate Rune 26B-A4B v3)79.02
  5. #5Jev-Omni76.54
  6. #6djev76.37
  7. #7JevK5 v0.372.31
  8. #8Plumb-4B71.65
  9. #9Decision 4B v1.271.11
  10. #10Imajev-4B70.80

Ours – s1-pro · reference modelJev 1.13.0 (Referenz-API)Andere getestete Modelle

Skala 0–100

Quelle: JevBench Capability Score · Daten · abgerufen 2 October 2026

Anmerkungen (EN)

Only models inside the cost and median latency caps (each 2× Jev 1.13.0) are ranked. Benchmark run by the founder of System1 Models. Tested reference engines; the hosted System1 engine has not been scored in this release.

Median-Latenz, niedriger ist besser

Medium text · one question · warm HTTP/2 · median ms ↓

  1. s1-pro · EUp95 749.4 ms30/30 erfolgreich199.6 ms
  2. s1-fast · EUp95 286.7 ms30/30 erfolgreich155.1 ms
  3. Jev 1.13.0p95 340.2 ms30/30 erfolgreich233.6 ms

Decision ModelsJev 1.13.0

Skala 0–300 ms

Measured from Nuremberg, Germany, 2 October 2026. 33 rotated rounds on identical medium synthetic support tickets, one question, HTTP/2 persistent clients; first 3 rounds excluded as warm-up; 30 measured calls per target. p50=sample median; p95=nearest rank ceil(0.95*n). End-to-end successful-response latency; every failure retained. s1-pro has a lower median but a higher p95 than Jev. Small sample; results vary with workload and network.

Quelle: Artefakt (JSON) · abgerufen 2 October 2026

Der gemessene Latenzvergleich steht im Geschwindigkeitsdiagramm oben — Mediane, p95 und Erfolgszahlen aus dem verlinkten Messartefakt. Öffentliche Index-Ergebnisse sind nur Referenz — keine gehosteten Decision-Models-Scores.

Methodennotizen (EN)

Public synthetic text; real customer API end-to-end latency, successful-response quantiles; failures tracked separately; no retained customer payloads. p95 uses the nearest sample percentile.

Eingabepreis pro Million Tokens (USD)

$0–0,05 pro M Eingabe-Tokens

  1. s1-fast · Peer-to-Peer$0.032
  2. s1-fast · EU$0.034
  3. s1-pro · Peer-to-Peer$0.038
  4. s1-pro · EU$0.040
  5. Jev 1.13.0$0.042

Decision ModelsJev 1.13.0

$0–0,05 pro M Eingabe-Tokens

Einführungspreise · Ausgabe kostenlos · ohne Steuern.

Quelle: Decision-Models-Preise · Jev-1.13.0-Preis · abgerufen 2 October 2026

Kosten pro 1.000 Entscheidungen (USD)

$0–0,012 pro 1.000 Entscheidungen

  1. s1-pro · Peer-to-Peer$0.0087
  2. s1-pro · EU$0.0093
  3. Jev 1.13.0$0.0109

Decision ModelsJev 1.13.0

$0–0,012 pro 1.000 Entscheidungen

Gemessene Kostenschätzung bei 3 Fragen pro Anruf. EU und Jev: 30/30 erfolgreich. Peer-to-Peer: 14/30 aus Finnland, 12/30 aus Virginia; Kosten nur für erfolgreiche Aufrufe; Peer-to-Peer-Bundles sind Best-Effort und können wiederholbare HTTP-503-Antworten liefern.

Quelle: Artefakt (JSON) · abgerufen 2 October 2026

Anmerkungen (EN)

2 October 2026. Medium text, 3 questions per call, from Finland. Mean billable input tokens × USD list rate / 3 decisions × 1,000. EU/Jev 10/10 successful medium calls; Peer-to-Peer 5/10, estimates cover successful calls only. Internal trial requests were not paid debits. Across all S/M/L cells: EU/Jev 30/30, Peer-to-Peer 14/30 in Finland and 12/30 in Virginia. Peer-to-Peer bundles are best-effort and may return retryable HTTP 503. Shared state billing reduces cost; large bundles can be slower than Jev.

Zwei Ansätze

Wähle den Ansatz, der zu deinen Daten passt.

Dieselben Modellprofile und dieselbe API-Anfrageform. Die Implementierung hängt von verfügbarer Kapazität ab. Wähle pro API-Schlüssel oder pro Anfrage mit einem Header.

PEER-TO-PEERElastische Kapazität

Peer-to-Peer – Kapazität, die mit deinem Bedarf wächst

Gebaut für weltweite Skalierung. Peer-to-Peer startet auf freier EU-Kapazität. Ist sie ausgelastet, können Schlüssel mit deiner Zustimmung nach Bedarf angemietete GPU-Kapazität von Lium nutzen, betrieben von unabhängigen Drittanbietern in verschiedenen Ländern, auch außerhalb der EU/des EWR.

Heute

EU-Anfragen haben Vorrang. Aktiviere „Allow worldwide processing“ (weltweite Verarbeitung erlauben) für jeden Schlüssel, der die EU verlassen darf. Ohne Zustimmung bleibt Peer-to-Peer auf EU-Kapazität und kann bei Auslastung warten oder abgelehnt werden. Bestandskunden behalten die Verarbeitung ausschließlich in der EU, sofern sie nicht zustimmen. Anfrage- und Antwortinhalte werden auf keinem Knoten gespeichert.

  • s1-fast 0,032 $ · s1-pro 0,038 $ je 1 Mio. Eingabe-Tokens
  • Ausgabe-Tokens kostenlos
  • Ideal für hohes Volumen und nicht sensible Daten
Peer-to-Peer-Preise →
EUFlagge der Europäischen UnionHöchster Datenschutz

EU – für die strengsten Datenschutzanforderungen

Für Teams mit höchsten Datenschutzansprüchen oder strengen EU-Regulierungsanforderungen. EU-Anfragen laufen ausschließlich bei vertraglich gebundenen Betreibern in der EU, und Inferenzdaten verlassen die EU nie. EU-Anfragen haben Vorrang, auch wenn ein Schlüssel weltweite Peer-to-Peer-Verarbeitung erlaubt.

  • s1-fast 0,034 $ · s1-pro 0,040 $ je 1 Mio. Eingabe-Tokens
  • Inferenzdaten bleiben in der EU
  • Nur vertraglich gebundene EU-Betreiber – EU-Anfragen haben Vorrang
  • AVV bei der Registrierung, veröffentlichte Liste der Unterauftragsverarbeiter
  • Prompts und Ausgaben werden nie gespeichert oder zum Training genutzt
Zur EU-Seite →

Anmeldung (Google) und Zahlungen (Stripe) übernehmen die Unterauftragsverarbeiter auf unserer Unterauftragsverarbeiter-Seite; sie erhalten nie deine Prompts.

Benchmark-Kontext

Mehrere Quellen. Unterschiedliche Aufgaben.

Vergleiche veröffentlichte Modellwerte mit ihren jeweiligen Versionen, Methoden und Einschränkungen. Werte verschiedener Benchmarks sind keine gemeinsame Rangliste.

Veröffentlichte Modellergebnisse · fünf gleichwertige Quellen · geprüft am 30. September 2026
ModellprofilDecision Index0.2.1Zufallsbereinigter Index / 100Unabhängige CommunityWorkflow EvalsDatensätze 2026-09-28 · Code 0ac3b8aÜbereinstimmung mit ModellreferenzenTypeSafe · ReferenzanbieterJev Rerank Bench2026-09-25Datensatz-Mittel nDCG@10 / 1Unabhängiger AutorJevBench1.5.1Gesamtwertung / 100Derselbe Gründer wie Decision ModelsImageJevBench0.1.4Gesamtwertung / 100Derselbe Gründer wie Decision Models
s1-fastPlumb-4BNicht gemessen¹Nicht gemessen¹Nicht gemessen¹71,56Nicht gemessen¹
s1-proWinnow-12B Q850,02Nicht gemessen¹0,63473,2343,56
TypeSafe-ReferenzJev 1.13.057,9167,80,67072,13Nicht gemessen¹

¹ Nicht gemessen bedeutet: Für dieses Modell wurde keine vergleichbare veröffentlichte Messung verifiziert; es ist kein Nullwert. Ergebnisse beziehen sich auf die getesteten Modellimplementierungen, nicht auf den Decision-Models-Dienst. Die veröffentlichten Werte wurden an den Implementierungen gemessen, die diese Profile zum Veröffentlichungszeitpunkt betrieben (Plumb-4B, Winnow-12B Q8 und der Winnow-Q8-Bildpfad). Seit 2. Oktober 2026 bedient die EU-Stufe s1-pro und s1-vision mit Surogate Rune 26B-A4B v3; Peer-to-Peer-Anfragen können Rune bei freier Kapazität nutzen; Winnow-12B Q8 ist das Ausweichmodell für s1-pro (Text), für s1-vision gibt es in der EU-Stufe und bei Peer-to-Peer ohne Opt-in zur weltweiten Verarbeitung keines (Peer-to-Peer-Schlüssel mit Opt-in können bei Auslastung von weltweiten On-Demand-GPUs mit der Gemma-4-12B-Bildimplementierung bedient werden), und eine Benchmark-Aktualisierung auf der aktuellen EU-Implementierung steht aus. ImageJevBench betrifft einen gesonderten Bildpfad; für Kunden gibt es Bildeingabe mit s1-vision.

Interessenkonflikt: JevBench und ImageJevBench werden vom Gründer von Decision Models betrieben. Workflow Evals wird von TypeSafe AI veröffentlicht, dem Anbieter des Referenzmodells. Es misst Übereinstimmung mit Modellreferenzen, keine Genauigkeit gegen menschliche Labels. Keine Gesamtwertung bei unvollständiger vergleichbarer Abdeckung. Methode und Quellen →