s1-pro
Rune · EU
Kalibrierte Textentscheidungen mit bis zu drei Fragen pro Aufruf. Rune ist das EU-Hauptmodell.
Modelle · Text, Bilder und Routing
Surogate Rune 26B-A4B v3 ist das primäre EU-Modell hinter s1-pro und s1-vision. Wähle s1-fast für kurze Textentscheidungen oder den CPU-Auto-Router zur Auswahl eines LLM. Peer-to-Peer bietet den niedrigsten Startpreis; im EU-Tier bleibt die Inferenz in der EU. Die Modellreferenz-Benchmarks unten beschreiben die getesteten Referenzimplementierungen; eine Aktualisierung der gehosteten Capability-Werte steht aus.
Rune · EU
Kalibrierte Textentscheidungen mit bis zu drei Fragen pro Aufruf. Rune ist das EU-Hauptmodell.
Plumb-4B · kurzer Text
Kurzer Text, niedrige Latenz. Läuft auf einer gebündelten Engine; Wahrscheinlichkeiten identischer Anfragen können sich geringfügig unterscheiden.
Rune · EU · ein Bild
Entscheidungen mit einem Bild.
CPU
Klassifiziert Kategorie, Schwierigkeit und Tragweite für Ihren LLM-Router.
Wenn Rune nicht verfügbar ist, greift s1-pro-Text auf Winnow-12B Q8 zurück; in der EU-Stufe und bei Peer-to-Peer ohne Opt-in zur weltweiten Verarbeitung hat s1-vision kein Ausweichmodell und liefert eine wiederholbare 503-Antwort; Peer-to-Peer-Schlüssel mit Opt-in zur weltweiten Verarbeitung können bei ausgelasteter Kapazität von weltweiten On-Demand-GPUs mit der Gemma-4-12B-Bildimplementierung bedient werden. Auf Peer-to-Peer läuft Rune, wenn freie Queue-/Admission-Kapazität es erlaubt, mit kompatiblem Einzelfragen-Fallback; Bundles sind Best-Effort und können wiederholbare HTTP-503-Antworten liefern. Gesamte Modellliste: /models · Lizenz.
Eingabegrenzen
Die Grenzen gelten je Anfrage und werden mit dem Tokenizer des gewählten Modells gezählt, nachdem State, Frageanweisungen und Antwortoptionen zusammengesetzt sind. Code, Zahlen und IDs brauchen mehr Tokens pro Zeichen als normaler Text. Die Antwort ist eine typisierte Entscheidung, daher gibt es kein separates Ausgabebudget. Beim State gilt: höchstens 16 KiB serialisiertes JSON bei s1-fast und 250 KiB bei s1-pro und s1-vision; die Anfrage insgesamt höchstens 6 MiB.
| Modell | Maximale Eingabe je Anfrage | Über der Grenze |
|---|---|---|
s1-fast | 4.096 Tokens | HTTP 400 invalid_request; nichts wird gekürzt oder abgerechnet |
s1-pro | 32.000 Tokens, alle Fragen der Anfrage zusammen | HTTP 400 invalid_request; nichts wird gekürzt oder abgerechnet |
s1-vision | 32.000 Tokens einschließlich Bild (ein 64×64-Testbild belegte etwa 250 Tokens; größere Bilder mehr) | HTTP 400 invalid_request; nichts wird gekürzt oder abgerechnet |
s1-llm-auto-router | Liest höchstens 512 Tokens: die ersten 600 Zeichen von context (falls vorhanden), dann den request, gekürzt auf insgesamt 512 | Angenommen; der Rest wird ignoriert und nicht abgerechnet |
Anfragen mit mehr als 16 KiB State bedient immer der EU-Rune-Knoten . Anfragen zwischen 4.096 Tokens und dieser Größe bedient Rune im EU-Tier; bei Peer-to-Peer oder während eines EU-Fallbacks kann ein Knoten mit 4.096 Tokens sie mit HTTP 400 ablehnen (nicht abgerechnet) – dann im EU-Tier erneut senden. Anfragen mit mehr als 16 KiB State können kurz in der Warteschlange stehen: ist die Kapazität für lange Eingaben belegt, antwortet die API mit HTTP 429 und Retry-After: 3; die Anfrage wird dann nicht abgerechnet, einfach erneut senden. Gemessen am 7. Oktober 2026 auf einem eigenen Test-Pod (nicht an der Produktions-API, eine Anfrage ohne Last): etwa 0,4 s bei 8.000, 0,9 s bei 16.000 und 2,3 s bei 32.000 Tokens. Messwerte.
Frühere Messung an der Produktions-API am 6. Oktober 2026 (damals galten 4.096 Tokens je Modell): Anfragen mit 4.095 Tokens (s1-fast) bzw. 4.094 Tokens (s1-pro) wurden angenommen, nur wenige Tokens längere abgelehnt. Messwerte der früheren Messung.
Rune liegt bei beiden öffentlichen Referenzbenchmarks nahe an Jev. Unsere EU-Eingabepreise liegen unter Jevs Listenpreis. Vergleiche die gemessene Latenz im Diagramm unten. Surogate Rune 26B-A4B v3 ist das Hauptmodell in der EU und dient als s1-pro für kalibrierte Textentscheidungen. Die folgenden Indizes sind öffentliche Referenzergebnisse — keine gehosteten Decision-Models-Scores — und JevBench wird vom Gründer von Decision Models betrieben. Methode und Rohdaten: /benchmarks · Artefakt (JSON) herunterladen.
Balanced, chance-corrected index / 100 ↑ · v0.2.1
Stand: Decision Index v0.2.1, 2. Oktober 2026 · aktuelles Ranking ansehen
Ours – s1-pro · reference modelJev 1.13.0 (Referenz-API)Andere getestete Modelle
Skala 0–100
Quelle: Decision Index · Daten · abgerufen 2 October 2026
Public default balanced index; equal weight across five areas. Rows retain the source order and use sequential display ranks, including tied scores. Jev is the reference API; other entries are tested model implementations. Reference results are not a hosted System1 measurement.
Mean of Intelligence and Calibration / 100 ↑ · v1.5.5 · gerankt innerhalb der Caps
Stand: JevBench Capability Score v1.5.5, 2. Oktober 2026 · aktuelles Ranking ansehen
Ours – s1-pro · reference modelJev 1.13.0 (Referenz-API)Andere getestete Modelle
Skala 0–100
Quelle: JevBench Capability Score · Daten · abgerufen 2 October 2026
Only models inside the cost and median latency caps (each 2× Jev 1.13.0) are ranked. Benchmark run by the founder of System1 Models. Tested reference engines; the hosted System1 engine has not been scored in this release.
Medium text · one question · warm HTTP/2 · median ms ↓
Decision ModelsJev 1.13.0
Skala 0–300 ms
Measured from Nuremberg, Germany, 2 October 2026. 33 rotated rounds on identical medium synthetic support tickets, one question, HTTP/2 persistent clients; first 3 rounds excluded as warm-up; 30 measured calls per target. p50=sample median; p95=nearest rank ceil(0.95*n). End-to-end successful-response latency; every failure retained. s1-pro has a lower median but a higher p95 than Jev. Small sample; results vary with workload and network.
Quelle: Artefakt (JSON) · abgerufen 2 October 2026
Der gemessene Latenzvergleich steht im Geschwindigkeitsdiagramm oben — Mediane, p95 und Erfolgszahlen aus dem verlinkten Messartefakt. Öffentliche Index-Ergebnisse sind nur Referenz — keine gehosteten Decision-Models-Scores.
Public synthetic text; real customer API end-to-end latency, successful-response quantiles; failures tracked separately; no retained customer payloads. p95 uses the nearest sample percentile.
$0–0,05 pro M Eingabe-Tokens
Decision ModelsJev 1.13.0
$0–0,05 pro M Eingabe-Tokens
Einführungspreise · Ausgabe kostenlos · ohne Steuern.
Quelle: Decision-Models-Preise · Jev-1.13.0-Preis · abgerufen 2 October 2026
$0–0,012 pro 1.000 Entscheidungen
Decision ModelsJev 1.13.0
$0–0,012 pro 1.000 Entscheidungen
Gemessene Kostenschätzung bei 3 Fragen pro Anruf. EU und Jev: 30/30 erfolgreich. Peer-to-Peer: 14/30 aus Finnland, 12/30 aus Virginia; Kosten nur für erfolgreiche Aufrufe; Peer-to-Peer-Bundles sind Best-Effort und können wiederholbare HTTP-503-Antworten liefern.
Quelle: Artefakt (JSON) · abgerufen 2 October 2026
2 October 2026. Medium text, 3 questions per call, from Finland. Mean billable input tokens × USD list rate / 3 decisions × 1,000. EU/Jev 10/10 successful medium calls; Peer-to-Peer 5/10, estimates cover successful calls only. Internal trial requests were not paid debits. Across all S/M/L cells: EU/Jev 30/30, Peer-to-Peer 14/30 in Finland and 12/30 in Virginia. Peer-to-Peer bundles are best-effort and may return retryable HTTP 503. Shared state billing reduces cost; large bundles can be slower than Jev.
Zwei Ansätze
Dieselben Modellprofile und dieselbe API-Anfrageform. Die Implementierung hängt von verfügbarer Kapazität ab. Wähle pro API-Schlüssel oder pro Anfrage mit einem Header.
Gebaut für weltweite Skalierung. Peer-to-Peer startet auf freier EU-Kapazität. Ist sie ausgelastet, können Schlüssel mit deiner Zustimmung nach Bedarf angemietete GPU-Kapazität von Lium nutzen, betrieben von unabhängigen Drittanbietern in verschiedenen Ländern, auch außerhalb der EU/des EWR.
Heute
EU-Anfragen haben Vorrang. Aktiviere „Allow worldwide processing“ (weltweite Verarbeitung erlauben) für jeden Schlüssel, der die EU verlassen darf. Ohne Zustimmung bleibt Peer-to-Peer auf EU-Kapazität und kann bei Auslastung warten oder abgelehnt werden. Bestandskunden behalten die Verarbeitung ausschließlich in der EU, sofern sie nicht zustimmen. Anfrage- und Antwortinhalte werden auf keinem Knoten gespeichert.
Für Teams mit höchsten Datenschutzansprüchen oder strengen EU-Regulierungsanforderungen. EU-Anfragen laufen ausschließlich bei vertraglich gebundenen Betreibern in der EU, und Inferenzdaten verlassen die EU nie. EU-Anfragen haben Vorrang, auch wenn ein Schlüssel weltweite Peer-to-Peer-Verarbeitung erlaubt.
Anmeldung (Google) und Zahlungen (Stripe) übernehmen die Unterauftragsverarbeiter auf unserer Unterauftragsverarbeiter-Seite; sie erhalten nie deine Prompts.
Benchmark-Kontext
Vergleiche veröffentlichte Modellwerte mit ihren jeweiligen Versionen, Methoden und Einschränkungen. Werte verschiedener Benchmarks sind keine gemeinsame Rangliste.
| Modellprofil | Decision Index0.2.1Zufallsbereinigter Index / 100Unabhängige Community | Workflow EvalsDatensätze 2026-09-28 · Code 0ac3b8aÜbereinstimmung mit ModellreferenzenTypeSafe · Referenzanbieter | Jev Rerank Bench2026-09-25Datensatz-Mittel nDCG@10 / 1Unabhängiger Autor | JevBench1.5.1Gesamtwertung / 100Derselbe Gründer wie Decision Models | ImageJevBench0.1.4Gesamtwertung / 100Derselbe Gründer wie Decision Models |
|---|---|---|---|---|---|
| s1-fastPlumb-4B | Nicht gemessen¹ | Nicht gemessen¹ | Nicht gemessen¹ | 71,56 | Nicht gemessen¹ |
| s1-proWinnow-12B Q8 | 50,02 | Nicht gemessen¹ | 0,634 | 73,23 | 43,56 |
| TypeSafe-ReferenzJev 1.13.0 | 57,91 | 67,8 | 0,670 | 72,13 | Nicht gemessen¹ |
¹ Nicht gemessen bedeutet: Für dieses Modell wurde keine vergleichbare veröffentlichte Messung verifiziert; es ist kein Nullwert. Ergebnisse beziehen sich auf die getesteten Modellimplementierungen, nicht auf den Decision-Models-Dienst. Die veröffentlichten Werte wurden an den Implementierungen gemessen, die diese Profile zum Veröffentlichungszeitpunkt betrieben (Plumb-4B, Winnow-12B Q8 und der Winnow-Q8-Bildpfad). Seit 2. Oktober 2026 bedient die EU-Stufe s1-pro und s1-vision mit Surogate Rune 26B-A4B v3; Peer-to-Peer-Anfragen können Rune bei freier Kapazität nutzen; Winnow-12B Q8 ist das Ausweichmodell für s1-pro (Text), für s1-vision gibt es in der EU-Stufe und bei Peer-to-Peer ohne Opt-in zur weltweiten Verarbeitung keines (Peer-to-Peer-Schlüssel mit Opt-in können bei Auslastung von weltweiten On-Demand-GPUs mit der Gemma-4-12B-Bildimplementierung bedient werden), und eine Benchmark-Aktualisierung auf der aktuellen EU-Implementierung steht aus. ImageJevBench betrifft einen gesonderten Bildpfad; für Kunden gibt es Bildeingabe mit s1-vision.
Interessenkonflikt: JevBench und ImageJevBench werden vom Gründer von Decision Models betrieben. Workflow Evals wird von TypeSafe AI veröffentlicht, dem Anbieter des Referenzmodells. Es misst Übereinstimmung mit Modellreferenzen, keine Genauigkeit gegen menschliche Labels. Keine Gesamtwertung bei unvollständiger vergleichbarer Abdeckung. Methode und Quellen →