Kleine, schnelle Modelle, die eine typisierte Frage mit Wahrscheinlichkeiten beantworten: Ticket zuordnen, Aktion freigeben, Entwurf bewerten. Bis zu ~40× günstiger und ~18× schneller als ein 27B-Reasoning-LLM bei denselben Entscheidungsaufgaben.¹
1 JevBench-Schätzungen für dieselben Entscheidungsaufgaben im Vergleich zu einem 27B-Reasoning-LLM; keine Messung des gehosteten Dienstes. Methode und Einordnung →
Anfrage → AntwortBeispiel-Anfragen
ANFRAGE / Auswahl
Zustand: Mia besitzt ein rotes Fahrrad.
Frage: Welche Farbe hat das Fahrrad?
ANTWORT / Wahrscheinlichkeiten
rot0.91
blau0.09
ANFRAGE / Auswahl
Zustand: Ein Geschäftskunde möchte die Rechnungsadresse ändern.
Frage: Welche Support-Warteschlange passt?
ANTWORT / Wahrscheinlichkeiten
billing0.87
technical0.09
account0.04
ANFRAGE / Ja-Nein
Zustand: Ein Nutzer mit Leserolle löscht einen Arbeitsbereich.
Unser niedrigster Preis pro Entscheidung, auf Kapazität, die mit dem Bedarf wächst.
Heute: freie EU-Kapazität und GPUs nach Bedarf für Schlüssel mit erlaubter weltweiter Verarbeitung.
Als Nächstes: das REAX-Netzwerk – ein Bittensor-Subnetz, in dem alle mit einer starken GPU offene Modelle bereitstellen und variable Subnetz-Belohnungen erhalten können – mit den damit verbundenen Risiken.
Prüfe geplante Aktionen. Behalte feste Zugriffskontrollen in deiner Anwendung.
Leser löscht Arbeitsbereich → erlaubt?
Qualität
Entwürfe nach Kriterien bewerten
Bewerte Antworten oder Zusammenfassungen und eskaliere unsichere Fälle.
Entwurf + Kriterien → Bewertung
Vertrieb
Leads priorisieren
Ordne eingehende Nachrichten nach deinen Kriterien ein.
Rollout möglich? → heiß | warm | kalt
Betrieb / Dokumente
Dokumente richtig weiterleiten
Ordne Dokumenttext dem passenden Ablauf zu.
Dokument → Rechnung | Vertrag | Sonstiges
Agents
Den nächsten Schritt wählen
Wähle zwischen Suche, Rückfrage, Antwort oder Stopp.
Kontext + Tools → nächster Schritt?
LLM-Kosten
Anfragen zum passenden Modell routen
Klassifiziere Schwierigkeit und Risiko, bevor du ein LLM auswählst.
Anfrage → Kategorie · Schwierigkeit · Risiko
Beispiele zur Orientierung. Prüfe repräsentative Fälle mit deinen eigenen Daten, bevor du Entscheidungen automatisierst.
Zahlen mit Einordnung
Schneller und günstiger – mit Grenzen bei der Genauigkeit.
Für klar umrissene Entscheidungen kann ein kleineres Modell ausreichen. Für offene Texte oder schwierige Schlussfolgerungen bleibt ein LLM die bessere Wahl.
JE 1.000 ENTSCHEIDUNGEN
~40× niedrigere geschätzte Kosten
Rund 0,05 $ gegenüber 2,18 $ für ein 27B-Reasoning-LLM.
DIESELBEN AUFGABEN
~18× schnellerer angepasster Median
Rund 0,35 s gegenüber 6,49 s.
BENCHMARK-ERGEBNISSE
Geringere Spitzen-Genauigkeit
Das verglichene Entscheidungsmodell liegt bei der Genauigkeit unter Frontier-LLMs.
JevBench-Kosten- und Medianzeitwerte sind Schätzungen aus Modellimplementierungen, keine Messungen des gehosteten Decision-Models-Dienstes. Die Benchmark wird vom Gründer von Decision Models betrieben. Für freies Schreiben und schwierige Schlussfolgerungen eignet sich ein Frontier-LLM besser. Methode und Quellen → · Quelldaten
Presse-Einordnung
Was TechCrunch über Jev schrieb
“…LLMs as we know them aren't the right solution for a lot of software because they are comparatively slow and expensive.”
— TechCrunch; der Artikel handelt von Jev, nicht von Decision Models.
Modellprogramm
s1-pro
Rune · EU
Kalibrierte Textentscheidungen mit bis zu drei Fragen pro Aufruf. Rune ist das EU-Hauptmodell.
s1-fast
Plumb-4B · kurzer Text
Kurzer Text, niedrige Latenz. Läuft auf einer gebündelten Engine; Wahrscheinlichkeiten identischer Anfragen können sich geringfügig unterscheiden.
s1-vision
Rune · EU · ein Bild
Entscheidungen mit einem Bild.
s1-llm-auto-router
CPU
Klassifiziert Kategorie, Schwierigkeit und Tragweite für Ihren LLM-Router.
Wenn Rune nicht verfügbar ist, greift s1-pro-Text auf Winnow-12B Q8 zurück; in der EU-Stufe und bei Peer-to-Peer ohne Opt-in zur weltweiten Verarbeitung hat s1-vision kein Ausweichmodell und liefert eine wiederholbare 503-Antwort; Peer-to-Peer-Schlüssel mit Opt-in zur weltweiten Verarbeitung können bei ausgelasteter Kapazität von weltweiten On-Demand-GPUs mit der Gemma-4-12B-Bildimplementierung bedient werden. Auf Peer-to-Peer läuft Rune, wenn freie Queue-/Admission-Kapazität es erlaubt, mit kompatiblem Einzelfragen-Fallback; Bundles sind Best-Effort und können wiederholbare HTTP-503-Antworten liefern. Gesamte Modellliste: /models · Lizenz.
Fähigkeit, Preis und Geschwindigkeit
Rune liegt bei beiden öffentlichen Referenzbenchmarks nahe an Jev. Unsere EU-Eingabepreise liegen unter Jevs Listenpreis. Vergleiche die gemessene Latenz im Diagramm unten. Surogate Rune 26B-A4B v3 ist das Hauptmodell in der EU und dient als s1-pro für kalibrierte Textentscheidungen. Die folgenden Indizes sind öffentliche Referenzergebnisse — keine gehosteten Decision-Models-Scores — und JevBench wird vom Gründer von Decision Models betrieben. Methode und Rohdaten: /benchmarks · Artefakt (JSON) herunterladen.
Public default balanced index; equal weight across five areas. Rows retain the source order and use sequential display ranks, including tied scores. Jev is the reference API; other entries are tested model implementations. Reference results are not a hosted System1 measurement.
JevBench Capability Score
Mean of Intelligence and Calibration / 100 ↑ · v1.5.5 · gerankt innerhalb der Caps
Only models inside the cost and median latency caps (each 2× Jev 1.13.0) are ranked. Benchmark run by the founder of System1 Models. Tested reference engines; the hosted System1 engine has not been scored in this release.
Median-Latenz, niedriger ist besser
Medium text · one question · warm HTTP/2 · median ms ↓
s1-pro · EUp95 749.4 ms30/30 erfolgreich199.6 ms
s1-fast · EUp95 286.7 ms30/30 erfolgreich155.1 ms
Jev 1.13.0p95 340.2 ms30/30 erfolgreich233.6 ms
Decision ModelsJev 1.13.0
Skala 0–300 ms
Measured from Nuremberg, Germany, 2 October 2026. 33 rotated rounds on identical medium synthetic support tickets, one question, HTTP/2 persistent clients; first 3 rounds excluded as warm-up; 30 measured calls per target. p50=sample median; p95=nearest rank ceil(0.95*n). End-to-end successful-response latency; every failure retained. s1-pro has a lower median but a higher p95 than Jev. Small sample; results vary with workload and network.
Der gemessene Latenzvergleich steht im Geschwindigkeitsdiagramm oben — Mediane, p95 und Erfolgszahlen aus dem verlinkten Messartefakt. Öffentliche Index-Ergebnisse sind nur Referenz — keine gehosteten Decision-Models-Scores.
Methodennotizen (EN)
Public synthetic text; real customer API end-to-end latency, successful-response quantiles; failures tracked separately; no retained customer payloads. p95 uses the nearest sample percentile.
Eingabepreis pro Million Tokens (USD)
$0–0,05 pro M Eingabe-Tokens
s1-fast · Peer-to-Peer$0.032
s1-fast · EU$0.034
s1-pro · Peer-to-Peer$0.038
s1-pro · EU$0.040
Jev 1.13.0$0.042
Decision ModelsJev 1.13.0
$0–0,05 pro M Eingabe-Tokens
Einführungspreise · Ausgabe kostenlos · ohne Steuern.
Gemessene Kostenschätzung bei 3 Fragen pro Anruf. EU und Jev: 30/30 erfolgreich. Peer-to-Peer: 14/30 aus Finnland, 12/30 aus Virginia; Kosten nur für erfolgreiche Aufrufe; Peer-to-Peer-Bundles sind Best-Effort und können wiederholbare HTTP-503-Antworten liefern.
2 October 2026. Medium text, 3 questions per call, from Finland. Mean billable input tokens × USD list rate / 3 decisions × 1,000. EU/Jev 10/10 successful medium calls; Peer-to-Peer 5/10, estimates cover successful calls only. Internal trial requests were not paid debits. Across all S/M/L cells: EU/Jev 30/30, Peer-to-Peer 14/30 in Finland and 12/30 in Virginia. Peer-to-Peer bundles are best-effort and may return retryable HTTP 503. Shared state billing reduces cost; large bundles can be slower than Jev.
Die Schnittstelle
Eine API für wiederkehrende Entscheidungen
Sende Kontext und typisierte Fragen: bis zu drei mit s1-pro, eine mit s1-fast oder s1-vision. Du erhältst eine gewählte Antwort mit Wahrscheinlichkeiten, wenn das Modell sie unterstützt.
01 / INTEGRIEREN
Eine Anfrageform
Nutze einen benannten Zustand und Fragen vom Typ noul, choice oder score pro Anfrage.
02 / PRÜFEN
Eine nützliche Antwort
Lies Antwort, Konfidenz oder Wahrscheinlichkeitsverteilung, Nutzungsbeleg und die verwendete Stufe.
03 / STEUERN
Deine Stufe
Wähle Peer-to-Peer oder EU pro API-Schlüssel oder pro Anfrage mit dem Header S1-Region.
Zwei Ansätze
Wähle den Ansatz, der zu deinen Daten passt.
Dieselben Modellprofile und dieselbe API-Anfrageform. Die Implementierung hängt von verfügbarer Kapazität ab. Wähle pro API-Schlüssel oder pro Anfrage mit einem Header.
PEER-TO-PEERElastische Kapazität
Peer-to-Peer – Kapazität, die mit deinem Bedarf wächst
Gebaut für weltweite Skalierung. Peer-to-Peer startet auf freier EU-Kapazität. Ist sie ausgelastet, können Schlüssel mit deiner Zustimmung nach Bedarf angemietete GPU-Kapazität von Lium nutzen, betrieben von unabhängigen Drittanbietern in verschiedenen Ländern, auch außerhalb der EU/des EWR.
Heute
EU-Anfragen haben Vorrang. Aktiviere „Allow worldwide processing“ (weltweite Verarbeitung erlauben) für jeden Schlüssel, der die EU verlassen darf. Ohne Zustimmung bleibt Peer-to-Peer auf EU-Kapazität und kann bei Auslastung warten oder abgelehnt werden. Bestandskunden behalten die Verarbeitung ausschließlich in der EU, sofern sie nicht zustimmen. Anfrage- und Antwortinhalte werden auf keinem Knoten gespeichert.
Für Teams mit höchsten Datenschutzansprüchen oder strengen EU-Regulierungsanforderungen. EU-Anfragen laufen ausschließlich bei vertraglich gebundenen Betreibern in der EU, und Inferenzdaten verlassen die EU nie. EU-Anfragen haben Vorrang, auch wenn ein Schlüssel weltweite Peer-to-Peer-Verarbeitung erlaubt.
Anmeldung (Google) und Zahlungen (Stripe) übernehmen die Unterauftragsverarbeiter auf unserer Unterauftragsverarbeiter-Seite; sie erhalten nie deine Prompts.
Für Teams
Alles, was du zum Integrieren brauchst.
SCHNELLSTART
Dokumentation
Anfrageformen, Fehler und ein Migrationsleitfaden von Jev.
Nein. Decision Models ist ein eigenständiger Dienst für offene Entscheidungsmodelle mit einer Jev-kompatiblen API. Jev ist eine Marke von TypeSafe AI; Decision Models ist nicht mit TypeSafe verbunden.
Wie bekomme ich API-Zugang?
Mit Google anmelden, im Dashboard einen API-Schlüssel erstellen und die erste Anfrage senden. Kostenloses Kontingent auf Einladung. Aufladen ab 1 EUR. Privatpersonen und Unternehmen weltweit können sich registrieren und Guthaben aufladen. Steuern werden im Checkout angezeigt, bevor du bezahlst.
Werden Prompts oder Antworten gespeichert?
Nein. Prompts und Ausgaben werden nie gespeichert oder zum Training genutzt. Für die Abrechnung speichern wir nur Nutzungsdaten wie Token-Zahlen.
Worin unterscheiden sich Peer-to-Peer und EU?
Peer-to-Peer startet auf freier EU-Kapazität; EU-Anfragen haben Vorrang. Bei Auslastung kann Peer-to-Peer nach Bedarf angemietete GPU-Kapazität von Lium (lium.io) nutzen. Unabhängige Drittanbieter betreiben die Hardware in verschiedenen Ländern, einschließlich außerhalb der EU/des EWR. Das erfolgt nur für Schlüssel mit aktiviertem „Allow worldwide processing“ (weltweite Verarbeitung erlauben). Ohne Zustimmung bleibt Peer-to-Peer auf EU-Kapazität und kann bei Auslastung warten oder abgelehnt werden. Bestandskunden behalten die Verarbeitung ausschließlich in der EU, sofern sie nicht zustimmen. Anfrage- und Antwortinhalte werden auf keinem Knoten gespeichert. Anfragen des EU-Tiers bleiben immer in der EU. Verarbeitungsorte und Übermittlungsbedingungen →
Was erlaubt weltweite Verarbeitung?
Nur Peer-to-Peer-Anfragen von Schlüsseln mit deiner Zustimmung können Lium-GPU-Kapazität außerhalb der EU/des EWR nutzen, wenn freie EU-Kapazität ausgelastet ist. Anfragen des EU-Tiers bleiben immer in der EU. Der Schalter schafft keine Rechtsgrundlage für die Übermittlung personenbezogener Daten: Sende solche Daten auf Schlüsseln mit Zustimmung nur, wenn für deine Nutzung eine geeignete Übermittlungsgrundlage besteht. Lies den AVV und die Liste der Unterauftragsverarbeiter.
Kann ich Bilder senden?
Ja, mit s1-vision: ein Bild pro Anfrage (PNG, JPEG oder WebP). Reine Text-Anfragen kosten wie s1-pro; eine Anfrage mit Bild wird für alle Eingabe-Tokens (Text und Bildpositionen) zum Bildpreis abgerechnet, weil Bildverarbeitung pro Token etwa 3× so viel GPU-Zeit braucht. Ein Bild zählt als die Eingabe-Tokens, die das Modell tatsächlich liest.
Ist ein Entscheidungsmodell so genau wie ein Frontier-LLM?
Nein. Im Benchmark erzielt das verglichene Entscheidungsmodell eine geringere Genauigkeit als Frontier-LLMs. Prüfe eigene Beispieldaten; für offene Texte und schwierige Aufgaben nutze ein Frontier-LLM oder eine menschliche Prüfung. Methode und Ergebnisse →