TypeSafe Jev im Test: Preise, echte Latenz, ehrliche Grenzen
Tech
TypeSafe AI
Jev
System One Models
AI Agents

TypeSafe Jev im Test: Preise, echte Latenz, ehrliche Grenzen

TypeSafes Jev liefert typisierte Entscheidungen statt Text für 0,042 $ pro einer Million Tokens. Was der Launch verspricht, was Kritiker gemessen haben und wo es tatsächlich passt.

Uygar DuzgunUUygar Duzgun
Sep 19, 2026
Aktualisiert 21. Sept. 2026
14 min read

Der teuerste Teil meiner Content-Pipeline ist nicht das Schreiben. Es ist das Entscheiden. Genau für dieses Problem wurde TypeSafe Jev entwickelt – weshalb ich einen Vormittag mit einem Modell verbracht habe, das keinen einzigen Satz schreiben kann.

Jeder Artikel, der die Pipeline durchläuft, löst eine Reihe kleiner Entscheidungen aus: Ist dieses Thema eine Berichterstattung wert, handelt es sich um einen Tech- oder Musikbeitrag, ist der Entwurf gut genug, um die Redaktionsprüfung zu bestehen, rechtfertigt der SEO-Score eine Überarbeitung? Keine dieser Aufgaben braucht Prosa. Sie brauchen eine Antwort, die ein Switch-Statement lesen kann. Und bis letzte Woche war die einzige Möglichkeit, die ich dafür hatte, ein Frontier-Modell zu mieten, das einen Absatz generiert, ihn in JSON verpackt und mir beides berechnet.

Am 15. September 2026 veröffentlichte ein Labor namens TypeSafe AI ein Modell, das genau dieses Muster beseitigen soll. TypeSafe Jev ist ein System-One-Modell: Es generiert überhaupt keinen Text und kostet 0,042 $ pro einer Million Input-Tokens, während der Output kostenlos ist.

Ich hatte noch keinen praktischen Zugriff darauf. Der Early Access ist mit einer Warteliste versehen. Das hier ist also kein Praxistest. Es ist die Recherche, die ich durchgeführt habe, bevor ich entschied, ob ich das Modell auf eine Roadmap setzen sollte: die Teile des Launches, die einer Prüfung standhalten, die Teile, die das nicht tun, und wo es tatsächlich in die Systeme passen würde, die ich bereits betreibe.

Was TypeSafe tatsächlich veröffentlicht hat

TypeSafe AI entstand nach ungefähr zwei Jahren im Stealth-Modus mit einer Seed-Finanzierungsrunde über 40 Millionen Dollar unter Führung von DCVC. Das Gründungsteam besteht aus Diogo Almeida, Erik Gafni und Sasha Sheng.

Almeidas Hintergrund ist der Grund, warum dieser Launch Aufmerksamkeit bekam, statt einfach weitergescrollt zu werden. Er war bei OpenAI, Hauptautor mit gleichem Beitragsanteil am InstructGPT-Paper und wirkte an GPT-4 mit. Einige Berichte zum Launch verkürzten das zu „Miterfinder von ChatGPT“, was eine Übertreibung ist, die eine große gemeinsame Leistung auf eine Person reduziert. Die korrekte Version ist dennoch stark: Er half dabei, die Forschung zum Befolgen von Anweisungen aufzubauen, die Conversational Assistants funktionsfähig machte, und argumentiert nun, dass dieser Ansatz die falsche Schnittstelle für Automatisierung ist.

Seine zentrale Frage ist der gute Teil: Modelle sind seit Jahren übermenschlich gut im Chat – wo bleibt also die ganze Automatisierung?

TypeSafes Antwort lautet, dass der Engpass nie die Intelligenz war. Das Problem ist, dass ein Modell, das in Prosa antwortet, eine umständliche Grundlage für Software ist. Man stellt eine Frage, erhält einen String, parst ihn, validiert ihn, behandelt den Fall, dass das Modell die Antwort verweigert, behandelt den Fall, dass es zuerst drei Absätze Begründung schreibt, und verzweigt erst danach. Strukturierte Outputs haben das weniger schmerzhaft gemacht. Sie haben nichts daran geändert, dass die zugrunde liegende Schnittstelle weiterhin generativ ist.

Jev setzt stattdessen beim Entscheidungsraum an. Die Namensgebung ist an beiden Enden bewusst gewählt: „System One“ ist eine Anspielung auf Kahnemans schnelles, intuitives System-1-Denken, und Jev ist nach William Stanley Jevons benannt, dessen Paradoxon besagt, dass sinkende Kosten zu steigendem Verbrauch führen. TypeSafe sagt dir damit, was seiner Erwartung nach mit dem Aufrufvolumen passieren wird.

Drei Primitive – und das ist die gesamte API

Du sendest Programmzustand zusammen mit typisierten Fragen. Du erhältst typisierte Antworten zurück, die jeweils eine kalibrierte Wahrscheinlichkeit enthalten. Es gibt genau drei Fragetypen.

Choice, Score und Noul

Choice wählt eine Option aus einer deklarierten Menge von bis zu 255 Optionen und gibt eine Wahrscheinlichkeitsverteilung über alle Optionen sowie einen Konfidenzwert zurück.

Score ordnet den Input auf einer Skala von zwei bis zehn geordneten Stufen ein, die du in Worten beschreibst. Es gibt eine kontinuierliche Position zurück, die zwischen den Stufen liegen kann – 1,035 ist also eine gültige Antwort.

Noul bewertet eine binäre Aussage und gibt eine einzelne Zahl zwischen 0 und 1 zurück: die Wahrscheinlichkeit, dass sie wahr ist. Es gibt kein separates Konfidenzfeld, weil die Zahl bereits die Einschätzung darstellt.

Wie ein echter Aufruf aussieht

Hier ist die Struktur, die TypeSafes Python SDK dokumentiert:

python from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()

response = client.system_one( state={ "ticket": {"subject": "Duplicate charge", "body": "I was charged twice for order A-104."}, "order": {"id": "A-104", "charges": [{"amount_usd": 49}, {"amount_usd": 49}]}, "refund_policy": "Duplicate charges are eligible for a refund.", }, questions={ "department": Choice( instructions="Which team should handle this", criteria={ "billing": "Payment or subscription issues", "technical": "Bugs or integration problems", "other": "Anything else", }, ), "frustration": Score( instructions="How frustrated the customer appears", criteria=["Calm, just stating facts", "Frustrated but civil", "Very angry"], ), "refund_requested": Noul(instructions="The customer is explicitly asking for a refund"), "policy_supports": Noul(instructions="The stated refund policy covers this situation"), }, )

if response.answers["refund_requested"].noul > 0.7 and response.answers["policy_supports"].noul > 0.8: start_refund_flow("A-104")

Vier Entscheidungen, eine Anfrage, ein Roundtrip. Das Modell liefert semantisches Verständnis. Die Richtlinie bleibt im Code, wo ich sie lesen, vergleichen und testen kann.

Dieser letzte Punkt ist das architektonische Argument und interessanter als der Preis. Statt ein Modell zu bitten, „diesen Kunden zu bearbeiten“, legst du fest, was verstanden werden muss, und hältst fest, was danach passiert – in gewöhnlicher Versionsverwaltung.

Was TypeSafe Jev kostet

Das ist die Zahl, die Aufmerksamkeit erregt hat.

DimensionJevFrontier-LLMs
---------
Input-Preis0,042 $ / MTok0,20–10 $ / MTok
Output-PreisKostenlosUngefähr das 5-Fache des Inputs
Latenz (Anbieter)70–500 ms3–329 s
Kontext64k State + FragenHunderttausende
Output-FormTypisiert, festes SchemaStrings, die du parsen musst
KonfidenzKalibriert, in jedem FeldBei Prompts inkonsistent

Dass der Output kostenlos ist, ist keine Werbeaktion. Es gibt keine autoregressive Decodierungsschleife, also gibt es nichts zu messen. Ob 0,042 $ nachhaltig oder durch Venture-Kapital subventioniert ist, lässt sich derzeit nicht wissen, und TypeSafe sagt das in seinem eigenen Launch-Post direkt. Das Unternehmen erwartet, dass der Preis eher sinkt als steigt – eine Behauptung, die nur die Zeit klären kann.

Die Kontextlimits funktionieren anders als bei einem LLM, weil der State einmal eingelesen wird und die Fragen parallel darüber laufen: ungefähr 64k Tokens für State und alle Fragen zusammen, davon etwa 32k für den State plus die einzelne längste Frage. Nur Text und strukturiertes JSON. Keine Bilder, kein Audio, kein Video.

Die Latenzbehauptung und was tatsächlich gemessen wurde

TypeSafe veröffentlichte eine End-to-End-Latenz von 70–500 ms. Der Launch-Post ist ehrlich und weist darauf hin, dass diese Läufe auf den eigenen Laptops des Teams an der US-Westküste durchgeführt wurden – also unter den besten Bedingungen für eine in den USA gehostete API.

Ein Engineer bei Classmethod Malaysia setzte das Modell in einer echten Routing-Aufgabe ein. Er erhielt Zugang über die Warteliste, rief POST https://api.typesafe.ai/v1/systemone direkt auf und verwendete Choice, um den Classifier aus NVIDIAs NeMo-Switchyard-Routing-Setup nachzubilden, der Konversationen in vier Stufen einteilt. Vierzig Aufrufe, zehn pro Stufe.

Alle 40 waren erfolgreich. Alle 40 stimmten mit der erwarteten Stufe überein. Die mediane Latenz lag bei 0,64–0,67 Sekunden. Kosten pro Aufruf: 0,000025–0,000027 $.

Das ist ungefähr zehnmal langsamer als die beworbenen 70 ms und dennoch das interessanteste Ergebnis des gesamten Launch-Zyklus. Denn ersetzt wurde ein Gemini-3.5-Flash-Classifier mit einer medianen Latenz von 2,1 Sekunden oder ein DeepSeek-V4-Flash-Classifier mit 7,2 Sekunden. Jev war ungefähr dreimal schneller als die schnelle und teure Option und zehnmal schneller als die günstige und langsame – bei Kosten von Bruchteilen eines Cents pro Aufruf.

Ein Detail aus diesem Test ist mehr wert als die Geschwindigkeitszahlen. Bei den drei eindeutigen Stufen lag die Konfidenz bei 1,0. Bei der tatsächlich grenzwertigen „mittleren“ Stufe sank sie auf 0,57–0,67. Das Modell wusste, welcher Aufruf schwierig war. Diese Eigenschaft lässt sich aus einem Chat-Modell nicht zuverlässig herausholen, und genau sie verändert, wie du den umgebenden Code schreibst.

Was andere über TypeSafe Jev sagen

Der Launch löste einen Hacker-News-Thread mit 256 Kommentaren aus. Das Nützliche daran ist, dass fast niemand behauptete, die Technologie sei gefälscht. Mehrere Kommentatoren sagten, sie würden das Modell einsetzen. Die Kritik richtete sich klar gegen das Marketing, und sie ist lesenswert, bevor jemand darauf eine Roadmap aufbaut.

„Frontier-Modell“ leistet viel Arbeit

Jev kann keinen Code schreiben, keine Unterhaltung führen und keinen Satz formulieren. Es in derselben Formulierung wie GPT oder Claude zu nennen, leiht ihm Glaubwürdigkeit, die es sich nicht unabhängig verdient hat. Ein Kommentator schlug eine ehrlichere Überschrift vor: Es hat die Geschwindigkeits- und Kostenfrontier für strukturierte Entscheidungen verschoben. Das ist eine echte Leistung. Es ist aber nicht derselbe Satz.

„Kann nicht halluzinieren“ ist enger, als es klingt

Es stimmt, dass ein Modell, das niemals freien Text ausgibt, keine Zitation oder keinen Tool-Namen erfinden kann, und TypeSafes Zahl von 0 % Typfehlern ergibt sich konstruktionsbedingt und nicht aus einer Messung. Aber ein Modell, das auf drei erlaubte Kategorien beschränkt ist, kann trotzdem selbstbewusst die falsche auswählen. Beseitigt wurde die fehlerhafte Antwort, nicht die falsche Einschätzung. TypeSafes eigener CEO stimmte dieser Unterscheidung im Thread direkt zu.

Der Geschwindigkeitsvergleich ist möglicherweise nicht ganz fair

Die Zahl von 70 ms wird mit LLMs verglichen, die eine gesamte strukturierte Antwort autoregressiv generieren – einschließlich Schema-Namen und Formatierung – und nicht mit einem LLM, das darauf beschränkt ist, dieselbe kurze Entscheidung auszugeben. Diese methodische Frage ist noch nicht geklärt.

Die Evals sind selbst entworfen

TypeSafe entwickelte ein neues Format für „Workflow-Evals“, statt öffentliche Benchmarks auszuführen, und bewertete Modelle anhand der durchschnittlichen Vorhersage von GPT-6 Astra und Fable 5.1 statt anhand von Ground Truth. Das Unternehmen weist selbst auf seine Einschränkungen hin: Die Workflows wurden vom eigenen Team erstellt, die Referenzmodelle verzerren die Ergebnisse zugunsten von OpenAI und Anthropic, und konkurrierende LLMs laufen über TypeSafes eigenen Adapter. Außerdem hat das Unternehmen angekündigt, öffentliche Leaderboards zu überspringen – was mehrere Personen als bequem interpretierten.

Es gibt kein Architektur-Paper. RLCD, also Reinforcement Learning for Calibrated Decisions, ist die Trainingsmethode, auf der der gesamte Pitch beruht, und sie wird beschrieben, aber nicht offengelegt. Keine Reward-Funktion, keine Kalibrierungskurven, nichts unabhängig Reproduzierbares. Wie Anthony Maio anmerkte, ist Reinforcement Learning für Kalibrierung ebenfalls nicht grundsätzlich neu; frühere Arbeiten wie „Rewarding Doubt“ untersuchen dasselbe Terrain. Neu könnte das Gesamtpaket sein, nicht unbedingt die Methode.

Die Zahl, die in den meisten Berichten ausgelassen wurde

In TypeSafes eigener Evaluation, die vier Workflows aus den Bereichen Reaktion auf Sicherheitsvorfälle, Observability von Agent-Traces, Rechnungsverarbeitung und Kundenservice abdeckt, steckt – versteckt – das Bild zur Genauigkeit.

ModellÜbereinstimmungKosten / FallLatenz
------------
Jev67,8 %0,0004 $0,4 s
GPT-5.6 Terra67,9 %0,0304 $10,1 s
Claude Sonnet 567,8 %höherhöher
Claude Opus 573,1 %nicht veröffentlichtnicht veröffentlicht
GPT Sol74,1 %nicht veröffentlichtnicht veröffentlicht

Lies das sorgfältig, denn es stellt alles in einen anderen Kontext. Jev erreicht die Werte von Frontier-Modellen der mittleren Klasse bei ungefähr einem Sechsundsiebzigstel der Kosten und einem Fünfundzwanzigstel der Latenz. Die Spitzenklasse erreicht es nicht. Bei der Rechnungsverarbeitung war die Lücke besonders groß: Jev lag bei 61,8 %, Sol bei 79,1 %.

Die ehrliche Positionierung lautet also nicht „Frontier-Intelligenz, günstiger“. Sie lautet: „Sonnet-Klasse bei Einschätzungen zu einem Preis, bei dem du das Modell bei jeder Anfrage statt nur bei einigen einsetzen kannst.“ Für einen Router, einen Classifier oder einen Vorfilter ist dieser Kompromiss ausgezeichnet. Bei einer Entscheidung, bei der ein Fehler teuer ist, ist die Lücke von zwölf Prozentpunkten gegenüber Sol die gesamte Geschichte.

Wo TypeSafe Jev in meinen Stack passt

Wenn ich das gegen Systeme halte, die ich bereits betreibe, bestehen drei Einsatzbereiche – zwei nicht.

Artikelprüfungen in der Content-Pipeline

Der Koordinator, der die Multi-Agent-Pipeline dieser Website ausführt, trifft pro Lauf ein Dutzend begrenzter Entscheidungen. Die Kategoriezuordnung zwischen Tech und Musik basiert derzeit auf Heuristiken zur Tag-Verteilung. Die Prüfungen für Redaktion, Überarbeitung und Humanisierung beantworten jeweils eine Variante von „Ist das bereit?“. Das sind Choice- und Noul-Fragen in einem LLM-Kostüm. Hier ist die Kalibrierung wichtiger als der Preis: Ein Konfidenzwert ermöglicht es mir, eindeutige Fälle automatisch durchzuwinken und nur die unklaren an ein größeres Modell weiterzuleiten.

Die Apify Actors

Einer davon bewertet bestehende Artikel auf SEO-Qualität. Das ist buchstäblich eine Scoring-Aufgabe, und das Einzige, was dort gegen den Break-even zählt, sind die Modellkosten innerhalb der API. Ein Score-Primitive für 0,000026 $ pro Aufruf gegenüber einem Frontier-Modell, das dieselbe Aufgabe erledigt, verändert die Marge – es ist keine Optimierung. Das würde ich zuerst messen und erst danach glauben.

Routing von Kundenfragen auf der E-Commerce-Seite

Eingehende FAQ-Fragen brauchen eine Kategorie, eine Einschätzung der Dringlichkeit und ein „Braucht das einen Menschen?“-Flag. Drei parallele Fragen, eine Anfrage, unter einer Sekunde. Das ist der klassische Anwendungsfall und der, auf den die Launch-Demo ausgerichtet ist.

Wo es nicht passt

Zwei Bereiche, und beide sind harte Grenzen statt Ermessensfragen. Mixanalytic ist Audioanalyse, während Jev nur Text und JSON akzeptiert. Transkription oder Feature-Extraktion muss also zuerst stattfinden – und bis dahin ist die interessante Arbeit bereits erledigt. Und alles, was schreibt: Artikelentwürfe, Tweet-Generierung, Übersetzungen. Jev gibt absichtlich keine Strings aus. Es ist kein günstigeres Claude, sondern eine andere Komponente.

Diese Unterscheidung würde ich mir merken. Das ist kein Modellaustausch. Es ist eine neue Schicht, die unter den LLM-Aufrufen sitzt und die Entscheidungen übernimmt, für die diese Aufrufe derzeit überqualifiziert sind.

Empfohlen für dich

Weiterführende Lektüre: mein Multi-Agent-Code-Review-Workflow beschreibt, wie ich unabhängige Agent-Einschätzungen strukturiere, der Claude-Fable-5.1-Test enthält die Preise der Frontier-Modelle, mit denen dieses Modell verglichen wird, und das Build-Log, in dem diese Actors veröffentlicht wurden liefert den Kontext dazu, was sie tun.

So startest du mit TypeSafe Jev

Der Zugang ist über console.typesafe.ai oder über das Vercel AI Gateway mit einer Warteliste versehen. Der Engineer von Classmethod berichtete, direkt nach der Anmeldung Zugang erhalten zu haben – die Warteschlange könnte in der Praxis also kurz sein.

bash export TYPESAFE_API_KEY="sk-..."

pip install typesafe-sdk # Python 3.10+ npm install @typesafe-ai/sdk # Node 20+

Beide SDKs lesen TYPESAFE_API_KEY aus der Umgebung und verwenden standardmäßig jev-latest. Es gibt einen Endpunkt, POST https://api.typesafe.ai/v1/systemone, falls du das SDK vollständig umgehen möchtest. Die Console enthält einen Playground mit ausgearbeiteten Beispielen für Ticket-Routing, Bewerberauswahl und Audits von Support-Agents.

Zwei Dinge solltest du vor dem ersten Aufruf wissen, beide stammen aus dem Praxisleitfaden, der in den ersten 48 Stunden veröffentlicht wurde. Stelle alle Fragen von Anfang an, statt einen günstigen Aufruf zu machen und anschließend nachzufragen, denn Fragen werden parallel ausgewertet. Eine zehnte Frage kostet Tokens, aber fast keine zusätzliche Zeit, und TypeSafes Cookbook berichtet, dass Batching ungefähr zwölfmal günstiger und zehnmal schneller ist als einzelne Aufrufe. Füge außerdem in einem Choice immer explizit eine other-Option hinzu, damit das Modell sagen kann, dass nichts passt, statt die ähnlichste falsche Option auszuwählen.

Das Fazit zu TypeSafe Jev

Der Preis ist die Schlagzeile, die Architektur ist das eigentliche Argument. Wenn man die „Frontier-Modell“-Rahmung und die 200-fach-Zahlen aus selbst entworfenen Evals entfernt, bleibt immer noch das Interessanteste, was ich in diesem Quartal über AI-Infrastruktur gelesen habe: eine Komponente, die innerhalb von Software begrenzte Entscheidungen trifft, mit ehrlicher Unsicherheit, während deterministischer Code die Kontrolle über die Ausführung behält.

Was ich nicht tun würde, ist, die Kalibrierung als bewiesen zu betrachten. Jede relevante Behauptung – dass die Wahrscheinlichkeiten ehrlich sind, dass die Genauigkeit in der Domäne eines anderen Unternehmens Bestand hat und dass das Ganze die Produktionslast übersteht – stammt derzeit aus der Selbstauskunft eines Unternehmens, das erst seit einer Woche Early Access anbietet, ohne Paper und ohne Reproduktion durch Dritte. Geschwindigkeit und Preis kannst du am ersten Tag überprüfen. Kalibrierung erfordert Tausende gelabelter Ergebnisse, und niemand hat diese bisher veröffentlicht.

Also: Anmeldung für die Warteliste, eine Scoring-Aufgabe, die ich bereits in größerem Umfang ausführe, und eine eigene Messung, bevor irgendetwas umgestellt wird. Das ist das richtige Maß an Begeisterung für ein eine Woche altes Modell mit einer wirklich guten Idee und ohne Belege, die jemand außerhalb des Unternehmens überprüft hat.

Quellen

Introducing System One Models & Jev – TypeSafe AI (offizieller Launch-Post, Primärquelle für Preise, Primitive und die RLCD-Einordnung)
I tried replacing model routing with TypeSafe (Jev) – DevelopersIO / Classmethod (unabhängige API-Messung mit 40 Aufrufen: Latenz, Kosten und Konfidenz pro Stufe)
Jev by TypeSafe AI: 200x Faster Structured-Output Model – explainx.ai (Zusammenfassung des Hacker-News-Threads mit 256 Kommentaren und der konkreten Kritik)
TypeSafe AI's Jev and "System One Models": What Actually Shipped – TrueFoundry (trennt unabhängig überprüfbare Behauptungen von Angaben des Anbieters)
Jev: The Language Model That Won't Talk – Anthony Maio (Genauigkeitstabelle für vier Workflows und Kritik an der Kalibrierung)
How to Use Jev: A practical guide to TypeSafe's System One model – DEV Community (SDK-Einrichtung, Kontextlimits und Hinweise zum Batching)

Offenlegung: Recherche und Entwurf wurden am 19. September 2026 mit Claude Opus 5 über mein persönliches Website-MCP erstellt, auf Grundlage des TypeSafe-Launch-Posts und sechs unabhängiger Beiträge, darunter eine praktische API-Messung. Ich habe keinen Early Access zu Jev und erhebe keinen Anspruch auf eigene Tests. Vom Anbieter gemeldete Zahlen sind im gesamten Text als solche gekennzeichnet; jede Zahl hier lässt sich einer der oben genannten Quellen zuordnen.