Künstlich erzeugtJEV: Hype gegen den Reality-Check
Jack Rudenko hat eine Woche Launch-Demos gesehen. Das Modell ist schnell und billig. Die Vergleiche sind trotzdem die falschen.
JEV, das Entscheidungsmodell von TypeSafe AI, kam am 15. September 2026 aus dem Stealth. Jack Rudenko hat seine Lesart am 22. September veröffentlicht. Ein Aufruf dauert 70 bis 500 Millisekunden. Die Eingabe kostet 0,042 Dollar je Million Tokens. Die Ausgabe kostet nichts. Mit der Geschwindigkeit streitet er nicht. Er streitet mit dem Gegner.
Den Satz wollte im Thread fast niemand.
Jack Rudenko hat eine Woche Launch-Demos gesehen und den Satz geschrieben, den im Thread fast niemand sagen wollte: das neue Modell ist schnell und billig, und die meisten Vergleiche sind trotzdem die falschen.
Sein Text heißt Jev: Solving yesterday's problems, faking wins with overengineered demos, and never facing the real competition und ist am 22. September 2026 erschienen. Der Feed, den er beschreibt, hat Postfächer sortiert, Mails markiert, Sprachen erkannt, Stimmung bewertet und Pong gespielt. Jeder Clip endete auf derselben Pointe: schnell und billig, und ein Chat-Modell kommt da nicht hin.
Beide Behauptungen können stimmen. Der Gegner im Clip bleibt ein großer Generalist. Das ist die ganze Beschwerde, und sie lohnt das Langsamlesen, weil unter den Clips eine echte andere Form steckt.
State rein. Eine getypte Entscheidung raus. Ein Aufruf.
JEV ist das System-One-Modell von TypeSafe AI. Du gibst ihm einen Zustand und eine Liste getypter Fragen. Zurück kommen Entscheidungen: eine Wahl aus einer Liste, eine Note auf einer Skala, die du setzt, oder ein Ja oder Nein mit einer Wahrscheinlichkeit zwischen 0 und 1. TypeSafe nennt das letzte Noul. Alles läuft in einem Aufruf. Die Ausgabe landet im Code. Kein Absatz, aus dem du dir erst das Wort herausklauben musst.
Die Mechanik, die drei Fragetypen und die Geschwindigkeitszahl des Herstellers stehen auf dieser Site schon: Jev: kein Chatbot. Ein Entscheidungsmodell. Dieses Stück baut die Seite nicht noch einmal. Es bleibt bei Rudenko, und bei dem einen Außentest, der ihm recht gibt.
Einen Textgenerator nach dem Wort „billing“ zu fragen, ist das falsche Spiel.
Die Folie rennt gegen einen Romanautor. Der Job ist ein Etikett.
Jeder öffentliche Clip, den er gesehen hat, stellt JEV neben ein Modell aus der GPT-Klasse. Die eigene Schlagzeile von TypeSafe, so wie er sie wiedergibt: 193-mal schneller und 444-mal billiger als der Schnitt aus GPT-6 Astra und Fable 5.1, auf vier internen Abläufen. Die Pong-Demo von Ably: 227 Millisekunden je Zug, gegen 2,5 bis 3,5 Sekunden bei Haiku, Gemini Flash und GPT-5.6 Sol.
Gegen einen Textgenerator ist die Lücke echt. Ein großes Modell, das Tickets verteilt, braucht Sekunden und rechnet jedes Wort ab, das es ausspuckt. JEV rechnet die Eingabe mit 0,042 Dollar je Million Tokens ab und die Ausgabe mit null. Die Aufrufe landen zwischen 70 und 500 Millisekunden. Arize beschreibt dasselbe Preisschild und dasselbe Zeitfenster. Das Wunder, in diesen Einheiten, ist nicht erfunden.
Rudenko hält das Wunder für auf den falschen Gegner gerichtet. Klassifikation hatte schon Antworten. Ein fein abgestimmtes BERT ist der Standard seit 2018, seit Jacob Devlin und seine Mitautoren das Paper veröffentlicht haben: klein, rund 110 Millionen Parameter, zufrieden auf einer Laptop-CPU. Davor logistische Regression auf Wortzählungen. Davor reguläre Ausdrücke, die in echten Routern öfter laufen, als die Demos zugeben.
Zählst du das Netz mit, sitzt ein langweiliges BERT schon im Raum.
Er will die Spalte, die in den Clips fehlt. Für einen einzelnen CPU-Aufruf setzt er ein unoptimiertes BERT-base bei etwa 100 Millisekunden an, ein destilliertes bei etwa 60, ein optimiertes unter 10. Die 70 bis 500 Millisekunden von JEV enthalten den Weg zu einer fremden Maschine. Dieselbe Größenordnung, mal schneller, mal nicht. Packst du das lokale Modell auf eine GPU in einen Schwung, fällt die Zeit je Stück nach seiner Rechnung unter eine Millisekunde. Dort öffnet sich eine Lücke um den Faktor hundert, und sie öffnet sich zur Kiste hin, die du schon betreibst.
Beim Preis läuft derselbe Schnitt. 0,042 Dollar je Million Input-Tokens sehen neben Opus klein aus. Neben Hardware, die du schon bezahlst, gewinnt das lokale Modell nach dem Einrichten oft. Kein Aufschlag je Token. Kein Umweg über das Netz. Die CPU-Zahlen sind seine, keinen Lauf haben wir wiederholt. Lies sie als seine Schätzung. Die Richtung ist der Punkt, den er erzwingt: Klassifikator gegen Klassifikator.
Ein Team draußen hat den Vergleich veröffentlicht, nach dem er gefragt hat. Parallel, in einem Text von Vlad Shulman vom 18. September 2026, hat JEV auf Arbeit laufen lassen, die sie nach eigener Aussage milliardenfach am Tag machen. Zero-Shot-Reranking hat einen ihrer eigenen Reranker bei NDCG@10 von 0,7 erreicht. Themenklassifikation und die Frage, ob eine Suche frische Treffer braucht: ihre Modelle haben gewonnen. Die Kosten je Dokument lagen höher, und sie sagen warum: ihnen gehören die Maschinen, auf denen ihre Klassifikatoren laufen. Die Zusammenfassung dort deckt sich mit seiner. Die Schlagzeilen zu Tempo und Preis stehen gegen autoregressive Chat-Modelle. Spezialisierte Klassifikatoren gewinnen bei beidem oft immer noch.
Keine Labels. Die Frage ändert sich nächste Woche.
Ein fein abgestimmtes BERT kann eine ganz neue Frage am Donnerstag nicht beantworten, ohne eine Trainingsschleife: Beispiele, ein Lauf, eine Prüfung, ein Deploy, und dieselbe Schleife noch einmal, wenn die Labels wandern. JEV nimmt die Frage als Zeichenkette im Augenblick des Aufrufs.
Damit ist ein echtes Bündel von Jobs beschrieben. Ein Router, solange du die Kategorien noch nicht kennst. Recherche, während die Taxonomie wandert. Leute, die nie ein Modell trainieren werden. Leitplanken für Agenten, bei denen die Frage von Werkzeug zu Werkzeug wechselt. Parallels eigener Schluss ist dieselbe Regel: wenn du einen Klassifikator brauchst und noch keinen trainiert hast, fang hier an, und prüfe die Qualität an deinen Beispielen.
Er steigt am nächsten Morgen aus. An dem Tag, an dem die Kategorien fest werden und die Menge steigt, sind die Labels, die JEV gerade erzeugt hat, ein Trainingsset. Nimm sie und pass ein kleines Modell an, das dir gehört. Die API ist der Start. Der Betriebsweg ist das Modell auf deiner Maschine.
Eine Note auszugeben ist ein Format. Recht zu haben ist ein Produkt.
Die Demos vermischen zwei Sätze. JEV gibt eine Note aus. Die Note ist gut. Nur der erste Satz folgt aus dem Produkt. Der zweite ist eine eigene Frage, und bei der Frage nennt er es Mittelklasse, wie die anderen Generalisten.
Das eigene Dashboard von TypeSafe, in seiner Lesart: 67,8 Prozent Übereinstimmung mit der Referenz über ihre Abläufe. Opus 5 im Workflow-Modus landet bei 74,1 Prozent. Bei Rechnungen wird die Lücke breiter, 61,8 Prozent gegen 79,1 Prozent. Ihm gefällt, dass sie das veröffentlichen, und dass sie die Faktoren an das obere Ende der echten Gewinne setzen, auf Prüfungen, die ihr eigenes Team geschrieben hat.
Eine neue Hülle auf derselben Familie von Trainingsdaten wächst keinen neuen Geschmack. Bei MadAppGang hat er absichtlich schlampigen Text an JEV, Opus 5 und GPT-5.6 Sol gegeben und zugesehen, wie jedes Modell hoch bewertet hat. JEV stand nicht daneben. „Gut im Bewerten“ heißt also: gut darin, eine Zahl auszugeben.
Ein Datum in diesem Absatz passt nicht zum Rest seines Textes. Er legt den Schreibtest in den Mai 2024. Den Launch legt er auf den 15. September 2026. Ein Test im Mai 2024 kann kein Modell enthalten haben, das im September 2026 aus dem Stealth kam. Lies die Noten als seine Behauptung. Lies den Monat als Verrutscher.
Der Job, den er will, ist nicht das Postfach.
Leg eine Spec neben einen Diff und frag, wie weit sie auseinanderliegen. Ein fein abgestimmtes BERT hat keinen Datensatz namens „deine Spec gegen deine Umsetzung“. Ein Chat-Modell kann es in einem Absatz, den du danach auseinandernehmen musst, langsam und zu Frontier-Preisen. JEV kann eine getypte Note und eine Wahrscheinlichkeit in unter einer halben Sekunde zurückgeben, für den Bruchteil eines Cents.
Das ist die Form, die er in einem Prüfgeschirr will. Unten Prüfungen ohne Modell: Objekt-Diffs, Screenshots, bestanden oder durchgefallen nach einer Regel. Darüber ein Richter, der ein paar getypte Fragen stellt. Deckt die Änderung die Spec? Wie weit ist sie abgedriftet? Hat sie etwas ausgeliefert, nach dem die Spec nie gefragt hat? Die letzte Frage ist eine Halluzinationsprüfung mit einer Wahrscheinlichkeit daran. Das ist die Frage, für die er zahlen würde.
Die Grenzen nennt er selbst. JEV liest Text und JSON. Eine Prüfung der Oberfläche braucht das DOM, oder ein Seh-Modell, das beide Schirme beschreibt, bevor JEV die Beschreibungen benotet. Zustand plus längste Frage müssen in 32.000 Tokens passen, die Einheit ist also eine Komponente, kein Repository. Den Vergleich gegen Opus 5 bei der Umsetzungsqualität hat er nicht veröffentlicht. Diesen Vergleich nennt er offen, und er sagt, er werde ihn so oder so publizieren. Bis die Seite da ist, ist der zweite Job ein Vorschlag mit einer Form, kein Ergebnis.
Behalt den Clip. Setz DistilBERT daneben. Oder einen regulären Ausdruck.
Seine Bitte an die Leute, die die Demos posten, ist klein. Behalt die Clips. Die Latenz ist echt, und die Clips sind der Weg, auf dem eine neue Form sichtbar wird. Wenn der Benchmark hochgeht, kommt eine Spalte dazu: ein fein abgestimmtes DistilBERT, oder ein regulärer Ausdruck, wenn der Job so klein ist. Gewinnt JEV immer noch, hast du einen Einsatz gefunden. Verliert es, hast du das gemerkt, bevor eine Warteliste dein Router geworden ist.
Ein Modell, das eine Entscheidung zurückgibt statt Prosa, ist die richtige Idee. Es an einem Romanautor zu messen und dann einen Cloud-Aufruf hinzustellen, wo drei Zeilen regulärer Ausdruck reichen, ist der Fehler. Klassifikation hatte schon eine lokale Antwort. JEV hat die Zero-Shot-Fassung gelöst und einen zweiten Job geöffnet: ein Ergebnis gegen eine Referenz benoten, wenn niemand ein Trainingsset gebaut hat. Diesen zweiten Job hält er für den, der einen Test wert ist.
Der Rest des Feeds spielt immer noch Pong.
| Aussage | Korb | Woher |
|---|---|---|
| JEV kam am 15. September 2026 aus dem Stealth. TypeSafe AI. Gegründet von Diogo Almeida, der an InstructGPT gearbeitet hat. | Fakt | Jack Rudenko, 22. September 2026. Die Produktbeschreibung von Parallel zeigt auf dieselbe TypeSafe-Doku. |
| Aufrufe dauern 70 bis 500 Millisekunden. Eingabe 0,042 Dollar je Million Tokens. Ausgabe wird nicht berechnet. | Fakt, Herstellerzahlen | Rudenko. Dasselbe Fenster und derselbe Preis stehen bei Arize, 18. September 2026. |
| 193-mal schneller und 444-mal billiger als der Schnitt aus GPT-6 Astra und Fable 5.1, auf vier internen Abläufen. | Fakt als Herstellerzeile | Rudenko, über TypeSafe. Keine Wiederholung von außen. |
| Pong bei 227 Millisekunden je Zug, gegen 2,5 bis 3,5 Sekunden bei Haiku, Gemini Flash und GPT-5.6 Sol. | Fakt als beschriebene Demo | Rudenko über die Demo von Ably. Das Video haben wir nicht nachgestoppt. |
| BERT-base etwa 100 ms auf einer CPU, destilliert etwa 60, optimiert unter 10. Ein GPU-Schwung unter 1 ms je Stück. | Seine Schätzung | Rudenko. Kein eigener Lauf in diesem Stück. Richtung: lokaler Klassifikator gegen die API, sobald das Netz mitzählt. |
| Zero-Shot-Reranking bei NDCG@10 von 0,7, vergleichbar mit einem internen Reranker. Thema und Frische: interne Modelle vorn. Kosten je Dokument höher. | Fakt | Vlad Shulman, Parallel, 18. September 2026. Parallel betreibt die Klassifikatoren selbst. |
| Dashboard: JEV 67,8 Prozent auf ihren Abläufen, Opus 5 bei 74,1 Prozent. Rechnungen 61,8 gegen 79,1. | Berichtet | Rudenkos Lesart des TypeSafe-Dashboards. Eine zweite Ansicht des Boards haben wir nicht geöffnet. |
| Ein Schreibtest im Mai 2024 hat JEV enthalten. | Widerspruch | Der Text legt die MadAppGang-Noten in den Mai 2024 und den Launch auf den 15. September 2026. Beide Sätze stehen drin. Ein Test können sie nicht beide beschreiben. |
| Nur Text und JSON. 32.000 Tokens. Kein veröffentlichter Vergleich zur Umsetzungsqualität. | Fakt, als seine Grenze | Rudenko. Den Vergleich mit Opus 5 bei Spec gegen Diff nennt er offen. |
- Jack Rudenko, der Text22. September 2026. Die Woche der Demos, die Dashboard-Lesart, die Pong-Zeit, die Zeile zum Mai 2024, der Vorschlag Spec gegen Diff.https://www.linkedin.com/pulse/jev-solving-yesterdays-problems-faking-wins-demos-never-jack-rudenko-0ss8c/
- Vlad Shulman, Parallel18. September 2026. NDCG@10 von 0,7, Thema und Frische, Kosten je Dokument, und der Satz, dass die Tempo-Schlagzeile gegen Chat-Modelle steht.https://parallel.ai/blog/testing-jev
- Arize, über JEV als Richter18. September 2026. Dasselbe Zeitfenster, derselbe Eingabepreis, Ausgabe nicht berechnet.https://arize.com/blog/typesafe-jev-llm-judge/
- TypeSafe, EinführungDie eigene Seite des Herstellers zum Entscheidungsmodell. Parallel verlinkt sie.https://docs.typesafe.ai/introduction
- Jev: kein Chatbot. Ein Entscheidungsmodell.Unser Erklärer, 22. September 2026. Choice, Score, Noul, und die Geschwindigkeitszahl des Herstellers.https://mcgrinsey.com/magazin/jev-entscheidungsmodell-typesafe/
- BERT, Devlin und andere, 2018Das Paper hinter der Zeile „seit 2018“. Bidirektionale Transformer fürs Sprachverständnis.https://arxiv.org/abs/1810.04805
Schnitt: 24. September 2026. Die Dashboard-Prozente sind Rudenkos Lesart. Die Zahlen von Parallel sind die von Parallel. Das Datum Mai 2024 bleibt in der Fakten-Tabelle, weil der Text es druckt.


