Jev: KI, die entscheidet statt schreibt
- Jev
- KI
- LLM
- Klassifikation
- Automatisierung
Stellen Sie sich ein Sprachmodell vor, das nur Multiple Choice beherrscht. Es liest alles, was man ihm gibt – aber es kann kein einziges Wort zurückschreiben. Man gibt die möglichen Antworten vor, und es wählt eine davon. Klingt nutzlos in einer Zeit, in der LLMs so gut schreiben wie nie. Genau das ist aber Jev von TypeSafe – und genau darin liegt der Punkt.
Das Problem, das wir teuer gelöst haben
Wer heute ein LLM in eine Anwendung einbaut, kennt das Muster: Man bittet einen Textgenerator, eine Entscheidung zu treffen, bekommt Prosa zurück und schreibt dann Code, der daraus wieder etwas Maschinenlesbares macht. Dabei ist ein großer Teil dieser Aufgaben eigentlich simpel geformt: komplizierter Text rein, einfache Entscheidung raus. Klingt der Kunde, als würde er kündigen? Ist diese E-Mail eine echte Geschäftschance oder steht da nur „Geschäftschance“ drin? Darf der Agent diesen Befehl ausführen?
Für solche Fragen gab es bisher zwei Wege: klassische ML-Klassifikatoren – billig im Betrieb, aber für jede neue Kategorie braucht es Daten, Labels, Training und Pflege – oder ein LLM, das flexibel, aber vergleichsweise langsam und teuer ist. Jev ist der fehlende Mittelweg: ein universeller Klassifikator, der Sprache versteht wie ein LLM, aber nur strukturierte Entscheidungen ausgibt.
So funktioniert Jev
TypeSafe nennt Jev ein „System One“-Modell. Statt eines Prompts schickt man einen Zustand und eine Reihe klar umrissener Fragen. Drei Fragetypen gibt es:
Choice – wähle eine Option aus einer Liste.
Score – bewerte anhand eines Rasters.
Noul – wie wahr ist eine Aussage, als Wert zwischen 0 und 1.
Zurück kommen typisierte Antworten mit Wahrscheinlichkeiten und einer Konfidenz. Mehrere Fragen werden parallel und unabhängig voneinander ausgewertet; eine weitere Frage macht den Aufruf kaum langsamer. Und weil Jev allgemein trainiert ist, braucht es für eine neue Aufgabe kein neues Training – nur eine neue Frage.
Ein dritter Baustein für Software
Nate B Jones hat Jev in seinem Video „Why Developers Are Losing Their Minds Over AI That Can't Write“ ausführlich eingeordnet. Seine These: Bisher hatten wir zwei Bausteine für Software – deterministischen Code und LLMs. Mit einem schnellen, günstigen, universellen Klassifikator kommt ein dritter dazu. Laut Jones war Jev nach dem Launch am 15. September innerhalb von 24 Stunden das am schnellsten angenommene Modell in der Geschichte des Vercel AI Gateway – mit mehr als doppelt so vielen zahlenden Teams wie jedes Modell zuvor.
Er beschreibt vier Muster, wie Jev in Software eingebaut wird:
Weiche zwischen Chaos und Prozess. Jev sitzt zwischen unstrukturiertem Input und bestehender Logik: Ein Support-Ticket wird als „Billing, heute beantworten, Abwanderungsrisiko“ eingestuft, und der Code routet es entsprechend. Oder ein Coding-Agent will einen Build-Ordner löschen und force-pushen – Jev empfiehlt, erst nachzufragen.
Das Wichtige im großen Haufen finden. Ein Wissenschaftler ließ Jev aus 10.000 literaturbasierten Immunologie-Fragen die 100 wichtigsten auswählen. Jev löst die Fragen nicht – aber es lenkt die Aufmerksamkeit dorthin, wo sie sich lohnt.
Jev steuert die Schleife. Statt eines LLM entscheidet Jev über den nächsten Schritt: ein Tool aufrufen, ein kleines Modell schreiben lassen, ein Frontier-Modell für den schwierigen Fall holen – oder einen Menschen fragen. Generative Modelle werden zu Werkzeugen innerhalb der Schleife. Dasselbe Prinzip funktioniert beim Browser-Navigieren: Wenige Buttons und Links, eine Wahl.
Intelligenz in jedem Element. Der Code stellt alle Aktionen bereit, Jev interpretiert live, was der Nutzer will. Jones' Lieblingsbeispiel: eine Tabelle, in der man nur „Dringlichkeit“ in einen Spaltenkopf tippt – und Jev klassifiziert sofort jede Zeile. Normale Formeln können diese Urteile dann mit Datum und Betrag kombinieren.
Was die Praxis berichtet
Die Beispiele, die Jones zitiert, sind deutlich: Ein Entwickler ersetzte in einer bestehenden Pipeline für Tausende Steuerdokumente die LLM-Klassifikation durch Jev und berichtet von 34-mal geringeren Kosten bei sechsfacher Geschwindigkeit. Ein Unternehmer sortierte über 20.000 eigene E-Mails, Slack-Nachrichten und Transkripte nach Beschwerden, Upsell-Chancen und vergessenen Follow-ups – in sieben Minuten für insgesamt einen Dollar.
Zum Preis: Laut Jones kostet Jev 4,2 Cent pro Million Input-Tokens, Output ist kostenlos. Bei 1.000 Tokens pro Anfrage sind das rund 42 Cent für 10.000 Aufrufe – und 42 Dollar für eine Million. TypeSafes eigene Launch-Evaluation spricht von rund 100-mal schneller und mehr als 100-mal günstiger als ein LLM für dieselbe Aufgabe.
Unser eigener Test: ein Modell-Router
Wir wollten das selbst sehen und haben – ganz im Sinne von Muster Nr. 3 – einen kleinen Router für unseren KI-Coding-Workflow gebaut. Bevor eine Anfrage bearbeitet wird, fragt er Jev: Wie groß ist dieser Job? Kleinigkeiten wie eine Umbenennung gehen an ein kleines, günstiges Modell, eine E-Mail an ein mittleres, ein mehrstufiger Build an ein großes – und strategische Fragen, bei denen ein Fehler teuer wird, an das stärkste.
Zwei Sicherungen sind eingebaut: Liegt Jevs Konfidenz unter 60 %, entscheidet der Router nicht selbst. Und eine zweite Frage erkennt kurze Antworten wie „ja, mach das, aber kürzer“, die nur im Gesprächskontext Sinn ergeben und deshalb nicht weitergereicht werden.
Unser Testlauf mit zehn Beispielanfragen – von „Was ist die Hauptstadt von Portugal?“ bis zur Frage, ob man einen exklusiven Fünf-Jahres-Liefervertrag unterschreiben sollte:
10 von 10 Anfragen landeten beim passenden Modell bzw. wurden korrekt als Kontext-Antwort erkannt.
0,4 bis 1,2 Sekunden pro Entscheidung.
Rund 0,002 Cent pro Entscheidung – der gesamte Testlauf kostete weniger als 0,03 Cent.
Zehn Anfragen sind kein Benchmark. Aber die Größenordnung passt zu dem, was andere berichten.
Wo Jev an Grenzen stößt
Jev ist kein Ersatz für LLMs. Alles, was geschrieben, geplant oder durchdacht werden muss, bleibt ein LLM-Problem – Jev kann die wichtigsten Immunologie-Fragen auswählen, aber keine davon beantworten. Jev macht auch Fehler; man sollte es immer an der eigenen Aufgabe testen, gegen den LLM-Aufruf oder den Klassifikator, den es ersetzen soll. Und Jev läuft als Cloud-API: Alles, was man klassifizieren lässt, verlässt die eigene Infrastruktur. Für personenbezogene oder vertrauliche Daten gelten die üblichen Regeln zu Auftragsverarbeitung und Datensparsamkeit.
Warum der Name passt
Der Ökonom William Stanley Jevons beobachtete im 19. Jahrhundert, dass effizientere Nutzung einer Ressource ihren Gesamtverbrauch nicht senkt, sondern steigert. TypeSafe hat Jev bewusst danach benannt. Wenn eine Entscheidung fast nichts mehr kostet, wird nicht nur die bestehende KI-Rechnung kleiner – es lohnen sich plötzlich Fragen, die bisher niemand gestellt hat: jeden Kundenanruf prüfen statt einer Stichprobe, das gesamte Dokumentenarchiv täglich neu einordnen, jeden Schritt eines Agenten absichern statt nur den ersten.
Das macht LLMs nicht überflüssig, im Gegenteil: Mehr Klassifikation fördert mehr Ausnahmen und mehr lohnende Fragen zutage – und die landen wieder bei Modellen, die denken und schreiben können. Die Arbeitsteilung lautet: Jev entscheidet, das LLM schreibt.
Unser Tipp zum Einstieg: Suchen Sie in Ihrer eigenen Software nach Stellen, an denen ein LLM heute nur aus vorgegebenen Optionen wählt – oder an denen Sie bisher ganz auf ein Urteil verzichtet haben, weil es zu teuer schien. Dort lohnt sich ein Test. Mehr zu Jev in der offiziellen Dokumentation.
Kontakt
Ähnliches Vorhaben?
Sprechen Sie mit uns über Ihre Infrastruktur — das Erstgespräch ist kostenlos und unverbindlich.
Beratungsgespräch vereinbaren