Jev-Alternativen im Vergleich (Oktober 2026)

Benchmark Heaven misst 94 Jev-kompatible Modelle unabhängig auf JevBench; 61 Open-Weights-Systeme sind auf dem Open-Weights-Board gerankt. Jev 1.13.0 ist die ungerankte Referenz (77,1 Capability); API-Angebote werden auf dem API-Leaderboard gerankt. Der Capability Score ist der Mittelwert aus Intelligenz und Kalibrierung innerhalb der festgelegten Kosten- und Latenzgrenzen. Wrapper und subventionierte Angebote sind vom Ranking ausgenommen.

Daten: JevBench v1.6.1, veröffentlicht am 06.10.2026. Preisangaben sind je Zeile als gemessen, geschätzt oder selbst angegeben gekennzeichnet.

Die Top 15 nach Capability Score

RangModellCapabilityIntelligenzKalibrierungKosten pro 1.000 EntscheidungenLatenz (p50)Offene Gewichte
#1Quyet-1.0-Large (Chinh Nguyen, Gemma-4-31B decoder, option-letter logits)81,773,490,00,045 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#2deck-31B (krishna765, frozen Gemma-4-31B-it, TorchAO FP8 dynamic)77,673,082,20,048 $ pro 1.000 Entscheidungen (geschätzt)0,4 sUnbekannt
#3torchcast-decision-12b (Torchcast AI, Gemma-4-12B fine-tune, option-letter logprob readout)71,760,582,90,028 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#4Jev-Omni (akhilaaa3, Gemma-4-12B merged)71,355,587,00,029 $ pro 1.000 Entscheidungen (geschätzt)0,5 sJa
#5Winnow-12B Q871,259,583,00,028 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#6Cygnet (blockbrain, frozen Gemma-4-12B-it)70,954,887,00,028 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#7Plumb-4B (crh225, JevK5 v0.2 + LoRA)65,443,087,90,017 $ pro 1.000 Entscheidungen (geschätzt)0,2 sUnbekannt
#8decider-4b v2 (Mapika)64,940,189,60,015 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#9JevK5 v0.3 (4B)64,238,589,90,017 $ pro 1.000 Entscheidungen (geschätzt)0,2 sUnbekannt
#10Clef-Flash (Cloudflare, Qwen3.5-9B post-train with a joint schema head, multimodal, measured on text)63,842,285,50,059 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#11deck-4B v1.0 (krishna765, JevK5 + LoRA, FP8 weight-only)63,638,688,60,017 $ pro 1.000 Entscheidungen (geschätzt)0,3 sUnbekannt
#12JevK5 v0.2.062,836,389,40,017 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#13Hopper62,434,790,10,018 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#14Imajev-4B (RTX 5090)61,934,689,20,017 $ pro 1.000 Entscheidungen (geschätzt)0,3 sUnbekannt
#15jqv (Qwen3-32B zero-shot)61,933,989,90,042 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa

API-Angebote werden auf dem API-Leaderboard gerankt (Sage 1.3.0, wity-1, Fastino GLiNER-2.5-Decide): zum API-Leaderboard.

Open-Weight-Alternativen der Jev-Klasse

Gezeigt werden nur Messungen der aktuellen Version; Jev 1.13.0 ist die Referenzzeile. Zeilen außerhalb der Grenzen erhalten keinen Capability-Rang. Prüfen Sie vor dem Self-Hosting die Lizenz und das dokumentierte Setup.

RangModellCapabilityIntelligenzKalibrierungKosten pro 1.000 EntscheidungenLatenz (p50)Offene Gewichte
Referenz, nicht geranktJev 1.13.0 (TypeSafe AI)77,163,690,60,032 $ pro 1.000 Entscheidungen (nicht veröffentlicht)0,2 sNein
#1Quyet-1.0-Large (Chinh Nguyen, Gemma-4-31B decoder, option-letter logits)81,773,490,00,045 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#3torchcast-decision-12b (Torchcast AI, Gemma-4-12B fine-tune, option-letter logprob readout)71,760,582,90,028 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#4Jev-Omni (akhilaaa3, Gemma-4-12B merged)71,355,587,00,029 $ pro 1.000 Entscheidungen (geschätzt)0,5 sJa
#5Winnow-12B Q871,259,583,00,028 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#6Cygnet (blockbrain, frozen Gemma-4-12B-it)70,954,887,00,028 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#8decider-4b v2 (Mapika)64,940,189,60,015 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#10Clef-Flash (Cloudflare, Qwen3.5-9B post-train with a joint schema head, multimodal, measured on text)63,842,285,50,059 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#12JevK5 v0.2.062,836,389,40,017 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#13Hopper62,434,790,10,018 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#15jqv (Qwen3-32B zero-shot)61,933,989,90,042 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#16metask-jev-4b61,839,284,40,026 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#17lev (Interfaze AI, Qwen3.5-4B + LoRA r32, label-token readout + candidate-path head, per-bucket temperatures)61,741,182,30,019 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#18Malkuth-4B (newfull5, Kev post-train)61,133,888,40,030 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#20Quyet-1.0-Medium (Chinh Nguyen, Qwen3.5-4B decoder, option-letter logits)59,241,776,80,017 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#21Manchego v2.158,332,584,00,015 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#22jev-local (Qwen3.5-9B)57,541,973,10,024 $ pro 1.000 Entscheidungen (geschätzt)0,9 sJa
#24JEV Qwen3.5-9B Base NVFP457,129,385,00,056 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#25typecastlm (Mikhail Gribov, Qwen3.5-4B computed head)56,529,883,30,016 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#26SemIf, formerly OpenJev (Qwen3.5-4B, TheoLeeCJ)55,427,183,60,017 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#27local-jev Qwen3.5-4B55,024,185,80,023 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#28Decision 2B (FlyMy.AI, v59)54,822,986,80,013 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#29spark-s1-4b-v6 (Open Spark Jev, abhishek085)54,043,264,80,021 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#31open-alternative-jev (Qwen3.5-4B, IkerMoel)49,122,375,90,017 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#32OpenSourceJev (Qwen3.5-4B Q4_K_M, native llama.cpp)48,623,273,90,011 $ pro 1.000 Entscheidungen (geschätzt)0,7 sJa
#33Malkuth-2B (newfull5, Kev post-train)47,615,979,30,014 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#34Nemotron Diffusion 8B (pst2154, optimized vLLM)47,520,474,50,030 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#36decider-2b (Mapika)44,620,768,50,015 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#38kev 4B (research preview)44,019,568,50,014 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#40lev-350m (Franck Verrot, LFM2.5-350M)43,34,881,90,0046 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#41Certo v1 (AltSlate Labs)43,20,286,10,0013 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#42smalljev semantic-v943,08,777,20,020 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#44Decision Fast (FlyMy.AI, v53a)40,66,175,10,0046 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#45openJev Verdict 1.440,45,075,70,0028 $ pro 1.000 Entscheidungen (geschätzt)0,7 sJa
#46Quyet-1.0-Small-EN (Chinh Nguyen, ModernBERT-base encoder with fixed heads)39,56,173,00,0023 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#48verdict-small (Manavarya09, multilingual-e5-small 118M)37,62,372,90,0009 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#49kev 0.6B (research preview)36,97,666,30,0046 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
#52kev 0.5B32,94,661,20,0046 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#53Quyet-1.0-Small (Chinh Nguyen, SEA-LION-ModernBERT-300M encoder with fixed heads)32,54,061,00,0048 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#54Quyet-1.0-Tiny (Chinh Nguyen, mmBERT-small encoder (16 layers kept) with fixed heads)31,13,758,50,0024 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#55Open Jev JSON Canvas (JoshuaSP)30,661,20,00,049 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
#56openJev Verdict (heman10x, ModernBERT-base 151M)26,64,149,10,0028 $ pro 1.000 Entscheidungen (geschätzt)0,7 sJa
#57CLM-8B (Contrastive-LM, clm-latest)20,10,140,00,045 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
#58Deem 0.8B v118,16,529,60,0045 $ pro 1.000 Entscheidungen (geschätzt)0,5 sJa
#59Laya multilingual17,00,333,70,0039 $ pro 1.000 Entscheidungen (geschätzt)0,9 sJa
Nicht berücksichtigtBespoke Nimble 9B (Bespoke Labs)56,543,169,90,128 $ pro 1.000 Entscheidungen (geschätzt)0,4 sJa
Nicht berücksichtigtBev / Bonsai 27B66,143,888,50,247 $ pro 1.000 Entscheidungen (geschätzt)2,1 sJa
Nicht berücksichtigtClef (Cloudflare, Qwen3.8-27B post-train with a joint schema head, multimodal, measured on text)75,359,191,60,249 $ pro 1.000 Entscheidungen (geschätzt)0,6 sJa
Nicht berücksichtigtdecider-35b-a3b (Mapika)66,248,783,60,154 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
Nicht berücksichtigtJevOne68,946,091,80,101 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
Nicht berücksichtigtkev 8B (research preview)50,029,370,80,097 $ pro 1.000 Entscheidungen (geschätzt)0,3 sJa
Nicht berücksichtigtLaya (Convai Innovations, ModernBERT-large 421M)32,51,863,20,0032 $ pro 1.000 Entscheidungen (geschätzt)1,8 sJa
Nicht berücksichtigtLaya typed-decisions44,25,583,00,0038 $ pro 1.000 Entscheidungen (geschätzt)1,9 sJa
Nicht berücksichtigtLitJev (Qwen3.8-27B)66,643,389,90,244 $ pro 1.000 Entscheidungen (geschätzt)3,1 sJa
Nicht berücksichtigtMirror25,80,051,60,0023 $ pro 1.000 Entscheidungen (geschätzt)1,5 sJa
Nicht berücksichtigtOpen-Jev 27B v1.1 (Zefan Cai, LoRA + decision head on Qwen3.8-27B)68,052,583,50,716 $ pro 1.000 Entscheidungen (geschätzt)1,7 sJa
Nicht berücksichtigtOpen-Jev 2B (Zefan Cai)47,721,873,60,170 $ pro 1.000 Entscheidungen (geschätzt)1,0 sJa
Nicht berücksichtigtOpen-Jev 9B (Zefan Cai)61,843,979,80,170 $ pro 1.000 Entscheidungen (geschätzt)1,4 sJa
Nicht berücksichtigtopen-jev-deberta-v3-large (local CPU)35,42,868,00,0056 $ pro 1.000 Entscheidungen (geschätzt)3,5 sJa
Nicht berücksichtigtOpenJev (thinking, BF16)75,970,381,40,241 $ pro 1.000 Entscheidungen (geschätzt)1,9 sJa
Nicht berücksichtigtQwen3.5-0.8B Decision Model (Mourad Ghafiri)42,67,378,00,0048 $ pro 1.000 Entscheidungen (geschätzt)11,3 sJa
Nicht berücksichtigtQwen3.5-9B Jev-like data-mix v260,941,979,80,065 $ pro 1.000 Entscheidungen (geschätzt)0,5 sJa
Nicht berücksichtigtreflex 4B (kshetrajna12)59,030,987,00,017 $ pro 1.000 Entscheidungen (geschätzt)2,9 sJa
Nicht berücksichtigtSimpleJev (Qwen3.5-0.8B, CPU)31,613,050,20,0098 $ pro 1.000 Entscheidungen (geschätzt)8,8 sJa
Nicht berücksichtigtStandard One 8B (Standard Thinking)58,432,884,00,078 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa
Nicht berücksichtigtswanOne (blockbrain, Qwen3.8-Flash-Next NVFP4)72,456,288,60,085 $ pro 1.000 Entscheidungen (geschätzt)0,7 sJa
Nicht berücksichtigtsystem-one (Qwen3-8B, Sean Goedecke)29,729,330,20,068 $ pro 1.000 Entscheidungen (geschätzt)0,2 sJa

Worauf sollten Sie bei einer Jev-Alternative achten?

  • Lizenz: Code, Adapter und Gewichte können unterschiedlichen Bedingungen unterliegen. Entscheidend ist die Lizenz in der veröffentlichten Zeile, nicht der Modellname.
  • Hardware: Die Messwerte gelten für das dokumentierte Setup. Auf anderer Hardware oder mit anderer Quantisierung können Qualität und Tempo abweichen.
  • Latenz: Wir weisen den Median (p50) unter den Benchmark-Bedingungen aus. Prüfen Sie die Latenz mit Ihrer eigenen Last und Netzanbindung.
  • Kosten pro 1.000 Entscheidungen: Der Preis ist als gemessen, geschätzt oder selbst angegeben gekennzeichnet. Selbst angegebene Preise haben wir nicht überprüft.
  • Datenschutz und Self-Hosting in der EU: Open-Weight-Modelle lassen sich grundsätzlich auf eigener Infrastruktur oder bei einem Anbieter mit Standort in der EU betreiben, sodass Daten nicht an einen Drittanbieter außerhalb der EU gesendet werden müssen. Ob ein konkreter Einsatz den Datenschutzanforderungen genügt, hängt von Ihrem Fall ab und ist keine Aussage dieser Seite; holen Sie dazu bei Bedarf fachkundigen Rat ein.

Auswahl nach Anwendungsfall und Messbedingungen (Englisch)

Häufige Fragen

Was vergleicht JevBench?
JevBench v1.6.1 misst Jev-kompatible Entscheidungsmodelle auf vier Achsen: Intelligenz, Kalibrierung, Geschwindigkeit und Kosten. Der Capability Score ist der Mittelwert aus Intelligenz und Kalibrierung, aber nur innerhalb der festgelegten Kosten- und Latenzgrenzen (Median). Der Composite-Wert ist nachrangig.
Welche Open-Weight-Alternative zu Jev erreicht den höchsten Wert?
Quyet-1.0-Large (Chinh Nguyen, Gemma-4-31B decoder, option-letter logits) hat unter den Open-Weight-Modellen der Jev-Klasse den höchsten berücksichtigten Capability Score: 81,7, Rang 1 auf dem Open-Weights-Board. Der Wert stammt aus der aktuellen Messung und gilt nur für die dort dokumentierten Bedingungen.
Was gilt hier als Open-Weight- bzw. Open-Source-Alternative?
Die veröffentlichte Zeile muss öffentlichen Code oder öffentliche Gewichte, eine Lizenz und einen Quellenlink enthalten. Fehlen Belege, bleibt die Einstufung „unbekannt“. Die Bedingungen können sich für Code, Adapter und Gewichte unterscheiden; lesen Sie die Lizenz vor dem Einsatz.
Sind Preise und Latenz direkt gemessen?
Jede Zeile kennzeichnet den Preis als gemessen, geschätzt oder selbst angegeben. Die Latenz stammt aus den veröffentlichten Benchmark-Bedingungen und kann eine offengelegte Anpassung enthalten. Für eine andere Last oder Hardware sind beide Werte keine Zusage.