Genaueste (Achse Intelligenz)
Quyet-1.0-Large (Chinh Nguyen, Gemma-4-31B decoder, option-letter logits)
Intelligenz 73,4 · Geschwindigkeit 86,9
0,045 $ pro 1.000 Entscheidungen (geschätzt)
Hosting = where inference runs; company = where the provider or lab is registered.
EU hosting means the route's inference runs inside the EU: an EU region, AWS Bedrock's EU cross-region (geo) profiles, Azure's Europe Data Zone, or a provider whose entire public fleet is documented as EU-hosted, each checked per model against the provider's documentation. Global deployments do not count, and neither does an EU billing region, an EU company or an EU control plane on its own. One disclosed company-policy exception stays in, marked “EU equivalent”.
Evidence requirements (benchmark evidence, priced provider, measured task tokens) sit above the table they apply to.
Applies to price views & model offers; benchmark evidence stays unfiltered.
Benchmark Heaven misst 94 Jev-kompatible Modelle unabhängig auf JevBench; 61 Open-Weights-Systeme sind auf dem Open-Weights-Board gerankt. Jev 1.13.0 ist die ungerankte Referenz (77,1 Capability); API-Angebote werden auf dem API-Leaderboard gerankt. Der Capability Score ist der Mittelwert aus Intelligenz und Kalibrierung innerhalb der festgelegten Kosten- und Latenzgrenzen. Wrapper und subventionierte Angebote sind vom Ranking ausgenommen.
Daten: JevBench v1.6.1, veröffentlicht am 06.10.2026. Preisangaben sind je Zeile als gemessen, geschätzt oder selbst angegeben gekennzeichnet.
| Rang | Modell | Capability | Intelligenz | Kalibrierung | Kosten pro 1.000 Entscheidungen | Latenz (p50) | Offene Gewichte |
|---|---|---|---|---|---|---|---|
| #1 | Quyet-1.0-Large (Chinh Nguyen, Gemma-4-31B decoder, option-letter logits) | 81,7 | 73,4 | 90,0 | 0,045 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #2 | deck-31B (krishna765, frozen Gemma-4-31B-it, TorchAO FP8 dynamic) | 77,6 | 73,0 | 82,2 | 0,048 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Unbekannt |
| #3 | torchcast-decision-12b (Torchcast AI, Gemma-4-12B fine-tune, option-letter logprob readout) | 71,7 | 60,5 | 82,9 | 0,028 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #4 | Jev-Omni (akhilaaa3, Gemma-4-12B merged) | 71,3 | 55,5 | 87,0 | 0,029 $ pro 1.000 Entscheidungen (geschätzt) | 0,5 s | Ja |
| #5 | Winnow-12B Q8 | 71,2 | 59,5 | 83,0 | 0,028 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #6 | Cygnet (blockbrain, frozen Gemma-4-12B-it) | 70,9 | 54,8 | 87,0 | 0,028 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #7 | Plumb-4B (crh225, JevK5 v0.2 + LoRA) | 65,4 | 43,0 | 87,9 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Unbekannt |
| #8 | decider-4b v2 (Mapika) | 64,9 | 40,1 | 89,6 | 0,015 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #9 | JevK5 v0.3 (4B) | 64,2 | 38,5 | 89,9 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Unbekannt |
| #10 | Clef-Flash (Cloudflare, Qwen3.5-9B post-train with a joint schema head, multimodal, measured on text) | 63,8 | 42,2 | 85,5 | 0,059 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #11 | deck-4B v1.0 (krishna765, JevK5 + LoRA, FP8 weight-only) | 63,6 | 38,6 | 88,6 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Unbekannt |
| #12 | JevK5 v0.2.0 | 62,8 | 36,3 | 89,4 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #13 | Hopper | 62,4 | 34,7 | 90,1 | 0,018 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #14 | Imajev-4B (RTX 5090) | 61,9 | 34,6 | 89,2 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Unbekannt |
| #15 | jqv (Qwen3-32B zero-shot) | 61,9 | 33,9 | 89,9 | 0,042 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
API-Angebote werden auf dem API-Leaderboard gerankt (Sage 1.3.0, wity-1, Fastino GLiNER-2.5-Decide): zum API-Leaderboard.
Gezeigt werden nur Messungen der aktuellen Version; Jev 1.13.0 ist die Referenzzeile. Zeilen außerhalb der Grenzen erhalten keinen Capability-Rang. Prüfen Sie vor dem Self-Hosting die Lizenz und das dokumentierte Setup.
| Rang | Modell | Capability | Intelligenz | Kalibrierung | Kosten pro 1.000 Entscheidungen | Latenz (p50) | Offene Gewichte |
|---|---|---|---|---|---|---|---|
| Referenz, nicht gerankt | Jev 1.13.0 (TypeSafe AI) | 77,1 | 63,6 | 90,6 | 0,032 $ pro 1.000 Entscheidungen (nicht veröffentlicht) | 0,2 s | Nein |
| #1 | Quyet-1.0-Large (Chinh Nguyen, Gemma-4-31B decoder, option-letter logits) | 81,7 | 73,4 | 90,0 | 0,045 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #3 | torchcast-decision-12b (Torchcast AI, Gemma-4-12B fine-tune, option-letter logprob readout) | 71,7 | 60,5 | 82,9 | 0,028 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #4 | Jev-Omni (akhilaaa3, Gemma-4-12B merged) | 71,3 | 55,5 | 87,0 | 0,029 $ pro 1.000 Entscheidungen (geschätzt) | 0,5 s | Ja |
| #5 | Winnow-12B Q8 | 71,2 | 59,5 | 83,0 | 0,028 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #6 | Cygnet (blockbrain, frozen Gemma-4-12B-it) | 70,9 | 54,8 | 87,0 | 0,028 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #8 | decider-4b v2 (Mapika) | 64,9 | 40,1 | 89,6 | 0,015 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #10 | Clef-Flash (Cloudflare, Qwen3.5-9B post-train with a joint schema head, multimodal, measured on text) | 63,8 | 42,2 | 85,5 | 0,059 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #12 | JevK5 v0.2.0 | 62,8 | 36,3 | 89,4 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #13 | Hopper | 62,4 | 34,7 | 90,1 | 0,018 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #15 | jqv (Qwen3-32B zero-shot) | 61,9 | 33,9 | 89,9 | 0,042 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #16 | metask-jev-4b | 61,8 | 39,2 | 84,4 | 0,026 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #17 | lev (Interfaze AI, Qwen3.5-4B + LoRA r32, label-token readout + candidate-path head, per-bucket temperatures) | 61,7 | 41,1 | 82,3 | 0,019 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #18 | Malkuth-4B (newfull5, Kev post-train) | 61,1 | 33,8 | 88,4 | 0,030 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #20 | Quyet-1.0-Medium (Chinh Nguyen, Qwen3.5-4B decoder, option-letter logits) | 59,2 | 41,7 | 76,8 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #21 | Manchego v2.1 | 58,3 | 32,5 | 84,0 | 0,015 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #22 | jev-local (Qwen3.5-9B) | 57,5 | 41,9 | 73,1 | 0,024 $ pro 1.000 Entscheidungen (geschätzt) | 0,9 s | Ja |
| #24 | JEV Qwen3.5-9B Base NVFP4 | 57,1 | 29,3 | 85,0 | 0,056 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #25 | typecastlm (Mikhail Gribov, Qwen3.5-4B computed head) | 56,5 | 29,8 | 83,3 | 0,016 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #26 | SemIf, formerly OpenJev (Qwen3.5-4B, TheoLeeCJ) | 55,4 | 27,1 | 83,6 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #27 | local-jev Qwen3.5-4B | 55,0 | 24,1 | 85,8 | 0,023 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #28 | Decision 2B (FlyMy.AI, v59) | 54,8 | 22,9 | 86,8 | 0,013 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #29 | spark-s1-4b-v6 (Open Spark Jev, abhishek085) | 54,0 | 43,2 | 64,8 | 0,021 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #31 | open-alternative-jev (Qwen3.5-4B, IkerMoel) | 49,1 | 22,3 | 75,9 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #32 | OpenSourceJev (Qwen3.5-4B Q4_K_M, native llama.cpp) | 48,6 | 23,2 | 73,9 | 0,011 $ pro 1.000 Entscheidungen (geschätzt) | 0,7 s | Ja |
| #33 | Malkuth-2B (newfull5, Kev post-train) | 47,6 | 15,9 | 79,3 | 0,014 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #34 | Nemotron Diffusion 8B (pst2154, optimized vLLM) | 47,5 | 20,4 | 74,5 | 0,030 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #36 | decider-2b (Mapika) | 44,6 | 20,7 | 68,5 | 0,015 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #38 | kev 4B (research preview) | 44,0 | 19,5 | 68,5 | 0,014 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #40 | lev-350m (Franck Verrot, LFM2.5-350M) | 43,3 | 4,8 | 81,9 | 0,0046 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #41 | Certo v1 (AltSlate Labs) | 43,2 | 0,2 | 86,1 | 0,0013 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #42 | smalljev semantic-v9 | 43,0 | 8,7 | 77,2 | 0,020 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #44 | Decision Fast (FlyMy.AI, v53a) | 40,6 | 6,1 | 75,1 | 0,0046 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #45 | openJev Verdict 1.4 | 40,4 | 5,0 | 75,7 | 0,0028 $ pro 1.000 Entscheidungen (geschätzt) | 0,7 s | Ja |
| #46 | Quyet-1.0-Small-EN (Chinh Nguyen, ModernBERT-base encoder with fixed heads) | 39,5 | 6,1 | 73,0 | 0,0023 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #48 | verdict-small (Manavarya09, multilingual-e5-small 118M) | 37,6 | 2,3 | 72,9 | 0,0009 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #49 | kev 0.6B (research preview) | 36,9 | 7,6 | 66,3 | 0,0046 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| #52 | kev 0.5B | 32,9 | 4,6 | 61,2 | 0,0046 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #53 | Quyet-1.0-Small (Chinh Nguyen, SEA-LION-ModernBERT-300M encoder with fixed heads) | 32,5 | 4,0 | 61,0 | 0,0048 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #54 | Quyet-1.0-Tiny (Chinh Nguyen, mmBERT-small encoder (16 layers kept) with fixed heads) | 31,1 | 3,7 | 58,5 | 0,0024 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #55 | Open Jev JSON Canvas (JoshuaSP) | 30,6 | 61,2 | 0,0 | 0,049 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| #56 | openJev Verdict (heman10x, ModernBERT-base 151M) | 26,6 | 4,1 | 49,1 | 0,0028 $ pro 1.000 Entscheidungen (geschätzt) | 0,7 s | Ja |
| #57 | CLM-8B (Contrastive-LM, clm-latest) | 20,1 | 0,1 | 40,0 | 0,045 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| #58 | Deem 0.8B v1 | 18,1 | 6,5 | 29,6 | 0,0045 $ pro 1.000 Entscheidungen (geschätzt) | 0,5 s | Ja |
| #59 | Laya multilingual | 17,0 | 0,3 | 33,7 | 0,0039 $ pro 1.000 Entscheidungen (geschätzt) | 0,9 s | Ja |
| Nicht berücksichtigt | Bespoke Nimble 9B (Bespoke Labs) | 56,5 | 43,1 | 69,9 | 0,128 $ pro 1.000 Entscheidungen (geschätzt) | 0,4 s | Ja |
| Nicht berücksichtigt | Bev / Bonsai 27B | 66,1 | 43,8 | 88,5 | 0,247 $ pro 1.000 Entscheidungen (geschätzt) | 2,1 s | Ja |
| Nicht berücksichtigt | Clef (Cloudflare, Qwen3.8-27B post-train with a joint schema head, multimodal, measured on text) | 75,3 | 59,1 | 91,6 | 0,249 $ pro 1.000 Entscheidungen (geschätzt) | 0,6 s | Ja |
| Nicht berücksichtigt | decider-35b-a3b (Mapika) | 66,2 | 48,7 | 83,6 | 0,154 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| Nicht berücksichtigt | JevOne | 68,9 | 46,0 | 91,8 | 0,101 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| Nicht berücksichtigt | kev 8B (research preview) | 50,0 | 29,3 | 70,8 | 0,097 $ pro 1.000 Entscheidungen (geschätzt) | 0,3 s | Ja |
| Nicht berücksichtigt | Laya (Convai Innovations, ModernBERT-large 421M) | 32,5 | 1,8 | 63,2 | 0,0032 $ pro 1.000 Entscheidungen (geschätzt) | 1,8 s | Ja |
| Nicht berücksichtigt | Laya typed-decisions | 44,2 | 5,5 | 83,0 | 0,0038 $ pro 1.000 Entscheidungen (geschätzt) | 1,9 s | Ja |
| Nicht berücksichtigt | LitJev (Qwen3.8-27B) | 66,6 | 43,3 | 89,9 | 0,244 $ pro 1.000 Entscheidungen (geschätzt) | 3,1 s | Ja |
| Nicht berücksichtigt | Mirror | 25,8 | 0,0 | 51,6 | 0,0023 $ pro 1.000 Entscheidungen (geschätzt) | 1,5 s | Ja |
| Nicht berücksichtigt | Open-Jev 27B v1.1 (Zefan Cai, LoRA + decision head on Qwen3.8-27B) | 68,0 | 52,5 | 83,5 | 0,716 $ pro 1.000 Entscheidungen (geschätzt) | 1,7 s | Ja |
| Nicht berücksichtigt | Open-Jev 2B (Zefan Cai) | 47,7 | 21,8 | 73,6 | 0,170 $ pro 1.000 Entscheidungen (geschätzt) | 1,0 s | Ja |
| Nicht berücksichtigt | Open-Jev 9B (Zefan Cai) | 61,8 | 43,9 | 79,8 | 0,170 $ pro 1.000 Entscheidungen (geschätzt) | 1,4 s | Ja |
| Nicht berücksichtigt | open-jev-deberta-v3-large (local CPU) | 35,4 | 2,8 | 68,0 | 0,0056 $ pro 1.000 Entscheidungen (geschätzt) | 3,5 s | Ja |
| Nicht berücksichtigt | OpenJev (thinking, BF16) | 75,9 | 70,3 | 81,4 | 0,241 $ pro 1.000 Entscheidungen (geschätzt) | 1,9 s | Ja |
| Nicht berücksichtigt | Qwen3.5-0.8B Decision Model (Mourad Ghafiri) | 42,6 | 7,3 | 78,0 | 0,0048 $ pro 1.000 Entscheidungen (geschätzt) | 11,3 s | Ja |
| Nicht berücksichtigt | Qwen3.5-9B Jev-like data-mix v2 | 60,9 | 41,9 | 79,8 | 0,065 $ pro 1.000 Entscheidungen (geschätzt) | 0,5 s | Ja |
| Nicht berücksichtigt | reflex 4B (kshetrajna12) | 59,0 | 30,9 | 87,0 | 0,017 $ pro 1.000 Entscheidungen (geschätzt) | 2,9 s | Ja |
| Nicht berücksichtigt | SimpleJev (Qwen3.5-0.8B, CPU) | 31,6 | 13,0 | 50,2 | 0,0098 $ pro 1.000 Entscheidungen (geschätzt) | 8,8 s | Ja |
| Nicht berücksichtigt | Standard One 8B (Standard Thinking) | 58,4 | 32,8 | 84,0 | 0,078 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
| Nicht berücksichtigt | swanOne (blockbrain, Qwen3.8-Flash-Next NVFP4) | 72,4 | 56,2 | 88,6 | 0,085 $ pro 1.000 Entscheidungen (geschätzt) | 0,7 s | Ja |
| Nicht berücksichtigt | system-one (Qwen3-8B, Sean Goedecke) | 29,7 | 29,3 | 30,2 | 0,068 $ pro 1.000 Entscheidungen (geschätzt) | 0,2 s | Ja |
Quyet-1.0-Large (Chinh Nguyen, Gemma-4-31B decoder, option-letter logits)
Intelligenz 73,4 · Geschwindigkeit 86,9
0,045 $ pro 1.000 Entscheidungen (geschätzt)
Quyet-1.0-Tiny (Chinh Nguyen, mmBERT-small encoder (16 layers kept) with fixed heads)
Intelligenz 3,7 · Geschwindigkeit 95,1
0,0024 $ pro 1.000 Entscheidungen (geschätzt)
verdict-small (Manavarya09, multilingual-e5-small 118M)
Intelligenz 2,3 · Geschwindigkeit 89,5
0,0009 $ pro 1.000 Entscheidungen (geschätzt)