decyzji przyjętych automatycznie
basal-1.5-max · zmierzony błąd: 5,24%
Modele decyzyjne wybraliśmy wstępnie z czołówki rankingu Benchmark Heaven (JevBench). Tylko wybraną grupę poddajemy wspólnej weryfikacji w naszym benchmarku Werdykt — na tych samych pytaniach po polsku i angielsku, według jednego protokołu. Dla porównania pokazujemy też rodzinę basal, duże modele API i pomiary kontrolne.
Werdykt to autorski benchmark projektu basal. Mierzy średnią trafność z 20 grup: 10 kategorii w dwóch językach. Główna tabela obejmuje ukończone przebiegi pełnego testu; dla basal-1.5 i max wybrano pomiar SGLang, dla mini — tryb fast.
Pomiary silnika: Sześć konfiguracji basal na H100 NVL ↓
48 systemów · tabela przewija się poziomo na mniejszych ekranach.
| Model / parametry | PL + EN | 95% przedział PL + EN | Polski | Angielski | Czas p50 ms ↓ | Czas p95 ms ↓ | USD / 1000 decyzji ↓ | Silnik / rozumowanie |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.8 Flash— · API | 99,56% | 99,38%–99,72% | 99,56% | 99,56% | 3 314,5 | 7 379,4 | 2,5297 | APIAPI dostawcyRozumowanie: Domyślne dostawcy |
| Claude Opus 5.5†— · API | 99,40% | 99,18%–99,62% | 99,20% | 99,60% | 5 531,3 | 9 362,2 | 15,1738 | APIAPI dostawcyRozumowanie: Domyślne dostawcy |
| GPT-6.1 Sol— · API | 99,38% | 99,16%–99,60% | 99,24% | 99,52% | 2 213,6 | 4 928,0 | 3,1780 | APIAPI dostawcyRozumowanie: Domyślne dostawcy |
| GPT-6 Astra†— · API | 99,34% | 99,12%–99,56% | 99,20% | 99,48% | 1 993,9 | 4 356,5 | 15,8178 | APIAPI dostawcyRozumowanie: Domyślne dostawcy |
| GPT-6 Luna— · API | 98,32% | 97,94%–98,64% | 97,84% | 98,80% | 2 380,1 | 4 210,5 | 0,1880 | APIAPI dostawcyRozumowanie: Domyślne dostawcy |
| Gemini 3.1 Pro (preview)†— · API5 nieodczytanych odpowiedzi / 5 000 | 97,88% | 97,48%–98,24% | 97,92% | 97,84% | 5 539,5 | 19 820,1 | 12,2981 | APIAPI dostawcyRozumowanie: Domyślne dostawcy |
| Surogate Rune 26B-A4B v3¹26B-A4B · otwarte wagi | 81,68% | 80,66%–82,64% | 80,88% | 82,48% | 164,1 | 1 509,9 | 0,1533 | surogate · C++1 × RTX PRO 6000 Blackwell 96 GB |
| Jev 1.13.0— · API | 81,64% | 80,70%–82,58% | 82,04% | 81,24% | 286,4 | 378,8 | 0,0710 | APIAPI dostawcy |
| Cygnet¹12B · otwarte wagi | 78,52% | 77,52%–79,54% | 79,04% | 78,00% | 39,6 | 276,9 | 0,0522 | Serwer modelu1 × H100 80 GB |
| Winnow-12B (Q8)¹12B · otwarte wagi | 78,50% | 77,42%–79,44% | 78,56% | 78,44% | 126,2 | 1 096,7 | 0,2599 | Serwer modelu1 × H100 80 GB |
| basal-1.5-max¹11B · otwarte wagi | 77,28% | 76,24%–78,28% | 77,68% | 76,88% | 67,1 | 476,6 | 0,1081 | SGLang1 × H100 80 GB |
| Jev-Omni¹12B · otwarte wagi | 75,34% | 74,22%–76,38% | 76,32% | 74,36% | 1 131,5 | 1 555,0 | 1,2397 | Serwer modelu1 × H100 80 GB |
| basal-1.5¹4.5B · otwarte wagi | 72,12% | 71,02%–73,26% | 72,44% | 71,80% | 33,8 | 270,2 | 0,0477 | SGLang1 × H100 80 GB |
| Decision-2.0-Nox-4B¹4B (4.21B) · otwarte wagi | 71,64% | 70,46%–72,80% | 70,92% | 72,36% | 863,8 | 1 302,4 | 1,0093 | eager · H100 NVL1 × H100 NVL 94 GB |
| Clef-Flash¹9B · otwarte wagi | 71,58% | 70,40%–72,70% | 70,08% | 73,08% | 1 700,2 | 1 857,0 | 1,8990 | Serwer modelu1 × H100 80 GB |
| Qwen3-32B, zero-shot (jqv)¹32B · otwarte wagi | 70,54% | 69,42%–71,68% | 69,52% | 71,56% | 129,5 | 910,7 | 0,2298 | Serwer modelu1 × H100 80 GB |
| Hopper4B · otwarte wagi | 70,28% | 69,16%–71,42% | 69,40% | 71,16% | 60,4 | 165,4 | 0,1376 | Serwer modelu1 × H100 80 GB |
| Decision 4B v1.2¹4B · otwarte wagi | 70,16% | 69,08%–71,34% | 69,84% | 70,48% | 28,7 | 206,9 | 0,0710 | Serwer modelu1 × H100 80 GB |
| decider-4b v2¹4B · otwarte wagi | 70,00% | 68,86%–71,14% | 69,68% | 70,32% | 27,8 | 283,3 | 0,0515 | Serwer modelu1 × H100 80 GB |
| djev¹26B (4B active) · otwarte wagi274 błędów wywołania / 5 000 | 69,80% | 68,72%–70,98% | 70,16% | 69,44% | 66,6 | 159,1 | 0,0526 | Serwer modelu1 × H100 80 GB |
| spark-s1-4b-v6¹4B · otwarte wagi | 69,38% | 68,16%–70,58% | 68,84% | 69,92% | 217,4 | 565,2 | 0,2879 | open_spark_jev · HF1 × H100 80 GB |
| Plumb-4B¹4B · otwarte wagi | 69,04% | 67,88%–70,32% | 68,92% | 69,16% | 27,7 | 245,7 | 0,0553 | Serwer modelu1 × H100 80 GB |
| Decision 4B v1.1¹4B · otwarte wagi | 69,02% | 67,88%–70,22% | 68,76% | 69,28% | 28,5 | 207,1 | 0,1236 | Serwer modelu1 × H100 80 GB |
| JevK5 v0.3¹4B · otwarte wagi | 68,86% | 67,68%–70,12% | 68,28% | 69,44% | 28,4 | 258,5 | 0,0570 | Serwer modelu1 × H100 80 GB |
| Kev 1.0 (kev-4b)¹4B · otwarte wagi | 68,36% | 67,14%–69,64% | 67,16% | 69,56% | 34,1 | 308,9 | 0,0442 | kev.serve1 × H100 80 GB |
| Imajev-4B¹4B · otwarte wagi436 błędów wywołania / 5 000 | 68,16% | 67,10%–69,24% | 66,56% | 69,76% | 112,7 | 132,3 | 0,1349 | Serwer modelu1 × H100 80 GB |
| JevK5 v0.2 (4B)¹4B · otwarte wagi | 66,72% | 65,56%–67,94% | 66,40% | 67,04% | 30,7 | 240,4 | 0,0562 | jevk5-serve1 × H100 80 GB |
| basal-1.0 · 4.5B4.5B · otwarte wagi | 66,04% | 64,70%–67,18% | 66,20% | 65,88% | 26,5 | 779,5 | 0,1353 | basal · fast1 × H100 80 GB |
| Malkuth-4B¹4B · otwarte wagi108 błędów wywołania / 5 000 | 63,36% | 62,10%–64,66% | 62,24% | 64,48% | 153,2 | 285,2 | 0,1722 | Serwer modelu1 × H100 80 GB |
| Manchego v2.14B · otwarte wagi | 63,04% | 61,76%–64,30% | 62,20% | 63,88% | 73,5 | 400,8 | 0,1149 | Serwer modelu1 × H100 80 GB |
| local-jev (Qwen3.5-4B)¹4B · otwarte wagi | 62,98% | 61,76%–64,16% | 62,48% | 63,48% | 142,7 | 535,8 | 0,2534 | local-jev · HF1 × H100 80 GB |
| typecastlm v1.3.0 (Qwen3.5 3.8B)¹3.8B · otwarte wagi | 62,88% | 61,72%–64,14% | 62,36% | 63,40% | 95,2 | 217,3 | 0,1381 | typecastlm · local1 × H100 80 GB |
| lev4B · otwarte wagi | 62,86% | 61,64%–64,12% | 61,68% | 64,04% | 157,6 | 538,1 | 0,2013 | Serwer modelu1 × H100 80 GB |
| jev-local (Qwen3.5-9B, HF scorer)¹9B · otwarte wagi436 błędów wywołania / 5 000 | 62,18% | 61,08%–63,32% | 61,56% | 62,80% | 460,7 | 829,0 | 2,0440 | jevlocal · HF scorer1 × H100 80 GB |
| Qwen3-4B-Instruct-2507 (raw, letter logits)¹4B · otwarte wagi · pomiar kontrolny | 62,08% | 60,90%–63,22% | 61,40% | 62,76% | 40,0 | 161,2 | 0,0222 | vLLM · logity liter1 × H100 80 GB |
| metask-jev-4b¹4B · otwarte wagi441 błędów wywołania / 5 000 | 61,16% | 59,90%–62,34% | 60,68% | 61,64% | 107,8 | 177,1 | 0,3400 | Serwer modelu1 × H100 80 GB |
| basal-1.5-mini1.5B · otwarte wagi | 60,66% | 59,40%–61,92% | 61,92% | 59,40% | 14,2 | 346,4 | 0,0535 | basal · fast1 × H100 80 GB |
| open-alternative-jev (so1, Qwen3.5-4B)¹4B · otwarte wagi | 60,24% | 58,94%–61,50% | 59,16% | 61,32% | 101,4 | 433,4 | 0,1579 | so1 · HF + adapter HTTP1 × H100 80 GB |
| SemIf¹4B · otwarte wagi436 błędów wywołania / 5 000 | 58,80% | 57,62%–59,92% | 57,52% | 60,08% | 66,0 | 119,4 | 0,0800 | Serwer modelu1 × H100 80 GB |
| decider-2b (v11)¹2B · otwarte wagi | 58,66% | 57,40%–59,94% | 58,04% | 59,28% | 20,3 | 168,5 | 0,0248 | decider-ai 1.8.11 × H100 80 GB |
| JEV-Qwen3.5-9B-Base-NVFP4¹9B · otwarte wagi | 57,26% | 55,92%–58,52% | 57,76% | 56,76% | 31,8 | 177,9 | 0,0264 | SGLang · NVFP4 + adapter HTTP1 × RTX PRO 6000 Blackwell 96 GB |
| Phi-4-mini-instruct (raw, letter logits)¹3.8B · otwarte wagi · pomiar kontrolny | 55,78% | 54,40%–57,02% | 53,68% | 57,88% | 35,9 | 132,9 | 0,0171 | vLLM · logity liter1 × H100 80 GB |
| Decision 2B (preview)¹2B · otwarte wagi431 błędów wywołania / 5 000 | 54,62% | 53,36%–55,78% | 49,24% | 60,00% | 48,7 | 76,8 | 0,0580 | model.decide + adapter HTTP1 × H100 80 GB |
| basal-1.0 · 1.5B1.5B · otwarte wagi | 52,24% | 50,94%–53,62% | 52,72% | 51,76% | 14,6 | 354,4 | 0,0549 | basal · fast1 × H100 80 GB |
| Nemotron Diffusion 8B (Nemotron_Jev)¹8B · otwarte wagi | 51,54% | 50,16%–52,94% | 48,72% | 54,36% | 38,6 | 210,7 | 0,0628 | Nemotron_Jev · vLLM1 × H100 80 GB |
| Malkuth-2B¹2B · otwarte wagi108 błędów wywołania / 5 000 | 49,98% | 48,74%–51,26% | 48,16% | 51,80% | 73,2 | 119,9 | 0,0765 | kev.serve1 × H100 80 GB |
| Qwen3-Reranker-4B (as a decider)¹4B · otwarte wagi · pomiar kontrolny | 47,20% | 46,02%–48,44% | 45,92% | 48,48% | 131,6 | 1 089,1 | 0,2743 | Transformers · adapter rerankera1 × H100 80 GB |
| Certo v1¹0.4B · otwarte wagi | 28,26% | 27,04%–29,38% | 29,40% | 27,12% | 20,8 | 25,0 | 0,0238 | certo · adapter HTTP1 × H100 80 GB |
† Wynik nie jest niezależny. Model lub model z tej samej rodziny uczestniczył w budowie albo sprawdzaniu pytań. Tych wyników nie należy traktować jako niezależnego porównania.
¹ Różnice konfiguracji. Cygnet: adapter nazw pól i limit 16 384 tokenów; dłuższe wejścia odrzucone przez serwer liczą się jako błędy. basal-1.5 i max na SGLang: limit kontekstu 32 768 zamiast domyślnego 4 096. Winnow: kontekst 65 536 zgodny z README. Nox: H100 NVL 94 GB i tryb eager. Pomiary pochodzą z różnych środowisk chmurowych. Kartę GPU podajemy przy każdym systemie.
Blackwell i H100. Surogate Rune oraz JEV-Qwen3.5-9B-Base-NVFP4 działają na RTX PRO 6000 Blackwell 96 GB, zgodnie z konfiguracją autorów. Ich czas i koszt dotyczą innego sprzętu niż pozostałe wiersze.
Pomiary kontrolne. Qwen3-4B-Instruct-2507 i Phi-4-mini-instruct to modele ogólne oceniane przez prawdopodobieństwa liter odpowiedzi. Qwen3-Reranker-4B ocenia opcje przez adapter rerankera i skraca długie wejścia do 8 192 tokenów. Te trzy wiersze są punktami odniesienia w Werdykcie, a nie wyspecjalizowanymi modelami decyzyjnymi.
Ograniczenia wykonania. Błędy wywołań i nieodczytane odpowiedzi liczą się jako błędne decyzje; ich liczby podajemy przy nazwach. Decision 2B odrzucił 431 pytań z powodu limitów długości, Malkuth-2B — 108, a jev-local (Qwen3.5-9B, HF scorer) — 436 z powodu limitu 4 096 tokenów. Czas p50 i p95 jev-local wyliczono ze 181 poprawnie obsłużonych zapytań w próbie 200 pytań. Certo odczytuje tylko pierwsze 64 tokeny pytania i stanu. Czas bibliotek bez własnego serwera obejmuje nasz adapter HTTP. Spark, local-jev i so1 używają referencyjnej ścieżki Transformers bez FLA; Spark dodatkowo wraca do pełnego przebiegu po błędzie cache. JevK5 v0.2 korzysta z referencyjnej konwolucji. Instalacja zależności na CPU podczas części pomiaru decider-2b mogła nieco zaniżyć jego przepustowość.
Protokół Nox. Pełny wynik 5 000 pytań jest w głównej tabeli. Model korzysta z trybu eager na H100 NVL 94 GB; jego szybka ścieżka jest zweryfikowana przez autorów dla ROCm. Czas i przepustowość zmierzono z jednym procesem serwera. Pozostałe 3 000 pytań wykonano z pulą pięciu procesów wyłącznie na potrzeby oceny trafności; ich czasu nie użyto do wyliczania kosztu ani szybkości.
Jak liczymy koszt. H100 i H100 NVL: stawka porównawcza 3,95 USD/h; RTX PRO 6000 Blackwell: 2,09 USD/h. Koszt 1 000 decyzji wynika z przepustowości przy pełnym obciążeniu. API: koszt raportowany przez dostawcę. Własne wdrożenie przy małym ruchu może kosztować więcej na decyzję. Znak „—” oznacza brak danych.
Im wyżej i bliżej lewej strony, tym lepszy wynik przy krótszym oczekiwaniu. Oś czasu jest logarytmiczna; dokładne wartości znajdziesz w tabeli.
Porównujemy sześć konfiguracji silnika basal-1.5 na H100 NVL 94 GB. W tabeli podajemy zakres każdego przebiegu: pełne 5 000 pytań lub warstwowy podzbiór s2000. Te pomiary uzupełniają główny ranking.
| Model / parametry | Konfiguracja | Zakres testu | PL + EN ↑ | Czas p50 ms ↓ | Czas p95 ms ↓ | USD / 1000 decyzji ↓ |
|---|---|---|---|---|---|---|
| basal-1.54.5B | fast1 kolejność opcji | 5 000 pytańpełny zbiór | 72,02% | 32,0 | 331,3 | 0,0969 |
| basal-1.54.5B | vLLM · FP82 kolejności opcji | 5 000 pytańpełny zbiór | 71,68% | 35,6 | 232,5 | 0,0431 |
| basal-1.54.5B | vLLM · FP81 kolejność opcji | 2 000 pytańpodzbiór s2000 | 71,80% | 29,2 | 205,1 | 0,0416 |
| basal-1.54.5B | fast2 kolejności opcji | 2 000 pytańpodzbiór s2000 | 72,30% | 36,0 | 1 116,6 | 0,1986 |
| basal-1.54.5B | vLLM · BF162 kolejności opcji | 2 000 pytańpodzbiór s2000 | 72,50% | 40,9 | 264,8 | 0,0583 |
| basal-1.54.5B | vLLM · BF161 kolejność opcji | 2 000 pytańpodzbiór s2000 | 72,35% | 33,5 | 274,6 | 0,0532 |
Porównuj ten sam zakres testu. Dwa przebiegi obejmują pełne 5 000 pytań, a cztery — warstwowy podzbiór s2000, liczący 2 000 pytań. Trafność porównuj między konfiguracjami ocenionymi na tym samym zbiorze.
Sprzęt i silnik. Wszystkie konfiguracje basal-1.5 w tej tabeli uruchomiono na H100 NVL 94 GB. Porównujemy tryby fast i vLLM, precyzję wag oraz liczbę kolejności opcji. Liczba kolejności określa, czy basal ocenia jedną, czy dwie kolejności opcji.
Koszt według wspólnej stawki. Wszystkie koszty przeliczono z przepustowości przy 16 równoległych zapytaniach i umownej stawki 3,95 USD/h. To stawka porównawcza benchmarku; nie cena wynajmu tej maszyny.
Ranking 42 systemów: wyniki z raportu „basal-1.5 in Polish” uzupełnione o nowe pełne przebiegi z 4 października 2026. Trafność to średnia z 10 polskich kategorii, 2 500 pytań. Czas to mediana dla całego Werdyktu, a nie osobny pomiar tylko polskich pytań. Modele ogólne i reranker oznaczono jako pomiary kontrolne.
| Miejsce | Model | Parametry | Trafność PL ↑ | Mediana czasu ↓ |
|---|---|---|---|---|
| 1 | Jev 1.13.0API dostawcy | – | 82,1% | 286 ms |
| 2 | Surogate Rune 26B-A4B v31 × RTX PRO 6000 Blackwell 96 GB | 26B-A4B | 80,9% | 164,1 ms |
| 3 | Cygnet1 × H100 80 GB | 12B | 79,0% | 40 ms |
| 4 | Winnow-12B (Q8)1 × H100 80 GB | 12B | 78,5% | 126 ms |
| 5 | basal-1.5-max1 × H100 80 GB | 11B | 77,7% | 67 ms |
| 6 | Jev-Omni1 × H100 80 GB | 12B | 76,3% | 1,132 ms |
| 7 | basal-1.51 × H100 80 GB | 4.5B | 72,4% | 34 ms |
| 8 | Decision-2.0-Nox-4B1 × H100 NVL 94 GB | 4B (4.21B) | 70,9% | 863,8 ms |
| 9 | djev1 × H100 80 GBBłędy wywołania w pełnym teście: 274 / 5 000 | – | 70,2% | 67 ms |
| 10 | Clef-Flash1 × H100 80 GB | 9B | 70,1% | 1,700 ms |
| 11 | Decision 4B v1.21 × H100 80 GB | 4B | 69,9% | 29 ms |
| 12 | decider-4b v21 × H100 80 GB | 4B | 69,7% | 28 ms |
| 13 | Qwen3-32B, zero-shot (jqv)1 × H100 80 GB | 32B | 69,5% | 130 ms |
| 14 | Hopper1 × H100 80 GB | 4B | 69,4% | 60 ms |
| 15 | Plumb-4B1 × H100 80 GB | 4B | 69,0% | 28 ms |
| 16 | spark-s1-4b-v61 × H100 80 GB | 4B | 68,8% | 217,4 ms |
| 17 | Decision 4B v1.11 × H100 80 GB | 4B | 68,8% | 29 ms |
| 18 | JevK5 v0.31 × H100 80 GB | 4B | 68,3% | 28 ms |
| 19 | Kev 1.0 (kev-4b)1 × H100 80 GB | 4B | 67,2% | 34,1 ms |
| 20 | Imajev-4B1 × H100 80 GBBłędy wywołania w pełnym teście: 436 / 5 000 | 4B | 66,6% | 113 ms |
| 21 | JevK5 v0.2 (4B)1 × H100 80 GB | 4B | 66,4% | 30,7 ms |
| 22 | basal-1.0 · 4.5B1 × H100 80 GB | 4.5B | 66,3% | 27 ms |
| 23 | local-jev (Qwen3.5-4B)1 × H100 80 GB | 4B | 62,5% | 142,7 ms |
| 24 | typecastlm v1.3.0 (Qwen3.5 3.8B)1 × H100 80 GB | 3.8B | 62,4% | 95,2 ms |
| 25 | Malkuth-4B1 × H100 80 GBBłędy wywołania w pełnym teście: 108 / 5 000 | 4B | 62,3% | 153 ms |
| 26 | Manchego v2.11 × H100 80 GB | – | 62,2% | 74 ms |
| 27 | basal-1.5-mini1 × H100 80 GB | 1.5B | 61,9% | 14 ms |
| 28 | lev1 × H100 80 GB | – | 61,7% | 158 ms |
| 29 | jev-local (Qwen3.5-9B, HF scorer)1 × H100 80 GBBłędy wywołania w pełnym teście: 436 / 5 000 | 9B | 61,6% | 460,7 ms |
| 30 | Qwen3-4B-Instruct-2507 (raw, letter logits)Pomiar kontrolny1 × H100 80 GB | 4B | 61,4% | 40,0 ms |
| 31 | metask-jev-4b1 × H100 80 GBBłędy wywołania w pełnym teście: 441 / 5 000 | 4B | 60,7% | 108 ms |
| 32 | open-alternative-jev (so1, Qwen3.5-4B)1 × H100 80 GB | 4B | 59,2% | 101,4 ms |
| 33 | decider-2b (v11)1 × H100 80 GB | 2B | 58,0% | 20,3 ms |
| 34 | JEV-Qwen3.5-9B-Base-NVFP41 × RTX PRO 6000 Blackwell 96 GB | 9B | 57,8% | 31,8 ms |
| 35 | SemIf1 × H100 80 GBBłędy wywołania w pełnym teście: 436 / 5 000 | 4B | 57,6% | 66 ms |
| 36 | Phi-4-mini-instruct (raw, letter logits)Pomiar kontrolny1 × H100 80 GB | 3.8B | 53,7% | 35,9 ms |
| 37 | basal-1.0 · 1.5B1 × H100 80 GB | 1.5B | 52,7% | 15 ms |
| 38 | Decision 2B (preview)1 × H100 80 GBBłędy wywołania w pełnym teście: 431 / 5 000 | 2B | 49,2% | 48,7 ms |
| 39 | Nemotron Diffusion 8B (Nemotron_Jev)1 × H100 80 GB | 8B | 48,7% | 38,6 ms |
| 40 | Malkuth-2B1 × H100 80 GBBłędy wywołania w pełnym teście: 108 / 5 000 | 2B | 48,2% | 73,2 ms |
| 41 | Qwen3-Reranker-4B (as a decider)Pomiar kontrolny1 × H100 80 GB | 4B | 45,9% | 131,6 ms |
| 42 | Certo v11 × H100 80 GB | 0.4B | 29,4% | 20,8 ms |
Inny punkt kompromisu między trafnością a czasem odpowiedzi. † Oznacza udział modelu lub jego rodziny w budowie albo sprawdzaniu pytań; taki wynik nie stanowi niezależnego porównania.
| Model | Trafność PL ↑ | Mediana czasu ↓ |
|---|---|---|
| Gemini 3.8 Flash | 99,6% | 3.3 s |
| GPT-6.1 Sol | 99,2% | 2.2 s |
| Claude Opus 5.5 † | 99,2% | 5.5 s |
| GPT-6 Astra † | 99,2% | 2.0 s |
| Gemini 3.1 Pro (preview) † | 97,9% | 5.5 s |
| GPT-6 Luna | 97,8% | 2.4 s |
Źródło: raport „basal-1.5 in Polish” z 3.10.2026; dodatkowe systemy — eksport Werdyktu z 4 października 2026. Dotychczasowe wartości zachowują precyzję raportu, stąd niewielkie rozbieżności względem pełnej tabeli. Nox zmierzono na H100 NVL 94 GB, Surogate Rune i JEV-Qwen3.5-9B-Base-NVFP4 na RTX PRO 6000 Blackwell, pozostałe otwarte modele na H100 80 GB. Różnice poniżej około 2 punktów procentowych w polskim wyniku ogólnym należy interpretować ostrożnie.
Porównaj 29 systemów w 10 rodzajach decyzji. Każda polska kategoria liczy około 250 pytań. Kolor pomaga odczytać wynik, a każda komórka zawiera dokładną wartość.
Przewiń tabelę poziomo, aby zobaczyć wszystkie modele. Wyniki tylko dla języka polskiego.
| Kategoria | Jev 1.13.0 | Surogate Rune 26B-A4B v3 | Cygnet · 12B | Winnow Q8 · 12B | basal-1.5-max · 11B | Jev-Omni · 12B | basal-1.5 · 4.5B | Decision-2.0-Nox-4B | Clef-Flash · 9B | Decision 4B v1.2 | spark-s1-4b-v6 | Kev 1.0 (kev-4b) | JevK5 v0.2 (4B) | basal-1.0 · 4.5B | local-jev (Qwen3.5-4B) | typecastlm v1.3.0 (Qwen3.5 3.8B) | basal-1.5-mini · 1.5B | jev-local (Qwen3.5-9B, HF scorer) | Qwen3-4B-Instruct-2507 (raw, letter logits) | open-alternative-jev (so1, Qwen3.5-4B) | decider-2b (v11) | JEV-Qwen3.5-9B-Base-NVFP4 | Phi-4-mini-instruct (raw, letter logits) | basal-1.0 · 1.5B | Decision 2B (preview) | Nemotron Diffusion 8B (Nemotron_Jev) | Malkuth-2B | Qwen3-Reranker-4B (as a decider) | Certo v1 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Brak wystarczających danychabstain | 73,1% | 76,8% | 70,3% | 70,7% | 73,6% | 67,9% | 70,0% | 63,2% | 59,4% | 69,9% | 60,0% | 59,6% | 57,6% | 59,4% | 53,2% | 48,4% | 52,0% | 52,0% | 51,2% | 51,2% | 48,0% | 51,2% | 45,2% | 41,6% | 42,0% | 34,8% | 36,4% | 28,8% | 21,2% |
| Następny krok agentaaction | 83,6% | 85,2% | 83,6% | 82,4% | 72,8% | 76,4% | 62,4% | 70,0% | 66,4% | 61,2% | 60,4% | 65,6% | 60,0% | 62,8% | 60,8% | 52,4% | 42,0% | 60,0% | 55,6% | 52,0% | 51,6% | 50,8% | 46,4% | 45,6% | 45,6% | 40,8% | 43,6% | 43,6% | 19,2% |
| Umowycontract | 76,0% | 76,0% | 75,2% | 71,6% | 69,6% | 69,6% | 64,8% | 65,6% | 64,8% | 60,4% | 64,8% | 59,6% | 60,8% | 59,2% | 58,8% | 58,0% | 54,8% | 60,4% | 54,4% | 50,0% | 50,0% | 50,4% | 49,6% | 48,4% | 48,0% | 51,2% | 43,6% | 41,2% | 32,8% |
| Ocena odpowiedzijudge | 92,0% | 86,8% | 89,2% | 88,8% | 85,6% | 84,4% | 80,0% | 67,2% | 70,0% | 69,6% | 69,6% | 62,0% | 67,2% | 59,2% | 57,2% | 62,0% | 69,2% | 70,4% | 62,8% | 54,0% | 56,8% | 57,2% | 52,4% | 44,8% | 57,6% | 50,4% | 45,2% | 50,0% | 44,4% |
| Długie dokumentylong | 74,4% | 73,6% | 66,8% | 66,8% | 69,6% | 66,8% | 61,2% | 60,0% | 63,2% | 56,0% | 54,4% | 57,2% | 54,4% | 58,8% | 50,8% | 50,4% | 55,6% | 7,6% | 51,6% | 48,8% | 55,2% | 46,4% | 46,8% | 46,8% | 0,0% | 34,8% | 38,0% | 38,4% | 26,4% |
| Rzeczywiste dokumentyrealdoc | 99,2% | 98,0% | 95,2% | 94,8% | 97,6% | 96,0% | 94,0% | 92,0% | 94,0% | 89,2% | 88,8% | 89,2% | 90,8% | 88,4% | 84,8% | 84,8% | 83,2% | 92,0% | 84,8% | 87,6% | 82,4% | 84,0% | 82,8% | 74,8% | 72,8% | 78,0% | 78,8% | 64,4% | 34,8% |
| Wyszukiwanie i RAGretrieval | 98,8% | 97,6% | 98,0% | 97,6% | 98,0% | 96,0% | 97,2% | 94,0% | 92,4% | 95,6% | 94,0% | 86,0% | 89,6% | 91,6% | 82,4% | 92,0% | 90,0% | 86,0% | 82,4% | 79,6% | 74,8% | 71,6% | 68,8% | 71,2% | 73,2% | 52,0% | 62,4% | 56,8% | 52,0% |
| Kierowanie zgłoszeńrouting | 98,8% | 97,6% | 96,4% | 97,6% | 99,2% | 92,8% | 94,0% | 96,8% | 93,6% | 93,2% | 93,6% | 91,2% | 93,2% | 89,2% | 90,0% | 90,0% | 86,8% | 91,6% | 87,6% | 86,0% | 82,4% | 82,0% | 75,6% | 75,6% | 76,8% | 78,4% | 70,0% | 68,8% | 18,0% |
| Reguły i terminyrules | 44,2% | 40,0% | 38,2% | 35,3% | 34,0% | 38,2% | 34,8% | 31,6% | 30,5% | 35,3% | 34,0% | 34,0% | 28,4% | 34,5% | 28,0% | 24,8% | 32,4% | 31,6% | 23,6% | 27,2% | 29,6% | 26,8% | 25,2% | 29,2% | 25,2% | 22,4% | 20,8% | 26,0% | 25,2% |
| Ocena na skaliscore | 80,7% | 77,2% | 77,1% | 79,9% | 76,8% | 74,7% | 66,0% | 68,8% | 67,1% | 68,3% | 68,8% | 67,2% | 62,0% | 59,4% | 58,8% | 60,8% | 53,2% | 64,0% | 60,0% | 55,2% | 49,6% | 57,2% | 44,0% | 49,2% | 51,2% | 44,4% | 42,8% | 41,2% | 20,0% |
| Wszystkie polskie pytania | 82,1% | 80,9% | 79,0% | 78,5% | 77,7% | 76,3% | 72,4% | 70,9% | 70,1% | 69,9% | 68,8% | 67,2% | 66,4% | 66,3% | 62,5% | 62,4% | 61,9% | 61,6% | 61,4% | 59,2% | 58,0% | 57,8% | 53,7% | 52,7% | 49,2% | 48,7% | 48,2% | 45,9% | 29,4% |
Przy około 250 pytaniach na kategorię różnice poniżej około 6 punktów procentowych mogą być szumem. To orientacyjna uwaga z raportu, nie test istotności każdej pary. Źródło: „basal-1.5 in Polish”, 3.10.2026; dodatkowe systemy — polskie kategorie z eksportu Werdyktu z 4 października 2026. Qwen3-4B-Instruct-2507, Phi-4-mini-instruct oraz Qwen3-Reranker-4B to pomiary kontrolne.
Wybór odpowiedzi lub stwierdzenie, że nie da się jej ustalić.
Działanie zgodne z podaną polityką i stanem procesu.
Interpretacja zapisów oraz decyzje na podstawie warunków umowy.
Poprawność odpowiedzi i porównywanie dwóch propozycji.
Decyzje na podstawie dokumentów o długości 3–10 tys. tokenów.
Pytania o treść autentycznych dokumentów urzędowych.
Trafność fragmentu, wystarczalność kontekstu i oparcie twierdzenia w źródle.
Wybór kolejki, intencji i priorytetu według podanych zasad.
Stosowanie reguł, terminów i warunków dotyczących kwot.
Wybór poziomu zgodnego z opisem skali.
Trzy oddzielne testy polskie, niezależne od tabeli Werdyktu. Najmocniejszy sygnał: 93,1% wobec 87,4% na 3 000 nowych decyzji utworzonych po zamrożeniu wag.
| Test | basal-1.0 · 4.5B | basal-1.5 · 4.5B | basal-1.5-max · 11B | basal-1.0 · 1.5B | basal-1.5-mini · 1.5B |
|---|---|---|---|---|---|
| Zamknięty test polski3 000 nowych decyzji; po zamrożeniu wag | 87,4% | 93,1% | 93,3% | 88,9% | 91,0% |
| Polskie decyzje7 081 przypadków | 88,6% | 92,3% | 94,0% | 85,1% | 87,7% |
| Wiedza ogólna po polsku3 079 przypadków | 73,7% | 74,1% | 79,4% | 65,6% | 66,7% |
Główny model zyskuje 5,7 punktu procentowego na zamkniętym teście polskim (95% przedział różnicy: +4,5 do +6,8 pkt). Max ma zbliżony wynik w tym teście i przewagę w wiedzy ogólnej. Poprawa wiedzy ogólnej dla głównego modelu i mini nie jest statystycznie istotna.
Model wybiera odpowiedź i podaje jej prawdopodobieństwo. Ustalasz próg: decyzje o wyższej pewności przyjmujesz automatycznie, pozostałe kierujesz do człowieka. Sprawdzamy, jak dużo pracy przechodzi przez taki próg — i jaki błąd pozostaje wśród przyjętych decyzji.
basal-1.5-max · zmierzony błąd: 5,24%
basal-1.5-max · zmierzony błąd: 0,84%
basal-1.5-max jest średnio zbyt pewny odpowiedzi. Wartość progu trzeba sprawdzić na danych własnego procesu.
Cel nie jest gwarancją. Próg dobrano na jednej połowie pytań, a odsetek automatyzacji i błąd zmierzono na drugiej. Na przykład cel 5% dla max dał błąd 5,24%. Ta analiza obejmuje 40 systemów zwracających prawdopodobieństwa, na 5 000 pytaniach PL+EN. Modele basal-1.5 pracują tutaj w trybie fast, z plikiem kalibracji; w głównym rankingu basal-1.5 i max korzystają z SGLang.
Dla modelu głównego basal-1.5 próg dobrany do celu 5% przyjmuje 49,3% decyzji, przy zmierzonym błędzie 4,57%. Porównaj poniżej, jak zmiana modelu wpływa na odsetek przyjętych decyzji i wiarygodność deklarowanej pewności.
Kliknij nazwę, aby dodać lub ukryć serię. Wybór dotyczy obu wykresów.
Nie wybrano systemu. Rozwiń „Wybierz systemy na wykresach” lub przywróć domyślny wybór.
Deklarowana pewność i rzeczywista trafność w 10 przedziałach. Punkty poniżej przekątnej oznaczają zawyżoną pewność. Większy punkt to więcej pytań.
Przesuń wykres w poziomie, aby zobaczyć całą skalę.
Linie: trafność od najpewniejszych decyzji, na całym zbiorze. Znaczniki: osobny pomiar na połowie testowej, po dobraniu progu do celu 1% (○) lub 5% (□).
Przesuń wykres w poziomie, aby zobaczyć całą skalę.
Wskaż punkt, aby odczytać wartość. Z klawiatury: Tab wybiera serię, strzałki ← → zmieniają punkt. Wszystkie systemy i wyniki progów są również w tabeli.
Interaktywne wykresy wymagają JavaScript i pobrania danych. Pełne wyniki są dostępne w tabeli poniżej oraz w pliku JSON.
W kolumnach celów: automatycznie przyjęte decyzje, zmierzony błąd i zastosowany próg. Mniejszy ECE, Brier i AURC oznacza lepszy wynik.
40 systemów · domyślna kolejność według automatyzacji dla celu 1% · tabela przewija się poziomo.
| System / parametry | Trafność ↑ | Średnia pewność | ECE ↓ | Brier ↓ | AURC ↓ | Cel błędu: 1% Automatyzacja ↑ | Cel błędu: 5% Automatyzacja ↑ |
|---|---|---|---|---|---|---|---|
| Surogate Rune 26B-A4B v326B-A4B · otwarte wagi | 81,68% | 82,09% | 0,024 | 0,240 | 0,038 | 50,93%Błąd: 1,40%Próg: 0,9266 | 73,31%Błąd: 5,12%Próg: 0,7146 |
| Jev 1.13.0— · API | 81,64% | 82,92% | 0,016 | 0,235 | 0,036 | 49,39%Błąd: 1,04%Próg: 0,9700 | 72,84%Błąd: 4,07%Próg: 0,7200 |
| Winnow-12B (Q8)12B · otwarte wagi | 78,50% | 86,99% | 0,085 | 0,288 | 0,047 | 47,37%Błąd: 1,50%Próg: 0,9857 | 69,80%Błąd: 5,60%Próg: 0,9279 |
| Cygnet12B · otwarte wagi | 78,52% | 81,42% | 0,045 | 0,283 | 0,049 | 45,83%Błąd: 1,21%Próg: 0,9330 | 66,25%Błąd: 4,59%Próg: 0,8015 |
| basal-1.5-max11B · otwarte wagi | 77,18% | 84,68% | 0,075 | 0,307 | 0,054 | 42,16%Błąd: 0,84%Próg: 0,9868 | 66,32%Błąd: 5,24%Próg: 0,8585 |
| Jev-Omni12B · otwarte wagi | 75,34% | 84,03% | 0,087 | 0,333 | 0,062 | 37,66%Błąd: 0,52%Próg: 0,9936 | 60,76%Błąd: 4,16%Próg: 0,9234 |
| decider-4b v24B · otwarte wagi | 70,00% | 73,31% | 0,038 | 0,375 | 0,095 | 25,23%Błąd: 1,10%Próg: 0,9565 | 46,55%Błąd: 4,24%Próg: 0,8476 |
| spark-s1-4b-v64B · otwarte wagi | 69,38% | 85,34% | 0,160 | 0,453 | 0,107 | 24,52%Błąd: 1,45%Próg: 0,9978 | 39,24%Błąd: 3,62%Próg: 0,9921 |
| basal-1.54.5B · otwarte wagi | 72,08% | 79,10% | 0,072 | 0,372 | 0,088 | 21,99%Błąd: 1,26%Próg: 0,9932 | 49,27%Błąd: 4,57%Próg: 0,9267 |
| Decision-2.0-Nox-4B4B (4.21B) · otwarte wagi | 71,64% | 68,89% | 0,032 | 0,362 | 0,092 | 21,95%Błąd: 0,54%Próg: 0,9303 | 44,14%Błąd: 4,20%Próg: 0,8079 |
| Kev 1.0 (kev-4b)4B · otwarte wagi | 68,36% | 65,35% | 0,034 | 0,397 | 0,114 | 21,67%Błąd: 1,46%Próg: 0,9100 | 36,72%Błąd: 4,09%Próg: 0,8048 |
| jev-local (Qwen3.5-9B, HF scorer)9B · otwarte wagi | 62,18% | 59,15% | 0,090 | 0,550 | 0,132 | 20,69%Błąd: 1,15%Próg: 0,8063 | 38,45%Błąd: 5,03%Próg: 0,6658 |
| Qwen3-32B, zero-shot (jqv)32B · otwarte wagi | 70,54% | 71,64% | 0,039 | 0,385 | 0,103 | 17,33%Błąd: 1,37%Próg: 0,9340 | 36,00%Błąd: 4,28%Próg: 0,8569 |
| basal-1.0 · 4.5B4.5B · otwarte wagi | 66,04% | 72,74% | 0,070 | 0,446 | 0,139 | 17,02%Błąd: 0,46%Próg: 0,9773 | 31,78%Błąd: 4,72%Próg: 0,9098 |
| Malkuth-4B4B · otwarte wagi | 63,36% | 69,92% | 0,052 | 0,474 | 0,143 | 16,27%Błąd: 1,46%Próg: 0,9664 | 32,49%Błąd: 5,59%Próg: 0,8939 |
| JevK5 v0.34B · otwarte wagi | 68,86% | 76,41% | 0,075 | 0,404 | 0,107 | 13,50%Błąd: 1,75%Próg: 0,9914 | 41,49%Błąd: 4,38%Próg: 0,9029 |
| Decision 4B v1.14B · otwarte wagi | 69,02% | 71,49% | 0,025 | 0,397 | 0,110 | 13,11%Błąd: 1,51%Próg: 0,9724 | 33,99%Błąd: 3,37%Próg: 0,9043 |
| basal-1.5-mini1.5B · otwarte wagi | 60,66% | 69,26% | 0,086 | 0,498 | 0,174 | 11,92%Błąd: 1,66%Próg: 0,9846 | 21,87%Błąd: 4,33%Próg: 0,9554 |
| Clef-Flash9B · otwarte wagi | 71,58% | 77,87% | 0,063 | 0,383 | 0,099 | 10,74%Błąd: 0,37%Próg: 0,9675 | 39,01%Błąd: 4,25%Próg: 0,9222 |
| typecastlm v1.3.0 (Qwen3.5 3.8B)3.8B · otwarte wagi | 62,88% | 62,03% | 0,067 | 0,459 | 0,151 | 10,34%Błąd: 1,15%Próg: 0,8927 | 23,81%Błąd: 5,14%Próg: 0,8223 |
| JevK5 v0.2 (4B)4B · otwarte wagi | 66,72% | 72,92% | 0,062 | 0,416 | 0,120 | 10,07%Błąd: 0,39%Próg: 0,9883 | 37,47%Błąd: 4,85%Próg: 0,9004 |
| djev26B (4B active) · otwarte wagi | 69,80% | 84,34% | 0,105 | 0,448 | 0,087 | 9,83%Błąd: 2,01%Próg: 0,9994 | 55,19%Błąd: 5,72%Próg: 0,9263 |
| decider-2b (v11)2B · otwarte wagi | 58,66% | 70,99% | 0,123 | 0,538 | 0,204 | 9,79%Błąd: 3,23%Próg: 0,9881 | 17,02%Błąd: 5,57%Próg: 0,9649 |
| metask-jev-4b4B · otwarte wagi | 61,16% | 73,71% | 0,066 | 0,572 | 0,151 | 9,59%Błąd: 1,65%Próg: 0,9510 | 23,73%Błąd: 4,99%Próg: 0,9196 |
| Decision 4B v1.24B · otwarte wagi | 70,16% | 70,05% | 0,024 | 0,386 | 0,103 | 9,51%Błąd: 0,41%Próg: 0,9738 | 35,61%Błąd: 3,66%Próg: 0,8698 |
| open-alternative-jev (so1, Qwen3.5-4B)4B · otwarte wagi | 60,24% | 73,66% | 0,134 | 0,528 | 0,182 | 7,86%Błąd: 1,01%Próg: 0,9937 | 22,11%Błąd: 5,18%Próg: 0,9677 |
| Hopper4B · otwarte wagi | 70,28% | 70,12% | 0,059 | 0,395 | 0,111 | 7,30%Błąd: 1,08%Próg: 0,9947 | 30,40%Błąd: 3,77%Próg: 0,9291 |
| Imajev-4B4B · otwarte wagi | 68,16% | 76,60% | 0,039 | 0,476 | 0,097 | 6,24%Błąd: 0,00%Próg: 0,9931 | 50,41%Błąd: 4,62%Próg: 0,8078 |
| SemIf4B · otwarte wagi | 58,80% | 73,51% | 0,091 | 0,588 | 0,166 | 4,97%Błąd: 0,79%Próg: 0,9989 | 24,83%Błąd: 5,56%Próg: 0,9715 |
| Decision 2B (preview)2B · otwarte wagi | 54,62% | 62,45% | 0,030 | 0,627 | 0,215 | 4,66%Błąd: 0,85%Próg: 0,9574 | 16,27%Błąd: 6,80%Próg: 0,8789 |
| Nemotron Diffusion 8B (Nemotron_Jev)8B · otwarte wagi | 51,54% | 66,62% | 0,151 | 0,620 | 0,276 | 4,66%Błąd: 2,54%Próg: 0,9931 | 10,03%Błąd: 7,87%Próg: 0,9772 |
| local-jev (Qwen3.5-4B)4B · otwarte wagi | 62,98% | 64,27% | 0,020 | 0,458 | 0,158 | 4,30%Błąd: 0,92%Próg: 0,9854 | 24,71%Błąd: 6,39%Próg: 0,8895 |
| Manchego v2.14B · otwarte wagi | 63,04% | 74,95% | 0,119 | 0,502 | 0,178 | 3,91%Błąd: 1,01%Próg: 0,9978 | 19,98%Błąd: 3,95%Próg: 0,9577 |
| Plumb-4B4B · otwarte wagi | 69,04% | 78,96% | 0,099 | 0,423 | 0,116 | 1,74%Błąd: 0,00%Próg: 0,9969 | 33,87%Błąd: 3,73%Próg: 0,9339 |
| Certo v10.4B · otwarte wagi | 28,26% | 29,71% | 0,017 | 0,730 | 0,616 | 0,00%Błąd: —Próg: — | 0,00%Błąd: —Próg: — |
| JEV-Qwen3.5-9B-Base-NVFP49B · otwarte wagi | 57,26% | 63,32% | 0,061 | 0,539 | 0,235 | 0,00%Błąd: —Próg: — | 0,00%Błąd: —Próg: — |
| Malkuth-2B2B · otwarte wagi | 49,98% | 64,45% | 0,134 | 0,644 | 0,302 | 0,00%Błąd: —Próg: — | 2,80%Błąd: 2,82%Próg: 0,9909 |
| Qwen3-Reranker-4B (as a decider)4B · otwarte wagi | 47,20% | 33,67% | 0,137 | 0,669 | 0,414 | 0,00%Błąd: —Próg: — | 0,00%Błąd: —Próg: — |
| basal-1.0 · 1.5B1.5B · otwarte wagi | 52,24% | 63,65% | 0,114 | 0,601 | 0,289 | 0,00%Błąd: —Próg: — | 5,53%Błąd: 6,43%Próg: 0,9820 |
| lev4B · otwarte wagi | 62,86% | 73,91% | 0,111 | 0,484 | 0,168 | 0,00%Błąd: —Próg: — | 11,05%Błąd: 3,93%Próg: 0,9746 |
Jak czytać cel 1% i 5%. Progi wybieramy na jednej połowie pytań, według stałego podziału opartego na skrócie identyfikatora. Następnie stosujemy je do drugiej połowy. „Automatyzacja” to odsetek przyjętych decyzji na tej drugiej części; „Błąd” to błędne odpowiedzi wśród przyjętych. Wynik może przekroczyć założony cel. Znak „—” oznacza brak wyznaczonego progu lub brak przyjętych decyzji, dla których można zmierzyć błąd.
Pewność i zakres porównania. Pewność to najwyższe prawdopodobieństwo odpowiedzi zwrócone przez system. Analiza obejmuje 40 systemów z takimi wynikami w dostarczonym raporcie. GPT, Gemini i Claude zwracały w tym protokole wybraną odpowiedź, bez porównywalnego rozkładu prawdopodobieństw. Dlatego nie ma ich w tej tabeli.
ECE, Brier i AURC. ECE to średnia ważona bezwzględnej różnicy między pewnością a trafnością w 10 przedziałach równej szerokości. Brier mierzy błąd całego rozkładu prawdopodobieństw odpowiedzi (wariant wieloklasowy). AURC to pole pod krzywą błędu względem odsetka przyjętych decyzji — ocenia, czy pewność dobrze szereguje odpowiedzi od najbardziej do najmniej wiarygodnych.
Krzywe a pomiar progów. Krzywe kalibracji i trafności opisują cały zbiór. Na wykresie automatyzacji znaczniki 1% i 5% pokazują faktyczny odsetek i trafność z osobnej połowy testowej; nie muszą leżeć na linii całego zbioru. Nieudane wywołanie nigdy nie jest przyjmowane automatycznie i liczy się jako błąd w trafności całego testu. Przedziały kalibracji obejmują odpowiedzi z dostępnymi prawdopodobieństwami.
Warunki basal. Modele basal-1.5 działają przez basal-serve w trybie fast, z plikiem kalibracji modelu. Ich trafność w tej analizie wynosi 72,08% dla modelu głównego i 77,18% dla max. To odrębne przebiegi od wyników SGLang w głównej tabeli. Dane są agregatami z analizy „Werdykt: próg pewności”; nie publikujemy pytań ani dokumentów testowych.
Wynik dotyczy wyboru odpowiedzi z podanych opcji. Nie jest oceną całego produktu ani gwarancją poprawności w nowym procesie.
Każdy system otrzymuje ten sam stan, pytanie i opcje. Modele czatowe dostają wspólny, ustalony prompt z odpowiedzią JSON; serwery decyzyjne — równoważne pola System One. Nieodczytana odpowiedź i wywołanie zakończone błędem liczą się jako błąd.
Główny wynik to średnia trafności z 20 grup: 10 kategorii × polski i angielski, po 250 pytań. Przedziały 95% wyznaczono przez bootstrap warstwowy: 1 000 losowań wewnątrz każdej grupy. Przedział w tabeli dotyczy wyłącznie wyniku PL + EN, także po zmianie filtra.
Mediana i p95: 200 wspólnych pytań, pojedyncze zapytania bez kolejki. Większość otwartych modeli działa na jednym H100 80 GB, Nox na H100 NVL 94 GB, a Surogate Rune i JEV-Qwen3.5-9B-Base-NVFP4 na RTX PRO 6000 Blackwell 96 GB. Klient działa przy serwerze. Koszt H100 i H100 NVL wyliczamy przy 3,95 USD/h, Blackwell przy 2,09 USD/h. Czas API obejmuje sieć do dostawcy. Przepustowość dla modeli lokalnych mierzona przy 16 równoległych zapytaniach. Modelom API pozostawiono ustawienie rozumowania podane w tabeli; Jev korzysta ze swojego API.
basal stosuje obie kolejności opcji i kalibrację. W tej tabeli 4.5B i max działają przez SGLang; ich mediany w trybie fast wyniosły odpowiednio 31,2 i 44,7 ms. Wynik 13,7 ms z testu HTTP na stronie głównej pochodzi z innego zestawu zapytań.
Ukrytych pytań nie publikujemy. Żadne pytanie, dokument ani fragment Werdyktu nie występuje w danych treningowych basal. Poniższe przykłady są osobnymi, syntetycznymi ilustracjami napisanymi na potrzeby tej strony. Nie zawierają fragmentów dokumentów źródłowych i nie służyły do wyliczenia rankingu. Przy kolejnej wersji benchmarku planowana jest wymiana około 30% każdej grupy oraz raportowanie wyników na zachowanej części.
Po trzy fikcyjne scenariusze na kategorię, w języku polskim i angielskim. Przygotowaliśmy je od podstaw na potrzeby tej strony, bez kopiowania dokumentów źródłowych. Osoby i organizacje zastępują oznaczenia ról, np. „Klient A”. Te przykłady ilustrują zadania i nie służyły do wyliczenia rankingu.
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Nie da się ustalić na podstawie rejestru
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: The log does not establish the assignment
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: 6 godzin
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Sprawdź uprawnienie
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Deploy to staging
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Odczekać 20 sekund i ponowić
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: 20 punktów
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: No, separate permission is required
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: 30 punktów
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Partly correct: the support claim is wrong
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Odpowiedź A
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: It omits the requested amount
Przykłady są skróconymi, fikcyjnymi pakietami. Dokumenty w tej kategorii benchmarku mają 3–10 tys. tokenów.
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Nie, test A nie został zatwierdzony
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Yes, 14 unreserved units of Material X are available
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Oczekuje na test kontrolny
W tej sekcji pokazujemy dokumenty fikcyjne. Ilustrują typ pytań; właściwy benchmark korzysta w tej kategorii z dokumentów rzeczywistych.
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Electronic submission with the required attachments
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Kod projektu
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Expansion of the test area for two workstations
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Passage A
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Nie, potrzebny jest fragment o przywracaniu
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Contradicted
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Account Access
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Płatności
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: High
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: 10 punktów
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: No
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: Nie, brakuje drugiej akceptacji
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: 2 — blokada jednego zespołu
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: 2
Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.
Odpowiedź wzorcowa: High
Wyniki poprzedniego wydania i metodologia: Raport techniczny basal-1.0 ↗
Zobacz modele w zastosowaniach