BENCHMARK / 04.10.2026

Decyzje pod lupą.
Wyniki, które możesz porównać.

Modele decyzyjne wybraliśmy wstępnie z czołówki rankingu Benchmark Heaven (JevBench). Tylko wybraną grupę poddajemy wspólnej weryfikacji w naszym benchmarku Werdykt — na tych samych pytaniach po polsku i angielsku, według jednego protokołu. Dla porównania pokazujemy też rodzinę basal, duże modele API i pomiary kontrolne.

5 000decyzji w Werdykcie
10 × 2kategorii × języki
48systemów w pełnej tabeli
1 protokółjawne warunki porównania
01 / PEŁNE PORÓWNANIE

Werdykt v1

Pobierz wyniki JSON

Werdykt to autorski benchmark projektu basal. Mierzy średnią trafność z 20 grup: 10 kategorii w dwóch językach. Główna tabela obejmuje ukończone przebiegi pełnego testu; dla basal-1.5 i max wybrano pomiar SGLang, dla mini — tryb fast.

Pomiary silnika: Sześć konfiguracji basal na H100 NVL ↓

48 systemów · tabela przewija się poziomo na mniejszych ekranach.

Werdykt v1 · 5 000 decyzji · eksport z 4 października 2026
Model / parametryPL + EN95% przedział
PL + EN
PolskiAngielskiCzas p50
ms ↓
Czas p95
ms ↓
USD / 1000
decyzji ↓
Silnik / rozumowanie
Gemini 3.8 Flash— · API99,56%99,38%–99,72%99,56%99,56%3 314,57 379,42,5297APIAPI dostawcyRozumowanie: Domyślne dostawcy
Claude Opus 5.5†— · API99,40%99,18%–99,62%99,20%99,60%5 531,39 362,215,1738APIAPI dostawcyRozumowanie: Domyślne dostawcy
GPT-6.1 Sol— · API99,38%99,16%–99,60%99,24%99,52%2 213,64 928,03,1780APIAPI dostawcyRozumowanie: Domyślne dostawcy
GPT-6 Astra†— · API99,34%99,12%–99,56%99,20%99,48%1 993,94 356,515,8178APIAPI dostawcyRozumowanie: Domyślne dostawcy
GPT-6 Luna— · API98,32%97,94%–98,64%97,84%98,80%2 380,14 210,50,1880APIAPI dostawcyRozumowanie: Domyślne dostawcy
Gemini 3.1 Pro (preview)†— · API5 nieodczytanych odpowiedzi / 5 00097,88%97,48%–98,24%97,92%97,84%5 539,519 820,112,2981APIAPI dostawcyRozumowanie: Domyślne dostawcy
Surogate Rune 26B-A4B v3¹26B-A4B · otwarte wagi81,68%80,66%–82,64%80,88%82,48%164,11 509,90,1533surogate · C++1 × RTX PRO 6000 Blackwell 96 GB
Jev 1.13.0— · API81,64%80,70%–82,58%82,04%81,24%286,4378,80,0710APIAPI dostawcy
Cygnet¹12B · otwarte wagi78,52%77,52%–79,54%79,04%78,00%39,6276,90,0522Serwer modelu1 × H100 80 GB
Winnow-12B (Q8)¹12B · otwarte wagi78,50%77,42%–79,44%78,56%78,44%126,21 096,70,2599Serwer modelu1 × H100 80 GB
basal-1.5-max¹11B · otwarte wagi77,28%76,24%–78,28%77,68%76,88%67,1476,60,1081SGLang1 × H100 80 GB
Jev-Omni¹12B · otwarte wagi75,34%74,22%–76,38%76,32%74,36%1 131,51 555,01,2397Serwer modelu1 × H100 80 GB
basal-1.5¹4.5B · otwarte wagi72,12%71,02%–73,26%72,44%71,80%33,8270,20,0477SGLang1 × H100 80 GB
Decision-2.0-Nox-4B¹4B (4.21B) · otwarte wagi71,64%70,46%–72,80%70,92%72,36%863,81 302,41,0093eager · H100 NVL1 × H100 NVL 94 GB
Clef-Flash¹9B · otwarte wagi71,58%70,40%–72,70%70,08%73,08%1 700,21 857,01,8990Serwer modelu1 × H100 80 GB
Qwen3-32B, zero-shot (jqv)¹32B · otwarte wagi70,54%69,42%–71,68%69,52%71,56%129,5910,70,2298Serwer modelu1 × H100 80 GB
Hopper4B · otwarte wagi70,28%69,16%–71,42%69,40%71,16%60,4165,40,1376Serwer modelu1 × H100 80 GB
Decision 4B v1.2¹4B · otwarte wagi70,16%69,08%–71,34%69,84%70,48%28,7206,90,0710Serwer modelu1 × H100 80 GB
decider-4b v2¹4B · otwarte wagi70,00%68,86%–71,14%69,68%70,32%27,8283,30,0515Serwer modelu1 × H100 80 GB
djev¹26B (4B active) · otwarte wagi274 błędów wywołania / 5 00069,80%68,72%–70,98%70,16%69,44%66,6159,10,0526Serwer modelu1 × H100 80 GB
spark-s1-4b-v6¹4B · otwarte wagi69,38%68,16%–70,58%68,84%69,92%217,4565,20,2879open_spark_jev · HF1 × H100 80 GB
Plumb-4B¹4B · otwarte wagi69,04%67,88%–70,32%68,92%69,16%27,7245,70,0553Serwer modelu1 × H100 80 GB
Decision 4B v1.1¹4B · otwarte wagi69,02%67,88%–70,22%68,76%69,28%28,5207,10,1236Serwer modelu1 × H100 80 GB
JevK5 v0.3¹4B · otwarte wagi68,86%67,68%–70,12%68,28%69,44%28,4258,50,0570Serwer modelu1 × H100 80 GB
Kev 1.0 (kev-4b)¹4B · otwarte wagi68,36%67,14%–69,64%67,16%69,56%34,1308,90,0442kev.serve1 × H100 80 GB
Imajev-4B¹4B · otwarte wagi436 błędów wywołania / 5 00068,16%67,10%–69,24%66,56%69,76%112,7132,30,1349Serwer modelu1 × H100 80 GB
JevK5 v0.2 (4B)¹4B · otwarte wagi66,72%65,56%–67,94%66,40%67,04%30,7240,40,0562jevk5-serve1 × H100 80 GB
basal-1.0 · 4.5B4.5B · otwarte wagi66,04%64,70%–67,18%66,20%65,88%26,5779,50,1353basal · fast1 × H100 80 GB
Malkuth-4B¹4B · otwarte wagi108 błędów wywołania / 5 00063,36%62,10%–64,66%62,24%64,48%153,2285,20,1722Serwer modelu1 × H100 80 GB
Manchego v2.14B · otwarte wagi63,04%61,76%–64,30%62,20%63,88%73,5400,80,1149Serwer modelu1 × H100 80 GB
local-jev (Qwen3.5-4B)¹4B · otwarte wagi62,98%61,76%–64,16%62,48%63,48%142,7535,80,2534local-jev · HF1 × H100 80 GB
typecastlm v1.3.0 (Qwen3.5 3.8B)¹3.8B · otwarte wagi62,88%61,72%–64,14%62,36%63,40%95,2217,30,1381typecastlm · local1 × H100 80 GB
lev4B · otwarte wagi62,86%61,64%–64,12%61,68%64,04%157,6538,10,2013Serwer modelu1 × H100 80 GB
jev-local (Qwen3.5-9B, HF scorer)¹9B · otwarte wagi436 błędów wywołania / 5 00062,18%61,08%–63,32%61,56%62,80%460,7829,02,0440jevlocal · HF scorer1 × H100 80 GB
Qwen3-4B-Instruct-2507 (raw, letter logits)¹4B · otwarte wagi · pomiar kontrolny62,08%60,90%–63,22%61,40%62,76%40,0161,20,0222vLLM · logity liter1 × H100 80 GB
metask-jev-4b¹4B · otwarte wagi441 błędów wywołania / 5 00061,16%59,90%–62,34%60,68%61,64%107,8177,10,3400Serwer modelu1 × H100 80 GB
basal-1.5-mini1.5B · otwarte wagi60,66%59,40%–61,92%61,92%59,40%14,2346,40,0535basal · fast1 × H100 80 GB
open-alternative-jev (so1, Qwen3.5-4B)¹4B · otwarte wagi60,24%58,94%–61,50%59,16%61,32%101,4433,40,1579so1 · HF + adapter HTTP1 × H100 80 GB
SemIf¹4B · otwarte wagi436 błędów wywołania / 5 00058,80%57,62%–59,92%57,52%60,08%66,0119,40,0800Serwer modelu1 × H100 80 GB
decider-2b (v11)¹2B · otwarte wagi58,66%57,40%–59,94%58,04%59,28%20,3168,50,0248decider-ai 1.8.11 × H100 80 GB
JEV-Qwen3.5-9B-Base-NVFP4¹9B · otwarte wagi57,26%55,92%–58,52%57,76%56,76%31,8177,90,0264SGLang · NVFP4 + adapter HTTP1 × RTX PRO 6000 Blackwell 96 GB
Phi-4-mini-instruct (raw, letter logits)¹3.8B · otwarte wagi · pomiar kontrolny55,78%54,40%–57,02%53,68%57,88%35,9132,90,0171vLLM · logity liter1 × H100 80 GB
Decision 2B (preview)¹2B · otwarte wagi431 błędów wywołania / 5 00054,62%53,36%–55,78%49,24%60,00%48,776,80,0580model.decide + adapter HTTP1 × H100 80 GB
basal-1.0 · 1.5B1.5B · otwarte wagi52,24%50,94%–53,62%52,72%51,76%14,6354,40,0549basal · fast1 × H100 80 GB
Nemotron Diffusion 8B (Nemotron_Jev)¹8B · otwarte wagi51,54%50,16%–52,94%48,72%54,36%38,6210,70,0628Nemotron_Jev · vLLM1 × H100 80 GB
Malkuth-2B¹2B · otwarte wagi108 błędów wywołania / 5 00049,98%48,74%–51,26%48,16%51,80%73,2119,90,0765kev.serve1 × H100 80 GB
Qwen3-Reranker-4B (as a decider)¹4B · otwarte wagi · pomiar kontrolny47,20%46,02%–48,44%45,92%48,48%131,61 089,10,2743Transformers · adapter rerankera1 × H100 80 GB
Certo v1¹0.4B · otwarte wagi28,26%27,04%–29,38%29,40%27,12%20,825,00,0238certo · adapter HTTP1 × H100 80 GB

† Wynik nie jest niezależny. Model lub model z tej samej rodziny uczestniczył w budowie albo sprawdzaniu pytań. Tych wyników nie należy traktować jako niezależnego porównania.

¹ Różnice konfiguracji. Cygnet: adapter nazw pól i limit 16 384 tokenów; dłuższe wejścia odrzucone przez serwer liczą się jako błędy. basal-1.5 i max na SGLang: limit kontekstu 32 768 zamiast domyślnego 4 096. Winnow: kontekst 65 536 zgodny z README. Nox: H100 NVL 94 GB i tryb eager. Pomiary pochodzą z różnych środowisk chmurowych. Kartę GPU podajemy przy każdym systemie.

Blackwell i H100. Surogate Rune oraz JEV-Qwen3.5-9B-Base-NVFP4 działają na RTX PRO 6000 Blackwell 96 GB, zgodnie z konfiguracją autorów. Ich czas i koszt dotyczą innego sprzętu niż pozostałe wiersze.

Pomiary kontrolne. Qwen3-4B-Instruct-2507 i Phi-4-mini-instruct to modele ogólne oceniane przez prawdopodobieństwa liter odpowiedzi. Qwen3-Reranker-4B ocenia opcje przez adapter rerankera i skraca długie wejścia do 8 192 tokenów. Te trzy wiersze są punktami odniesienia w Werdykcie, a nie wyspecjalizowanymi modelami decyzyjnymi.

Ograniczenia wykonania. Błędy wywołań i nieodczytane odpowiedzi liczą się jako błędne decyzje; ich liczby podajemy przy nazwach. Decision 2B odrzucił 431 pytań z powodu limitów długości, Malkuth-2B — 108, a jev-local (Qwen3.5-9B, HF scorer) — 436 z powodu limitu 4 096 tokenów. Czas p50 i p95 jev-local wyliczono ze 181 poprawnie obsłużonych zapytań w próbie 200 pytań. Certo odczytuje tylko pierwsze 64 tokeny pytania i stanu. Czas bibliotek bez własnego serwera obejmuje nasz adapter HTTP. Spark, local-jev i so1 używają referencyjnej ścieżki Transformers bez FLA; Spark dodatkowo wraca do pełnego przebiegu po błędzie cache. JevK5 v0.2 korzysta z referencyjnej konwolucji. Instalacja zależności na CPU podczas części pomiaru decider-2b mogła nieco zaniżyć jego przepustowość.

Protokół Nox. Pełny wynik 5 000 pytań jest w głównej tabeli. Model korzysta z trybu eager na H100 NVL 94 GB; jego szybka ścieżka jest zweryfikowana przez autorów dla ROCm. Czas i przepustowość zmierzono z jednym procesem serwera. Pozostałe 3 000 pytań wykonano z pulą pięciu procesów wyłącznie na potrzeby oceny trafności; ich czasu nie użyto do wyliczania kosztu ani szybkości.

Jak liczymy koszt. H100 i H100 NVL: stawka porównawcza 3,95 USD/h; RTX PRO 6000 Blackwell: 2,09 USD/h. Koszt 1 000 decyzji wynika z przepustowości przy pełnym obciążeniu. API: koszt raportowany przez dostawcę. Własne wdrożenie przy małym ruchu może kosztować więcej na decyzję. Znak „—” oznacza brak danych.

Trafność a czas odpowiedzi

Im wyżej i bliżej lewej strony, tym lepszy wynik przy krótszym oczekiwaniu. Oś czasu jest logarytmiczna; dokładne wartości znajdziesz w tabeli.

Werdykt: trafność i mediana czasu odpowiedzi 48 systemówbasal-1.5 osiąga 72,12% przy 33,8 ms, max 77,28% przy 67,1 ms, mini 60,66% przy 14,2 ms. Skala trafności obejmuje od 0 do 100%. Sprzęt różni się między systemami; pełne warunki i dane są w tabeli powyżej.100%75%50%25%0%10 ms100 ms1 s10 sGemini 3.8 Flash: 99,56%, 3 314,5 ms · API dostawcyClaude Opus 5.5 †: 99,40%, 5 531,3 ms · API dostawcyGPT-6.1 Sol: 99,38%, 2 213,6 ms · API dostawcyGPT-6 Astra †: 99,34%, 1 993,9 ms · API dostawcyGPT-6 Luna: 98,32%, 2 380,1 ms · API dostawcyGemini 3.1 Pro (preview) †: 97,88%, 5 539,5 ms · API dostawcySurogate Rune 26B-A4B v3: 81,68%, 164,1 ms · 1 × RTX PRO 6000 Blackwell 96 GBJev 1.13.0: 81,64%, 286,4 ms · API dostawcyCygnet: 78,52%, 39,6 ms · 1 × H100 80 GBWinnow-12B (Q8): 78,50%, 126,2 ms · 1 × H100 80 GBbasal-1.5-max: 77,28%, 67,1 ms · 1 × H100 80 GBJev-Omni: 75,34%, 1 131,5 ms · 1 × H100 80 GBbasal-1.5: 72,12%, 33,8 ms · 1 × H100 80 GBDecision-2.0-Nox-4B: 71,64%, 863,8 ms · 1 × H100 NVL 94 GBClef-Flash: 71,58%, 1 700,2 ms · 1 × H100 80 GBQwen3-32B, zero-shot (jqv): 70,54%, 129,5 ms · 1 × H100 80 GBHopper: 70,28%, 60,4 ms · 1 × H100 80 GBDecision 4B v1.2: 70,16%, 28,7 ms · 1 × H100 80 GBdecider-4b v2: 70,00%, 27,8 ms · 1 × H100 80 GBdjev: 69,80%, 66,6 ms · 1 × H100 80 GBspark-s1-4b-v6: 69,38%, 217,4 ms · 1 × H100 80 GBPlumb-4B: 69,04%, 27,7 ms · 1 × H100 80 GBDecision 4B v1.1: 69,02%, 28,5 ms · 1 × H100 80 GBJevK5 v0.3: 68,86%, 28,4 ms · 1 × H100 80 GBKev 1.0 (kev-4b): 68,36%, 34,1 ms · 1 × H100 80 GBImajev-4B: 68,16%, 112,7 ms · 1 × H100 80 GBJevK5 v0.2 (4B): 66,72%, 30,7 ms · 1 × H100 80 GBbasal-1.0 · 4.5B: 66,04%, 26,5 ms · 1 × H100 80 GBMalkuth-4B: 63,36%, 153,2 ms · 1 × H100 80 GBManchego v2.1: 63,04%, 73,5 ms · 1 × H100 80 GBlocal-jev (Qwen3.5-4B): 62,98%, 142,7 ms · 1 × H100 80 GBtypecastlm v1.3.0 (Qwen3.5 3.8B): 62,88%, 95,2 ms · 1 × H100 80 GBlev: 62,86%, 157,6 ms · 1 × H100 80 GBjev-local (Qwen3.5-9B, HF scorer): 62,18%, 460,7 ms · 1 × H100 80 GBQwen3-4B-Instruct-2507 (raw, letter logits): 62,08%, 40,0 ms · 1 × H100 80 GBmetask-jev-4b: 61,16%, 107,8 ms · 1 × H100 80 GBbasal-1.5-mini: 60,66%, 14,2 ms · 1 × H100 80 GBopen-alternative-jev (so1, Qwen3.5-4B): 60,24%, 101,4 ms · 1 × H100 80 GBSemIf: 58,80%, 66,0 ms · 1 × H100 80 GBdecider-2b (v11): 58,66%, 20,3 ms · 1 × H100 80 GBJEV-Qwen3.5-9B-Base-NVFP4: 57,26%, 31,8 ms · 1 × RTX PRO 6000 Blackwell 96 GBPhi-4-mini-instruct (raw, letter logits): 55,78%, 35,9 ms · 1 × H100 80 GBDecision 2B (preview): 54,62%, 48,7 ms · 1 × H100 80 GBbasal-1.0 · 1.5B: 52,24%, 14,6 ms · 1 × H100 80 GBNemotron Diffusion 8B (Nemotron_Jev): 51,54%, 38,6 ms · 1 × H100 80 GBMalkuth-2B: 49,98%, 73,2 ms · 1 × H100 80 GBQwen3-Reranker-4B (as a decider): 47,20%, 131,6 ms · 1 × H100 80 GBCerto v1: 28,26%, 20,8 ms · 1 × H100 80 GB
Rodzina basalInne otwarte modeleAPI

Konfiguracje basal na H100 NVL

Porównujemy sześć konfiguracji silnika basal-1.5 na H100 NVL 94 GB. W tabeli podajemy zakres każdego przebiegu: pełne 5 000 pytań lub warstwowy podzbiór s2000. Te pomiary uzupełniają główny ranking.

basal-1.5 · H100 NVL 94 GB · konfiguracje silnika i zakres testu
Model / parametryKonfiguracjaZakres testuPL + EN ↑Czas p50
ms ↓
Czas p95
ms ↓
USD / 1000
decyzji ↓
basal-1.54.5B fast1 kolejność opcji 5 000 pytańpełny zbiór 72,02% 32,0331,30,0969
basal-1.54.5B vLLM · FP82 kolejności opcji 5 000 pytańpełny zbiór 71,68% 35,6232,50,0431
basal-1.54.5B vLLM · FP81 kolejność opcji 2 000 pytańpodzbiór s2000 71,80% 29,2205,10,0416
basal-1.54.5B fast2 kolejności opcji 2 000 pytańpodzbiór s2000 72,30% 36,01 116,60,1986
basal-1.54.5B vLLM · BF162 kolejności opcji 2 000 pytańpodzbiór s2000 72,50% 40,9264,80,0583
basal-1.54.5B vLLM · BF161 kolejność opcji 2 000 pytańpodzbiór s2000 72,35% 33,5274,60,0532

Porównuj ten sam zakres testu. Dwa przebiegi obejmują pełne 5 000 pytań, a cztery — warstwowy podzbiór s2000, liczący 2 000 pytań. Trafność porównuj między konfiguracjami ocenionymi na tym samym zbiorze.

Sprzęt i silnik. Wszystkie konfiguracje basal-1.5 w tej tabeli uruchomiono na H100 NVL 94 GB. Porównujemy tryby fast i vLLM, precyzję wag oraz liczbę kolejności opcji. Liczba kolejności określa, czy basal ocenia jedną, czy dwie kolejności opcji.

Koszt według wspólnej stawki. Wszystkie koszty przeliczono z przepustowości przy 16 równoległych zapytaniach i umownej stawki 3,95 USD/h. To stawka porównawcza benchmarku; nie cena wynajmu tej maszyny.

02 / POLISH ITEMS ONLY

Jak modele radzą sobie po polsku?

Ranking 42 systemów: wyniki z raportu „basal-1.5 in Polish” uzupełnione o nowe pełne przebiegi z 4 października 2026. Trafność to średnia z 10 polskich kategorii, 2 500 pytań. Czas to mediana dla całego Werdyktu, a nie osobny pomiar tylko polskich pytań. Modele ogólne i reranker oznaczono jako pomiary kontrolne.

72,4% basal-1.577,7% basal-1.5-max61,9% basal-1.5-mini
Polish items only · systemy decyzyjne i pomiary kontrolne
MiejsceModelParametryTrafność PL ↑Mediana czasu ↓
1Jev 1.13.0API dostawcy–82,1%286 ms
2Surogate Rune 26B-A4B v31 × RTX PRO 6000 Blackwell 96 GB26B-A4B80,9%164,1 ms
3Cygnet1 × H100 80 GB12B79,0%40 ms
4Winnow-12B (Q8)1 × H100 80 GB12B78,5%126 ms
5basal-1.5-max1 × H100 80 GB11B77,7%67 ms
6Jev-Omni1 × H100 80 GB12B76,3%1,132 ms
7basal-1.51 × H100 80 GB4.5B72,4%34 ms
8Decision-2.0-Nox-4B1 × H100 NVL 94 GB4B (4.21B)70,9%863,8 ms
9djev1 × H100 80 GBBłędy wywołania w pełnym teście: 274 / 5 000–70,2%67 ms
10Clef-Flash1 × H100 80 GB9B70,1%1,700 ms
11Decision 4B v1.21 × H100 80 GB4B69,9%29 ms
12decider-4b v21 × H100 80 GB4B69,7%28 ms
13Qwen3-32B, zero-shot (jqv)1 × H100 80 GB32B69,5%130 ms
14Hopper1 × H100 80 GB4B69,4%60 ms
15Plumb-4B1 × H100 80 GB4B69,0%28 ms
16spark-s1-4b-v61 × H100 80 GB4B68,8%217,4 ms
17Decision 4B v1.11 × H100 80 GB4B68,8%29 ms
18JevK5 v0.31 × H100 80 GB4B68,3%28 ms
19Kev 1.0 (kev-4b)1 × H100 80 GB4B67,2%34,1 ms
20Imajev-4B1 × H100 80 GBBłędy wywołania w pełnym teście: 436 / 5 0004B66,6%113 ms
21JevK5 v0.2 (4B)1 × H100 80 GB4B66,4%30,7 ms
22basal-1.0 · 4.5B1 × H100 80 GB4.5B66,3%27 ms
23local-jev (Qwen3.5-4B)1 × H100 80 GB4B62,5%142,7 ms
24typecastlm v1.3.0 (Qwen3.5 3.8B)1 × H100 80 GB3.8B62,4%95,2 ms
25Malkuth-4B1 × H100 80 GBBłędy wywołania w pełnym teście: 108 / 5 0004B62,3%153 ms
26Manchego v2.11 × H100 80 GB–62,2%74 ms
27basal-1.5-mini1 × H100 80 GB1.5B61,9%14 ms
28lev1 × H100 80 GB–61,7%158 ms
29jev-local (Qwen3.5-9B, HF scorer)1 × H100 80 GBBłędy wywołania w pełnym teście: 436 / 5 0009B61,6%460,7 ms
30Qwen3-4B-Instruct-2507 (raw, letter logits)Pomiar kontrolny1 × H100 80 GB4B61,4%40,0 ms
31metask-jev-4b1 × H100 80 GBBłędy wywołania w pełnym teście: 441 / 5 0004B60,7%108 ms
32open-alternative-jev (so1, Qwen3.5-4B)1 × H100 80 GB4B59,2%101,4 ms
33decider-2b (v11)1 × H100 80 GB2B58,0%20,3 ms
34JEV-Qwen3.5-9B-Base-NVFP41 × RTX PRO 6000 Blackwell 96 GB9B57,8%31,8 ms
35SemIf1 × H100 80 GBBłędy wywołania w pełnym teście: 436 / 5 0004B57,6%66 ms
36Phi-4-mini-instruct (raw, letter logits)Pomiar kontrolny1 × H100 80 GB3.8B53,7%35,9 ms
37basal-1.0 · 1.5B1 × H100 80 GB1.5B52,7%15 ms
38Decision 2B (preview)1 × H100 80 GBBłędy wywołania w pełnym teście: 431 / 5 0002B49,2%48,7 ms
39Nemotron Diffusion 8B (Nemotron_Jev)1 × H100 80 GB8B48,7%38,6 ms
40Malkuth-2B1 × H100 80 GBBłędy wywołania w pełnym teście: 108 / 5 0002B48,2%73,2 ms
41Qwen3-Reranker-4B (as a decider)Pomiar kontrolny1 × H100 80 GB4B45,9%131,6 ms
42Certo v11 × H100 80 GB0.4B29,4%20,8 ms

Dla porównania: duże modele przez API

Inny punkt kompromisu między trafnością a czasem odpowiedzi. † Oznacza udział modelu lub jego rodziny w budowie albo sprawdzaniu pytań; taki wynik nie stanowi niezależnego porównania.

Polish items only · modele ogólne przez API
ModelTrafność PL ↑Mediana czasu ↓
Gemini 3.8 Flash99,6%3.3 s
GPT-6.1 Sol99,2%2.2 s
Claude Opus 5.5 †99,2%5.5 s
GPT-6 Astra †99,2%2.0 s
Gemini 3.1 Pro (preview) †97,9%5.5 s
GPT-6 Luna97,8%2.4 s

Źródło: raport „basal-1.5 in Polish” z 3.10.2026; dodatkowe systemy — eksport Werdyktu z 4 października 2026. Dotychczasowe wartości zachowują precyzję raportu, stąd niewielkie rozbieżności względem pełnej tabeli. Nox zmierzono na H100 NVL 94 GB, Surogate Rune i JEV-Qwen3.5-9B-Base-NVFP4 na RTX PRO 6000 Blackwell, pozostałe otwarte modele na H100 80 GB. Różnice poniżej około 2 punktów procentowych w polskim wyniku ogólnym należy interpretować ostrożnie.

03 / POLISH, CATEGORY BY CATEGORY

Jedna średnia nie mówi wszystkiego.

Porównaj 29 systemów w 10 rodzajach decyzji. Każda polska kategoria liczy około 250 pytań. Kolor pomaga odczytać wynik, a każda komórka zawiera dokładną wartość.

Przewiń tabelę poziomo, aby zobaczyć wszystkie modele. Wyniki tylko dla języka polskiego.

Polish, category by category · trafność
KategoriaJev 1.13.0Surogate Rune 26B-A4B v3Cygnet · 12BWinnow Q8 · 12Bbasal-1.5-max · 11BJev-Omni · 12Bbasal-1.5 · 4.5BDecision-2.0-Nox-4BClef-Flash · 9BDecision 4B v1.2spark-s1-4b-v6Kev 1.0 (kev-4b)JevK5 v0.2 (4B)basal-1.0 · 4.5Blocal-jev (Qwen3.5-4B)typecastlm v1.3.0 (Qwen3.5 3.8B)basal-1.5-mini · 1.5Bjev-local (Qwen3.5-9B, HF scorer)Qwen3-4B-Instruct-2507 (raw, letter logits)open-alternative-jev (so1, Qwen3.5-4B)decider-2b (v11)JEV-Qwen3.5-9B-Base-NVFP4Phi-4-mini-instruct (raw, letter logits)basal-1.0 · 1.5BDecision 2B (preview)Nemotron Diffusion 8B (Nemotron_Jev)Malkuth-2BQwen3-Reranker-4B (as a decider)Certo v1
Brak wystarczających danychabstain73,1%76,8%70,3%70,7%73,6%67,9%70,0%63,2%59,4%69,9%60,0%59,6%57,6%59,4%53,2%48,4%52,0%52,0%51,2%51,2%48,0%51,2%45,2%41,6%42,0%34,8%36,4%28,8%21,2%
Następny krok agentaaction83,6%85,2%83,6%82,4%72,8%76,4%62,4%70,0%66,4%61,2%60,4%65,6%60,0%62,8%60,8%52,4%42,0%60,0%55,6%52,0%51,6%50,8%46,4%45,6%45,6%40,8%43,6%43,6%19,2%
Umowycontract76,0%76,0%75,2%71,6%69,6%69,6%64,8%65,6%64,8%60,4%64,8%59,6%60,8%59,2%58,8%58,0%54,8%60,4%54,4%50,0%50,0%50,4%49,6%48,4%48,0%51,2%43,6%41,2%32,8%
Ocena odpowiedzijudge92,0%86,8%89,2%88,8%85,6%84,4%80,0%67,2%70,0%69,6%69,6%62,0%67,2%59,2%57,2%62,0%69,2%70,4%62,8%54,0%56,8%57,2%52,4%44,8%57,6%50,4%45,2%50,0%44,4%
Długie dokumentylong74,4%73,6%66,8%66,8%69,6%66,8%61,2%60,0%63,2%56,0%54,4%57,2%54,4%58,8%50,8%50,4%55,6%7,6%51,6%48,8%55,2%46,4%46,8%46,8%0,0%34,8%38,0%38,4%26,4%
Rzeczywiste dokumentyrealdoc99,2%98,0%95,2%94,8%97,6%96,0%94,0%92,0%94,0%89,2%88,8%89,2%90,8%88,4%84,8%84,8%83,2%92,0%84,8%87,6%82,4%84,0%82,8%74,8%72,8%78,0%78,8%64,4%34,8%
Wyszukiwanie i RAGretrieval98,8%97,6%98,0%97,6%98,0%96,0%97,2%94,0%92,4%95,6%94,0%86,0%89,6%91,6%82,4%92,0%90,0%86,0%82,4%79,6%74,8%71,6%68,8%71,2%73,2%52,0%62,4%56,8%52,0%
Kierowanie zgłoszeńrouting98,8%97,6%96,4%97,6%99,2%92,8%94,0%96,8%93,6%93,2%93,6%91,2%93,2%89,2%90,0%90,0%86,8%91,6%87,6%86,0%82,4%82,0%75,6%75,6%76,8%78,4%70,0%68,8%18,0%
Reguły i terminyrules44,2%40,0%38,2%35,3%34,0%38,2%34,8%31,6%30,5%35,3%34,0%34,0%28,4%34,5%28,0%24,8%32,4%31,6%23,6%27,2%29,6%26,8%25,2%29,2%25,2%22,4%20,8%26,0%25,2%
Ocena na skaliscore80,7%77,2%77,1%79,9%76,8%74,7%66,0%68,8%67,1%68,3%68,8%67,2%62,0%59,4%58,8%60,8%53,2%64,0%60,0%55,2%49,6%57,2%44,0%49,2%51,2%44,4%42,8%41,2%20,0%
Wszystkie polskie pytania82,1%80,9%79,0%78,5%77,7%76,3%72,4%70,9%70,1%69,9%68,8%67,2%66,4%66,3%62,5%62,4%61,9%61,6%61,4%59,2%58,0%57,8%53,7%52,7%49,2%48,7%48,2%45,9%29,4%

Przy około 250 pytaniach na kategorię różnice poniżej około 6 punktów procentowych mogą być szumem. To orientacyjna uwaga z raportu, nie test istotności każdej pary. Źródło: „basal-1.5 in Polish”, 3.10.2026; dodatkowe systemy — polskie kategorie z eksportu Werdyktu z 4 października 2026. Qwen3-4B-Instruct-2507, Phi-4-mini-instruct oraz Qwen3-Reranker-4B to pomiary kontrolne.

abstain

Brak wystarczających danych

Wybór odpowiedzi lub stwierdzenie, że nie da się jej ustalić.

action

Następny krok agenta

Działanie zgodne z podaną polityką i stanem procesu.

contract

Umowy

Interpretacja zapisów oraz decyzje na podstawie warunków umowy.

judge

Ocena odpowiedzi

Poprawność odpowiedzi i porównywanie dwóch propozycji.

long

Długie dokumenty

Decyzje na podstawie dokumentów o długości 3–10 tys. tokenów.

realdoc

Rzeczywiste dokumenty

Pytania o treść autentycznych dokumentów urzędowych.

retrieval

Wyszukiwanie i RAG

Trafność fragmentu, wystarczalność kontekstu i oparcie twierdzenia w źródle.

routing

Kierowanie zgłoszeń

Wybór kolejki, intencji i priorytetu według podanych zasad.

rules

Reguły i terminy

Stosowanie reguł, terminów i warunków dotyczących kwot.

score

Ocena na skali

Wybór poziomu zgodnego z opisem skali.

04 / OD BASAL-1.0 DO BASAL-1.5

Postęp na polskich zadaniach.

Trzy oddzielne testy polskie, niezależne od tabeli Werdyktu. Najmocniejszy sygnał: 93,1% wobec 87,4% na 3 000 nowych decyzji utworzonych po zamrożeniu wag.

Rodzina basal · trafność na polskich zbiorach testowych
Testbasal-1.0 · 4.5Bbasal-1.5 · 4.5Bbasal-1.5-max · 11Bbasal-1.0 · 1.5Bbasal-1.5-mini · 1.5B
Zamknięty test polski3 000 nowych decyzji; po zamrożeniu wag87,4%93,1%93,3%88,9%91,0%
Polskie decyzje7 081 przypadków88,6%92,3%94,0%85,1%87,7%
Wiedza ogólna po polsku3 079 przypadków73,7%74,1%79,4%65,6%66,7%
JAK CZYTAĆ TE WYNIKI

Specjalizacja w decyzjach, z mierzalnym postępem.

Główny model zyskuje 5,7 punktu procentowego na zamkniętym teście polskim (95% przedział różnicy: +4,5 do +6,8 pkt). Max ma zbliżony wynik w tym teście i przewagę w wiedzy ogólnej. Poprawa wiedzy ogólnej dla głównego modelu i mini nie jest statystycznie istotna.

05 / PEWNOŚĆ DECYZJI · 04.10.2026

Ile decyzji można zautomatyzować?

Pobierz analizę JSON

Model wybiera odpowiedź i podaje jej prawdopodobieństwo. Ustalasz próg: decyzje o wyższej pewności przyjmujesz automatycznie, pozostałe kierujesz do człowieka. Sprawdzamy, jak dużo pracy przechodzi przez taki próg — i jaki błąd pozostaje wśród przyjętych decyzji.

  1. 01 Model wybiera odpowiedź
  2. 02 Sprawdzasz jej pewność
  3. 03 Automatyzacja lub człowiek
CEL BŁĘDU: 5%66,3%

decyzji przyjętych automatycznie

basal-1.5-max · zmierzony błąd: 5,24%

CEL BŁĘDU: 1%42,2%

decyzji przyjętych automatycznie

basal-1.5-max · zmierzony błąd: 0,84%

PEWNOŚĆ A TRAFNOŚĆ84,7% → 77,2%

deklaracja modelu a wynik testu

basal-1.5-max jest średnio zbyt pewny odpowiedzi. Wartość progu trzeba sprawdzić na danych własnego procesu.

Cel nie jest gwarancją. Próg dobrano na jednej połowie pytań, a odsetek automatyzacji i błąd zmierzono na drugiej. Na przykład cel 5% dla max dał błąd 5,24%. Ta analiza obejmuje 40 systemów zwracających prawdopodobieństwa, na 5 000 pytaniach PL+EN. Modele basal-1.5 pracują tutaj w trybie fast, z plikiem kalibracji; w głównym rankingu basal-1.5 i max korzystają z SGLang.

Dla modelu głównego basal-1.5 próg dobrany do celu 5% przyjmuje 49,3% decyzji, przy zmierzonym błędzie 4,57%. Porównaj poniżej, jak zmiana modelu wpływa na odsetek przyjętych decyzji i wiarygodność deklarowanej pewności.

Interaktywne wykresy wymagają JavaScript i pobrania danych. Pełne wyniki są dostępne w tabeli poniżej oraz w pliku JSON.

Porównanie 40 systemów

W kolumnach celów: automatycznie przyjęte decyzje, zmierzony błąd i zastosowany próg. Mniejszy ECE, Brier i AURC oznacza lepszy wynik.

40 systemów · domyślna kolejność według automatyzacji dla celu 1% · tabela przewija się poziomo.

Werdykt v1 · PL+EN · analiza z 4 października 2026 · basal-1.5: tryb fast
System / parametryTrafność ↑Średnia
pewność
ECE ↓Brier ↓AURC ↓Cel błędu: 1%
Automatyzacja ↑
Cel błędu: 5%
Automatyzacja ↑
Surogate Rune 26B-A4B v326B-A4B · otwarte wagi 81,68%82,09%0,0240,2400,038 50,93%Błąd: 1,40%Próg: 0,9266 73,31%Błąd: 5,12%Próg: 0,7146
Jev 1.13.0— · API 81,64%82,92%0,0160,2350,036 49,39%Błąd: 1,04%Próg: 0,9700 72,84%Błąd: 4,07%Próg: 0,7200
Winnow-12B (Q8)12B · otwarte wagi 78,50%86,99%0,0850,2880,047 47,37%Błąd: 1,50%Próg: 0,9857 69,80%Błąd: 5,60%Próg: 0,9279
Cygnet12B · otwarte wagi 78,52%81,42%0,0450,2830,049 45,83%Błąd: 1,21%Próg: 0,9330 66,25%Błąd: 4,59%Próg: 0,8015
basal-1.5-max11B · otwarte wagi 77,18%84,68%0,0750,3070,054 42,16%Błąd: 0,84%Próg: 0,9868 66,32%Błąd: 5,24%Próg: 0,8585
Jev-Omni12B · otwarte wagi 75,34%84,03%0,0870,3330,062 37,66%Błąd: 0,52%Próg: 0,9936 60,76%Błąd: 4,16%Próg: 0,9234
decider-4b v24B · otwarte wagi 70,00%73,31%0,0380,3750,095 25,23%Błąd: 1,10%Próg: 0,9565 46,55%Błąd: 4,24%Próg: 0,8476
spark-s1-4b-v64B · otwarte wagi 69,38%85,34%0,1600,4530,107 24,52%Błąd: 1,45%Próg: 0,9978 39,24%Błąd: 3,62%Próg: 0,9921
basal-1.54.5B · otwarte wagi 72,08%79,10%0,0720,3720,088 21,99%Błąd: 1,26%Próg: 0,9932 49,27%Błąd: 4,57%Próg: 0,9267
Decision-2.0-Nox-4B4B (4.21B) · otwarte wagi 71,64%68,89%0,0320,3620,092 21,95%Błąd: 0,54%Próg: 0,9303 44,14%Błąd: 4,20%Próg: 0,8079
Kev 1.0 (kev-4b)4B · otwarte wagi 68,36%65,35%0,0340,3970,114 21,67%Błąd: 1,46%Próg: 0,9100 36,72%Błąd: 4,09%Próg: 0,8048
jev-local (Qwen3.5-9B, HF scorer)9B · otwarte wagi 62,18%59,15%0,0900,5500,132 20,69%Błąd: 1,15%Próg: 0,8063 38,45%Błąd: 5,03%Próg: 0,6658
Qwen3-32B, zero-shot (jqv)32B · otwarte wagi 70,54%71,64%0,0390,3850,103 17,33%Błąd: 1,37%Próg: 0,9340 36,00%Błąd: 4,28%Próg: 0,8569
basal-1.0 · 4.5B4.5B · otwarte wagi 66,04%72,74%0,0700,4460,139 17,02%Błąd: 0,46%Próg: 0,9773 31,78%Błąd: 4,72%Próg: 0,9098
Malkuth-4B4B · otwarte wagi 63,36%69,92%0,0520,4740,143 16,27%Błąd: 1,46%Próg: 0,9664 32,49%Błąd: 5,59%Próg: 0,8939
JevK5 v0.34B · otwarte wagi 68,86%76,41%0,0750,4040,107 13,50%Błąd: 1,75%Próg: 0,9914 41,49%Błąd: 4,38%Próg: 0,9029
Decision 4B v1.14B · otwarte wagi 69,02%71,49%0,0250,3970,110 13,11%Błąd: 1,51%Próg: 0,9724 33,99%Błąd: 3,37%Próg: 0,9043
basal-1.5-mini1.5B · otwarte wagi 60,66%69,26%0,0860,4980,174 11,92%Błąd: 1,66%Próg: 0,9846 21,87%Błąd: 4,33%Próg: 0,9554
Clef-Flash9B · otwarte wagi 71,58%77,87%0,0630,3830,099 10,74%Błąd: 0,37%Próg: 0,9675 39,01%Błąd: 4,25%Próg: 0,9222
typecastlm v1.3.0 (Qwen3.5 3.8B)3.8B · otwarte wagi 62,88%62,03%0,0670,4590,151 10,34%Błąd: 1,15%Próg: 0,8927 23,81%Błąd: 5,14%Próg: 0,8223
JevK5 v0.2 (4B)4B · otwarte wagi 66,72%72,92%0,0620,4160,120 10,07%Błąd: 0,39%Próg: 0,9883 37,47%Błąd: 4,85%Próg: 0,9004
djev26B (4B active) · otwarte wagi 69,80%84,34%0,1050,4480,087 9,83%Błąd: 2,01%Próg: 0,9994 55,19%Błąd: 5,72%Próg: 0,9263
decider-2b (v11)2B · otwarte wagi 58,66%70,99%0,1230,5380,204 9,79%Błąd: 3,23%Próg: 0,9881 17,02%Błąd: 5,57%Próg: 0,9649
metask-jev-4b4B · otwarte wagi 61,16%73,71%0,0660,5720,151 9,59%Błąd: 1,65%Próg: 0,9510 23,73%Błąd: 4,99%Próg: 0,9196
Decision 4B v1.24B · otwarte wagi 70,16%70,05%0,0240,3860,103 9,51%Błąd: 0,41%Próg: 0,9738 35,61%Błąd: 3,66%Próg: 0,8698
open-alternative-jev (so1, Qwen3.5-4B)4B · otwarte wagi 60,24%73,66%0,1340,5280,182 7,86%Błąd: 1,01%Próg: 0,9937 22,11%Błąd: 5,18%Próg: 0,9677
Hopper4B · otwarte wagi 70,28%70,12%0,0590,3950,111 7,30%Błąd: 1,08%Próg: 0,9947 30,40%Błąd: 3,77%Próg: 0,9291
Imajev-4B4B · otwarte wagi 68,16%76,60%0,0390,4760,097 6,24%Błąd: 0,00%Próg: 0,9931 50,41%Błąd: 4,62%Próg: 0,8078
SemIf4B · otwarte wagi 58,80%73,51%0,0910,5880,166 4,97%Błąd: 0,79%Próg: 0,9989 24,83%Błąd: 5,56%Próg: 0,9715
Decision 2B (preview)2B · otwarte wagi 54,62%62,45%0,0300,6270,215 4,66%Błąd: 0,85%Próg: 0,9574 16,27%Błąd: 6,80%Próg: 0,8789
Nemotron Diffusion 8B (Nemotron_Jev)8B · otwarte wagi 51,54%66,62%0,1510,6200,276 4,66%Błąd: 2,54%Próg: 0,9931 10,03%Błąd: 7,87%Próg: 0,9772
local-jev (Qwen3.5-4B)4B · otwarte wagi 62,98%64,27%0,0200,4580,158 4,30%Błąd: 0,92%Próg: 0,9854 24,71%Błąd: 6,39%Próg: 0,8895
Manchego v2.14B · otwarte wagi 63,04%74,95%0,1190,5020,178 3,91%Błąd: 1,01%Próg: 0,9978 19,98%Błąd: 3,95%Próg: 0,9577
Plumb-4B4B · otwarte wagi 69,04%78,96%0,0990,4230,116 1,74%Błąd: 0,00%Próg: 0,9969 33,87%Błąd: 3,73%Próg: 0,9339
Certo v10.4B · otwarte wagi 28,26%29,71%0,0170,7300,616 0,00%Błąd: —Próg: — 0,00%Błąd: —Próg: —
JEV-Qwen3.5-9B-Base-NVFP49B · otwarte wagi 57,26%63,32%0,0610,5390,235 0,00%Błąd: —Próg: — 0,00%Błąd: —Próg: —
Malkuth-2B2B · otwarte wagi 49,98%64,45%0,1340,6440,302 0,00%Błąd: —Próg: — 2,80%Błąd: 2,82%Próg: 0,9909
Qwen3-Reranker-4B (as a decider)4B · otwarte wagi 47,20%33,67%0,1370,6690,414 0,00%Błąd: —Próg: — 0,00%Błąd: —Próg: —
basal-1.0 · 1.5B1.5B · otwarte wagi 52,24%63,65%0,1140,6010,289 0,00%Błąd: —Próg: — 5,53%Błąd: 6,43%Próg: 0,9820
lev4B · otwarte wagi 62,86%73,91%0,1110,4840,168 0,00%Błąd: —Próg: — 11,05%Błąd: 3,93%Próg: 0,9746

Jak czytać cel 1% i 5%. Progi wybieramy na jednej połowie pytań, według stałego podziału opartego na skrócie identyfikatora. Następnie stosujemy je do drugiej połowy. „Automatyzacja” to odsetek przyjętych decyzji na tej drugiej części; „Błąd” to błędne odpowiedzi wśród przyjętych. Wynik może przekroczyć założony cel. Znak „—” oznacza brak wyznaczonego progu lub brak przyjętych decyzji, dla których można zmierzyć błąd.

Pewność i zakres porównania. Pewność to najwyższe prawdopodobieństwo odpowiedzi zwrócone przez system. Analiza obejmuje 40 systemów z takimi wynikami w dostarczonym raporcie. GPT, Gemini i Claude zwracały w tym protokole wybraną odpowiedź, bez porównywalnego rozkładu prawdopodobieństw. Dlatego nie ma ich w tej tabeli.

ECE, Brier i AURC. ECE to średnia ważona bezwzględnej różnicy między pewnością a trafnością w 10 przedziałach równej szerokości. Brier mierzy błąd całego rozkładu prawdopodobieństw odpowiedzi (wariant wieloklasowy). AURC to pole pod krzywą błędu względem odsetka przyjętych decyzji — ocenia, czy pewność dobrze szereguje odpowiedzi od najbardziej do najmniej wiarygodnych.

Krzywe a pomiar progów. Krzywe kalibracji i trafności opisują cały zbiór. Na wykresie automatyzacji znaczniki 1% i 5% pokazują faktyczny odsetek i trafność z osobnej połowy testowej; nie muszą leżeć na linii całego zbioru. Nieudane wywołanie nigdy nie jest przyjmowane automatycznie i liczy się jako błąd w trafności całego testu. Przedziały kalibracji obejmują odpowiedzi z dostępnymi prawdopodobieństwami.

Warunki basal. Modele basal-1.5 działają przez basal-serve w trybie fast, z plikiem kalibracji modelu. Ich trafność w tej analizie wynosi 72,08% dla modelu głównego i 77,18% dla max. To odrębne przebiegi od wyników SGLang w głównej tabeli. Dane są agregatami z analizy „Werdykt: próg pewności”; nie publikujemy pytań ani dokumentów testowych.

WARUNKI POMIARÓW

Co dokładnie mierzy Werdykt?

Wynik dotyczy wyboru odpowiedzi z podanych opcji. Nie jest oceną całego produktu ani gwarancją poprawności w nowym procesie.

Ten sam problem, jedno wywołanie

Każdy system otrzymuje ten sam stan, pytanie i opcje. Modele czatowe dostają wspólny, ustalony prompt z odpowiedzią JSON; serwery decyzyjne — równoważne pola System One. Nieodczytana odpowiedź i wywołanie zakończone błędem liczą się jako błąd.

Trafność i niepewność

Główny wynik to średnia trafności z 20 grup: 10 kategorii × polski i angielski, po 250 pytań. Przedziały 95% wyznaczono przez bootstrap warstwowy: 1 000 losowań wewnątrz każdej grupy. Przedział w tabeli dotyczy wyłącznie wyniku PL + EN, także po zmianie filtra.

Czas, sprzęt i koszt

Mediana i p95: 200 wspólnych pytań, pojedyncze zapytania bez kolejki. Większość otwartych modeli działa na jednym H100 80 GB, Nox na H100 NVL 94 GB, a Surogate Rune i JEV-Qwen3.5-9B-Base-NVFP4 na RTX PRO 6000 Blackwell 96 GB. Klient działa przy serwerze. Koszt H100 i H100 NVL wyliczamy przy 3,95 USD/h, Blackwell przy 2,09 USD/h. Czas API obejmuje sieć do dostawcy. Przepustowość dla modeli lokalnych mierzona przy 16 równoległych zapytaniach. Modelom API pozostawiono ustawienie rozumowania podane w tabeli; Jev korzysta ze swojego API.

basal stosuje obie kolejności opcji i kalibrację. W tej tabeli 4.5B i max działają przez SGLang; ich mediany w trybie fast wyniosły odpowiednio 31,2 i 44,7 ms. Wynik 13,7 ms z testu HTTP na stronie głównej pochodzi z innego zestawu zapytań.

Zamknięty zbiór i jawne przykłady

Ukrytych pytań nie publikujemy. Żadne pytanie, dokument ani fragment Werdyktu nie występuje w danych treningowych basal. Poniższe przykłady są osobnymi, syntetycznymi ilustracjami napisanymi na potrzeby tej strony. Nie zawierają fragmentów dokumentów źródłowych i nie służyły do wyliczenia rankingu. Przy kolejnej wersji benchmarku planowana jest wymiana około 30% każdej grupy oraz raportowanie wyników na zachowanej części.

PRZYKŁADY SYNTETYCZNE / 30 SCENARIUSZY

Jak wyglądają takie decyzje?

Po trzy fikcyjne scenariusze na kategorię, w języku polskim i angielskim. Przygotowaliśmy je od podstaw na potrzeby tej strony, bez kopiowania dokumentów źródłowych. Osoby i organizacje zastępują oznaczenia ról, np. „Klient A”. Te przykłady ilustrują zadania i nie służyły do wyliczenia rankingu.

Brak wystarczających danych 3 przykłady
1 · PL · Ile sztuk produktu B można przeznaczyć na nowe zamówienie?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fikcyjny rejestr magazynu. Produkt A: 18 sztuk na stanie, 7 zarezerwowanych. Produkt B: 9 sztuk na stanie. Rejestr nie podaje liczby rezerwacji produktu B. Towar dostępny do nowego zamówienia to stan pomniejszony o rezerwacje.

Możliwe odpowiedzi

  • 9 sztuk
  • 2 sztuki
  • Nie da się ustalić na podstawie rejestru

Odpowiedź wzorcowa: Nie da się ustalić na podstawie rejestru

2 · EN · Who is assigned to the afternoon shift?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Synthetic handover log. Operator A covers the morning shift. Operator B has requested an exchange with Operator C for the afternoon shift. A request becomes effective only after approval by the shift lead. The log includes no approval and does not identify the original afternoon operator.

Możliwe odpowiedzi

  • Operator B
  • Operator C
  • The log does not establish the assignment

Odpowiedź wzorcowa: The log does not establish the assignment

3 · PL · Jaki limit czasu pracy obowiązuje według podanych dokumentów?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Demonstracyjna specyfikacja urządzenia. Projekt dokumentu podaje limit 8 godzin pracy. Zatwierdzona wersja dokumentu podaje limit 6 godzin. Instrukcja procesu mówi, że wersja zatwierdzona zastępuje projekt.

Możliwe odpowiedzi

  • 6 godzin
  • 8 godzin
  • Nie da się ustalić

Odpowiedź wzorcowa: 6 godzin

Następny krok agenta 3 przykłady
1 · PL · Jaki powinien być następny krok agenta?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Symulacja obsługi zgłoszenia. Procedura: najpierw sprawdź kompletność, następnie zweryfikuj uprawnienie, a na końcu zaproponuj rozwiązanie. Stan procesu: kompletność potwierdzona; uprawnienie jeszcze niesprawdzone. Dostępne narzędzia: sprawdź kompletność, sprawdź uprawnienie, przygotuj propozycję, zamknij zgłoszenie.

Możliwe odpowiedzi

  • Sprawdź uprawnienie
  • Przygotuj propozycję
  • Zamknij zgłoszenie

Odpowiedź wzorcowa: Sprawdź uprawnienie

2 · EN · Which action is allowed next?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Synthetic deployment exercise. Policy: a release may reach the staging environment only after both the build and automated checks pass. Production additionally requires an explicit approval. Current state: build passed, checks passed, staging not started, production approval absent.

Możliwe odpowiedzi

  • Deploy to staging
  • Deploy directly to production
  • Skip the remaining steps

Odpowiedź wzorcowa: Deploy to staging

3 · PL · Co powinien teraz zrobić agent?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fikcyjne wywołanie usługi zwróciło kod 429 i nagłówek Retry-After: 20. Procedura pozwala na najwyżej trzy próby i wymaga odczekania czasu z nagłówka. Zakończyła się pierwsza próba; operacja jest bezpieczna do ponowienia.

Możliwe odpowiedzi

  • Ponowić natychmiast
  • Odczekać 20 sekund i ponowić
  • Uznać operację za zakończoną sukcesem

Odpowiedź wzorcowa: Odczekać 20 sekund i ponowić

Umowy 3 przykłady
1 · PL · Jaką obniżkę przewidują podane warunki?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Umowa demonstracyjna: miesięczna opłata za usługę wynosi 200 punktów rozliczeniowych. Jeśli miesięczna dostępność spadnie poniżej 99%, przysługuje obniżka równa 10% tej opłaty. W badanym miesiącu dostępność wyniosła 98,5%. Innych obniżek nie przewidziano.

Możliwe odpowiedzi

  • 0 punktów
  • 20 punktów
  • 100 punktów

Odpowiedź wzorcowa: 20 punktów

2 · EN · Is the proposed task permitted by the stated agreement?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fictional service agreement. The supplier may use Subcontractor A for storage only. Access to message content requires separate written permission. No such permission has been granted. The proposed task is to let Subcontractor A read messages to prepare summaries.

Możliwe odpowiedzi

  • Yes, storage permission includes reading
  • No, separate permission is required
  • Yes, if the summaries are short

Odpowiedź wzorcowa: No, separate permission is required

3 · PL · Jaka dopłata wynika z tej umowy?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fikcyjna umowa wypożyczenia: podstawowy pakiet obejmuje 4 dni. Każdy rozpoczęty dodatkowy dzień kosztuje 15 punktów. Sprzęt pozostawał u odbiorcy przez 6 pełnych dni. Nie ma okresu bezpłatnego ani innych dopłat.

Możliwe odpowiedzi

  • 15 punktów
  • 30 punktów
  • 90 punktów

Odpowiedź wzorcowa: 30 punktów

Ocena odpowiedzi 3 przykłady
1 · EN · How should the candidate answer be assessed?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Synthetic reference: Plan A permits three devices and includes email support. It does not include telephone support. User question: how many devices are allowed and is telephone support included? Candidate answer: three devices are allowed and telephone support is included.

Możliwe odpowiedzi

  • Fully correct
  • Partly correct: the support claim is wrong
  • Unsupported in every part

Odpowiedź wzorcowa: Partly correct: the support claim is wrong

2 · PL · Która odpowiedź obejmuje wszystkie wymagane czynności?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fikcyjna instrukcja: przy przeniesieniu projektu zachowaj jego nazwę, wskaż nowy katalog i wykonaj kopię zapasową. Pytanie dotyczy wszystkich wymaganych czynności. Odpowiedź A wymienia trzy czynności. Odpowiedź B wymienia zachowanie nazwy i wskazanie katalogu, lecz pomija kopię zapasową.

Możliwe odpowiedzi

  • Odpowiedź A
  • Odpowiedź B
  • Obie odpowiedzi

Odpowiedź wzorcowa: Odpowiedź A

3 · EN · What is the main issue with the summary?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Synthetic reference: a completed form must contain a project code, a purpose and a requested amount. Candidate summary: the form needs a project code and a purpose. The summary makes no other claims.

Możliwe odpowiedzi

  • It adds an unsupported requirement
  • It omits the requested amount
  • It contradicts the project code requirement

Odpowiedź wzorcowa: It omits the requested amount

Długie dokumenty 3 przykłady

Przykłady są skróconymi, fikcyjnymi pakietami. Dokumenty w tej kategorii benchmarku mają 3–10 tys. tokenów.

1 · PL · Czy można już uruchomić urządzenie B?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Skrócony, syntetyczny pakiet dokumentów.

Sekcja 1 — plan: test urządzenia A ma zakończyć się przed uruchomieniem urządzenia B. Zespół 1 odpowiada za test, Zespół 2 za uruchomienie.

Sekcja 2 — sprawa poboczna: urządzenie C przeszło test i otrzymało zgodę na pracę. Ta zgoda dotyczy wyłącznie C.

Sekcja 3 — raport: dla urządzenia A wykonano pomiary, lecz brakuje podpisu osoby zatwierdzającej. W tym procesie test uznaje się za zakończony dopiero po zatwierdzeniu.

Sekcja 4 — kolejność: Zespół 2 czeka na potwierdzenie zakończenia testu A. Nie wydano wyjątku od tej zasady.

Możliwe odpowiedzi

  • Tak, ponieważ urządzenie C ma zgodę
  • Tak, same pomiary wystarczą
  • Nie, test A nie został zatwierdzony

Odpowiedź wzorcowa: Nie, test A nie został zatwierdzony

2 · EN · Can the request for Project A be approved?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Short synthetic case file.

Section 1 — request: Project A needs 12 units of Material X.

Section 2 — warehouse: 20 units of Material X are stored, of which 6 are reserved for Project B. Reservations cannot be reassigned.

Section 3 — unrelated shipment: 30 units of Material Y arrive tomorrow. They cannot substitute for Material X.

Section 4 — rule: approve a request only if enough unreserved units of the requested material are available now.

Możliwe odpowiedzi

  • Yes, 14 unreserved units of Material X are available
  • No, only 6 units are available
  • Only after the Material Y shipment arrives

Odpowiedź wzorcowa: Yes, 14 unreserved units of Material X are available

3 · PL · Jaki status wynika z procedury dla bieżącego alertu?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Skrócony, syntetyczny raport serwisowy.

Część A — procedura: alert jest zakończony dopiero po naprawie i pomyślnym teście kontrolnym.

Część B — archiwum: poprzedni alert dla modułu A został zakończony po teście. Ten wpis dotyczy wcześniejszego zdarzenia.

Część C — bieżące zdarzenie: wymieniono uszkodzony element modułu A; test kontrolny nowej naprawy nie został jeszcze uruchomiony.

Część D — notatka przekazania: zespół kolejnej zmiany ma wykonać brakujący test.

Możliwe odpowiedzi

  • Zakończony
  • Oczekuje na test kontrolny
  • Nie wymaga żadnego działania

Odpowiedź wzorcowa: Oczekuje na test kontrolny

Rzeczywiste dokumenty 3 przykłady

W tej sekcji pokazujemy dokumenty fikcyjne. Ilustrują typ pytań; właściwy benchmark korzysta w tej kategorii z dokumentów rzeczywistych.

1 · EN · Which submission method does this document specify?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Synthetic document written for this demonstration; it is not an official notice.

Notice from Organisation A: applications for the fictional equipment programme are accepted electronically only. A submission consists of a completed form and an inventory list. A telephone call does not count as a submission.

Możliwe odpowiedzi

  • Telephone only
  • Electronic submission with the required attachments
  • Any method without attachments

Odpowiedź wzorcowa: Electronic submission with the required attachments

2 · PL · Jaką informację trzeba wpisać do rejestru przy pobraniu sprzętu?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Syntetyczny dokument demonstracyjny; nie jest to dokument urzędowy.

Komunikat Organizacji A: magazyn demonstracyjny jest dostępny dla zespołów projektu od godziny 8:00 do 16:00. Pobranie sprzętu wymaga wpisania kodu projektu do rejestru. Pracownik dyżurny sprawdza zgodność kodu, ale nie zmienia godzin dostępu.

Możliwe odpowiedzi

  • Kod projektu
  • Prywatny adres pracownika
  • Numer dokumentu tożsamości

Odpowiedź wzorcowa: Kod projektu

3 · EN · Which request has been accepted?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Synthetic document written for this demonstration; it is not a legal decision.

Decision record of Organisation A: the request to expand the test area is accepted for two workstations. The separate request to expand the storage area remains pending because a floor plan is missing. The record makes no decision about opening hours.

Możliwe odpowiedzi

  • Expansion of the storage area
  • Expansion of the test area for two workstations
  • A change to opening hours

Odpowiedź wzorcowa: Expansion of the test area for two workstations

Wyszukiwanie i RAG 3 przykłady
1 · EN · Which passage directly answers the user question?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Synthetic knowledge snippets.
Passage A: a project owner can export reports from the Reports menu.
Passage B: account passwords are changed from Security settings.
Passage C: billing history is visible to the billing role.
User question: where can a project owner export a report?

Możliwe odpowiedzi

  • Passage A
  • Passage B
  • Passage C

Odpowiedź wzorcowa: Passage A

2 · PL · Czy zebrany kontekst wystarcza do odpowiedzi na pytanie użytkownika?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Syntetyczny fragment bazy wiedzy: zadania ukończone można archiwizować. Archiwizacja zachowuje historię komentarzy.
Pytanie użytkownika: czy zarchiwizowane zadanie da się przywrócić? W zebranym materiale nie opisano przywracania.

Możliwe odpowiedzi

  • Tak, można potwierdzić przywracanie
  • Tak, można wykluczyć przywracanie
  • Nie, potrzebny jest fragment o przywracaniu

Odpowiedź wzorcowa: Nie, potrzebny jest fragment o przywracaniu

3 · EN · How does the claim relate to the source?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Synthetic source: notifications can be paused for one hour, four hours or until the next day. Pausing does not delete existing notifications.
Claim to check: pausing notifications deletes all earlier notifications.

Możliwe odpowiedzi

  • Supported
  • Contradicted
  • Not addressed

Odpowiedź wzorcowa: Contradicted

Kierowanie zgłoszeń 3 przykłady
1 · EN · Which queue should receive the message?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fictional support rules: login failures go to Account Access; questions about charges go to Billing; requests for new capabilities go to Product Feedback. Message from Customer A: I know my password, but the verification code never arrives and I cannot sign in.

Możliwe odpowiedzi

  • Account Access
  • Billing
  • Product Feedback

Odpowiedź wzorcowa: Account Access

2 · PL · Do jakiej kolejki skierować główną prośbę?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fikcyjna procedura: brak możliwości zapłaty kierujemy do Płatności, brak przesyłki do Dostawy, a pytania o parametry do Informacji o produkcie. Wiadomość Klienta A: parametry są jasne, chcę kupić produkt, lecz każda próba opłacenia koszyka kończy się błędem.

Możliwe odpowiedzi

  • Płatności
  • Dostawy
  • Informacje o produkcie

Odpowiedź wzorcowa: Płatności

3 · EN · Which priority follows from this policy?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fictional priority policy: service unavailable for all users = urgent; unavailable for one team without a workaround = high; cosmetic issue with a workaround = normal. Report: one team cannot use the export function and no workaround exists. Other teams can use it.

Możliwe odpowiedzi

  • Urgent
  • High
  • Normal

Odpowiedź wzorcowa: High

Reguły i terminy 3 przykłady
1 · PL · Jaki koszt dostawy wynika z tych zasad?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fikcyjny cennik: dostawa standardowa kosztuje 10 punktów. Jest bezpłatna, gdy wartość produktów po rabatach wynosi co najmniej 100 punktów. Klient A wybrał dostawę standardową. Produkty kosztują 120 punktów przed rabatem wynoszącym 25%.

Możliwe odpowiedzi

  • 0 punktów
  • 10 punktów
  • 25 punktów

Odpowiedź wzorcowa: 10 punktów

2 · EN · Is the pass valid on the immediately following Friday?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fictional access rule: a temporary pass is valid for the three calendar days after the day it is issued. The issue day is excluded. A pass was issued on a Monday. There are no exceptions.

Możliwe odpowiedzi

  • Yes
  • No
  • The issue hour is required to decide

Odpowiedź wzorcowa: No

3 · PL · Czy zadanie A spełnia warunki automatycznego przydzielenia?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Reguły demonstracyjne: zadanie zostaje automatycznie przydzielone tylko wtedy, gdy ma opiekuna i co najmniej dwie niezależne akceptacje. Zadanie A ma opiekuna, jedną akceptację i jeden komentarz bez akceptacji.

Możliwe odpowiedzi

  • Tak
  • Nie, brakuje drugiej akceptacji
  • Nie, brakuje opiekuna

Odpowiedź wzorcowa: Nie, brakuje drugiej akceptacji

Ocena na skali 3 przykłady
1 · PL · Który poziom skali pasuje do opisu?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fikcyjna skala wpływu: 0 — brak utrudnienia; 1 — niewielkie utrudnienie z obejściem; 2 — zadanie zablokowane dla jednego zespołu; 3 — podstawowa usługa zablokowana dla wszystkich. Zespół A nie może ukończyć zadania i nie ma obejścia. Pozostałe zespoły pracują normalnie.

Możliwe odpowiedzi

  • 0 — brak utrudnienia
  • 1 — niewielkie utrudnienie
  • 2 — blokada jednego zespołu
  • 3 — blokada wszystkich

Odpowiedź wzorcowa: 2 — blokada jednego zespołu

2 · EN · Which completeness level applies?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Synthetic completeness rubric: 0 = none of the required fields; 1 = one field; 2 = two fields; 3 = all three fields. Required fields are purpose, project code and requested amount. The form contains a purpose and a project code, but no amount.

Możliwe odpowiedzi

  • 0
  • 1
  • 2
  • 3

Odpowiedź wzorcowa: 2

3 · EN · What relevance level fits the passage?

Przykład syntetyczny · tekst przygotowany na potrzeby tej strony.

Fictional relevance scale: low = unrelated topic; medium = same topic without answering the question; high = directly answers the question. Question: how can notifications be paused? Candidate passage: open Notification Settings and choose Pause, then select a duration.

Możliwe odpowiedzi

  • Low
  • Medium
  • High

Odpowiedź wzorcowa: High

Wyniki poprzedniego wydania i metodologia: Raport techniczny basal-1.0 ↗

Zobacz modele w zastosowaniach