Analiza · AI w produkcji · październik 2026
Twoje AI myśli za długo: czym jest AI Systemu 1
Przez dwa lata branża uczyła modele językowe myśleć wolno. Tymczasem większość pytań, które firma zadaje AI, ma krótką listę dozwolonych odpowiedzi, a nowa klasa modeli wybiera jedną z nich w milisekundach.
W skrócie
Daniel Kahneman podzielił ludzkie myślenie na szybki, automatyczny System 1 i wolny, wysiłkowy System 2. Od premiery modelu o1 firmy OpenAI we wrześniu 2024 dostawcy AI inwestują w stronę Systemu 2: modele, które „myślą”, zanim odpowiedzą. Pomaga to przy matematyce i kodzie, a przy każdym wywołaniu kosztuje tokeny i sekundy. We wrześniu 2026 firma TypeSafe AI, współzałożona przez byłego badacza OpenAI Diogo Almeidę, pokazała Jev, model, który w ogóle nie pisze tekstu. Dostaje sytuację i listę dozwolonych odpowiedzi, a zwraca jedną z nich z prawdopodobieństwem. Remigiusz Kinas zbudował już otwarty polski odpowiednik, basal, na bazie Bielika. Badania Mety pokazują, gdzie to działa (ocena odpowiedzi w 4 tokenach zamiast 2118) i gdzie się sypie (matematyka szkolna). W moim małym teście na 30 polskich decyzjach z obsługi klienta model myślący był nieco trafniejszy (29 wobec 27), ale potrzebował 3,9 sekundy na decyzję wobec 118 milisekund basala, a przy ostrzejszym z dwóch dostarczonych progów pewności basal sam rozstrzygnął 23 przypadki bez ani jednego błędu. Na końcu jest lista kroków, jak sprawdzić to we własnym procesie.
Pytanie na pierwszą sekundę
Kij i piłka kosztują razem 1,10 zł. Kij jest o złotówkę droższy od piłki. Ile kosztuje piłka?
Jeśli „10 groszy” pojawiło się, zanim skończyłeś czytać, jesteś w dobrym towarzystwie. Shane Frederick umieścił to pytanie w swoim Teście Refleksji Poznawczej w 2005 roku (w oryginale w dolarach), a Kahneman podaje, że ponad połowa studentów Harvardu, MIT i Princeton dała intuicyjną odpowiedź. Poprawna to 5 groszy: kij kosztuje 1,05 zł, czyli dokładnie złotówkę więcej.
Wokół takich chwil Kahneman zbudował „Pułapki myślenia. O myśleniu szybkim i wolnym” (2011). System 1 odpowiada od razu i bez wysiłku: rozpoznaje twarz w tłumie i podsuwa „10 groszy”. System 2 jest potrzebny przy 17 × 24. Jest wolny i męczący, a przy tym potrafi sprawdzić, co zaproponował System 1. Same nazwy pochodzą od psychologów Keitha Stanovicha i Richarda Westa (2000). Kahneman traktuje oba systemy jako wygodny sposób opisu umysłu i nie umieszcza ich w konkretnych miejscach mózgu.
Jedno uczciwe zastrzeżenie, zanim oprę się na tej książce. Nie wszystko w niej przetrwało kryzys replikacji w psychologii. Rozdział o primingu społecznym się nie obronił i Kahneman sam to przyznał w 2017 roku: „I placed too much faith in underpowered studies” (za bardzo zaufałem badaniom na zbyt małych próbach). Model dwóch systemów i wynik z kijem i piłką stoją na dużo solidniejszym gruncie, i tylko na nich opiera się ten artykuł.
Dwa lata uczenia AI wolnego myślenia
Świat AI szybko pożyczył słownik Kahnemana. W grudniu 2019 na NeurIPS Yoshua Bengio wygłosił wykład „From System 1 Deep Learning to System 2 Deep Learning”: sieci neuronowe świetnie radzą sobie z percepcją, a kolejnym krokiem jest rozumowanie. W listopadzie 2023 Andrej Karpathy opisał ówczesne duże modele językowe jako czysty System 1, który losuje słowo po słowie i nie potrafi się zatrzymać, żeby coś sprawdzić.
Potem branża na serio wzięła się za System 2. o1 od OpenAI (wrzesień 2024) zużywa dodatkowe obliczenia na długi wewnętrzny tok rozumowania, zanim odpowie. Anthropic przedstawił Claude 3.7 Sonnet (luty 2025) jako pierwszy model hybrydowy, który może odpowiedzieć od razu albo długo pomyśleć. Qwen3 (kwiecień 2025) miał jeden model z przełącznikiem myślenia, a w lipcu 2025 zespół Qwen rozdzielił go z powrotem na osobne modele, szybki i myślący, bo tak z każdego da się wycisnąć najlepszą jakość. GPT-5 (sierpień 2025) dostał router, który sam decyduje, kiedy pytanie zasługuje na wolną ścieżkę.
Firma płaci za to w dwóch walutach. Myślenie kosztuje tokeny: na przykład w Claude tokeny myślenia są rozliczane jak tokeny wyjściowe, czyli najdroższe. I kosztuje czas. Model myślący potrafi potrzebować kilkudziesięciu sekund do pierwszego słowa odpowiedzi. Okienko czatu to zniesie, infolinia nie: w badaniu dziesięciu języków Stivers i współpracownicy (PNAS, 2009) pokazali, że ludzie odpowiadają sobie w ciągu 0 do 200 milisekund od końca wypowiedzi rozmówcy.
Jev: model, który nie pisze
15 września 2026 firma TypeSafe AI z San Francisco wyszła z trybu stealth z rundą seed 40 mln dolarów prowadzoną przez DCVC. Jej CEO Diogo Almeida spędził około czterech lat w OpenAI przy InstructGPT, ChatGPT i GPT-4, a wcześniej pracował w Google Brain. Wpis premierowy mówi to wprost: „We were inspired by Daniel Kahneman, Thinking, Fast and Slow.” Nazwa modelu pochodzi od Williama Stanleya Jevonsa, ekonomisty od paradoksu Jevonsa: kiedy zasób tanieje, zwykle zużywamy go więcej.
Jev nie generuje tekstu. Wysyłasz mu opis sytuacji i pytanie określonego typu, a on zwraca rozkład prawdopodobieństwa dla odpowiedzi, na które pozwalasz. Są trzy rodzaje pytań: choice (wybierz jedną z opcji), score (oceń) i pytanie tak/nie, które TypeSafe nazywa noul. Firma podaje 70 do 500 milisekund na decyzję, 0,042 dolara za milion tokenów wejściowych i nic za wyjście, bo nie ma tekstu, za który trzeba by zapłacić.
pytanie: Czy to reklamacja? (tak / nie) odpowiedź: tak 0,990 112 ms„Moja paczka miała przyjść w poniedziałek, jest czwartek, a status w śledzeniu od trzech dni to »w drodze«. Gdzie jest moja przesyłka?”
pytanie: Który dział to obsłuży? (reklamacje / płatności / dostawa / techniczny / sprzedaż) odpowiedź: dostawa 0,997 117 ms
Model generatywny z tym samym zadaniem pisze zdanie, a twój kod musi mieć nadzieję, że znajdzie w nim jedno ze spodziewanych słów. Model decyzyjny nie może odpowiedzieć spoza listy. TypeSafe reklamuje to jako model, który „nie może halucynować”, co jest prawdą tylko w wąskim sensie: nadal może wybrać złą opcję z listy, po prostu nie wymyśli nowej. A liczby z nagłówków, 193,6 razy szybciej i 444,6 razy taniej, pochodzą z testów samego TypeSafe na czterech wewnętrznych procesach, ocenianych względem uśrednionych odpowiedzi dwóch dużych modeli, a nie etykiet sprawdzonych przez ludzi. TypeSafe sam określa je jako „on the higher end”. Nie ma raportu technicznego ani publicznych wag, więc na razie to deklaracje, a nie wyniki.
Pierwsze znane mi niezależne użycie jest akademickie. Badacze z University of Texas at Dallas opublikowali Jev-Mem (arXiv, 21 września 2026), gdzie Jev zarządza pamięcią agenta AI: decyduje, jakiego rodzaju wspomnieniem jest obserwacja, które wspomnienia są powiązane i kiedy przestać szukać. Zwykły model językowy pisze tylko końcową odpowiedź. Na benchmarku długich rozmów LoCoMo, gdzie odpowiedzi ocenia inny model językowy, raportują wynik ogólny 0,777 wobec 0,700 dla najmocniejszego konkurenta, 158 sekund na zbudowanie pamięci wobec 1044 sekund u najszybszego konkurenta i 0,93 sekundy na zapytanie. To jeden benchmark, najmocniejszy konkurent to wcześniejszy system tych samych autorów, a tekst miejscami nie zgadza się z własnymi tabelami, więc czytam to jako wczesny sygnał, jak ludzie będą używać takich modeli.
Gdzie szybka decyzja wystarcza
Wystarczy przejrzeć ruch w typowym procesie obsługi klienta albo back-office, żeby zobaczyć, że większość pytań zadawanych tam AI ma zamkniętą odpowiedź. Do którego zespołu trafia zgłoszenie. Czy klient jest zdenerwowany. Czy to reklamacja w rozumieniu regulaminu zwrotów. Czy formularz ma wszystkie wymagane pola, o ile reguła jest prosta. Czy teraz powinien przejąć człowiek. Czy tę odpowiedź można bezpiecznie wysłać. Żadne z tych pytań nie wymaga wypracowania, a każde pada tysiące razy dziennie, więc czas i koszt się sumują.
Za tym pomysłem stoi też mocny wynik badawczy. W pracy „Distilling System 2 into System 1” (Meta, lipiec 2024) Ping Yu i współpracownicy kazali modelowi wiele razy długo rozumować, zostawili odpowiedzi, co do których model był zgodny sam ze sobą, i nauczyli go podawać je od razu. Jako sędzia jakości odpowiedzi szybka wersja zgadzała się z ludzkimi oceniającymi w 58,4% przypadków, używając 4 tokenów, wobec 49,1% dla wolnej metody rozumowania, która zużywała 2118 tokenów. W tym zadaniu pokonała GPT-4. W teście odporności na tendencyjne, sugerujące pytania szybka wersja uzyskała 81,3% wobec 76,0% dla wolnej metody, przy 56 tokenach zamiast 147.
Ta sama praca jest też najlepszą etykietą ostrzegawczą. Na GSM8k, zbiorze szkolnych zadań z treścią, szybka wersja uzyskała 7,1%, wobec 52,8% przy rozumowaniu krok po kroku. Na niektóre pytania nie da się odpowiedzieć bez przemyślenia, u modeli tak samo jak u ludzi. Praktyczna zasada: szybkiemu modelowi dawaj decyzje z zamkniętą odpowiedzią, a wolnemu modelowi albo człowiekowi wszystko, co trzeba przemyśleć.
Szybkość zmienia też to, jakie produkty w ogóle da się zbudować. Agent głosowy, który przy każdej wypowiedzi zawiesza się na kilka sekund, sprawia wrażenie zepsutego, niezależnie od jakości odpowiedzi. Decyzja w kilkadziesiąt milisekund mieści się w przerwie, jaką ludzie zostawiają w zwykłej rozmowie, więc routing, eskalacja i kontrole bezpieczeństwa mogą działać przy każdej wypowiedzi, a dzwoniący niczego nie zauważy.
Polska wersja już istnieje
Pod koniec września, dwa tygodnie po premierze Jev, Remigiusz Kinas, jeden z twórców modeli Bielik, udostępnił basal: otwartą (Apache-2.0) rodzinę modeli decyzyjnych dla polskiego i angielskiego, z interfejsem tego samego rodzaju co Jev. TypeSafe nigdy nie opublikował, jak trenuje Jev, więc basal to autorski przepis Kinasa: Bielik-4.5B-v3.0 i Bielik-1.5B-v3.0 dostrojone na 63 663 przykładach decyzji (terminy z polskiego kalendarza świąt, kwoty i VAT, pytania o przepisy, czy dowody wystarczą). Każdy przykład został wygenerowany przez kod, oparty na tekście przepisu albo sprawdzony przez dwa niezależne modele weryfikujące, a mniej więcej jedna piąta jest po angielsku. Do tego dochodzi kalibracja, dzięki której 0,9 oznacza, że model ma rację mniej więcej dziewięć razy na dziesięć. Jedna decyzja projektowa ma znaczenie szczególnie dla polskiego: tokenizer Bielika v3 potrzebuje na polski tekst od 17 do 51% mniej tokenów niż alternatywy, które zmierzył, a to obniża koszt każdej decyzji.
Na własnym boisku wyniki są mocne. Na jego zbiorze 7081 polskich decyzji basal-4.5B ma rację w 88,4% przypadków, a Jev w 78,0%. Najbardziej podoba mi się liczba o pokryciu: jeśli pozwolisz modelowi decydować tylko wtedy, gdy jest na tyle pewny, żeby błędy trzymały się w okolicy 1%, basal-4.5B nadal sam rozstrzyga 58,6% przypadków, a Jev 18,1%. Reszta trafia do człowieka albo wolniejszego modelu. Na karcie H100 jedna decyzja trwa 12,5 milisekundy. Kinas uczciwie pisze też o ograniczeniach: ten zbiór testowy jest jego własny i nieopublikowany, a na publicznym, angielskim JevBench basal-4.5B ma 0,740 wobec 0,861 dla Jev. Właśnie dlatego warto go sprawdzić niezależnie, na cudzych danych.
Mój test na trzydziestu polskich decyzjach
Liczby Kinasa pochodzą z jego własnego zbioru testowego, więc napisałem inny: trzydzieści krótkich polskich wiadomości, jakie codziennie dostaje sklep internetowy, operator albo bank. Dziesięć pyta, czy wiadomość jest reklamacją, dziesięć kieruje ją do jednego z pięciu działów, pięć pyta, czy powinien przejąć człowiek, a pięć sprawdza formularz reklamacyjny z regułą kompletności złożoną z czterech warunków. Uruchomiłem basal-4.5B i basal-1.5B na swoim Macu (Apple M5 Max, zwykły PyTorch, uśrednione obie kolejności opcji, tak jak robi to basal) i porównałem z Qwen3-14B, ogólnym modelem mniej więcej trzy razy większym, z włączonym i wyłączonym trybem myślenia.
Najtrafniejszy był model myślący: 29 na 30 z myśleniem, 28 bez niego i 27 dla obu modeli basal. Przy trzydziestu przypadkach jedna odpowiedź to 3,3 punktu, więc nie wyciągałbym z tej różnicy wniosków. Różnica w szybkości jest duża: mediana czasu decyzji basal-4.5B wyniosła 118 milisekund, basal-1.5B 50 milisekund, a Qwen3 z myśleniem 3,9 sekundy, bo najpierw generował rozumowanie (mediana 224 tokeny). Bez myślenia Qwen3 odpowiadał w 289 milisekund.
Dwa z trzech błędów basal-4.5B wzięły się z reguły kompletności, czyli sprawdzenia czterech warunków: numer zamówienia, opis wady, żądanie klienta i numer rachunku, ale tylko wtedy, gdy klient chce zwrotu pieniędzy. basal uznał 4 z 5 formularzy za kompletne, w tym prośbę o zwrot bez numeru rachunku. Qwen3 z myśleniem przeszedł warunki po kolei i wszystkie pięć ocenił dobrze. Sprawdzanie listy warunków po kolei to dokładnie ten rodzaj zadania, na którym w badaniu Mety wykładały się szybkie modele.
Dla menedżera ważniejsza jest liczba o pewności. basal ma progi pewności ustalone z góry przez autora. Przy ostrzejszym z dwóch (pewność co najmniej 0,913, dobrana pod około 1% błędów) basal-4.5B sam rozstrzygnął 23 z 30 przypadków i wszystkie 23 poprawnie. Pozostałe 7 trafiłoby do człowieka, a wszystkie trzy pomyłki były właśnie wśród nich. Model myślący częściej ma rację, ale w tym ustawieniu nie daje porównywalnej liczby pewności, więc bez drugiej kontroli nie wiadomo, którym jego odpowiedziom ufać.
Ograniczenia są realne i chcę je jasno wypisać. Przypadki i etykiety napisałem sam, bez drugiej osoby oceniającej, a jedna etykieta jest dyskusyjna (pytanie o router Wi-Fi przed zakupem zaliczyłem do sprzedaży, a trzy z czterech systemów, w tym model myślący, wysłały je do wsparcia technicznego). Trzydzieści przypadków to demonstracja. Mac to też nie H100: mój prosty port pomija optymalizacje szybkości basala (Kinas podaje 12,5 milisekundy na H100), a Qwen3 działał na szybkiej ścieżce MLX od Apple z wagami 4-bitowymi, więc jeśli porównanie szybkości komuś sprzyja, to modelowi myślącemu. Przypadki, etykiety, skrypty i surowe wyniki są na GitHubie w agentGreg/system-1-ai, więc możesz je powtórzyć albo dodać własne.
Które decyzje oddać
Dwa pytania porządkują prawie każdą decyzję AI w procesie. Jak otwarta jest odpowiedź: stała lista opcji czy dowolny tekst? I ile kosztuje pomyłka? Zamknięte odpowiedzi z tanią pomyłką można oddać szybkiemu modelowi w całości. Zamknięte odpowiedzi z drogą pomyłką też pasują do szybkiego modelu, pod warunkiem że jego prawdopodobieństwo służy jako bramka, a wszystko poniżej progu trafia do człowieka. Praca otwarta, czyli odpowiedź do napisania albo wątek do streszczenia, należy do modelu generatywnego, z włączonym myśleniem tam, gdzie zadanie trzeba przemyśleć. A tam, gdzie odpowiedź jest otwarta i stawka wysoka, AI wspiera człowieka, który decyduje.
Jeśli chcesz to sprawdzić we własnym procesie, zrobiłbym to w tej kolejności.
- Spisz zamknięte decyzje. Przejdź jeden prawdziwy proces od początku do końca i zapisz każde miejsce, w którym człowiek albo model wybiera ze znanego zestawu odpowiedzi. Większość zespołów znajduje ich więcej, niż się spodziewa.
- Opisz kilkaset prawdziwych przypadków. Weź je z własnych zgłoszeń i dokumentów, a etykiety niech nadadzą ludzie, którzy dziś tę pracę wykonują, bo twoja skrzynka ma swój własny język.
- Mierz pokrycie przy swoim celu błędu, obok trafności. Ustal, ile pomyłek jesteś w stanie zaakceptować, i sprawdź, jaką część przypadków model obsłuży sam na tym poziomie. Ta część to twoja oszczędność.
- Przekazuj dalej to, czego model nie jest pewien. Poniżej progu wysyłaj sprawę do człowieka albo wolniejszego modelu. Prawdopodobieństwo z szybkiego modelu jest przełącznikiem.
- Mierz pełny czas odpowiedzi, razem z siecią. Model, który odpowiada w 12 milisekund na GPU, po drugiej stronie Atlantyku jest wolniejszy.
- Sprawdzaj regularnie. Klienci zmieniają język szybciej niż twój zbiór testowy.
Czym zajmę się dalej
Dwiema rzeczami. Czy kalibracja basala trzyma się na danych, które nie pochodzą z pipeline'u jego autora, bo to luka, którą Kinas sam zostawia otwartą, a mam polskie dane z własnych badań nad pewnością modeli, na których mogę to sprawdzić. I co daje dostrojenie basal-4.5B pod konkretną domenę na prawdziwych decyzjach z obsługi klienta, porównane z dużym modelem w roli sędziego pod względem kosztu i zgodności z ludźmi. Ciąg dalszy nastąpi.
To analiza publicznie dostępnych prac plus mój mały eksperyment. Liczby o Jev to deklaracje producenta, liczby o basalu pochodzą z jego raportu technicznego, a liczby Mety z pracy podlinkowanej niżej.
TypeSafe AI, premiera Jev → basal na GitHubie → Mój zbiór testowy i skrypty → Yu i in., Distilling System 2 into System 1 → Jiang i in., Jev-Mem → Stivers i in., wymiana wypowiedzi →
Dziękuję Remigiuszowi Kinasowi za otwarte opublikowanie basala, z wyjątkowo szczerym raportem technicznym. Powiązana lektura na tej stronie (po angielsku): A confidence dial you can read, and turn, moja publikacja o tym, na ile polskie modele wiedzą, czego nie wiedzą.