Czego lokalne AI nie zrobi, wiem z pomiarów, a nie z wrażeń. Pytanie zadaje się przed decyzją o sprzęcie, nie po: „czy lokalny model zastąpi mi płatne API?”. W części zadań tak – i tę część da się obrysować liczbami, bo granica nie jest kwestią opinii, tylko przepustowości pamięci i jej ilości.
Wszystkie liczby poniżej są zmierzone na jednej maszynie, w serii pomiarów z września 2026: AMD Ryzen AI 9 HX 470, zintegrowany układ graficzny Radeon 890M, 32 GB pamięci dzielonej z procesorem. Dwadzieścia trzy modele, każdy z rozmiarem pliku i prędkością generowania.
Ograniczenie pierwsze: prędkość ma sufit i nie jest wysoki
45,7 tokena na sekundę to maksimum
To pierwsze miejsce, w którym widać, czego lokalne AI nie zrobi szybciej. Sufit jest niski i nie przeskoczysz go zmianą kwantyzacji.
Najszybszy model na tej maszynie, granite 4.2 8B, robi 45,7 tokena na sekundę. To górna granica całej tabeli, a nie jej środek. Modele, na których realnie się pracuje, to mieszanki ekspertów (MoE) – te trzymają 21–33. Z trzynastu wpisów MoE w tej serii jedenaście mieści się w tym pasmie, a dwa schodzą do 16,3 i 17,86 – i oba mają w nazwie 35B, więc architektura zawęża widełki, ale ich nie gwarantuje.
Dedykowana karta RTX 4090 robi w podobnych testach około 80; to nie jest mój pomiar. Tego dystansu nie nadrobisz ustawieniami silnika, bo różnica siedzi w przepustowości pamięci: w maszynie z pamięcią dzieloną dane płyną około 50–70 GB na sekundę, a tam ponad 1 TB na sekundę.
Wszystkie dwadzieścia trzy wiersze, z rozmiarem pliku i prędkością, są w osobnym tekście: jaki model AI uruchomisz lokalnie na mini PC.
Ograniczenie drugie: duży model gęsty jest tu nie do pracy
Gęsty 30B w praktyce nie nadaje się do pracy
Czego lokalne AI nie zrobi w modelu gęstym, pokazuje sam sufit: powyżej 10 tokenów na sekundę tekst pojawia się szybciej, niż zdążysz go przeczytać. Poniżej – czekasz na odpowiedź.
W tych pomiarach każdy model gęsty od 27 miliardów parametrów w górę jest poniżej tego progu. Qwen3.8 27B robi 7,6. Gemma 4 31B – 6,1–6,4. Muse Glimmer 30B – 4,2. Qwen3.6 27B Fable – około 3,5. DeepSeek-R1-Distill-Qwen 32B – około 3–4. To nie są modele zepsute; ładują się i odpowiadają. Po prostu nie da się na nich pracować przez cały dzień.
Ograniczenie trzecie: 32 GB to twarda granica rozmiaru
22,8 GB to maksimum, które zmieściłem
Rozmiar pliku liczę według tego, co pokazuje transformers przy kwantyzacji. Największy plik, jaki na tej maszynie uruchomiłem, to 22,8 GB. Modele gęste z przedziału od 27 do 32 miliardów parametrów zajmują w tej serii od 15 do 19 GB na dysku, a w pamięci trzeba do tego doliczyć system, silnik i zapis rozmowy. Model, który potrzebuje więcej, niż masz, nie jest wolny – on się nie uruchamia, i żadne ustawienie tego nie zmieni.
Do tego rzecz, o której mówi się rzadko: lokalnie pracujesz na wersji modelu o obniżonej precyzji. Albo skwantowanej po treningu, albo od razu trenowanej na mniejszej liczbie bitów, jak dwa wpisy QAT w tej serii. Ile dokładnie kosztuje to w jakości odpowiedzi – nie zmierzyłem i nie będę tego zgadywał.
Ograniczenie czwarte: jeden model naraz
Przełączenie modelu to 30–60 sekund
Tryb routera wygląda jak to, co vLLM robi na klastrach, tylko na jednej maszynie. Silnik llama.cpp w trybie routera trzyma w pamięci jeden model. Przełączenie na inny to 30–60 sekund zimnego startu. Dwie osoby piszące w tej samej chwili do dwóch różnych modeli to scenariusz, którego ta maszyna nie obsłuży, i nie ma na to obejścia poza drugą maszyną.
Jak ta maszyna jest poskładana – system, silnik i brama API – opisałem krok po kroku tutaj: jak uruchomić lokalny model AI na Ubuntu Server.
Kiedy więc sięgam do chmury
Czego lokalne AI nie zrobi: cztery sytuacje dla chmury
Reguła wynika wprost z czterech punktów wyżej. To jest praktyczna odpowiedź na pytanie, czego lokalne AI nie zrobi dobrze:
- Kiedy zadanie wymaga modelu z czołówki. Najlepsze modele dostarcza się dziś jako API i nie zmieszczę ich na tej maszynie.
- Kiedy liczy się czas przy dużej liczbie zapytań. Te 45,7 tokena na sekundę to sufit całej maszyny, a nie punkt, od którego się skaluje.
- Kiedy w jednym procesie muszą pracować dwa różne modele równolegle.
- Kiedy potrzebny model nie mieści się w 32 GB. To nie jest kwestia cierpliwości.
I odwrotnie: lokalnie zostaje wszystko, co pracuje na dokumentach, których nie wysyłam nigdzie, co ma chodzić bez limitu zapytań i bez zmiany cennika, i co mieści się w pasmie 21–33 tokenów na sekundę. Przy 3–8 W na biegu jałowym taka maszyna może po prostu stać włączona.
Czego ta strona nie dotyczy
Nie dotyczy tego, które dane wolno w ogóle wypuścić z budynku. Tam, gdzie granica jest prawna, lokalne AI wygrywa zawsze. To osobne pytanie – o zgodność i o architekturę, nie o sprzęt. Tutaj chodzi wyłącznie o to, czego ta maszyna nie dowiezie, nawet gdyby wolno jej było wszystko.
To drugie pytanie – co w ogóle wolno wypuścić z budynku i jak to udowodnić – jest tutaj: AI a RODO: dane klienta w chmurze.