Pytanie pada zwykle w tej formie: „jaki model AI uruchomić lokalnie, skoro mam mały komputer?”. Odpowiedź nie sprowadza się do jednej nazwy: decyduje architektura modelu, a nie liczba parametrów w jego nazwie.
Wszystkie poniższe wartości zmierzyłem na jednej maszynie, w serii pomiarów z września 2026. Konfiguracja: AMD Ryzen AI 9 HX 470 (24 rdzenie), zintegrowana grafika Radeon 890M, 32 GB pamięci współdzielonej z procesorem i dysk NVMe 1 TB. To mini PC mniejszy od książki w twardej oprawie, który w Europie kosztuje około 900 EUR. Pytanie „jaki model AI uruchomić lokalnie” ma więc odpowiedź bardzo konkretną. Działa na nim Ubuntu Server bez środowiska graficznego, llama.cpp jako silnik inferencji i LiteLLM jako brama API.
MoE kontra model gęsty
Model gęsty (dense) wykorzystuje wszystkie swoje parametry do wygenerowania każdego tokena. Model MoE (mixture of experts) ma łącznie tyle samo parametrów co gęsty model o tej samej nominalnej wielkości, ale na jeden token aktywuje tylko ich ułamek, zwykle 3–4 miliardy. W rezultacie model MoE o rozmiarze 30B generuje tekst w tempie zbliżonym do modelu 3B, a jego wiedza jest znacznie bliższa modelowi 30B.
W maszynie, w której procesor i grafika współdzielą tę samą pamięć, ta różnica jest kluczowa. Pamięć systemowa zapewnia przepustowość rzędu 50–70 GB/s, podczas gdy RTX 4090 przekracza 1 TB/s. Tego ograniczenia nie da się obejść ustawieniami. Można je obejść wyłącznie wyborem architektury.
Sam mechanizm opisałem osobno, razem z tabelą i wyjaśnieniem źródła tej różnicy: dlaczego model 30B potrafi być szybszy niż 12B.
Zmierzone prędkości
Poniżej modele MoE z około 3 miliardami aktywnych parametrów. To segment, w którym ten sprzęt pracuje najlepiej, a rozmiar podany w nazwie ma niewielki wpływ na wynik. Prędkość dotyczy generowania.
Najszybszy segment na tej maszynie
| Model | Rozmiar pliku | Tokenów na sekundę | Uwagi |
|---|---|---|---|
| Nemotron 3.5 Lightning 30B-A3B | 18 GB | 29,9–32,9 | |
| Qwen3-Coder 30B-A3B | 18 GB | 30,4 | zoptymalizowany pod kod |
| gpt-oss 20B | 11 GB | 30,4 | |
| Qwen3.6 35B-A3B | 21 GB | 30,4 | kontekst 256K |
| Gemma 4 26B-A4B QAT | 14 GB | ok. 28 | obrazy, kontekst 128K, wywoływanie narzędzi |
| SmallThinker 21B-A3B QAT | 12,2 GB | 26,2 | |
| Tiel-Coder 35B-A3B | 21,7 GB | 23,1 |
W przypadku modeli gęstych rozmiar decyduje o wszystkim, co widać od razu – to samo pytanie, jaki model AI uruchomić lokalnie, ma wtedy inną odpowiedź:
A modele gęste – tu decyduje rozmiar w nazwie
| Model | Rozmiar pliku | Tokenów na sekundę | Uwagi |
|---|---|---|---|
| granite 4.2 8B | ok. 4 GB | 45,7 | najszybszy model na tej maszynie, i to nie jeden z dużych |
| Qwen3.8 9B | 5,4 GB | 27,7–28,1 | |
| Gemma 4 12B | 7,9 GB | 11,3 | przy dłuższym kontekście |
| Qwen3.8 27B | 16 GB | 7,6 | działa, ale nie nadaje się do pracy przez cały dzień |
| Gemma 4 31B | 18 GB | 6,1–6,4 | |
| DeepSeek-R1-Distill-Qwen 32B | 19 GB | ok. 3–4 |
Z tych danych wynika reguła krótsza niż cała tabela. Większość modeli MoE osiąga 21–33 tokenów na sekundę, a rozmiar w nazwie ma niewielkie znaczenie: z trzynastu wpisów MoE w tej serii jedenaście mieści się w tym przedziale, a dwa spadają do 16,3 i 17,86 tokena na sekundę (oba mają „35B” w nazwie). Model gęsty o więcej niż 9 miliardach parametrów spada do 14 tokenów na sekundę lub mniej, ponieważ ogranicza go przepustowość pamięci, a nie moc obliczeniowa.
Ile to znaczy „wystarczająco szybko”
Ile tokenów na sekundę wystarcza
Człowiek czyta w tempie około 4–5 tokenów na sekundę. Powyżej 10 tekst pojawia się szybciej, niż można go przeczytać, więc czekanie przestaje być odczuwalne. RTX 4090 osiąga około 80 tokenów na sekundę. To rzetelna skala różnicy i warto ją znać przed zakupem, a nie po nim.
Ile pamięci faktycznie zajmuje model
Modele gęste o rozmiarze około 30 miliardów parametrów, w wersji o obniżonej precyzji (kwantyzowanej), zajmują w tej serii od 15 do 19 GB. Na system, serwer inferencji i pozostałe procesy zostaje 13–17 GB. Zapas jest niewielki, ale konfiguracja działa.
Lokalny model AI przy 32 GB RAM: co się mieści
Przy 16 GB zostają modele 8B–12B. Wystarczają do prostych zadań, ale wyraźnie odstają w programowaniu, dłuższym rozumowaniu i wszędzie tam, gdzie potrzebna jest szersza wiedza. Dopłata z 16 do 32 GB to około 80–100 EUR i jest to najbardziej opłacalna pojedyncza decyzja w całym zestawieniu.
Pełne wyliczenie pamięci (co mieści się w 16 GB, co otwiera 32 GB i ile zajmuje sama długa rozmowa) opisałem tutaj: 16 GB czy 32 GB do lokalnego AI.
Dlatego wybrałem Ubuntu Server bez środowiska graficznego. System zajmuje wtedy około 400 MB, podczas gdy Windows startuje od 4–6 GB, zanim otworzysz przeglądarkę. W maszynie, w której każdy gigabajt to fragment modelu, to narzut widoczny w tabelach powyżej.
Jeden model naraz
llama.cpp w trybie routera utrzymuje w pamięci jeden model. Gdy przychodzi zapytanie do innego, bieżący model jest zwalniany, a nowy ładowany. Zimny start trwa 30–60 sekund. W zamian zyskujesz możliwość uruchamiania modeli, które przy dwóch utrzymywanych jednocześnie wymagałyby 48 lub 64 GB pamięci. Jeśli dwie osoby chcą w tej samej chwili korzystać z dwóch różnych modeli, nie da się tego zrealizować na jednej maszynie. Jedynym rozwiązaniem jest druga maszyna.
Konfigurację routera i całej reszty (Ubuntu Server bez pulpitu, llama.cpp i bramę API) opisałem osobno: jak uruchomić lokalny model AI na Ubuntu Server.
Co wybrać – podsumowanie
- Kod: Qwen3-Coder 30B-A3B, 30,4 tokena na sekundę.
- Codzienne pytania, pisanie, analiza i obrazy: Gemma 4 26B-A4B QAT, około 28 tokenów na sekundę.
- Dłuższy kontekst bez utraty prędkości: Qwen3.6 35B-A3B, 30,4 tokena na sekundę.
- Krótkie odpowiedzi, mało pamięci i maksymalna prędkość: granite 4.2 8B, 45,7 tokena na sekundę.
Wszystkie modele w zestawieniu to LLM-y, czyli modele generujące tekst token po tokenie. Istnieją też inne rodziny modeli z otwartymi wagami, które działają na odmiennej zasadzie: JEPA i LLaDA.
Po tym zestawieniu zostaje jedna reguła. Jeśli pytanie brzmi „jaki model AI uruchomić lokalnie”, odpowiedź zaczyna się od sprawdzenia, ile parametrów model aktywuje na token, a dopiero potem, ile ma ich w nazwie.