Pytanie „16 GB czy 32 GB do lokalnego AI” wraca przy każdym zakupie i ma liczbową odpowiedź. Da się na nie odpowiedzieć liczbowo, bo to kwestia arytmetyki, a nie preferencji.
Wszystkie rozmiary i prędkości podane poniżej zmierzyłem na jednej maszynie, w serii pomiarów z września 2026.
Konfiguracja: AMD Ryzen AI 9 HX 470, zintegrowana grafika Radeon 890M, 32 GB pamięci współdzielonej z procesorem i dysk NVMe. Działa na niej Ubuntu Server bez środowiska graficznego, llama.cpp jako silnik inferencji i LiteLLM jako brama API.
Wynik dla 16 GB jest więc wyliczeniem na podstawie tych pomiarów, a nie osobnym testem na maszynie z 16 GB. Każdy może powtórzyć to wyliczenie na własnym sprzęcie.
Punkt wyjścia: ile zajmuje model
Model 30B zajmuje 15–19 GB
Wariant 16 GB czy 32 GB do lokalnego AI rozstrzyga się na pierwszym wierszu tabeli. Model o 30 miliardach parametrów, w wersji kwantyzowanej (o obniżonej precyzji, patrz dokumentacja kwantyzacji), zajmuje w tej serii od 15 do 19 GB. To rozstrzyga sprawę: w 16 GB nie zostaje po nim praktycznie nic na system, serwer inferencji i kontekst, a żadne ustawienie tego nie zmieni. Skąd bierze się ta obniżona precyzja i jak policzyć ją z rozmiaru pliku, wyjaśniam w tekście kwantyzacja: dlaczego lokalnie nie masz pełnego modelu.
Rzeczywiste rozmiary plików z pomiarów wrześniowych, od najmniejszego:
| Model | Rozmiar pliku | Tokenów na sekundę | Uwagi |
|---|---|---|---|
| granite 4.2 8B | ok. 4 GB | 45,7 | |
| Qwen3.8 9B | 5,4 GB | 27,7–28,1 | |
| Gemma 4 12B | 7,9 GB | 11,3 | przy dłuższym kontekście |
| gpt-oss 20B | 11 GB | 30,4 | |
| Gemma 4 26B-A4B QAT | 14 GB | ok. 28 | |
| Qwen3-Coder 30B-A3B | 18 GB | 30,4 | |
| Qwen3.6 35B-A3B | 21 GB | 30,4 |
Pierwsze trzy pozycje mieszczą się w 16 GB z zapasem na dłuższy kontekst. W przypadku modeli 11 GB i 14 GB sam plik jeszcze się mieści, ale po odjęciu systemu (ok. 0,4 GB) zostaje odpowiednio około 4,6 i 1,6 GB na serwer inferencji i pamięć rozmowy:
16 GB − 11 GB − 0,4 GB = 4,6 GB
16 GB − 14 GB − 0,4 GB = 1,6 GB
To za mało na komfortową pracę z długim kontekstem. Dwie ostatnie pozycje nie zmieszczą się w 16 GB w ogóle.
Co zostaje na resztę
13–17 GB na system i kontekst
Przy 32 GB i modelu 30B zajmującym 15–19 GB zostaje 13–17 GB na system, serwer inferencji i długi kontekst, ale nie na drugi model tej wielkości.
Stąd bierze się druga decyzja, która wygląda na drobną, a taka nie jest: wybór systemu operacyjnego. Ubuntu Server bez środowiska graficznego zajmuje około 400 MB, a Windows startuje od 4–6 GB, zanim otworzysz przeglądarkę. Na maszynie z 16 GB oznacza to oddanie od jednej czwartej do ponad jednej trzeciej pamięci, zanim cokolwiek zostanie uruchomione:
4 GB / 16 GB = 25%
6 GB / 16 GB = 37,5%
Czego nie widać w tabeli: pamięć rozmowy
Kontekst rośnie z każdą turą
Model nie jest jedynym elementem zajmującym pamięć. Im dłuższa rozmowa i im większy dokument, który wklejasz, tym więcej miejsca zajmuje zapis wszystkiego, co model już przetworzył, czyli bufor klucz-wartość (KV cache). Jego rozmiar zależy od ustawionej długości kontekstu i wypełnia się w trakcie pracy. Nikt go nie uwzględnia przy zakupie.
Bufor można przechowywać w postaci kwantyzowanej (skompresowanej), co pozwala zmieścić wyraźnie dłuższe rozmowy i większe dokumenty. Przy 32 GB ma to duże znaczenie. Przy 16 GB to różnica między „mieści się” a „przestaje działać w połowie dokumentu”.
Jeden model naraz
16 GB czy 32 GB do lokalnego AI: różnica widoczna przy przełączaniu
llama.cpp w trybie routera utrzymuje w pamięci jeden model. Gdy przychodzi zapytanie do innego, bieżący model jest zwalniany, a nowy ładowany, co przy zimnym starcie trwa 30–60 sekund. W zamian można uruchamiać modele, które przy dwóch utrzymywanych jednocześnie wymagałyby 48 lub 64 GB pamięci. W ten sposób 32 GB zachowuje się jak maszyna z dwukrotnie większą pamięcią, a kosztem jest około minuty przy przełączeniu.
Co dokładnie działa na tej maszynie i w jakiej kolejności to konfigurowałem, opisałem tutaj: jak uruchomić lokalny model AI na Ubuntu Server.
Ile kosztuje ta decyzja
Dopłata 80–100 EUR to około dziesięciu procent maszyny
Dopłata z 16 do 32 GB wynosi około 80–100 EUR przy obecnych cenach. Cała maszyna w tej konfiguracji kosztuje w Europie około 900 EUR, więc dopłata to około dziesięciu procent ceny.
Dlaczego większy model potrafi być szybszy od mniejszego, wyjaśniam osobno: dlaczego model 30B potrafi być szybszy niż 12B.
Podsumowanie
Jeśli z całego tekstu ma zostać jedno zdanie, to takie. Pytanie 16 GB czy 32 GB do lokalnego AI nie ma odpowiedzi uniwersalnej, ale ma jedną zasadę: 16 GB ogranicza do modeli 8B–12B oraz, przy skromnym kontekście, do najmniejszych modeli MoE, a 32 GB otwiera modele MoE 20–35B, które na tym samym sprzęcie działają szybciej niż gęsta dwunastka. Tyle kupujesz za 80–100 EUR.
Pełną tabelę prędkości dla tej maszyny, model po modelu, znajdziesz tutaj: jaki model AI uruchomisz lokalnie na mini PC.
A czy cała ta maszyna w ogóle się zwraca wobec abonamentu, rozpisałem w osobnym rachunku: po ilu miesiącach zwraca się własny serwer AI.