Kwantyzacja: dlaczego lokalnie nie masz pełnego modelu
Model 27B w pliku 16 GB to 4,7 bita na wagę. Jak to policzyć z dwóch liczb, pięć wyjątków w tabeli 23 modeli i czego ta metoda nie powie.
Model 27B w pliku 16 GB to 4,7 bita na wagę. Jak to policzyć z dwóch liczb, pięć wyjątków w tabeli 23 modeli i czego ta metoda nie powie.
Przy abonamencie 20 EUR miesięcznie maszyna za 900 EUR zwraca się po 53 miesiącach. Pełny rachunek: cena sprzętu, zmierzony pobór mocy i co pomija.
Sufit 45,7 tokena na sekundę, największy uruchomiony plik 22,8 GB, jeden model naraz. Zmierzone granice domowego AI.
Trzy warstwy, które naprawdę trzeba postawić: Ubuntu Server bez pulpitu, llama.cpp jako silnik i LiteLLM jako brama API.
MTP, DFlash, speculative decoding, kwantyzacja, MoE i krótszy kontekst – trzy grupy metod przyspieszania lokalnego modelu, z moimi pomiarami z września 2026 i cudzymi liczbami podanymi ze źródłem.
JEPA przewiduje reprezentacje, nie tekst. LLaDA odsłania tekst z masek, nie pisze od lewej do prawej. Definicje, przykłady z otwartymi wagami i to, co da się uruchomić w domu.
Model MoE 30B robi 30,4 tokena na sekundę, gęsty 12B na dłuższym kontekście – 11,3. O prędkości decyduje przede wszystkim liczba parametrów aktywnych na token, a nie liczba w nazwie modelu.
Model 30B o obniżonej precyzji zajmuje 15–19 GB, więc w 16 GB nie zostaje nic na resztę. Zmierzone rozmiary plików i prędkości, i co naprawdę kupujesz za te 80–100 EUR.
Zmierzone na jednej maszynie ze zintegrowanym Radeonem 890M i 32 GB RAM: który model działa, ile tokenów na sekundę i dlaczego 30B bywa szybsze niż 12B.
3–8 W na biegu jałowym, około 130 W pod pełnym obciążeniem. Całe wyliczenie w kWh, żebyś podstawił własną stawkę z rachunku za prąd.