Kwantyzacja: dlaczego lokalnie nie masz pełnego modelu
Model 27B w pliku 16 GB to 4,7 bita na wagę. Jak to policzyć z dwóch liczb, pięć wyjątków w tabeli 23 modeli i czego ta metoda nie powie.
SzczegółyModel 27B w pliku 16 GB to 4,7 bita na wagę. Jak to policzyć z dwóch liczb, pięć wyjątków w tabeli 23 modeli i czego ta metoda nie powie.
SzczegółyDlaczego osiem oddzielnych baz, a nie jedna z ośmioma schematami, i jedna reguła, która trzyma to w całości. Z ceną, którą ten podział kosztuje.
SzczegółyCztery próby zmierzenia oszczędzonego czasu, limit 10 minut na zadanie i brak punktu odniesienia. Dlaczego nie mam tej liczby i co zmieniłem.
SzczegółyPrzy abonamencie 20 EUR miesięcznie maszyna za 900 EUR zwraca się po 53 miesiącach. Pełny rachunek: cena sprzętu, zmierzony pobór mocy i co pomija.
SzczegółyJak system awansuje pojedyncze decyzje na podstawie zaufania, gdzie wyznaczyłem granice i dlaczego zabezpieczenie w tej samej maszynie nie chroni.
SzczegółyDziesięć automatyzacji, które zostały na stałe, i pięć, które wyłączyłem. Filtry decydujące, czy automatyzacja zostaje, i realne awarie z homelabu.
Szczegółyn8n jako mózg, Python jako ciało, 8 baz jako pamięć. Dlaczego cyfrowy bliźniak działa lepiej bez modelu językowego i gdzie model wciąż jest potrzebny.
SzczegółyPięć poziomów automatyzacji własnego życia, trzy realne awarie i próg, po którym system przestaje pytać. Dlaczego czwarty poziom jest najważniejszy.
SzczegółySufit 45,7 tokena na sekundę, największy uruchomiony plik 22,8 GB, jeden model naraz. Zmierzone granice domowego AI.
SzczegółyTrzy warstwy, które naprawdę trzeba postawić: Ubuntu Server bez pulpitu, llama.cpp jako silnik i LiteLLM jako brama API.
Szczegóły