JEPA i LLaDA: modele AI, które działają inaczej niż LLM
JEPA przewiduje reprezentacje, nie tekst. LLaDA odsłania tekst z masek, nie pisze od lewej do prawej. Definicje, przykłady z otwartymi wagami i to, co da się uruchomić w domu.
SzczegółyJEPA przewiduje reprezentacje, nie tekst. LLaDA odsłania tekst z masek, nie pisze od lewej do prawej. Definicje, przykłady z otwartymi wagami i to, co da się uruchomić w domu.
SzczegółyMTP, DFlash, speculative decoding, kwantyzacja, MoE i krótszy kontekst – trzy grupy metod przyspieszania lokalnego modelu, z moimi pomiarami z września 2026 i cudzymi liczbami podanymi ze źródłem.
SzczegółyModel MoE 30B robi 30,4 tokena na sekundę, gęsty 12B na dłuższym kontekście – 11,3. O prędkości decyduje przede wszystkim liczba parametrów aktywnych na token, a nie liczba w nazwie modelu.
SzczegółyModel 30B o obniżonej precyzji zajmuje 15–19 GB, więc w 16 GB nie zostaje nic na resztę. Zmierzone rozmiary plików i prędkości, i co naprawdę kupujesz za te 80–100 EUR.
SzczegółyZmierzone na jednej maszynie ze zintegrowanym Radeonem 890M i 32 GB RAM: który model działa, ile tokenów na sekundę i dlaczego 30B bywa szybsze niż 12B.
Szczegóły3–8 W na biegu jałowym, około 130 W pod pełnym obciążeniem. Całe wyliczenie w kWh, żebyś podstawił własną stawkę z rachunku za prąd.
SzczegółyOdpowiedź zależy od tego, co wyjeżdża z budynku. Co da się zrobić lokalnie, ile to naprawdę kosztuje i czego odcięcie od sieci nie załatwia.
SzczegółySiedem lat, sześć Arduino Mega, 6 km skrętki i około 400 encji. Co naprawdę się zepsuło w moim Home Assistant i co zrobiłbym inaczej.
Szczegóły