Kiedy ktoś mówi „model AI”, prawie zawsze ma na myśli LLM, czyli model generujący tekst słowo po słowie, od lewej do prawej. To nie jedyna rodzina modeli. Dwie inne – JEPA i LLaDA – mają otwarte wagi, działają na zupełnie innej zasadzie i można je uruchomić lokalnie. Poniżej znajdziesz definicje, przykłady i opis tego, co każda z nich faktycznie robi.
Punkt odniesienia: LLM
Przewidywanie następnego tokenu
LLM (large language model) jest trenowany do jednego zadania: przewidzieć następny token. Generuje autoregresywnie, czyli każde kolejne słowo powstaje na podstawie wszystkich poprzednich, a model nigdy nie widzi tego, co dopiero ma napisać. Pilnuje tego tzw. maska przyczynowa. Tak działają ChatGPT, Claude, Gemma i Qwen3.8, który pracuje u mnie na maszynie.
Z tej jednej cechy wynika wszystko inne. Odpowiedź napływa po kawałku. Nie można niczego wstawić w środek gotowego tekstu bez przepisania go od tego miejsca. Prędkość zależy od tego, ile parametrów trzeba odczytać z pamięci na jeden token. To ten odczyt decyduje o prędkości, a nie liczba w nazwie modelu.
JEPA: model, który niczego nie generuje
Architektura zaproponowana w 2022 roku
JEPA (joint embedding predictive architecture) to architektura zaproponowana przez Yanna LeCuna w 2022 roku, opisana w pracy I-JEPA. Zasłania fragment obrazu lub wideo i uczy się przewidywać reprezentację tego fragmentu, czyli abstrakcyjny wektor liczb, a nie same piksele. Składa się z dwóch części: kodera, który zamienia wejście w reprezentację, i predyktora, który przewiduje reprezentację brakującego fragmentu.
Różnica wobec LLM jest głębsza, niż wygląda na papierze. LLM przewiduje w przestrzeni tokenów, więc musi trafić w dokładne słowo. JEPA przewiduje w przestrzeni reprezentacji, więc może uchwycić, że „ta ręka zaraz dotknie kubka”, bez zgadywania, jakie piksele się pojawią. Dlatego mówi się o niej jako o kandydacie na model świata: ma przewidywać, co się stanie, a nie jak to będzie wyglądać.
JEPA nie pisze tekstu, nie rysuje obrazów i nie prowadzi rozmowy. Na wyjściu dostajesz wektory. Stają się użyteczne dopiero po dołożeniu klasyfikatora, wyszukiwania podobnych nagrań, wykrywania nietypowych zdarzeń albo planowania ruchu robota.
Przykłady z otwartymi wagami:
- I-JEPA (2023) to wersja dla obrazów i pierwsza, która pokazała, że to podejście działa.
- V-JEPA (2024) to wersja dla wideo.
- V-JEPA 2 (czerwiec 2025, Meta) ma 1,2 miliarda parametrów i jest trenowana metodą samonadzorowaną na ponad milionie godzin wideo i milionie obrazów. Wariant sterowany działaniem douczono na około 62 godzinach nieoznaczonych nagrań z robotów ze zbioru Droid. Pozwala on planować proste zadania (sięgnięcie, chwycenie, przeniesienie), gdy cel zostanie podany jako obraz, bez uczenia modelu konkretnego otoczenia. Wagi są publiczne.
- V-JEPA 2.1 (marzec 2026) to rozwinięcie z gęstszą funkcją straty, nastawione na cechy użyteczne w zadaniach wymagających szczegółowych reprezentacji obrazu i wideo. Obejmuje modele o 1–2 mld parametrów oraz dwa małe warianty destylowane (80 mln i 300 mln), które realnie mieszczą się na sprzęcie domowym.
- LeJEPA (2025) to praca teoretyczna LeCuna i Balestriero. Wskazuje optymalny rozkład reprezentacji i upraszcza trening do jednego celu, bez układu nauczyciel–uczeń.
Istnieją też warianty dla dźwięku, chmur punktów, skanów LiDAR, scen 3D i danych geoprzestrzennych. Rodzina rośnie szybciej, niż rośnie jej rozpoznawalność.
Zastosowanie u mnie. Mam w domu kamery i siedem lat historii z Home Assistant. Frigate wykrywa obiekty lokalnie, ale brakuje mi warstwy, która rozumie przebieg zdarzenia i potrafi odróżnić zwykły ruch od czegoś nietypowego. Model, który analizuje nagranie na miejscu i nie wysyła go nigdzie, wypełniłby tę lukę. Nie uruchomiłem go jeszcze, więc to plan, a nie wynik. V-JEPA 2 działa w PyTorch i nie występuje jako plik GGUF, więc wymaga innej ścieżki niż mój standardowy stos oparty na llama.cpp.
LLaDA: model językowy, który nie pisze od lewej do prawej
Odsłanianie blokiem, a nie słowami
LLaDA (large language diffusion with masking) to dyfuzyjny model tekstowy, opisany w pracy o modelach dyfuzyjnych języka. Zaczyna od bloku całkowicie zasłoniętego maskami i odsłania go stopniowo. W każdym kroku przewiduje wszystkie zasłonięte pozycje jednocześnie, zachowuje te, których jest najpewniejszy, a pozostałe zasłania ponownie i powtarza proces. Tekst nie powstaje więc od początku do końca, tylko od pozycji najpewniejszych do najmniej pewnych.
Taki model nie ma maski przyczynowej, czyli patrzy jednocześnie w lewo i w prawo. To jedyna naprawdę istotna różnica, ale ma duże konsekwencje. W jednym kroku model może odsłonić kilka tokenów, potrafi uzupełnić lukę w środku gotowego tekstu i nadaje się do poprawiania tego, co już napisał.
Nie ma tu żadnej magii. LLaDA jest zbudowana z tych samych komponentów co LLaMA (RMSNorm, RoPE, SwiGLU). Zmienia się sposób trenowania i generowania, a nie rodzaj sieci.
Przykłady z otwartymi wagami:
- LLaDA 8B (luty 2025, Uniwersytet Renmin w Chinach i Ant Group) jest, według autorów, pierwszym dyfuzyjnym modelem tekstowym trenowanym od zera w takiej skali. Przeszedł pretrening na 2,3 biliona tokenów i douczanie na 4,5 miliona par.
- LLaDA 1.5 (2025) to wersja z lepszym douczaniem na preferencjach.
- LLaDA-V (CVPR 2026) to wariant multimodalny, czyli dyfuzyjny model przyjmujący także obraz.
- LLaDA2.0-mini (16B) i LLaDA2.0-flash (100B) (Ant Group / InclusionAI) mają architekturę MoE, otwarte wagi i kod treningowy. Wersja 100B jest pierwszym dyfuzyjnym modelem tekstowym w tej skali.
- LLaDA2.1 (luty 2026) i LLaDA2.2 (lipiec 2026) to kolejne wersje, w których nacisk położono na edycję już odsłoniętego tekstu. Jest to dla tej rodziny naturalne, a dla LLM-ów nie. Wersja 2.2 jest dodatkowo projektowana pod zadania agentowe.
Istnieją też zamknięte modele z tej samej rodziny, jak Gemini Diffusion od Google i Mercury od Inception Labs. Wagi LLaDA są publiczne, a tamtych nie, dlatego to LLaDA jest tu przykładem.
Uruchomienie lokalne. llama.cpp ma osobne narzędzie llama-diffusion-cli, które obsługuje architektury Dream, LLaDA i RND1 oraz pozwala sterować liczbą kroków i długością bloku, na przykład --diffusion-block-length 32 --diffusion-steps 256. Są dwa ograniczenia (stan na październik 2026). Po pierwsze, to osobny program z katalogu przykładów, a nie llama-server, więc nie podłączysz go pod to samo API co zwykłe modele GGUF. W moim przypadku oznacza to, że nie trafi do bramki LiteLLM. Po drugie, model 8B po kwantyzacji zajmuje około 5 GB, czyli tyle co mój gęsty model 9B, więc zmieści się swobodnie. Wersji 100B nie uruchomisz na maszynie z 32 GB.
Trzy rodziny w jednej tabeli
| LLM | JEPA | Dyfuzyjny model tekstowy | |
|---|---|---|---|
| Co przewiduje | następny token | reprezentację zasłoniętego fragmentu | wszystkie zasłonięte tokeny jednocześnie |
| Przestrzeń przewidywania | tokeny | wektory (reprezentacje) | tokeny |
| Kolejność | od lewej do prawej | nie dotyczy | od pozycji najpewniejszych |
| Wynik na wyjściu | tekst | wektory do dalszego użycia | tekst |
| Przykłady z otwartymi wagami | Qwen3.8, Gemma 4, granite 4.2 | I-JEPA, V-JEPA 2, V-JEPA 2.1 | LLaDA 8B, LLaDA2.0-mini |
Czy to szybsze? Niekoniecznie
Odsłonięty blok to kilka rund obliczeń
Najczęstsze nieporozumienie wokół modeli dyfuzyjnych brzmi: skoro odsłaniają kilka tokenów naraz, muszą być szybsze. Na maszynie takiej jak moja nie jest to takie proste. Model dyfuzyjny wykonuje wiele kroków na jeden blok, a każdy krok to pełne przejście sieci przez cały blok. Zamieniasz więc odczyty z pamięci na moc obliczeniową, której zintegrowany układ graficzny ma niewiele. Liczba kroków jest pokrętłem jakości i prędkości jednocześnie: mniej kroków oznacza szybciej, ale gorzej.
Ciekawostka łącząca obie rodziny: ten sam pomysł, czyli dyfuzja na bloku tokenów, służy dziś do przyspieszania zwykłych LLM-ów. W metodzie DFlash mały model dyfuzyjny proponuje tokeny, a duży LLM je weryfikuje. Opisałem to razem z MTP i pozostałymi metodami: jak przyspieszyć lokalny model AI.
Czego ten podział nie oznacza
JEPA nie zastępuje LLM. To nie jest nowszy model do rozmowy, tylko inne narzędzie: służy do rozumienia i przewidywania, a nie do pisania.
Model dyfuzyjny nie jest automatycznie lepszy. Jest inny: odsłania wiele tokenów jednocześnie i potrafi wypełniać luki, ale na dziś ma słabsze zaplecze narzędziowe niż LLM-y.
Otwarte wagi nie oznaczają, że model uruchomisz. Między LLaDA 8B a LLaDA2.0-flash 100B leży cała różnica między maszyną domową a serwerownią. Ile faktycznie zmieścisz, policzyłem tutaj: jaki model AI uruchomisz lokalnie na mini PC.
Żadna z tych rodzin nie jest eksperymentem na papierze. Wagi są dostępne, kod jest publiczny, a jedna z nich ma już obsługę w llama.cpp. Po prostu nie są to modele, o których mówi się w wiadomościach.