Aurora Kursy

Kursy Własne AI na własnej karcieModel w Twojej przeglądarce — teraz

Model w Twojej przeglądarce — teraz

Lekcja 1 z 18 Podgląd

Otwierasz stronę, wpisujesz zdanie, a po chwili pojawia się odpowiedź. Brzmi prosto, ale to, co się właśnie wydarzyło, jest dość niezwykłe: model językowy pobrany z internetu, zapisany w Twojej pamięci karty graficznej, właśnie policzył odpowiedź na Twoim sprzęcie. Żaden serwer nie dostał Twojego zapytania. Żaden API key. Żadna chmura.

To jest WebGPU.

Co to jest WebGPU i dlaczego to ważne

WebGPU to interfejs programistyczny, który przeglądarka udostępnia do bezpośredniego dostępu do karty graficznej. Dawniej przeglądarki nie dawały dostępu do GPU – cała grafika szła przez WebGL, który był ograniczony do renderowania scen 3D. WebGPU zmienia to: pozwala uruchomić dowolne obliczenia na karcie graficznej, dokładnie tak, jak robią to programy desktopowe.

W praktyce oznacza to, że możesz pobrać plik z wagami modelu językowego, załadować go do pamięci VRAM (pamięci karty graficznej, nie RAM) i wykonać na nim obliczenia – czyli wygenerować tekst – bez żadnego dodatkowego oprogramowania. Cała logika: pobranie pliku, załadowanie do VRAM, dekodowanie tokenów – dzieje się w Twojej przeglądarce, na Twojej karcie.

Co się stało technicznie, krok po kroku

Gdy otworzyłeś stronę, przeglądarka zrobiła kilka rzeczy:

  1. Pobrała plik z wagami modelu. To zwykły plik binarny, który zawiera liczby – wagi neuronów. W tym przypadku jest to model o rozmiarze kilku setek megabajtów. Nie jest to ogromny plik, dlatego pomieścił się w pamięci karty.

  2. Załadowała te wagi do VRAM. Karta graficzna ma swoją własną pamięć, szybszą niż RAM. Wagi modelu trafiły właśnie tam. Od tego momentu model „żyje” na karcie.

  3. Wykonała obliczenia. Gdy wpisałeś tekst, przeglądarka przekształciła go w sekwencję tokenów (słów i fragmentów słów, które model rozumie), przepuściła przez warstwy modelu i wygenerowała kolejne tokeny po kolei, aż do końca odpowiedzi.

Cały proces odbył się lokalnie. Możesz to potwierdzić: odłącz internet po załadowaniu strony i model nadal będzie działał.

Dlaczego ten model jest głupszy

Model, który właśnie uruchomiłeś, jest mały. Ma rzędu kilkuset milionów parametrów. Dla porównania: modele, które będziesz uruchamiał na własnej karcie w dalszych lekcjach, mają od kilku do kilkudziesięciu miliardów parametrów.

Parametry to w uproszczeniu liczby, które model używa, żeby przewidzieć kolejny token. Im więcej parametrów, tym bogatsza „baza wiedzy” i tym lepiej model rozumie kontekst, logiczne zależności, niuanse. Mały model zna mniej, rozumie mniej, częściej się myli. To normalne – to jak porównanie kalkulatora do komputera. Kalkulator też liczy, ale nie napisze Ci eseju.

Warto to zrozumieć teraz, bo później, gdy uruchomisz większy model i zobaczysz, że odpowiada znacznie lepiej, nie będziesz myślał, że coś się zepsuło. To po prostu większy model.

Gdzie się podział RAM

Warto od razu rozdzielić dwie rzeczy, bo ludzie je mieszają. RAM (pamięć operacyjna komputera) służy do przechowywania danych, które CPU potrzebuje w danej chwili. VRAM (pamięć karty graficznej) to osobna, szybsza pamięć, do której karta ma bezpośredni dostęp.

Model językowy liczy się w VRAM. RAM służy tu co najwyżej do tymczasowego przechowania pliku, zanim trafi na kartę. Jeśli Twój model nie zmieści się w VRAM, przeglądarka może spróbować przenieść część wag do RAM – ale to awaryjny tryb, który drastycznie spowalnia generowanie. W praktyce: jeśli model działa w przeglądarce, to znaczy, że zmieścił się w pamięci karty.

Co to oznacza dla Ciebie

Teraz, gdy już widziałeś, że model działa lokalnie, masz punkt odniesienia. Wszystko, co będziesz robił dalej, jest rozszerzeniem tego samego mechanizmu:

  • Zamiast przeglądarki użyjesz dedykowanego oprogramowania (silnika inferencyjnego), które lepiej wykorzystuje kartę.
  • Zamiast małego modelu pobierzesz większy, który zmieści się w Twoim VRAM.
  • Zamiast jednego modelu będziesz mógł uruchamiać kilka, albo ten sam model z różnymi ustawieniami.

Ale fundament jest ten sam: wagi modelu w VRAM, obliczenia na karcie, tokeny wychodzą jeden po drugim.

Jak sprawdzić, ile VRAM ma Twoja karta

Wchodzisz w ustawienia systemu operacyjnego:

  • Windows: Menedżer urządzeń → Karty graficzne → właściwości Twojej karty. Albo po prostu: nvidia-smi w terminalu, jeśli masz kartę NVIDIA.
  • Linux: nvidia-smi dla NVIDIA, glxinfo dla AMD.
  • macOS: O tym komputerze → chip → pamięć wspólna (Apple Unified Memory).

Zapisz sobie tę liczbę. To jest Twój budżet. Każdy model, który uruchomisz, musi się w nim zmieścić – wagi plus dodatkowe dane potrzebne do obliczeń.

Co dalej z tym, co właśnie zrobiłeś

Strona, na której uruchomiłeś model, to dobry start, ale ma ograniczenia. Przeglądarka nie daje pełnej kontroli nad tym, jak karta jest wykorzystywana. Nie możesz łatwo zmienić formatu wag, nie masz dostępu do wszystkich optymalizacji, które oferuje dedykowane oprogramowanie.

Ale efekt „działa u mnie” masz. Wiesz, że Twój sprzęt jest w stanie uruchomić model językowy. Teraz trzeba to przerobić na coś, z czego będziesz korzystał na co dzień – z lepszą jakością odpowiedzi, większym kontekstem i możliwością podłączenia do narzędzi.