Mamy osobną stronę dla Ollama i małych modeli — to maszyna CPU za 12 $ uruchamiająca 1B–8B i osadzenia. Ta strona to drugi koniec: modele na tyle duże, że RAM, a nie CPU, jest tym, co Cię zatrzymuje.
Bądźmy szczerzy na wstępie, jak wszędzie: nasze serwery są tylko CPU, bez GPU. Duży model działa tutaj wolno. Jeśli chcesz szybkiego interaktywnego czatu na modelu 30B, potrzebujesz hosta z GPU — inny produkt, inny dostawca. Co maszyna CPU z dużą pamięcią robi dobrze, to uruchamianie dużego skwantyzowanego modelu prywatnie do pracy, która nie jest oknem czatu.
Matematyka RAM
Model siedzi w pamięci, skwantyzowany czy nie, plus narzut na kontekst i środowisko uruchomieniowe:
- 13B, 4-bit — mniej więcej 10–16 GB. Działa już na średnim planie.
- Klasa 30B, skwantyzowana — 24–48 GB w zależności od kwantyzacji. To teren Pro-32 do Pro-64.
- Większe lub o wyższej precyzji — 64–80 GB, a poza 80 GB żadna nasza pojedyncza maszyna nie zmieści. Pro-80 to tutaj sufit.
Dlatego „uruchom większy lokalny model” to naprawdę pytanie o dużą pamięć. Model jest śladem pamięci. Dodaj indeks RAG na tym samym hoście, a liczby się piętrzą.
Gdzie podejście „najpierw prywatność” naprawdę wygrywa
Argumentem nie jest szybkość i nie jest koszt — chodzi o to, że niektóre dane nie mogą wyjść. Dokumenty prawne. Dokumentacja medyczna. Zastrzeżony kod. Wszystko, gdzie wysłanie promptu do API osoby trzeciej odpada. Wolniejszy model działający w całości na Twojej maszynie bije szybki, który loguje wszystko, co mu wysyłasz. Napisaliśmy pełny obraz tutaj.
A jeśli dane są aż tak wrażliwe, płatność prawdopodobnie też powinna być prywatna. Wynajęcie maszyny za krypto i bez KYC utrzymuje cały łańcuch — serwer, model, prompty, rozliczenia — poza czyimikolwiek aktami tożsamości. To jest oferta: nie tańsza inferencja, ale inferencja, której nikt inny nie widzi.
Co wybrać
Dla modelu klasy 30B z miejscem na kontekst Pro-64 (64 GB) to wygodny wybór; ciaśniejsza kwantyzacja mieści się w Pro-32 lub Pro-48, większa idzie do Pro-80. Załaduj najpierw model, obserwuj pamięć rezydentną, dobierz rozmiar z tego, co zmierzyłeś. I ustaw oczekiwania: to prywatna inferencja wsadowa, nie szybkie okno czatu.
Komentarze
Brak komentarzy. Bądź pierwszy.