Sztuczna inteligencja u Ciebie w domu
Tyle samo pamięci. Dobra wydajność. Połowa ceny.
Żeby uruchomić w domu poważny model językowy, nie trzeba kupować flagowej karty graficznej za 20 tysięcy złotych. Dwie średnie karty dają dokładnie tyle samo pamięci — a to pamięć decyduje o tym, jak duży model w ogóle się uruchomi. Zbudowaliśmy taką maszynę, zmierzyliśmy ją i pokazujemy wyniki.
RTX 5090 — jedna karta flagowa
- Pamięć
- 32 GB
- Cena
- 19 000–20 000 zł
RTX 5070 Ti — dwie karty
- Pamięć
- 16 GB + 16 GB
- Cena
- 2 × 4 500 zł = 9 000 zł
| Wariant | Pamięć | Cena |
|---|---|---|
| RTX 5090 — jedna karta flagowa | 32 GB | 19 000–20 000 zł |
| RTX 5070 Ti — dwie karty | 16 GB + 16 GB | 2 × 4 500 zł = 9 000 zł |
Pamięć obu kart sumuje się: model dzieli się na pół i jedna połowa liczy na pierwszej karcie, druga na drugiej. Z zewnątrz wygląda to jak jeden komputer z 32 GB pamięci graficznej — za 47% ceny flagowca.
Ceny detaliczne, sierpień 2026. NVIDIA podnosiła w tym roku ceny już dwukrotnie — o 10–15% w styczniu na całej linii RTX 50 i w maju na samym RTX 5090 — a zapowiadana trzecia korekta ma sięgnąć 20–30%. Powodem jest drożejąca pamięć GDDR7, której niedobór prognozuje się co najmniej do 2028 roku. Podwyżka uderza w oba warianty, ale nie po równo: te same 30% to około 2 700 zł przy parze kart i blisko 6 000 zł przy flagowcu.
- pamięci graficznej na modele
- 32 GB
- pamięci graficznej na modele
- tokenów na sekundę; pisze szybciej, niż czytasz
- ~200
- tokenów na sekundę; pisze szybciej, niż czytasz
- tokenów kontekstu, czyli kilkaset stron naraz
- 262 tys.
- tokenów kontekstu, czyli kilkaset stron naraz
- poboru mocy, gdy maszyna czeka
- 120 W
- poboru mocy, gdy maszyna czeka
Zastosowania
Cztery rzeczy, dla których ją zbudowaliśmy
Rozmowa
Polszczyzna bez zarzutu
Asystent, który pisze i tłumaczy po polsku bez kalek językowych — odpowiada szybciej, niż zdążysz przeczytać poprzednie zdanie. Cała rozmowa zostaje na dysku w domu.
Obraz i wideo
Widzi to, co jej pokażesz
Zdjęcie, skan dokumentu, klip do minuty — model opisuje, streszcza i wyciąga dane. Bez wysyłania prywatnych plików na cudzy serwer.
Programowanie
Pisze kod i sama go sprawdza
Dostaje opis zadania i pracuje samodzielnie: zakłada pliki, uruchamia testy, poprawia błędy. W naszym teście dostarczała kompletne projekty po 1500–3000 linii.
Wyszukiwanie
Sięga po świeże informacje
Własna wyszukiwarka w tej samej maszynie pozwala modelowi sprawdzić dzisiejsze fakty, bez konta i bez śladu zapytań u pośrednika.
Dowód
Czterdzieści projektów napisanych bez naszej pomocy
Zamiast opierać się na deklaracjach, daliśmy maszynie dziesięć trudnych zadań programistycznych i cztery różne ustawienia modelu. Potem sprawdziliśmy wyniki własnymi narzędziami — bo model potrafi napisać w dokumentacji, że testy przechodzą, choć nie przechodzą.
- samodzielnych przebiegów
- 40
- samodzielnych przebiegów
- na komplet dziesięciu projektów
- 3,8 h
- na komplet dziesięciu projektów
- sprawdzone kryteria odbioru
- 284
- sprawdzone kryteria odbioru
- spełnionych w najlepszej konfiguracji
- 71/71
- spełnionych w najlepszej konfiguracji
-
Testy uruchamialiśmy sami. Deklaracja modelu o zielonych testach nie była przyjmowana na wiarę — runner odpalał je niezależnie.
-
Wymagania wydajnościowe sprawdzaliśmy pomiarem. Jeden z modeli wpisał sobie do dokumentacji łagodniejszy próg, niż wymagało zadanie. Wyszło to dopiero na uruchomieniu.
-
Cała maszyna pracowała w izolacji — na osobnym koncie bez uprawnień, z dostępem wyłącznie do katalogu roboczego.
Rachunek za prąd
Tyle, co dobra lodówka
Mierzyliśmy za pomocą gniazdka inteligentnego, licząc pobór całego komputera. Nie samych kart, nie w teorii.
- czeka na pytanie
- 120 W
- czeka na pytanie
- typowa praca
- 256 W
- typowa praca
- najcięższe ustawienie
- 352 W
- najcięższe ustawienie
- chwilowy szczyt
- 580 W
- chwilowy szczyt
5,68 zł
za taką kwotę powstało czterdzieści projektów z testu powyżej, czyli około 14 groszy za zadanie. Cztery dziesiąte tej kwoty to samo utrzymanie włączonego komputera.
Uczciwie
Czego takie rozwiązanie nie robi
Prędkość.
Flagowa karta ma dwukrotnie szybszą pamięć i przy najcięższych modelach będzie szybsza. Przewagą dwóch kart jest pojemność i cena, nie rekord prędkości — choć tempo pisania i tak wyprzedza czytającego.
Jeden naraz.
Maszyna trzyma w pamięci jeden model w danym momencie. Przełączenie na inny trwa kilkanaście sekund — w praktyce wybiera się model do zadania, tak jak wybiera się program.
Nie zastąpi wszystkiego.
Największe modele komercyjne wciąż wygrywają w najtrudniejszych zadaniach. Do rozmowy, dokumentów, obrazu i codziennego kodu różnica przestaje mieć znaczenie.
Wymaga opieki.
To serwer, a nie sprzęt z pudełka: aktualizacje, kopie, dobór modeli. Dlatego opisujemy całą konfigurację — łącznie z tym, co u nas nie zadziałało.
Laboratorium
Wszystkie pomiary opisane krok po kroku
Prowadzimy dokumentację tej maszyny od pierwszego uruchomienia. Zaglądnij, jeśli chcesz zbudować podobną — albo sprawdzić nasze liczby.
Dlaczego dwie karty mają sens: jak model dzieli się między nimi
Dwie karty graficzne nie liczą dwa razy szybciej — i nie po to się je kupuje. Kupuje się je po to, żeby zsumować pamięć. Oto co dokładnie dzieje się w środku, gdy model rozkłada się na dwie karty, i dlaczego akurat ten sposób podziału wygrywa na domowym sprzęcie.
Czytaj artykuł → 5 min czytania
Ile kontekstu naprawdę zmieści się w 32 GB
Kontekst to pamięć rozmowy — wszystko, co model ma przed oczami, gdy formułuje odpowiedź. Jest drugim po wagach modelu konsumentem pamięci karty i zwykle to on decyduje, czy konfiguracja w ogóle wstanie. Sprawdziliśmy, gdzie leży granica przy 32 GB. Odpowiedź okazała się zaskakująca: najczęściej nie po stronie sprzętu.
Czytaj artykuł → 4 min czytania
Modele, które przetestowaliśmy — i które zostały na stałe
Przez maszynę przeszły trzydzieści dwie skonfigurowane wersje modeli. Na stałe zostało dziesięć profili pracy zbudowanych na czterech plikach. Oto co decydowało o awansie, a co o odpadnięciu — i dlaczego droższy plik nie zawsze znaczy lepszy.
Czytaj artykuł → 4 min czytania
Ile prądu zużywa domowa AI przez rok
Zmierzyliśmy pobór inteligentnym gniazdkiem — całego komputera, nie samych kart, przez kilkanaście godzin ciągłej pracy. Wniosek jest niewygodny dla intuicji: najwięcej prądu zjada nie liczenie, tylko samo trzymanie maszyny włączonej.
Czytaj artykuł → 4 min czytania
Własna wyszukiwarka dla modelu, bez kont u pośredników
Model językowy zna świat do dnia, w którym skończono go trenować. Żeby odpowiadał na pytania o rzeczy dzisiejsze, musi umieć poszukać. Zbudowaliśmy do tego własną wyszukiwarkę na tej samej maszynie — i przy okazji zmierzyliśmy, ile pracy trzeba włożyć, żeby wyniki były po polsku.
Czytaj artykuł → 3 min czytania