L'intelligenza artificiale a casa tua
Stessa memoria. Buone prestazioni. Metà del prezzo.
Per far girare in casa un modello linguistico serio non serve una scheda grafica top di gamma da 4.650 € (5.350 $). Due schede di fascia media offrono esattamente la stessa memoria — ed è la memoria a decidere quanto grande può essere il modello che si riesce ad avviare. Abbiamo costruito una macchina così, l'abbiamo misurata e mostriamo i risultati.
RTX 5090 — una scheda top di gamma
- Memoria
- 32 GB
- Prezzo
- 4.400–4.650 € (5.100–5.350 $)
RTX 5070 Ti — due schede
- Memoria
- 16 GB + 16 GB
- Prezzo
- 2 × 1.050 € = 2.100 € (2 × 1.200 $ = 2.400 $)
| Variante | Memoria | Prezzo |
|---|---|---|
| RTX 5090 — una scheda top di gamma | 32 GB | 4.400–4.650 € (5.100–5.350 $) |
| RTX 5070 Ti — due schede | 16 GB + 16 GB | 2 × 1.050 € = 2.100 € (2 × 1.200 $ = 2.400 $) |
La memoria delle due schede si somma: il modello si divide a metà e una metà calcola sulla prima scheda, l'altra sulla seconda. Dall'esterno sembra un unico computer con 32 GB di memoria grafica — al 47% del prezzo del modello di punta.
Prezzi al dettaglio europei, agosto 2026. NVIDIA ha già alzato i prezzi due volte quest'anno — del 10–15% a gennaio su tutta la linea RTX 50 e a maggio sulla sola RTX 5090 — e la terza correzione annunciata dovrebbe arrivare al 20–30%. Il motivo è la memoria GDDR7, sempre più cara, la cui scarsità è prevista almeno fino al 2028. Il rincaro colpisce entrambe le varianti, ma non in parti uguali: lo stesso 30% vale circa 630 € (720 $) sulla coppia di schede e quasi 1.390 € (1.600 $) sul modello di punta.
- di memoria grafica per i modelli
- 32 GB
- di memoria grafica per i modelli
- token al secondo: scrive più in fretta di quanto tu legga
- ~200
- token al secondo: scrive più in fretta di quanto tu legga
- token di contesto, cioè qualche centinaio di pagine in una volta
- 262 mila
- token di contesto, cioè qualche centinaio di pagine in una volta
- di consumo quando la macchina è in attesa
- 120 W
- di consumo quando la macchina è in attesa
Applicazioni
Le quattro cose per cui l'abbiamo costruita
Conversazione
La tua lingua, senza calchi
Un assistente che scrive e traduce con naturalezza nella tua lingua: i modelli sono multilingue, e la qualità l'abbiamo verificata sul nostro polacco — una delle lingue più difficili da rendere bene. Risponde più in fretta di quanto tu riesca a leggere la frase precedente, e l'intera conversazione resta su un disco a casa tua.
Immagini e video
Vede quello che le mostri
Una foto, la scansione di un documento, una clip fino a un minuto: il modello descrive, riassume ed estrae i dati. Senza inviare file privati su un server altrui.
Programmazione
Scrive codice e lo verifica da sola
Riceve la descrizione del compito e lavora in autonomia: crea i file, esegue i test, corregge gli errori. Nel nostro test consegnava progetti completi da 1500–3000 righe.
Ricerca
Va a cercare informazioni fresche
Un motore di ricerca proprio, sulla stessa macchina, permette al modello di verificare i fatti di oggi — senza account e senza lasciare traccia delle ricerche presso un intermediario.
La prova
Quaranta progetti scritti senza il nostro aiuto
Invece di affidarci alle dichiarazioni, abbiamo dato alla macchina dieci compiti di programmazione difficili e quattro diverse configurazioni del modello. Poi abbiamo verificato i risultati con i nostri strumenti — perché il modello sa scrivere nella documentazione che i test passano anche quando non passano.
- esecuzioni autonome
- 40
- esecuzioni autonome
- per la serie completa di dieci progetti
- 3,8 h
- per la serie completa di dieci progetti
- criteri di accettazione verificati
- 284
- criteri di accettazione verificati
- soddisfatti nella configurazione migliore
- 71/71
- soddisfatti nella configurazione migliore
-
I test li abbiamo eseguiti noi. La dichiarazione del modello sui test «verdi» non veniva presa sulla fiducia — il runner li lanciava in modo indipendente.
-
I requisiti di prestazione li abbiamo verificati misurando. Uno dei modelli si è annotato nella documentazione una soglia più morbida di quella richiesta dal compito. È emerso solo all'esecuzione.
-
L'intera macchina lavorava in isolamento — su un account separato senza privilegi, con accesso alla sola cartella di lavoro.
La bolletta elettrica
Quanto un buon frigorifero
Abbiamo misurato con una presa intelligente, contando il consumo dell'intero computer. Non delle sole schede, non in teoria.
- in attesa di una domanda
- 120 W
- in attesa di una domanda
- lavoro tipico
- 256 W
- lavoro tipico
- la configurazione più pesante
- 352 W
- la configurazione più pesante
- picco momentaneo
- 580 W
- picco momentaneo
1,32 €
(1,52 $): con questa somma sono nati i quaranta progetti del test qui sopra, alla nostra tariffa polacca — circa 0,03 € (0,04 $) a compito. Quattro decimi di questa cifra se ne vanno solo per tenere acceso il computer.
Onestamente
Che cosa questa soluzione non fa
Velocità.
La scheda top di gamma ha una memoria due volte più veloce e con i modelli più pesanti sarà più rapida. Il vantaggio delle due schede sono la capienza e il prezzo, non il record di velocità — anche se il ritmo di scrittura resta comunque più veloce di chi legge.
Uno alla volta.
La macchina tiene in memoria un modello per volta. Passare a un altro richiede una quindicina di secondi — in pratica si sceglie il modello adatto al compito, come si sceglie un programma.
Non sostituisce tutto.
I più grandi modelli commerciali vincono ancora nei compiti più difficili. Per conversazione, documenti, immagini e codice quotidiano la differenza smette di contare.
Richiede cura.
È un server, non un apparecchio pronto all'uso: aggiornamenti, copie di sicurezza, scelta dei modelli. Per questo descriviamo l'intera configurazione — compreso ciò che da noi non ha funzionato.
Laboratorio
Tutte le misurazioni descritte passo per passo
Documentiamo questa macchina dal primo avvio. Dai un'occhiata se vuoi costruirne una simile — o verificare i nostri numeri.
Perché due schede hanno senso: come il modello si divide tra loro
Due schede grafiche non calcolano due volte più in fretta — e non è per questo che si comprano. Si comprano per sommare la memoria. Ecco che cosa succede esattamente all'interno quando il modello si distribuisce su due schede, e perché proprio questo tipo di divisione vince sull'hardware di casa.
Leggi l'articolo → 6 min di lettura
Quanto contesto entra davvero in 32 GB
Il contesto è la memoria della conversazione — tutto ciò che il modello ha davanti agli occhi mentre formula la risposta. È il secondo consumatore di memoria della scheda dopo i pesi del modello, e di solito è lui a decidere se la configurazione parte o no. Abbiamo verificato dove sta il limite con 32 GB. La risposta è stata una sorpresa: quasi mai dal lato dell'hardware.
Leggi l'articolo → 5 min di lettura
I modelli che abbiamo testato — e quelli che sono rimasti
Per la macchina sono passate trentadue versioni configurate di modelli. In pianta stabile sono rimasti dieci profili di lavoro costruiti su quattro file. Ecco che cosa decideva la promozione e che cosa l'eliminazione — e perché il file più costoso non sempre è il migliore.
Leggi l'articolo → 5 min di lettura
Quanta corrente consuma un'AI domestica in un anno
Abbiamo misurato il consumo con una presa intelligente — dell'intero computer, non delle sole schede, per molte ore di lavoro continuo. La conclusione è scomoda per l'intuizione: la corrente non la mangia il calcolo, ma il semplice tenere accesa la macchina.
Leggi l'articolo → 4 min di lettura
Un motore di ricerca privato per il modello, senza account da intermediari
Un modello linguistico conosce il mondo fino al giorno in cui è finito il suo addestramento. Perché risponda a domande sull'oggi, deve saper cercare. Per questo abbiamo costruito un motore di ricerca tutto nostro, sulla stessa macchina — e già che c'eravamo abbiamo misurato quanto lavoro serve perché i risultati arrivino nella lingua di chi cerca.
Leggi l'articolo → 4 min di lettura