L'intelligence artificielle chez vous
Autant de mémoire. De bonnes performances. La moitié du prix.
Pour faire tourner chez vous un modèle de langage sérieux, inutile d'acheter une carte graphique haut de gamme à 4 650 € (5 350 $). Deux cartes de milieu de gamme offrent exactement la même mémoire — et c'est la mémoire qui décide de la taille du modèle qui pourra seulement démarrer. Nous avons construit cette machine, nous l'avons mesurée, et nous montrons les résultats.
RTX 5090 — une carte haut de gamme
- Mémoire
- 32 Go
- Prix
- 4 400–4 650 € (5 100–5 350 $)
RTX 5070 Ti — deux cartes
- Mémoire
- 16 Go + 16 Go
- Prix
- 2 × 1 050 € = 2 100 € (2 × 1 200 $ = 2 400 $)
| Variante | Mémoire | Prix |
|---|---|---|
| RTX 5090 — une carte haut de gamme | 32 Go | 4 400–4 650 € (5 100–5 350 $) |
| RTX 5070 Ti — deux cartes | 16 Go + 16 Go | 2 × 1 050 € = 2 100 € (2 × 1 200 $ = 2 400 $) |
La mémoire des deux cartes s'additionne : le modèle se coupe en deux, une moitié calcule sur la première carte, l'autre sur la seconde. Vu de l'extérieur, cela ressemble à un seul ordinateur doté de 32 Go de mémoire graphique — pour 47 % du prix de la carte haut de gamme.
Prix de détail européens, août 2026. NVIDIA a déjà relevé ses prix deux fois cette année — de 10–15 % en janvier sur toute la gamme RTX 50, puis en mai sur la seule RTX 5090 — et une troisième correction annoncée doit atteindre 20–30 %. La cause : le renchérissement de la mémoire GDDR7, dont la pénurie est prévue au moins jusqu'en 2028. La hausse touche les deux variantes, mais pas à parts égales : les mêmes 30 % représentent environ 630 € (720 $) pour la paire de cartes et près de 1 390 € (1 600 $) pour la carte haut de gamme.
- de mémoire graphique pour les modèles
- 32 Go
- de mémoire graphique pour les modèles
- tokens par seconde ; il écrit plus vite que vous ne lisez
- ~200
- tokens par seconde ; il écrit plus vite que vous ne lisez
- tokens de contexte, soit plusieurs centaines de pages à la fois
- 262 000
- tokens de contexte, soit plusieurs centaines de pages à la fois
- de consommation quand la machine attend
- 120 W
- de consommation quand la machine attend
Usages
Quatre choses pour lesquelles nous l'avons construite
Conversation
Votre langue, sans tournures maladroites
Un assistant qui écrit et traduit naturellement dans votre langue — les modèles sont multilingues, et nous en avons vérifié la qualité sur notre polonais natal, l'une des langues les plus difficiles à bien rendre. Il répond plus vite que vous ne finissez de lire la phrase précédente, et toute la conversation reste sur un disque, chez vous.
Image et vidéo
Elle voit ce que vous lui montrez
Une photo, un document scanné, un clip d'une minute au plus — le modèle décrit, résume et extrait les données. Sans envoyer vos fichiers privés sur le serveur de quelqu'un d'autre.
Programmation
Elle écrit du code et le vérifie elle-même
Elle reçoit la description d'une tâche et travaille en autonomie : elle crée les fichiers, lance les tests, corrige les erreurs. Dans notre test, elle livrait des projets complets de 1 500–3 000 lignes.
Recherche
Elle va chercher l'information fraîche
Un moteur de recherche à demeure, sur la même machine, permet au modèle de vérifier les faits du jour — sans compte et sans laisser de trace des requêtes chez un intermédiaire.
La preuve
Quarante projets écrits sans notre aide
Plutôt que de nous fier aux déclarations, nous avons donné à la machine dix tâches de programmation difficiles et quatre réglages différents du modèle. Puis nous avons vérifié les résultats avec nos propres outils — car un modèle sait écrire dans la documentation que les tests passent, alors qu'ils ne passent pas.
- exécutions autonomes
- 40
- exécutions autonomes
- pour la série complète de dix projets
- 3,8 h
- pour la série complète de dix projets
- critères d'acceptation vérifiés
- 284
- critères d'acceptation vérifiés
- remplis dans la meilleure configuration
- 71/71
- remplis dans la meilleure configuration
-
Les tests, nous les avons lancés nous-mêmes. La déclaration du modèle sur des tests au vert n'était pas prise pour argent comptant — le runner les exécutait indépendamment.
-
Les exigences de performance, nous les avons vérifiées par la mesure. L'un des modèles s'était inscrit dans la documentation un seuil plus indulgent que celui exigé par la tâche. Cela n'est apparu qu'à l'exécution.
-
Toute la machine travaillait en isolement — sur un compte séparé sans privilèges, avec accès au seul répertoire de travail.
La facture d'électricité
Autant qu'un bon réfrigérateur
Nous avons mesuré avec une prise connectée, en comptant la consommation de l'ordinateur entier. Pas celle des seules cartes, pas en théorie.
- attend une question
- 120 W
- attend une question
- travail typique
- 256 W
- travail typique
- configuration la plus lourde
- 352 W
- configuration la plus lourde
- pic momentané
- 580 W
- pic momentané
1,32 €
(1,52 $) — c'est ce qu'ont coûté les quarante projets du test ci-dessus, à notre tarif polonais, soit environ 0,03 € (0,04 $) par tâche. Quatre dixièmes de cette somme tiennent au simple maintien de l'ordinateur allumé.
En toute honnêteté
Ce que cette solution ne fait pas
La vitesse.
La carte haut de gamme a une mémoire deux fois plus rapide et, sur les modèles les plus lourds, elle sera plus rapide. L'avantage des deux cartes, c'est la capacité et le prix, pas le record de vitesse — même si le rythme d'écriture devance de toute façon le lecteur.
Un seul à la fois.
La machine garde en mémoire un seul modèle à un instant donné. Passer à un autre prend une quinzaine de secondes — en pratique, on choisit le modèle selon la tâche, comme on choisit un programme.
Elle ne remplace pas tout.
Les plus grands modèles commerciaux gardent l'avantage sur les tâches les plus difficiles. Pour la conversation, les documents, l'image et le code du quotidien, la différence cesse de compter.
Elle demande de l'entretien.
C'est un serveur, pas un appareil prêt à l'emploi : mises à jour, sauvegardes, choix des modèles. C'est pourquoi nous décrivons toute la configuration — y compris ce qui, chez nous, n'a pas fonctionné.
Laboratoire
Toutes les mesures décrites pas à pas
Nous documentons cette machine depuis son premier démarrage. Jetez-y un œil si vous voulez en construire une semblable — ou vérifier nos chiffres.
Pourquoi deux cartes ont du sens : comment le modèle se partage entre elles
Deux cartes graphiques ne calculent pas deux fois plus vite — et ce n'est pas pour cela qu'on les achète. On les achète pour additionner leur mémoire. Voici ce qui se passe exactement à l'intérieur quand le modèle se répartit sur deux cartes, et pourquoi c'est précisément ce mode de découpage qui gagne sur du matériel domestique.
Lire l'article → 7 min de lecture
Combien de contexte tient vraiment dans 32 Go
Le contexte, c'est la mémoire de la conversation — tout ce que le modèle a sous les yeux quand il formule sa réponse. C'est le deuxième consommateur de mémoire de la carte après les poids du modèle, et c'est lui, en général, qui décide si une configuration démarre tout court. Nous avons cherché où passe la limite avec 32 Go. La réponse a surpris : le plus souvent, elle n'est pas du côté du matériel.
Lire l'article → 5 min de lecture
Les modèles que nous avons testés — et ceux qui sont restés
Trente-deux versions configurées de modèles sont passées par la machine. Dix profils de travail, construits sur quatre fichiers, sont restés à demeure. Voici ce qui décidait d'une promotion ou d'une élimination — et pourquoi le fichier le plus coûteux n'est pas toujours le meilleur.
Lire l'article → 5 min de lecture
Combien d'électricité consomme une IA domestique en un an
Nous avons mesuré la consommation avec une prise connectée — celle de l'ordinateur entier, pas des seules cartes, sur une quinzaine d'heures de travail continu. La conclusion dérange l'intuition : ce n'est pas le calcul qui consomme le plus, mais le simple fait de garder la machine allumée.
Lire l'article → 5 min de lecture
Un moteur de recherche privé pour le modèle, sans compte chez des intermédiaires
Un modèle de langage connaît le monde jusqu'au jour où son entraînement s'est achevé. Pour répondre à des questions d'aujourd'hui, il doit savoir chercher. Nous avons construit pour cela notre propre moteur de recherche, sur la même machine — et mesuré au passage le travail qu'il faut pour obtenir des résultats dans sa propre langue.
Lire l'article → 5 min de lecture