Künstliche Intelligenz bei Ihnen zu Hause
Gleich viel Speicher. Gute Leistung. Halber Preis.
Um zu Hause ein ernsthaftes Sprachmodell zu betreiben, braucht es keine Flaggschiff-Grafikkarte für 4.650 € (5.350 $). Zwei Mittelklasse-Karten bieten exakt denselben Speicher – und der Speicher entscheidet darüber, wie groß das Modell sein darf, das sich überhaupt starten lässt. Wir haben eine solche Maschine gebaut, sie vermessen und zeigen die Ergebnisse.
RTX 5090 – eine Flaggschiff-Karte
- Speicher
- 32 GB
- Preis
- 4.400–4.650 € (5.100–5.350 $)
RTX 5070 Ti – zwei Karten
- Speicher
- 16 GB + 16 GB
- Preis
- 2 × 1.050 € = 2.100 € (2 × 1.200 $ = 2.400 $)
| Variante | Speicher | Preis |
|---|---|---|
| RTX 5090 – eine Flaggschiff-Karte | 32 GB | 4.400–4.650 € (5.100–5.350 $) |
| RTX 5070 Ti – zwei Karten | 16 GB + 16 GB | 2 × 1.050 € = 2.100 € (2 × 1.200 $ = 2.400 $) |
Der Speicher beider Karten summiert sich: Das Modell wird halbiert – eine Hälfte rechnet auf der ersten Karte, die andere auf der zweiten. Von außen sieht das aus wie ein Rechner mit 32 GB Grafikspeicher – für 47 % des Flaggschiff-Preises.
Europäische Straßenpreise, August 2026. NVIDIA hat die Preise in diesem Jahr bereits zweimal angehoben – um 10–15 % im Januar für die gesamte RTX-50-Reihe und im Mai für die RTX 5090 allein – und die angekündigte dritte Korrektur soll 20–30 % erreichen. Der Grund ist teurer werdender GDDR7-Speicher, dessen Knappheit mindestens bis 2028 prognostiziert wird. Die Erhöhung trifft beide Varianten, aber nicht gleich stark: Dieselben 30 % sind rund 630 € (720 $) beim Kartenpaar und knapp 1.390 € (1.600 $) beim Flaggschiff.
- Grafikspeicher für Modelle
- 32 GB
- Grafikspeicher für Modelle
- Token pro Sekunde; es schreibt schneller, als Sie lesen
- ~200
- Token pro Sekunde; es schreibt schneller, als Sie lesen
- Token Kontext, also mehrere hundert Seiten auf einmal
- 262 Tsd.
- Token Kontext, also mehrere hundert Seiten auf einmal
- Leistungsaufnahme, wenn die Maschine wartet
- 120 W
- Leistungsaufnahme, wenn die Maschine wartet
Anwendungen
Vier Dinge, für die wir sie gebaut haben
Gespräch
Ihre Sprache, ohne holprige Formulierungen
Ein Assistent, der in Ihrer Sprache natürlich schreibt und übersetzt – die Modelle sind mehrsprachig; die Qualität haben wir an unserem muttersprachlichen Polnisch geprüft, einer der Sprachen, an denen Modelle am ehesten scheitern. Er antwortet schneller, als Sie den vorigen Satz zu Ende lesen. Das ganze Gespräch bleibt auf einer Festplatte bei Ihnen zu Hause.
Bild und Video
Sieht, was Sie ihr zeigen
Ein Foto, ein gescanntes Dokument, ein Clip bis zu einer Minute – das Modell beschreibt, fasst zusammen und zieht Daten heraus. Ohne private Dateien auf einen fremden Server zu schicken.
Programmierung
Schreibt Code und prüft ihn selbst
Sie bekommt eine Aufgabenbeschreibung und arbeitet selbstständig: legt Dateien an, führt Tests aus, korrigiert Fehler. In unserem Test lieferte sie komplette Projekte mit 1.500–3.000 Zeilen.
Suche
Greift auf frische Informationen zu
Eine eigene Suchmaschine auf derselben Maschine lässt das Modell die Fakten von heute nachschlagen – ohne Konto und ohne Spur Ihrer Anfragen bei einem Zwischenhändler.
Beweis
Vierzig Projekte, geschrieben ohne unsere Hilfe
Statt uns auf Zusicherungen zu stützen, haben wir der Maschine zehn schwierige Programmieraufgaben und vier verschiedene Modelleinstellungen gegeben. Anschließend haben wir die Ergebnisse mit eigenen Werkzeugen geprüft – denn ein Modell kann in die Dokumentation schreiben, dass die Tests bestehen, obwohl sie es nicht tun.
- selbstständige Durchläufe
- 40
- selbstständige Durchläufe
- für den kompletten Satz von zehn Projekten
- 3,8 h
- für den kompletten Satz von zehn Projekten
- geprüfte Abnahmekriterien
- 284
- geprüfte Abnahmekriterien
- erfüllt in der besten Konfiguration
- 71/71
- erfüllt in der besten Konfiguration
-
Die Tests haben wir selbst ausgeführt. Die Angabe des Modells, die Tests seien grün, wurde nicht auf Treu und Glauben übernommen – der Runner startete sie unabhängig.
-
Leistungsanforderungen haben wir nachgemessen. Eines der Modelle trug sich in die Dokumentation eine mildere Schwelle ein, als die Aufgabe verlangte. Das kam erst beim Ausführen ans Licht.
-
Die gesamte Maschine arbeitete isoliert – auf einem separaten Konto ohne Berechtigungen, mit Zugriff ausschließlich auf das Arbeitsverzeichnis.
Die Stromrechnung
So viel wie ein guter Kühlschrank
Gemessen mit einer smarten Steckdose, mit der Aufnahme des gesamten Rechners. Nicht nur der Karten, nicht in der Theorie.
- wartet auf eine Frage
- 120 W
- wartet auf eine Frage
- typische Arbeit
- 256 W
- typische Arbeit
- schwerste Einstellung
- 352 W
- schwerste Einstellung
- kurzzeitige Spitze
- 580 W
- kurzzeitige Spitze
1,32 €
(1,52 $) – für diese Summe entstanden die vierzig Projekte aus dem Test oben (zu unserem polnischen Stromtarif), also etwa 0,03 € (0,04 $) pro Aufgabe. Vier Zehntel dieses Betrags entfallen allein darauf, den Rechner eingeschaltet zu halten.
Ehrlich gesagt
Was eine solche Lösung nicht kann
Geschwindigkeit.
Die Flaggschiff-Karte hat doppelt so schnellen Speicher und wird bei den schwersten Modellen schneller sein. Der Vorteil zweier Karten liegt in Kapazität und Preis, nicht im Geschwindigkeitsrekord – wobei das Schreibtempo dem Lesenden ohnehin davonläuft.
Eines nach dem anderen.
Die Maschine hält zu jedem Zeitpunkt ein Modell im Speicher. Der Wechsel zu einem anderen dauert gut zehn Sekunden – in der Praxis wählt man das Modell zur Aufgabe, so wie man ein Programm wählt.
Ersetzt nicht alles.
Die größten kommerziellen Modelle gewinnen weiterhin bei den schwierigsten Aufgaben. Bei Gespräch, Dokumenten, Bildern und alltäglichem Code hört der Unterschied auf, eine Rolle zu spielen.
Braucht Pflege.
Das ist ein Server, kein Gerät aus dem Karton: Updates, Sicherungen, Modellauswahl. Deshalb beschreiben wir die gesamte Konfiguration – einschließlich dessen, was bei uns nicht funktioniert hat.
Labor
Alle Messungen Schritt für Schritt beschrieben
Wir dokumentieren diese Maschine seit dem ersten Start. Schauen Sie hinein, wenn Sie eine ähnliche bauen wollen – oder unsere Zahlen nachprüfen möchten.
Warum zwei Grafikkarten sinnvoll sind: wie sich das Modell zwischen ihnen aufteilt
Zwei Grafikkarten rechnen nicht doppelt so schnell – und dafür kauft man sie auch nicht. Man kauft sie, um den Speicher zu summieren. Hier steht, was genau im Inneren passiert, wenn sich ein Modell auf zwei Karten verteilt, und warum gerade diese Art der Aufteilung auf Heim-Hardware gewinnt.
Artikel lesen → 6 Min. Lesezeit
Wie viel Kontext wirklich in 32 GB passt
Der Kontext ist das Gedächtnis des Gesprächs – alles, was das Modell vor Augen hat, wenn es eine Antwort formuliert. Nach den Modellgewichten ist er der zweitgrößte Verbraucher von Kartenspeicher, und meist entscheidet er, ob eine Konfiguration überhaupt hochkommt. Wir haben geprüft, wo bei 32 GB die Grenze liegt. Die Antwort war überraschend: meistens nicht auf Seiten der Hardware.
Artikel lesen → 4 Min. Lesezeit
Die Modelle, die wir getestet haben – und die dauerhaft geblieben sind
Durch die Maschine sind zweiunddreißig konfigurierte Modellversionen gelaufen. Dauerhaft geblieben sind zehn Arbeitsprofile auf Basis von vier Dateien. Hier steht, was über Aufstieg und Ausscheiden entschied – und warum die teurere Datei nicht immer die bessere ist.
Artikel lesen → 5 Min. Lesezeit
Was Heim-KI im Jahr an Strom kostet
Wir haben den Verbrauch mit einer smarten Steckdose gemessen – den des ganzen Rechners, nicht nur der Karten, über viele Stunden Dauerbetrieb. Das Fazit ist unbequem für die Intuition: Den meisten Strom frisst nicht das Rechnen, sondern das bloße Eingeschaltethalten der Maschine.
Artikel lesen → 4 Min. Lesezeit
Eine eigene Suchmaschine für das Modell, ohne Konten bei Zwischenhändlern
Ein Sprachmodell kennt die Welt bis zu dem Tag, an dem sein Training endete. Damit es Fragen zu heutigen Dingen beantworten kann, muss es suchen können. Wir haben dafür eine eigene Suchmaschine auf derselben Maschine gebaut – und bei der Gelegenheit gemessen, wie viel Arbeit es kostet, bis die Ergebnisse in der eigenen Sprache kommen.
Artikel lesen → 4 Min. Lesezeit