Inteligência artificial em sua casa
A mesma memória. Bom desempenho. Metade do preço.
Para correr em casa um modelo de linguagem a sério, não é preciso comprar uma placa gráfica topo de gama de 4650 € (5350 $). Duas placas de gama média dão exatamente a mesma memória — e é a memória que decide que tamanho de modelo consegue sequer arrancar. Construímos uma máquina destas, medimo-la e mostramos os resultados.
RTX 5090 — uma placa topo de gama
- Memória
- 32 GB
- Preço
- 4400–4650 € (5100–5350 $)
RTX 5070 Ti — duas placas
- Memória
- 16 GB + 16 GB
- Preço
- 2 × 1050 € = 2100 € (2 × 1200 $ = 2400 $)
| Variante | Memória | Preço |
|---|---|---|
| RTX 5090 — uma placa topo de gama | 32 GB | 4400–4650 € (5100–5350 $) |
| RTX 5070 Ti — duas placas | 16 GB + 16 GB | 2 × 1050 € = 2100 € (2 × 1200 $ = 2400 $) |
A memória das duas placas soma-se: o modelo divide-se ao meio e uma metade calcula na primeira placa, a outra na segunda. Visto de fora, parece um único computador com 32 GB de memória gráfica — por 47% do preço do topo de gama.
Preços de retalho europeus, agosto de 2026. A NVIDIA já subiu os preços duas vezes este ano — 10–15% em janeiro em toda a linha RTX 50 e em maio apenas na RTX 5090 — e a terceira correção anunciada deverá chegar aos 20–30%. A razão é o encarecimento da memória GDDR7, cuja escassez se prevê pelo menos até 2028. A subida atinge as duas variantes, mas não por igual: os mesmos 30% são cerca de 630 € (720 $) no par de placas e perto de 1390 € (1600 $) no topo de gama.
- de memória gráfica para os modelos
- 32 GB
- de memória gráfica para os modelos
- tokens por segundo; escreve mais depressa do que consegue ler
- ~200
- tokens por segundo; escreve mais depressa do que consegue ler
- tokens de contexto, ou seja, várias centenas de páginas de uma vez
- 262 mil
- tokens de contexto, ou seja, várias centenas de páginas de uma vez
- de consumo quando a máquina está à espera
- 120 W
- de consumo quando a máquina está à espera
Utilizações
Quatro coisas para as quais a construímos
Conversa
A sua língua, sem decalques
Um assistente que escreve e traduz com naturalidade na sua língua — os modelos são multilingues; a qualidade, verificámo-la no nosso polaco nativo, uma das línguas mais difíceis de acertar. Responde mais depressa do que consegue ler a frase anterior, e toda a conversa fica num disco em casa.
Imagem e vídeo
Vê aquilo que lhe mostrar
Uma fotografia, um documento digitalizado, um clip até um minuto — o modelo descreve, resume e extrai dados. Sem enviar ficheiros privados para um servidor alheio.
Programação
Escreve código e verifica-o sozinha
Recebe a descrição da tarefa e trabalha de forma autónoma: cria ficheiros, corre testes, corrige erros. No nosso teste, entregava projetos completos de 1500–3000 linhas.
Pesquisa
Vai buscar informação fresca
Um motor de busca próprio na mesma máquina permite ao modelo verificar os factos de hoje, sem conta e sem deixar rasto das perguntas num intermediário.
Prova
Quarenta projetos escritos sem a nossa ajuda
Em vez de nos apoiarmos em declarações, demos à máquina dez tarefas de programação difíceis e quatro configurações diferentes do modelo. Depois verificámos os resultados com as nossas próprias ferramentas — porque um modelo é capaz de escrever na documentação que os testes passam quando não passam.
- execuções autónomas
- 40
- execuções autónomas
- para o conjunto de dez projetos
- 3,8 h
- para o conjunto de dez projetos
- critérios de aceitação verificados
- 284
- critérios de aceitação verificados
- cumpridos na melhor configuração
- 71/71
- cumpridos na melhor configuração
-
Os testes, corremo-los nós. A declaração do modelo de que os testes estavam verdes não era aceite pela palavra — o runner executava-os de forma independente.
-
Os requisitos de desempenho verificámo-los por medição. Um dos modelos escreveu na documentação um limiar mais brando do que a tarefa exigia. Só se percebeu na execução.
-
Toda a máquina trabalhou em isolamento — numa conta separada sem privilégios, com acesso apenas ao diretório de trabalho.
Conta da eletricidade
Tanto como um bom frigorífico
Medimos com uma tomada inteligente, contando o consumo do computador inteiro. Não só das placas, e não em teoria.
- à espera de uma pergunta
- 120 W
- à espera de uma pergunta
- trabalho típico
- 256 W
- trabalho típico
- a configuração mais pesada
- 352 W
- a configuração mais pesada
- pico momentâneo
- 580 W
- pico momentâneo
1,32 €
(1,52 $) — foi quanto custaram os quarenta projetos do teste acima (à nossa tarifa polaca), ou seja, cerca de 0,03 € (0,04 $) por tarefa. Quatro décimos desse valor são só manter o computador ligado.
Com honestidade
O que uma solução destas não faz
Velocidade.
A placa topo de gama tem memória duas vezes mais rápida e será mais veloz com os modelos mais pesados. A vantagem das duas placas é a capacidade e o preço, não o recorde de velocidade — ainda que o ritmo de escrita continue à frente de quem lê.
Um de cada vez.
A máquina mantém em memória um modelo de cada vez. Trocar para outro demora uma dúzia de segundos — na prática escolhe-se o modelo para a tarefa, como se escolhe um programa.
Não substitui tudo.
Os maiores modelos comerciais continuam a ganhar nas tarefas mais difíceis. Para conversa, documentos, imagem e código do dia a dia, a diferença deixa de ter importância.
Exige cuidados.
É um servidor, não um equipamento pronto a usar: atualizações, cópias de segurança, escolha de modelos. Por isso descrevemos a configuração completa — incluindo o que não funcionou connosco.
Laboratório
Todas as medições descritas passo a passo
Mantemos a documentação desta máquina desde o primeiro arranque. Espreite, se quiser construir uma parecida — ou verificar os nossos números.
Porque é que duas placas fazem sentido: como o modelo se divide entre elas
Duas placas gráficas não calculam duas vezes mais depressa — e não é para isso que se compram. Compram-se para somar a memória. Eis o que acontece exatamente lá dentro quando o modelo se reparte por duas placas, e porque é que este modo de divisão ganha no hardware doméstico.
Ler o artigo → 6 min de leitura
Quanto contexto cabe realmente em 32 GB
O contexto é a memória da conversa — tudo o que o modelo tem diante dos olhos quando formula a resposta. É, a seguir aos pesos do modelo, o segundo maior consumidor de memória da placa, e normalmente é ele que decide se a configuração sequer arranca. Fomos ver onde fica o limite com 32 GB. A resposta surpreendeu: na maioria dos casos, não está do lado do hardware.
Ler o artigo → 5 min de leitura
Os modelos que testámos — e os que ficaram em permanência
Pela máquina passaram trinta e duas versões configuradas de modelos. Ficaram em permanência dez perfis de trabalho construídos sobre quatro ficheiros. Eis o que decidia a promoção e o que ditava a eliminação — e porque é que um ficheiro mais caro nem sempre significa melhor.
Ler o artigo → 5 min de leitura
Quanta eletricidade consome uma IA doméstica por ano
Medimos o consumo com uma tomada inteligente — do computador inteiro, não só das placas, ao longo de muitas horas de trabalho contínuo. A conclusão é incómoda para a intuição: o que mais eletricidade come não é o calcular, é o simples manter da máquina ligada.
Ler o artigo → 5 min de leitura
Motor de busca próprio para o modelo, sem contas em intermediários
Um modelo de linguagem conhece o mundo até ao dia em que acabaram de o treinar. Para responder a perguntas sobre as coisas de hoje, tem de saber procurar. Construímos para isso um motor de busca próprio, na mesma máquina — e, já agora, medimos quanto trabalho é preciso para que os resultados venham na língua certa.
Ler o artigo → 4 min de leitura