Saltar para o conteúdo
V-Smart.

Inteligência artificial em sua casa

A mesma memória. Bom desempenho. Metade do preço.

Para correr em casa um modelo de linguagem a sério, não é preciso comprar uma placa gráfica topo de gama de 4650 € (5350 $). Duas placas de gama média dão exatamente a mesma memória — e é a memória que decide que tamanho de modelo consegue sequer arrancar. Construímos uma máquina destas, medimo-la e mostramos os resultados.

RTX 5090 — uma placa topo de gama

Memória
32 GB
Preço
4400–4650 € (5100–5350 $)

RTX 5070 Ti — duas placas

Memória
16 GB + 16 GB
Preço
2 × 1050 € = 2100 € (2 × 1200 $ = 2400 $)

A memória das duas placas soma-se: o modelo divide-se ao meio e uma metade calcula na primeira placa, a outra na segunda. Visto de fora, parece um único computador com 32 GB de memória gráfica — por 47% do preço do topo de gama.

Preços de retalho europeus, agosto de 2026. A NVIDIA já subiu os preços duas vezes este ano — 10–15% em janeiro em toda a linha RTX 50 e em maio apenas na RTX 5090 — e a terceira correção anunciada deverá chegar aos 20–30%. A razão é o encarecimento da memória GDDR7, cuja escassez se prevê pelo menos até 2028. A subida atinge as duas variantes, mas não por igual: os mesmos 30% são cerca de 630 € (720 $) no par de placas e perto de 1390 € (1600 $) no topo de gama.

de memória gráfica para os modelos
32 GB
de memória gráfica para os modelos
tokens por segundo; escreve mais depressa do que consegue ler
~200
tokens por segundo; escreve mais depressa do que consegue ler
tokens de contexto, ou seja, várias centenas de páginas de uma vez
262 mil
tokens de contexto, ou seja, várias centenas de páginas de uma vez
de consumo quando a máquina está à espera
120 W
de consumo quando a máquina está à espera

Utilizações

Quatro coisas para as quais a construímos

Conversa

A sua língua, sem decalques

Um assistente que escreve e traduz com naturalidade na sua língua — os modelos são multilingues; a qualidade, verificámo-la no nosso polaco nativo, uma das línguas mais difíceis de acertar. Responde mais depressa do que consegue ler a frase anterior, e toda a conversa fica num disco em casa.

Imagem e vídeo

Vê aquilo que lhe mostrar

Uma fotografia, um documento digitalizado, um clip até um minuto — o modelo descreve, resume e extrai dados. Sem enviar ficheiros privados para um servidor alheio.

Programação

Escreve código e verifica-o sozinha

Recebe a descrição da tarefa e trabalha de forma autónoma: cria ficheiros, corre testes, corrige erros. No nosso teste, entregava projetos completos de 1500–3000 linhas.

Pesquisa

Vai buscar informação fresca

Um motor de busca próprio na mesma máquina permite ao modelo verificar os factos de hoje, sem conta e sem deixar rasto das perguntas num intermediário.

Prova

Quarenta projetos escritos sem a nossa ajuda

Em vez de nos apoiarmos em declarações, demos à máquina dez tarefas de programação difíceis e quatro configurações diferentes do modelo. Depois verificámos os resultados com as nossas próprias ferramentas — porque um modelo é capaz de escrever na documentação que os testes passam quando não passam.

execuções autónomas
40
execuções autónomas
para o conjunto de dez projetos
3,8 h
para o conjunto de dez projetos
critérios de aceitação verificados
284
critérios de aceitação verificados
cumpridos na melhor configuração
71/71
cumpridos na melhor configuração
  • Os testes, corremo-los nós. A declaração do modelo de que os testes estavam verdes não era aceite pela palavra — o runner executava-os de forma independente.

  • Os requisitos de desempenho verificámo-los por medição. Um dos modelos escreveu na documentação um limiar mais brando do que a tarefa exigia. Só se percebeu na execução.

  • Toda a máquina trabalhou em isolamento — numa conta separada sem privilégios, com acesso apenas ao diretório de trabalho.

Conta da eletricidade

Tanto como um bom frigorífico

Medimos com uma tomada inteligente, contando o consumo do computador inteiro. Não só das placas, e não em teoria.

à espera de uma pergunta
120 W
à espera de uma pergunta
trabalho típico
256 W
trabalho típico
a configuração mais pesada
352 W
a configuração mais pesada
pico momentâneo
580 W
pico momentâneo

1,32 €

(1,52 $) — foi quanto custaram os quarenta projetos do teste acima (à nossa tarifa polaca), ou seja, cerca de 0,03 € (0,04 $) por tarefa. Quatro décimos desse valor são só manter o computador ligado.

Com honestidade

O que uma solução destas não faz

Velocidade.

A placa topo de gama tem memória duas vezes mais rápida e será mais veloz com os modelos mais pesados. A vantagem das duas placas é a capacidade e o preço, não o recorde de velocidade — ainda que o ritmo de escrita continue à frente de quem lê.

Um de cada vez.

A máquina mantém em memória um modelo de cada vez. Trocar para outro demora uma dúzia de segundos — na prática escolhe-se o modelo para a tarefa, como se escolhe um programa.

Não substitui tudo.

Os maiores modelos comerciais continuam a ganhar nas tarefas mais difíceis. Para conversa, documentos, imagem e código do dia a dia, a diferença deixa de ter importância.

Exige cuidados.

É um servidor, não um equipamento pronto a usar: atualizações, cópias de segurança, escolha de modelos. Por isso descrevemos a configuração completa — incluindo o que não funcionou connosco.

Laboratório

Todas as medições descritas passo a passo

Mantemos a documentação desta máquina desde o primeiro arranque. Espreite, se quiser construir uma parecida — ou verificar os nossos números.

01

Porque é que duas placas fazem sentido: como o modelo se divide entre elas

Duas placas gráficas não calculam duas vezes mais depressa — e não é para isso que se compram. Compram-se para somar a memória. Eis o que acontece exatamente lá dentro quando o modelo se reparte por duas placas, e porque é que este modo de divisão ganha no hardware doméstico.

Ler o artigo → 6 min de leitura

02

Quanto contexto cabe realmente em 32 GB

O contexto é a memória da conversa — tudo o que o modelo tem diante dos olhos quando formula a resposta. É, a seguir aos pesos do modelo, o segundo maior consumidor de memória da placa, e normalmente é ele que decide se a configuração sequer arranca. Fomos ver onde fica o limite com 32 GB. A resposta surpreendeu: na maioria dos casos, não está do lado do hardware.

Ler o artigo → 5 min de leitura

03

Os modelos que testámos — e os que ficaram em permanência

Pela máquina passaram trinta e duas versões configuradas de modelos. Ficaram em permanência dez perfis de trabalho construídos sobre quatro ficheiros. Eis o que decidia a promoção e o que ditava a eliminação — e porque é que um ficheiro mais caro nem sempre significa melhor.

Ler o artigo → 5 min de leitura

04

Quanta eletricidade consome uma IA doméstica por ano

Medimos o consumo com uma tomada inteligente — do computador inteiro, não só das placas, ao longo de muitas horas de trabalho contínuo. A conclusão é incómoda para a intuição: o que mais eletricidade come não é o calcular, é o simples manter da máquina ligada.

Ler o artigo → 5 min de leitura

05

Motor de busca próprio para o modelo, sem contas em intermediários

Um modelo de linguagem conhece o mundo até ao dia em que acabaram de o treinar. Para responder a perguntas sobre as coisas de hoje, tem de saber procurar. Construímos para isso um motor de busca próprio, na mesma máquina — e, já agora, medimos quanto trabalho é preciso para que os resultados venham na língua certa.

Ler o artigo → 4 min de leitura

Máquina de testes Home AI — computador com duas placas gráficas
A nossa máquina de testes — todos os números desta secção vêm de medições feitas nela.