Tal como foi referido no ano passado, a capacidade ideal recomendada de RAM para jogos e cargas de trabalho de IA era de 96 GB de memória do sistema. Desde então, muita coisa mudou, e um kit de 96 GB poderá já não ser uma opção recomendada.
O mercado das memórias sofreu alterações drásticas. A infraestrutura de IA está a consumir quantidades enormes de capacidade de DRAM e HBM, o que exerce uma pressão significativa sobre a oferta e os preços da DRAM destinada ao consumidor. Em 2026, os kits de 96 GB poderão ser difíceis de encontrar ou ter um preço significativamente mais elevado, tornando-os consideravelmente menos atrativos para uma configuração de computador destinada a entusiastas em geral.
Assim, de volta ao laboratório, a tentar encontrar a melhor solução, dadas as circunstâncias.
As configurações de 32 GB e 64 GB foram comparadas utilizando uma RTX 4090 e cargas de trabalho LLM locais, tendo-se analisado igualmente o efeito do desempenho da DDR5.
O sistema de testes era o seguinte:
A conclusão é clara: para um sistema moderno de jogos e IA, 64 GB de DDR5 representam o ponto ideal, e a DDR5-6000 C40 oferece um excelente equilíbrio entre capacidade, desempenho e praticabilidade.
Como era de esperar, 32 GB de memória não são suficientes para lidar com um LLM de grande dimensão com 70 mil milhões de parâmetros. A utilização da RAM ultrapassa largamente os 95 %, o que torna o sistema lento. Por outro lado, o sistema de 64 GB ainda dispunha de cerca de 15 GB de RAM, o que permite aos utilizadores realizar outras tarefas em simultâneo.
No que diz respeito ao tempo de geração dos tokens, não se verifica uma grande diferença. O kit de 64 GB 6000C40 está ligeiramente à frente, sem que isso signifique que seja, na prática, o melhor. Para este gráfico específico, foram selecionadas as execuções mais rápidas e as mais lentas entre os dois kits.
No entanto, numa média de 3 execuções, os resultados são os mesmos. Os kits 5600C40 e 6000C40 demoraram, praticamente, o mesmo tempo a concluir as tarefas. O kit 6000C40 foi ligeiramente mais rápido, em 0,5 segundos, mas isso está dentro da margem de erro.
No geral, os 64 GB proporcionaram capacidade de memória suficiente para executar cargas de trabalho locais de IA substancialmente maiores, sem sujeitar o sistema a uma pressão grave sobre a memória. Essa distinção é importante.
Mas porquê os LLMs locais? Por que não utilizar uma API online como o ChatGPT ou outras? Privacidade. Os dados que os utilizadores importam para qualquer serviço online podem ficar expostos ao público. Ao executar um LLM numa máquina que o senhor controla, não é necessário ligar-se à Internet e pode controlar o seu comportamento ao máximo. As vantagens dos LLMs locais não se limitam apenas à privacidade. O custo, a personalização e o comprimento do contexto são fatores importantes que favorecem os LLMs locais.
Para os testes, foi utilizado o modelo Llama 3.1 70B Instruct da Meta, executado localmente através do Ollama. O modelo 70B contém aproximadamente 70 mil milhões de parâmetros e suporta uma janela de contexto de 128K. Isto não pretende sugerir que todos os utilizadores de IA devam utilizar um modelo 70B. No entanto, os modelos de maior dimensão têm, geralmente, maior capacidade para representar conhecimentos e relações, podendo apresentar um melhor desempenho em tarefas exigentes de raciocínio, programação, análise e execução de instruções.
Uma placa gráfica RTX 4090 oferece 24 GB de VRAM dedicada. Trata-se de uma quantidade enorme de memória gráfica, mas não é necessariamente suficiente para modelos de IA locais de maior dimensão. Quando um modelo excede a VRAM disponível, parte da carga de trabalho tem de residir na memória do sistema (RAM). É aí que a RAM do sistema se torna muito mais do que um recurso para o Windows, jogos e aplicações em segundo plano.
Para a carga de trabalho de desempenho principal, foi selecionado o Llama3.1 8B. Este é substancialmente mais pequeno do que os 24 GB de VRAM disponíveis na RTX4090, o que significa que a memória do sistema passa a ser uma parte menos importante da carga de trabalho.
Em vez de solicitar ao modelo que realizasse um teste de desempenho artificial, como a geração de milhares de palavras, foram utilizadas tarefas representativas da utilização quotidiana da IA.
Entre estas contavam-se atividades como o planeamento, a síntese, a análise e a produção de conteúdos estruturados.
Foi utilizada a seguinte instrução: «Estou a planear uma viagem de 10 dias ao Japão, que incluirá Tóquio, Quioto, Osaka e Hiroshima. Elabore um itinerário detalhado, dia a dia. Para cada dia, inclua as principais atrações, a ordem em que devo visitá-las, o tempo aproximado de viagem entre os locais, sugestões de restaurantes ou zonas gastronómicas e dicas práticas. Explique o raciocínio subjacente ao itinerário e identifique quaisquer potenciais problemas de agendamento. No final, forneça uma lista concisa do que levar na mala e um resumo do tempo total gasto em viagem em comparação com o tempo dedicado a visitas turísticas.»
O mercado dos entusiastas de computadores está a mudar.
Oferecem capacidade suficiente para jogos modernos, multitarefas e cargas de trabalho significativas de IA local, evitando simultaneamente os problemas de custo e disponibilidade cada vez mais associados a kits de maior dimensão.
Em conjunto com as especificações DDR5-6000 C40, proporcionam um equilíbrio sólido entre capacidade e desempenho da memória.
PRODUTOS NO ARTIGO
Stay up to date with CORSAIR. Get our latest News, Guides, and Product Updates in your Google feeds.
Add CORSAIR as a preferred sourceThanks for helping us improve this article.
JOIN OUR OFFICIAL CORSAIR COMMUNITIES
Join our official CORSAIR Communities! Whether you're new or old to PC Building, have questions about our products, or want to chat about the latest PC, tech, and gaming trends, our community is the place for you.