Chinanews
Other爱范儿Thu, 27 Aug 2026 10:15:44 +0000

Por que os PCs com IA da Apple e da Xiaomi estão obcecados com o "muro da memória" | Diário de Artefatos de IA

Por que os PCs com IA da Apple e da Xiaomi estão obcecados com o "muro da memória" | Diário de Artefatos de IA

Os smartphones dominaram o ecossistema digital na última década. Eles são buracos negros para a nossa atenção e os nossos objetos pessoais mais íntimos. Mas, desde a sua conceção, os telemóveis foram desenhados para "serem olhados" — toda a sua lógica termina no ecrã.

As necessidades da IA são exatamente o oposto: exige uma perceção contínua do mundo físico — ver o que você vê, ouvir o que você ouve, estar sempre presente, em vez de esperar que você desbloqueie o ecrã para acordar.

Quando a IA se tornar verdadeiramente uma capacidade fundamental, mais cedo ou mais tarde irá romper a casca do ecrã e encontrar a sua própria forma. Este será um longo processo de exploração e evolução.

Daí surge a rubrica "Diário de Artefatos de IA". A ifanr quer observar continuamente consigo: como a IA está a mudar o design de hardware, como está a remodelar a interação humano-computador e, mais importante — de que forma a IA entrará no nosso quotidiano?

Este é o 23.º artigo do "Diário de Artefatos de IA".

Os novos Macs recentemente lançados pela Apple voltaram a redefinir as expectativas de desempenho para "PCs com IA". O compacto Mac mini foi definido pela própria marca como uma ferramenta de produtividade para executar Agentes 24 horas por dia, enquanto o Mac Studio de nível profissional oferece até 512GB de memória unificada.

No entanto, o seu verdadeiro ponto "forte" está escondido num parâmetro a que antes poucos davam atenção: a largura de banda da memória.

A largura de banda da memória unificada do M6 padrão chega aos 170GB/s, a versão M5 Pro é impulsionada para 307GB/s, e a topo de gama M5 Ultra ultrapassa diretamente a barreira dos terabytes, atingindo 1.2TB/s.

Para acompanhar estes novos produtos, a Apple até produziu um anúncio promocional para o Mac mini, mostrando a pequena caixa prateada a ganhar braços musculados e robustos.

Não por acaso, no dia anterior ao lançamento do novo Mac Studio, a Xiaomi revelou o seu chip acelerador de IA periférico Xuanjie O100, que também alcançou uma largura de banda de memória de 1.22TB/s; entretanto, a mais recente placa gráfica de consumo topo de gama da Nvidia, a RTX 5090, com 32GB de memória GDDR7, vê a sua largura de banda chegar a quase 1.8TB/s.

As arquiteturas dos SoCs de desktop, dos NPUs periféricos dedicados e das GPUs discretas são muito diferentes, mas, seja a fabricar computadores, chips para telemóveis ou placas gráficas, todos estão involuntariamente a fazer a mesma coisa: fazer com que os dados na memória se movam mais depressa.

A IA calcula cada vez mais rápido, e também é cada vez mais fácil "ficar com fome"

As fabricantes de chips fazem um esforço enorme para competir em largura de banda porque, no fundo, a IA de hoje consegue calcular cada vez mais, mas também é cada vez mais fácil ser "passada à fome" pela memória.

A primeira reação de muitas pessoas aqui é frequentemente: a memória não se mede pela capacidade? Quanto maior, melhor!

Na verdade, capacidade e largura de banda são coisas completamente diferentes. A capacidade determina o tamanho do modelo que este computador pode alojar, enquanto a largura de banda determina a velocidade a que esses dados são alimentados aos núcleos de cálculo, por segundo.

Assim que um modelo grande começa a funcionar, o que mais consome recursos muitas vezes não é o cálculo puro, mas sim o "transporte de dados" que percorre todo o processo.

Figura | Esquema de pré-preenchimento e saída de LLM | NVIDIA

O texto que vemos a aparecer palavra a palavra na caixa de diálogo, durante a fase de geração autoregressiva (Decode), exige que a unidade de cálculo leia na íntegra os milhares de milhões de pesos de parâmetros na memória de cada vez que gera um novo token.

É como um chef de cozinha extremamente rápido: o salteado demora apenas dois minutos, mas o ajudante demora uma eternidade a trazer um prato de ingredientes cortados. Por mais rápido que o chef cozinhe, passa a maior parte do tempo de pá na mão, à espera em frente ao fogão.

Quer seja um CPU, GPU ou NPU, todos estão agora presos neste obstáculo. O poder de computação avança a um ritmo alucinante, mas a velocidade de alargamento dos canais de memória não acompanha. Quando o modelo é pequeno ainda se consegue contornar, mas assim que se passa para modelos grandes de dezenas ou centenas de milhares de milhões (B) de parâmetros, cada palavra gerada exige o processamento de uma quantidade colossal de dados.

Por mais capaz que seja a unidade de cálculo, só pode desperdiçar muito tempo à espera que a memória lhe dê de comer. Este fenómeno na arquitetura de sistemas é chamado de memory-bound (limitado pela memória).

Figura | Compilado a partir de informações públicas na internet

Memórias mais rápidas, também mais caras

Muitas pessoas, ao olhar para o preço da memória, têm intuitivamente a ideia de que "32GB é certamente mais caro que 16GB, e 512GB é naturalmente mais caro que 32GB". Mas se olharmos para a cadeia de abastecimento de semicondutores, a verdadeira regra é, na verdade: quanto maior a memória, mais cara; mas quanto mais rápida a memória, o preço aumenta de forma exponencial.

Para fazer com que dados massivos se movam mais depressa, não basta empilhar chips; é necessária uma largura de bits maior, interfaces de maior frequência e um encapsulamento avançado e empilhamento vertical extremamente complexos. Tomando como exemplo a HBM (memória de alta largura de banda), atualmente padrão em servidores de IA, esta perfura e empilha verticalmente múltiplas camadas de chips DRAM (TSV), sendo a dificuldade de fabrico e a área do chip muito superiores às da memória tradicional.

Esta sede extrema por largas de banda ultrarrápidas está a desencadear uma "grande migração de capacidade" global a montante.

Dados da TrendForce mostram que, devido ao aumento explosivo da procura dos datacenters de IA por HBM e DDR5 de servidor de alta especificação, os três gigantes do armazenamento — Samsung, SK Hynix e Micron — estão a transferir totalmente a sua limitada capacidade de wafers avançados para o segmento empresarial.

Isto está a espremer diretamente o espaço de fornecimento deixado para a DRAM de PC de consumo. Mesmo na baixa temporada tradicional, os preços dos contratos continuam a subir de forma contínua.

No final do ano passado, a Micron anunciou formalmente a sua saída gradual do negócio de memória de consumo Crucial, direcionando totalmente os recursos da cadeia de abastecimento para clientes estratégicos de maior escala e lucratividade; e o encerramento recente das lojas autorizadas de terceira marca da SK Hynix no país também reflete o desinteresse dos fabricantes a montante pelos canais de consumo.

Figura | Micron

Quando o utilizador comum hesita perante o preço e levanta a cabeça, descobre que o orçamento para adicionar uma barra de memória está, invisivelmente, a competir com os datacenters de IA de todo o mundo pelos mesmos wafers avançados.

Para que o poder de cálculo não fique preso no transporte de dados, ...