Tema · Hardware & chips
github llama.cpp · há 11 d · 13 visualizações

llama.cpp b10255 estende o SDPA do oneDNN para caches KV não-FP16

O lançamento llama.cpp b10255 estende o caminho SDPA do oneDNN para suportar caches de chave-valor (KV) não-FP16, incluindo formatos quantizados Q4_0–Q8_0 e FP32. Esta atualização permite que o kernel systolic fundido seja executado de forma idêntica ao caminho nativo FP16, desquantizando ou convertendo os tensores K/V para FP16 denso no dispositivo antes do processamento.

media TLDR AI · há 22 d · 2 visualizações

Acordo entre AMD e Anthropic: AMD fornecerá chips MI450 e investirá US$ 5 bilhões

A AMD e a Anthropic assinaram um acordo importante envolvendo dezenas de bilhões de dólares em servidores de IA, com a Anthropic comprando até 2 gigawatts de chips Instinct MI450 da AMD a partir do primeiro semestre do próximo ano. Simultaneamente, a AMD investirá até US$ 5 bilhões na Anthropic à medida que marcos específicos de implantação forem atingidos, enquanto ambas as empresas colaboram para identificar data centers adequados para o hardware.

arxiv arXiv cs.AI · há 23 d · 4 visualizações

SLAI T-Rex permite o pós-treinamento de todos os parâmetros do DeepSeek-V4 no Ascend SuperPOD

O SLAI apresenta o T-Rex, um framework de otimização de ponta a ponta para o pós-treinamento de todos os parâmetros de modelos MoE na escala de trilhões de parâmetros no Ascend NPU SuperPOD. Utilizando a família de modelos DeepSeek-V4 como carga de trabalho alvo, o sistema aborda a pressão de memória e a sobrecarga de comunicação por meio de paralelismo hierárquico e otimizações de execução de kernels.

arxiv arXiv cs.CL · há 23 d · 1 visualização

SLAI T-Rex permite o pós-treinamento de todos os parâmetros do DeepSeek-V4 no Ascend SuperPOD

O SLAI apresenta o T-Rex, um framework de otimização de ponta a ponta para o pós-treinamento de todos os parâmetros de modelos MoE na escala de trilhão de parâmetros no Ascend NPU SuperPOD. Usando a família de modelos DeepSeek-V4 como carga de trabalho alvo, o sistema aborda a pressão de memória e a sobrecarga de comunicação por meio de paralelismo hierárquico e otimizações de execução de kernel.

media Together AI Blog · há 25 d · 2 visualizações

Together AI e Y Combinator lançam cluster de GPU dedicado para startups da YC

A Together AI e a Y Combinator anunciaram uma parceria para fornecer o primeiro cluster de GPU dedicado exclusivamente ao portfólio de startups nativas de IA da Y Combinator. Esta iniciativa visa resolver o gargalo crítico de acesso à computação, oferecendo infraestrutura flexível e econômica para treinamento e inferência, sem exigir compromissos de longo prazo.

lab NVIDIA Technical Blog · há 29 d · 2 visualizações

NVIDIA propõe co-design do BlueField para escalar fábricas de Agentic AI

A NVIDIA detalha como o co-design extremo com seus processadores BlueField pode resolver os desafios de infraestrutura impostos pelas cargas de trabalho de Agentic AI. A empresa argumenta que, à medida que os sistemas agênticos desencadeiam cadeias complexas de chamadas de modelo, interações com ferramentas e buscas de dados, os padrões de infraestrutura tradicionais são insuficientes para manter o desempenho.