Laboratório · Hugging Face
github llama.cpp · há 19 h · 2 visualizações

llama.cpp b11266 carrega a matriz A F32 de 2 em 2 para Vulkan na Intel

O projeto llama.cpp lançou a compilação b11266, que inclui uma otimização do Vulkan que carrega as matrizes A F32 dois elementos por vez quando estão alinhadas a 2. Essa alteração corrige problemas de desempenho no hardware da Intel, onde carregar floats um por um é ineficiente, e também corrige uma validação ausente para o alinhamento de `a_offset` no patch original.

media MarkTechPost · há 1 d Android World · 85.1% · 8 visualizações

H Company lança modelos de uso de computador Holo4 de peso aberto para desktop, web e mobile

A H Company lançou o Holo4, uma família de modelos de visão e linguagem generalistas para uso de computador, projetados para clicar, digitar, escrever código e chamar ferramentas em ambientes de desktop, web, Android e API. O lançamento inclui dois tamanhos de modelo: Holo4 27B (denso) e Holo4 35B-A3B (Mixture of Experts com 3B parâmetros ativos), ambos suportando uma janela de contexto de 256K.

github llama.cpp · há 2 d · 4 visualizações

llama.cpp b11238 adiciona ggml_pad_ext para preenchimento à esquerda e ignora taps do DFlash2

O projeto llama.cpp lançou a compilação b11238, introduzindo uma implementação unificada de preenchimento à esquerda por meio da nova função `ggml_pad_ext`. Essa alteração consolida os métodos anteriores usados por codificadores de áudio como Parakeet, LFM2-Audio, Granite Speech e Gemma 4, garantindo embeddings bit a bit idênticos para o Gemma 4 enquanto simplifica o suporte ao backend.

media Hugging Face Forums · há 3 d · 9 visualizações

Claude Opus 5 e Tetsu encontram seis verificações de CI vazias em seu próprio projeto

Em 27 de setembro, o Claude Opus 5 e o modelo Tetsu de 3B identificaram seis verificações de integração contínua separadas em seu repositório público que foram marcadas como verdes ou aprovadas, apesar de não verificarem o que deveriam medir. Os problemas variavam desde um gate de implantação que recusava reinicializações válidas devido a digests desatualizados até benchmarks de tempo com limiares vazios que aceitavam diferenças de desempenho insignificantes.