Local inference
github llama.cpp · há 17 h · 9 visualizações

llama.cpp adiciona suporte a DFlash para HunyuanOCR e corrige conversão de rascunho

O projeto llama.cpp adicionou suporte à decodificação especulativa DFlash com o modelo HunyuanOCR, expondo tensores de entrada das camadas no grafo alvo. Essa alteração permite que o modelo de rascunho leia os fluxos residuais, possibilitando que solicitações de imagem sejam executadas com sucesso, apresentando uma taxa de aceitação de rascunho de aproximadamente 0,5 e saída OCR idêntica em bytes em comparação às execuções não especulativas.

media Hugging Face Forums · há 1 d · 11 visualizações

Usuário busca fluxo de trabalho para ablatorar Llama-Krikri-8B-Instruct para uso local em grego

Um usuário está planejando construir um modelo de linguagem grande nativo em grego e sem censura para implantação local usando o checkpoint ilsp/Llama-Krikri-8B-Instruct. O plano proposto envolve ablatorar o modelo com Heretic (heretic-llm), convertê-lo para o formato GGUF Q4_K_M e executar inferência em um GMKtec EVO-X3 equipado com processador AMD Ryzen AI MAX+ 395 via Vulkan.