Inference efficiency
arxiv arXiv cs.AI · há 4 h · 9 visualizações

CliffCompaction reduz custos de agentes de codificação em 50% mantendo o desempenho

Pesquisadores apresentam o CliffCompaction, uma técnica de autocompactação projetada para reduzir custos para agentes de codificação de longo alcance em até 50% sob um contexto limitado. O método mantém ou melhora o desempenho no Terminal-Bench e alcança resultados de estado da arte no KernelBench ao manter as informações compactadas fiéis por meio de truncamento em vez de reformulação.

arxiv arXiv cs.LG · há 5 h · 9 visualizações

CliffCompaction reduz os custos de agentes de codificação de longo alcance em até 50% mantendo o desempenho

Pesquisadores apresentam o CliffCompaction, uma técnica de autocompactação projetada para agentes que lidam com milhões de tokens, que corta custos em até 50% sob contexto limitado. O método mantém ou melhora o desempenho no Terminal-Bench e alcança resultados de estado da arte no KernelBench ao manter a fidelidade das informações por meio de truncamento em vez de reformulação.

github llama.cpp · há 17 h · 9 visualizações

llama.cpp adiciona suporte a DFlash para HunyuanOCR e corrige conversão de rascunho

O projeto llama.cpp adicionou suporte à decodificação especulativa DFlash com o modelo HunyuanOCR, expondo tensores de entrada das camadas no grafo alvo. Essa alteração permite que o modelo de rascunho leia os fluxos residuais, possibilitando que solicitações de imagem sejam executadas com sucesso, apresentando uma taxa de aceitação de rascunho de aproximadamente 0,5 e saída OCR idêntica em bytes em comparação às execuções não especulativas.

media Hugging Face Forums · há 1 d · 11 visualizações

Usuário busca fluxo de trabalho para ablatorar Llama-Krikri-8B-Instruct para uso local em grego

Um usuário está planejando construir um modelo de linguagem grande nativo em grego e sem censura para implantação local usando o checkpoint ilsp/Llama-Krikri-8B-Instruct. O plano proposto envolve ablatorar o modelo com Heretic (heretic-llm), convertê-lo para o formato GGUF Q4_K_M e executar inferência em um GMKtec EVO-X3 equipado com processador AMD Ryzen AI MAX+ 395 via Vulkan.

media Together AI Blog · há 1 d · 11 visualizações

Together AI lança canários para atualizar modelos em produção sem tempo de inatividade

A Together AI introduziu lançamentos Canary, um recurso que migra o tráfego ativo de um modelo atual para uma nova verificação em etapas com controle de acesso. Este sistema automatiza o mecanismo de segurança para troca de modelos executando verificações de integridade e portas de métricas opcionais antes de mover o tráfego, permitindo pausas e reversões automáticas se o desempenho degradar.

arxiv arXiv cs.AI · há 1 d · 9 visualizações

AgentRouter reduz custos de fluxos de trabalho agênticos em 72% por meio de roteamento de modelos em nível de etapa

Pesquisadores propõem o AgentRouter, um classificador leve que otimiza fluxos de trabalho agênticos multi-etapas ao rotear etapas individuais da trajetória para níveis apropriados de modelo, em vez de usar modelos de fronteira para cada tarefa. O sistema aborda a ineficiência das soluções existentes que ignoram a complexidade variada de subtarefas dentro de uma única sessão de agente.

arxiv arXiv cs.CL · há 1 d · 11 visualizações

AgentRouter reduz custos de fluxos de trabalho agênticos em 72% por meio de roteamento de modelos em nível de etapa

Pesquisadores propõem o AgentRouter, um classificador leve que otimiza fluxos de trabalho agênticos multi-etapas ao rotear etapas individuais da trajetória para camadas apropriadas de modelos, em vez de usar um único modelo de fronteira para todas as tarefas. O sistema aborda a ineficiência dos sistemas empresariais que desperdiçam 60-80% de seu orçamento de inferência em subtarefas que modelos menores podem lidar igualmente bem.