Fonte · Hugging Face Blog
lab Hugging Face Blog · há 4 h · 1 visualização

Leaderboard Open TTS lança avaliação escalável de TTS multilíngue

O Leaderboard Open TTS foi lançado para abordar a fragmentação e a falta de padronização na avaliação de Text-to-Speech (TTS), utilizando métricas objetivas em vez de depender exclusivamente de pontuações lentas de preferência humana baseadas em arenas. Ele avalia modelos quanto à inteligibilidade, velocidade e similaridade do locutor usando embeddings Qwen3 ASR e WavLM.

lab Hugging Face Blog · há 1 d · 1 visualização

ProvenanceGuard adiciona verificação consciente da fonte a agentes MCP

O ProvenanceGuard é uma camada de verificação pós-geração para agentes do Model Context Protocol (MCP) que detecta a confluência entre fontes distintas, garantindo que as afirmações sejam atribuídas à fonte de evidência correta. O sistema analisa os rastros MCP capturados sem retreinar o agente, dividindo as respostas em afirmações e verificando se a fonte de suporte corresponde àquela nomeada ou implícita na saída.

lab Hugging Face Blog · há 6 d · 13 visualizações

Liquid AI lança LFM2.5-VL-DSpark para acelerar a inferência de modelos de visão e linguagem

A Liquid AI lançou o modelo em rascunho LFM2.5-VL-DSpark, um drafter de decodificação especulativa projetado para acelerar a inferência do modelo de visão e linguagem LFM2.5-VL-3B. O drafter captura estados ocultos de camadas fixas do modelo alvo para gerar tokens candidatos, adicionando apenas 280M parâmetros (sobrecarga de 8,9%) enquanto mantém a dimensionalidade idêntica entre as modalidades.

lab Hugging Face Blog · há 7 d · 16 visualizações

NVIDIA Warp e MjWarp permitem simulação de robótica paralela acelerada por GPU

O MuJoCo Warp (MJWarp), construído sobre o NVIDIA Warp, permite que modelos compatíveis do MuJoCo sejam executados em escala de GPU, viabilizando o avanço de centenas ou milhares de mundos de simulação independentes em uma única chamada. Essa arquitetura desloca o foco da minimização de latência para um único ambiente para a melhoria da taxa de transferência agregada, o que favorece o aprendizado por reforço e a amostragem em larga escala.

lab Hugging Face Blog · há 7 d · 27 visualizações

NVIDIA lança modelo de diarização Nemotron 3 com pesos abertos

A NVIDIA lançou o Nemotron 3 Diarization, um modelo com pesos abertos e 100M de parâmetros para diarização de falantes em tempo real que suporta até oito falantes. O modelo ocupa a posição #1 no ranking Diarization-Bench da VoiceArena com uma Taxa de Erro de Diarização (DER) de 14,72%, superando o próximo sistema classificado em aproximadamente 24% de redução relativa.

lab Hugging Face Blog · há 8 d · 25 visualizações

AISI divulga resultados verificados de avaliação para seis modelos de ponta em cinco benchmarks

O Instituto de Segurança de IA do Reino Unido (AISI) disponibilizou publicamente métodos de avaliação e achados por meio da plataforma Evaluation Cards do EvalEval, visando melhorar a reprodutibilidade dos benchmarks. Esta divulgação inclui resultados verificados, contexto e informações de configuração para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro e Terminal-Bench 2.0.

lab Hugging Face Blog · há 9 d · 12 visualizações

release candidate do tokenizers v1 entrega codificação 3 a 30 vezes mais rápida por meio de divisão e cache de bitstream

A biblioteca tokenizers lançou um release candidate da versão 1 que melhora significativamente o desempenho para codificação de texto, abordando gargalos nos fluxos de trabalho de treinamento e serviço. A atualização mantém compatibilidade de API com a v0.23 enquanto entrega acelerações substanciais em dez famílias de modelos.

lab Hugging Face Blog · há 9 d MMLU · 77.0% · 17 visualizações

Multiverse reformula a remoção de blocos de LLM como otimização de Ising para compressão profunda

O Multiverse publicou um artigo detalhando um método que reencaminha a poda de modelos de linguagem grandes como um problema de otimização binária restrita mapeado para um vidro de Ising. Ao tratar os blocos do transformer como spins com acoplamentos pares derivados da Hessiana da perda, a abordagem identifica configurações ótimas de remoção de blocos sem exigir benchmarking iterativo.

lab Hugging Face Blog · há 15 d · 20 visualizações

ALTK-Evolve introduz diretrizes de consistência para reduzir pela metade as lacunas de confiabilidade de agentes

Pesquisadores introduziram "diretrizes de consistência" dentro do sistema ALTK-Evolve, um novo mecanismo projetado para abordar a variabilidade no desempenho de agentes LLM que métricas padrão de precisão média frequentemente ocultam. Ao identificar e estabilizar pontos de decisão propensos a oscilações, essa abordagem melhora significativamente a consistência do sucesso da tarefa sem sacrificar a capacidade geral.

lab Hugging Face Blog · há 16 d · 19 visualizações

TRL v1.14 AsyncGRPOTrainer permite sincronização apenas com LoRA em Jobs do Hugging Face

O TRL v1.14 introduz suporte ao LoRA no AsyncGRPOTrainer, permitindo que ele treine um adaptador de Adaptação de Baixo Ranque e sincronize apenas esse pequeno arquivo com os workers de inferência do vLLM. Essa arquitetura desacopla os jobs de treinamento e geração em máquinas separadas, usando um Storage Bucket compartilhado como ponte de sistema de arquivos, eliminando a necessidade de NCCL ou comunicação direta de rede entre nós.

lab Hugging Face Blog · há 20 d · 29 visualizações

Gradio lança Workflow1111, reconstruindo recursos do AUTOMATIC1111 como um grafo Gradio

O Gradio lançou o Workflow1111, um projeto que reconstrói a maioria do conjunto de recursos do stable-diffusion-webui do AUTOMATIC1111 usando o framework gr.Workflow. O aplicativo consiste em uma única tela contendo onze pipelines de mídia construídos a partir de setenta e três nós, abrangendo texto-para-imagem, imagem-para-vídeo e várias tarefas de pré-processamento.

lab Hugging Face Blog · há 22 d · 28 visualizações

Computação Multiverso propõe auto-distilação consciente de fronteira para recusa precisa de segurança em LLMs

Um artigo da Computação Multiverso apresenta um método para treinar modelos de linguagem a recusar apenas subconjuntos específicos prejudiciais de um tópico, em vez de toda a categoria, abordando as limitações das barreiras de tópicos grosseiras. A abordagem utiliza auto-distilação consciente de fronteira com reparo de cobertura e dados benignos na distribuição para manter a segurança enquanto reduz recusas falsas em prompts legítimos.

lab Hugging Face Blog · há 27 d · 37 visualizações

NeoMME lança codificadores multimodais eficientes com recuperação de interação densa e tardia

Pesquisadores apresentam o NeoMME, uma família de codificadores multimodais multilíngues de 260M e 800M que processam texto e patches de imagem brutos usando um único Transformer bidirecional. Diferente dos modelos de linguagem visual generativos, o NeoMME não depende de torres de visão pré-treinadas separadas ou decodificadores causais, treinando todo o modelo do zero com um objetivo de difusão discreta mascarada.