A Arcee, uma desenvolvedora de modelos de peso aberto nos EUA, fez parceria com o Departamento de Energia para criar o Genesis-Science-1. Essa colaboração resulta em um modelo aberto projetado especificamente para pesquisa científica.
Arcee e Departamento de Energia se associam para construir Genesis-Science-1
Arcee AI e DOE anunciam Genesis-Science-1, um modelo de pesos abertos com 1T para pesquisa científica
O Departamento de Energia (DOE) e a Arcee AI anunciaram o desenvolvimento do Genesis-Science-1 (GS1), um modelo de linguagem de pesos abertos projetado especificamente para pesquisa científica. Esta iniciativa faz parte da Missão Genesis, com o objetivo de levar capacidades avançadas de IA a uma ampla gama de campos científicos por meio de um esforço conjunto entre a agência governamental e a empresa privada.
Tencent lança HiLS-Attention-7B com atenção esparsa por chunk
A Tencent lançou o checkpoint HiLS-Attention-7B, um modelo de 7 bilhões de parâmetros construído sobre uma arquitetura OLMo3-style. O modelo implementa um mecanismo de atenção esparsa por chunk que aprende a seleção de chunks end-to-end sob a perda de modelagem de linguagem.
DiaLLM investiga a lacuna entre robustez e geração na adaptação a dialetos do inglês
O estudo DiaLLM aborda a desconexão entre compreender e produzir inglês dialectal por meio do pré-treinamento contínuo de três famílias de modelos de linguagem de peso aberto no Corpus Internacional do Inglês. Aplica paradigmas de pós-treinamento implícitos e explícitos combinados com três estratégias de alinhamento para comparar o inglês australiano, indiano e britânico setentrional.
DiaLLM investiga a lacuna entre robustez e geração na adaptação a dialetos do inglês
O estudo do DiaLLM revela que a robustez dialetal e a geração estão dissociadas em grandes modelos de linguagem, pois os benchmarks moldados pelo pré-treinamento contínuo não capturam como o alinhamento remodela a saída real. Os autores realizam pré-treinamento contínuo em três famílias de modelos de peso aberto no International Corpus of English e aplicam paradigmas de pós-treinamento implícitos e explícitos combinados com três estratégias de alinhamento para o inglês australiano, indiano e britânico do norte.
Qllm lança modelo de inferência O(1) sem cache KV
Um pesquisador lançou o Qllm, uma nova arquitetura de modelo de linguagem grande que alcança tempo de inferência O(1) eliminando a necessidade de um cache de chave-valor (KV). O modelo de 100M parâmetros é construído com base em associatividade de fase e não depende de estruturas de transformer ou mamba.