Arcee, un développeur de modèles à poids ouverts aux États-Unis, s'est associé au Département de l'énergie pour créer Genesis-Science-1. Cette collaboration donne lieu à un modèle ouvert conçu spécifiquement pour la recherche scientifique.
Arcee et le Département de l'énergie s'associent pour construire Genesis-Science-1
Arcee AI et le DOE annoncent Genesis-Science-1, un modèle à poids ouverts de 1T pour la recherche scientifique
Le Département de l'Énergie (DOE) et Arcee AI ont annoncé le développement de Genesis-Science-1 (GS1), un modèle de langage à poids ouverts conçu spécifiquement pour la recherche scientifique. Cette initiative s'inscrit dans la Mission Genesis, visant à apporter des capacités d'IA avancées à un large éventail de domaines scientifiques grâce à un effort conjoint entre l'agence gouvernementale et l'entreprise privée.
Tencent publie HiLS-Attention-7B avec une attention creuse par blocs
Tencent a publié le checkpoint HiLS-Attention-7B, un modèle de 7 milliards de paramètres construit sur une architecture de type OLMo3. Le modèle implémente un mécanisme d'attention creuse par blocs qui apprend la sélection des blocs de bout en bout sous la perte de modélisation du langage.
DiaLLM étudie l'écart de robustesse-génération dans l'adaptation aux dialectes anglais
L'étude DiaLLM comble le fossé entre la compréhension et la production de l'anglais dialectal en effectuant un pré-entraînement continu sur trois familles de modèles linguistiques à poids ouverts, basées sur le Corpus international de l'anglais. Elle applique des paradigmes d'entraînement postérieur implicites et explicites combinés à trois stratégies d'alignement pour comparer l'anglais australien, indien et britannique du Nord.
DiaLLM enquête sur l'écart robustesse-génération dans l'adaptation aux dialectes anglais
L'étude DiaLLM révèle que la robustesse dialectale et la génération sont dissociées dans les grands modèles de langage, car les benchmarks façonnés par le pré-entraînement continu ne capturent pas comment l'alignement reshape la sortie réelle. Les auteurs ont effectué un pré-entraînement continu sur trois familles de modèles à poids ouverts avec le International Corpus of English et ont appliqué des paradigmes de post-entraînement implicites et explicites combinés à trois stratégies d'alignement pour l'anglais australien, indien et britannique du Nord.\n\n- L'adaptation explicite ciblée sur la variété produit une sortie reconnue de manière fiable comme dialectale et préférée par rapport à un alignement large.
Qllm libère un modèle d'inférence O(1) sans cache KV
Un chercheur a publié Qllm, une nouvelle architecture de grand modèle linguistique qui atteint un temps d'inférence O(1) en éliminant le besoin d'un cache clé-valeur (KV). Le modèle de 100M paramètres est construit sur l'associativité de phase et ne repose pas sur des structures de transformateur ou de mamba.