Arcee, un desarrollador de modelos de peso abierto en EE. UU., se ha asociado con el Departamento de Energía para crear Genesis-Science-1. Esta colaboración da lugar a un modelo abierto diseñado específicamente para la investigación científica.
Arcee y el Departamento de Energía se asocian para construir Genesis-Science-1
Arcee AI y el DOE anuncian Genesis-Science-1, un modelo de 1T con pesos abiertos para investigación científica
El Departamento de Energía (DOE) y Arcee AI han anunciado el desarrollo de Genesis-Science-1 (GS1), un modelo de lenguaje con pesos abiertos diseñado específicamente para la investigación científica. Esta iniciativa forma parte de la Misión Genesis, cuyo objetivo es llevar capacidades avanzadas de IA a una amplia gama de campos científicos mediante un esfuerzo conjunto entre la agencia gubernamental y la empresa privada.
Tencent lanza HiLS-Attention-7B con atención dispersa por fragmentos
Tencent ha lanzado el checkpoint HiLS-Attention-7B, un modelo de 7 mil millones de parámetros construido sobre una arquitectura OLMo3-style. El modelo implementa un mecanismo de atención dispersa por fragmentos que aprende la selección de fragmentos end-to-end bajo la pérdida de modelado del lenguaje.
DiaLLM investiga la brecha entre robustez y generación en la adaptación a dialectos del inglés
El estudio DiaLLM aborda la desconexión entre comprender y producir inglés dialectal mediante el preentrenamiento continuo de tres familias de modelos de lenguaje de peso abierto en el Corpus Internacional del Inglés. Aplica paradigmas de postentrenamiento implícitos y explícitos combinados con tres estrategias de alineación para comparar el inglés australiano, indio y británico septentrional.
DiaLLM investiga la brecha entre robustez y generación en la adaptación a dialectos del inglés
El estudio de DiaLLM revela que la robustez dialectal y la generación están disociadas en los modelos de lenguaje grandes, ya que las evaluaciones formadas por preentrenamiento continuo no capturan cómo el alineamiento moldea la salida real. Los autores realizan un preentrenamiento continuo de tres familias de modelos de peso abierto en el Corpus Internacional del Inglés y aplican paradigmas de postentrenamiento implícitos y explícitos combinados con tres estrategias de alineamiento para el inglés australiano, indio y británico del norte.
Qllm lanza un modelo de inferencia O(1) sin caché KV
Un investigador ha lanzado Qllm, una nueva arquitectura de modelo de lenguaje grande que logra un tiempo de inferencia O(1) eliminando la necesidad de una caché de clave-valor (KV). El modelo de 100M parámetros se basa en la asociatividad de fase y no depende de estructuras de transformador o mamba.