Arcee, разработчик моделей с открытым весом в США, заключил партнерство с Министерством энергетики для создания Genesis-Science-1. Это сотрудничество привело к созданию открытой модели, специально разработанной для научных исследований.
Arcee и Министерство энергетики заключили партнерство для создания Genesis-Science-1
Arcee AI и DOE объявляют о Genesis-Science-1: 1T-модели с открытыми весами для научных исследований
Министерство энергетики США (DOE) и Arcee AI объявили о разработке Genesis-Science-1 (GS1), языковой модели с открытыми весами, специально предназначенной для научных исследований. Эта инициатива является частью миссии Genesis, направленной на внедрение передовых возможностей ИИ в широкий спектр научных областей благодаря совместным усилиям государственного агентства и частной компании.
Tencent выпустила HiLS-Attention-7B с блочным разреженным вниманием
Tencent выпустила чекпоинт HiLS-Attention-7B, модель с 7 миллиардами параметров, построенную на основе архитектуры OLMo3-style. Модель реализует механизм блочного разреженного внимания, который обучает выбор блоков сквозным образом (end-to-end) через функцию потерь языкового моделирования.
DiaLLM исследует разрыв между устойчивостью и генерацией при адаптации к английским диалектам
Исследование DiaLLM устраняет разрыв между пониманием и генерацией диалектного английского языка путем непрерывного дообучения трех семейств языковых моделей с открытым весом на корпусе International Corpus of English. Применяются неявные и явные парадигмы постобучения в сочетании с тремя стратегиями выравнивания для сравнения австралийского, индийского и северного британского английского.
DiaLLM исследует разрыв между устойчивостью и генерацией при адаптации к английским диалектам
Исследование DiaLLM показывает, что диалектная устойчивость и генерация разделены в больших языковых моделях, поскольку бенчмарки, сформированные непрерывным дообучением, не отражают то, как выравнивание изменяет реальный вывод. Авторы проводят непрерывное дообучение трех семейств моделей с открытыми весами на корпусе International Corpus of English и применяют неявные и явные парадигмы постобучения в сочетании с тремя стратегиями выравнивания для австралийского, индийского и северного британского английского.
Qllm выпускает модель вывода O(1) без KV-кэша
Исследователь выпустил Qllm, новую архитектуру большой языковой модели, которая достигает времени вывода O(1), устраняя необходимость в ключ-значении (KV) кэше. Модель с 100M параметров построена на фазовой ассоциативности и не опирается на структуры трансформера или mamba.