IHUBERT — это монолингвальный персийский предобученный язык-модель, обученная на отобранных 45 ГБ из коллекции Sepahr-Danesh. Модель использует векторную семантическую дедупликацию и пайплайн предобучения с балансировкой доменов для улучшения качества корпуса и снижения дублирования, достигая лучших результатов в извлечении ответов на вопросы и хороших результатов в распознавании сущностей и классификации тем, хотя распознавание связей остаётся сложной задачей.
IHUBERT: Монолингвальный персийский предобученный модель с семантической дедупликацией
CAT-Translate: Компактные модели японского-английского перевода превосходят многозначные в реальных задачах
CAT-Translate представляет семейство компактных, открытых моделей, специализирующихся на переводе японского на английский. Используя синтетические параллельные корпуса и двухэтапную методику настройки, модели достигают превосходных результатов на реальных тестах в областях бизнеса, права, медицины, финансов и патентов, превосходя большие многозначные модели в практическом применении.
NVIDIA представляет Spatial-IQ: иерархическую диагностическую систему для пространственного мышления мультимодальных моделей
Исследователи NVIDIA представили Spatial-IQ — диагностическую систему, предназначенную для деконструкции пространственного интеллекта мультимодальных больших языковых моделей (MLLMs). В отличие от существующих бенчмарков, которые рассматривают модели как чёрные ящики, этот подход разбивает подсчёт объектов в стопках 3D-структур на девять перцептивных и когнитивных подзадач, согласованных с этапами человеческого развития.
Тесты плагинов для агентов программирования показывают: экономия токенов не равна снижению затрат
Анализ задач кодинговых агентов с использованием GPT-5.6-sol и Codex CLI 0.144.1 демонстрирует, что сокращение контекстных токенов на 90% не приводит к пропорциональной экономии затрат на выполнение всей задачи.
Набор данных CSB показывает, что MLLM устраняют разрыв в точности описания сложных социальных сцен
В данном исследовании представлен набор данных Complex Social Behavior (CSB), содержащий 100 изображений сложных социальных взаимодействий, для оценки моделей «зрение-язык» за десятилетие (2017–2025 гг.). Исследование анализирует пять типов визуальных когнитивных ошибок в четырех до-мультимодальных больших языковых моделях (MLLM) и пяти MLLM.
MedRealMM: Реальный многомодальный бенчмарк для китайских онлайн медицинских консультаций
Исследователи представляют MedRealMM, крупномасштабный бенчмарк для многомодальных онлайн медицинских консультаций, созданный на основе обезличенных взаимодействий пациентов и врачей, собранных в национальной китайской интернет-больнице. Набор данных использует фреймворк извлечения Multimodal Clinical Challenge Point для преобразования реальных траекторий консультаций в стандартизированные задачи генерации следующего ответа, сопровождаемые уточнёнными врачами рубриками.