STAGE — это пайплайн, который генерирует обучающие данные текст-в-JSON с использованием языковых моделей для синтеза отчётов и схем JSON, проверенных посредством исходных таблиц. Оценки на STAGE-Eval показывают, что STAGE повышает точность Qwen3-4B с 31,37% до 74,27% и точность значений с 45,46% до 90,69%.
STAGE: Генерация данных с опорой на источник для преобразования текста в JSON
Экономика ИИ начинает отдавать предпочтение открытым моделям
Последние выпуски ИИ-моделей показывают, что высококвалифицированные, недорогие модели всё чаще доминируют среди открытых моделей, таких как DeepSeek, Qwen, GLM, Kimi и MiniMax. Для большинства реальных применений разрыв в производительности между передовыми закрытыми моделями и сильными открытыми моделями сокращается быстрее, чем разрыв в стоимости, что делает открытое модели конкурентоспособными как с точки зрения возможностей, так и с точки зрения цены.
Alibaba анонсировала Qwen 3.8 Max — модель с 2,4 трлн параметров и открытыми весами, которая выйдет на следующей неделе
Команда Qwen от Alibaba объявила о выпуске Qwen 3.8 Max, новой флагманской модели с 2,4 трлн параметров, ориентированной на программирование, долгосрочную автономную работу агентов и мультимодальное рассуждение. Компания подтвердила, что на следующей неделе будут выпущены версии с открытыми весами как для Qwen 3.8 Max, так и для более компактной модели Qwen 3.8-27B.
Выход Qwen3.8 с открытыми весами, CLI для Kimi Code, стек LLM от Netflix, программное обеспечение для чипов Alibaba
Alibaba объявила о выпуске модели Qwen3.8 с открытыми весами, содержащей 2,4 триллиона параметров, а также об открытии исходного кода стека программного обеспечения для своего ИИ-чипа Zhenwu, чтобы снизить зависимость от экосистемы CUDA от Nvidia.
Achilles1089 выпускает нецензурную гибридную модель Qwen Fable
Пользователь Achilles1089 загрузил на Hugging Face гибридную модель "fable и opus 4.8" без ограничений, утверждая, что цифры демонстрируют её эффективность.
AGC-Bench представляет единый бенчмарк и AGC-Judge для измерения искусственного общего творчества
Исследователи представляют AGC-Bench, единый бенчмарк для оценки искусственного общего творчества, созданный на основе 3101 отобранных статей и охватывающий 78 наборов данных в таких областях, как мозговой штурм и STEM. Чтобы устранить предвзятость автоматической оценки, команда дообучает Qwen3-30B на скорректированных по предвзятости оценках, чтобы создать AGC-Judge — модель с открытым весом, которая надежно оценивает новые бенчмарки творчества.