Источник · Together AI Blog
media Together AI Blog · 2 д назад DeepSWE · 67.2% · 7 просмотров

DeepSeek-V4 Flash 0731 против GPT-5.6 Luna на DeepSWE: стоимость и программирование

Сравнение моделей DeepSeek-V4 Flash 0731 и GPT-5.6 Luna на бенчмарке DeepSWE показывает, что, хотя GPT-5.6 Luna является более сильным инженером, каскадная стратегия с использованием обеих моделей обеспечивает более высокую точность при меньшей стоимости.

media Together AI Blog · 7 д назад · 9 просмотров

Moonshot выпустила Kimi K3, самую большую модель с открытым весом на 2,8 триллиона параметров

Moonshot AI выпустила Kimi K3 — модель с открытым весом на 2,8 триллиона параметров, предназначенную для долгосрочного программирования и глубокого рассуждения. Это первая в мире модель с открытым исходным кодом класса в 3 триллиона параметров, поддерживающая контекстное окно на 1 миллион токенов.

media Together AI Blog · 10 д назад · 8 просмотров

Together AI заключила партнёрство с Moonshot AI для обслуживания моделей Kimi

Together AI объявила о стратегическом партнёрстве с Moonshot AI, чтобы стать платформой запуска для open-weight моделей Moonshot, начиная с Kimi K3. Это сотрудничество предоставляет разработчикам доступ к передовым релизам с первого дня через инфраструктуру и инструменты Together AI, размещённые в США.

media Together AI Blog · 13 д назад DeepSWE · 72.7% · 1 просмотр

Kimi K3 превосходит GPT-5.6 Sol на DeepSWE pass@4 и обходится на 64% дешевле

Сравнение Kimi K3 и GPT-5.6 Sol на бенчмарке DeepSWE показывает, что хотя GPT-5.6 Sol лидирует по качеству в режиме одного запроса (72,7% против 68,5%), Kimi K3 достигает более высоких показателей pass@k при k > 1 при значительно меньшей стоимости.

media Together AI Blog · 16 д назад · 5 просмотров

Kimi K3 соответствует Claude Fable 5 по качеству DeepSWE при стоимости в три раза ниже

Kimi K3, модель с открытыми весами от Moonshot AI, демонстрирует производительность, сопоставимую с Claude Fable 5 от Anthropic на бенчмарке DeepSWE, при этом стоимость за задачу значительно ниже. В оценке от 16 июля 2026 года Kimi K3 достигла результата pass@1 на уровне 68,5% по сравнению с 69,9% у Fable 5, но превзошла её в сценариях с несколькими попытками и обеспечила превосходную эффективность затрат.

media Together AI Blog · 24 д назад · 4 просмотра

Together AI запускает мультимодальную модель рассуждений Inkling от Thinking Machines Lab

Thinking Machines Lab выпустила Inkling, новую мультимодельную смесь экспертов (MoE), предназначенную для токено-эффективного рассуждения и нативного понимания текстовых, изображенийных и аудио входных данных. Together AI делает модель доступной на своей платформе инференса с нулевым днем доступа.

media Together AI Blog · 8 д назад

Together AI представляет автоскейлинг, нативный для инференса, для эндпоинтов LLM

Together AI добавила возможности автоскейлинга в свою плат Dedicated Model Inference, позволяя развертываниям масштабироваться на основе метрик, которые понимает движок инференса, таких как находящиеся в обработке запросы, время до первого токена (TTFT) и использование GPU.

media Together AI Blog · 10 д назад · 2 просмотра

ThunderAgent обеспечивает ускорение агентного вывода в 2 раза за счёт планирования на уровне программы

ThunderAgent — это система, которая вводит абстракцию программы для планирования запросов агентов LLM с целью устранения фрагментации KV-кэша при генерации синтетических данных с высокой степенью параллелизма. Рассматривая рабочие процессы агентов как планируемые программы, а не независимые запросы, она значительно повышает пропускную способность и снижает задержку.

media Together AI Blog · 11 д назад

Together AI объясняет маршрутизацию с учётом пропускной способности для выделенного вывода моделей

Together AI подробно описывает архитектуру своей платформы Dedicated Model Inference, которая связывает конечные точки, развертывания и неизменяемые конфигурации через распределение трафика с учётом пропускной способности. Эта система маршрутизирует запросы на основе эффективной пропускной способности (вес, умноженный на количество готовых реплик), а не фиксированных процентов, что позволяет реализовать функции безостановочного обновления и A/B-тестирования.

media Together AI Blog · 16 д назад

Together запускает выделенный вывод моделей с бета-версией пользовательского обучения

Together выпустила значительное обновление своей платформы вывода, представив «Выделенный вывод моделей», предназначенный для предоставления пользователям полного контроля над производительностью, стоимостью и качеством моделей с открытыми весами. Обновление также анонсирует закрытую бета-версию возможностей пользовательского обучения, включая обучение с подкреплением с полными весами и LoRA.

media Together AI Blog · 19 д назад · 2 просмотра

Together AI и Y Combinator запускают выделенный GPU-кластер для стартапов YC

Компании Together AI и Y Combinator объявили о партнёрстве, направленном на предоставление первого выделенного GPU-кластера исключительно для портфеля AI-native стартапов Y Combinator. Эта инициатива призвана решить критическую проблему доступа к вычислительным ресурсам за счёт предоставления гибкой и экономически эффективной инфраструктуры для обучения и вывода моделей без необходимости долгосрочных обязательств.

media Together AI Blog · 23 д назад

Together AI объясняет, что означают 99%, 99.9% и 99.99% времени безотказной работы для GPU-инференса

Together AI подробно описывает специфические архитектурные требования, необходимые для достижения различных уровней надежности при GPU-инференсе, утверждая, что стандартные показатели SLA часто скрывают реальные домены отказов.

media Together AI Blog · 24 д назад

В кластерах GPU Together добавлены пассивные проверки работоспособности, Slurm-on-K8s 2.0 и внешний OIDC

Together обновила свою платформу GPU Cluster новыми функциями надежности и операционного контроля, предназначенными для масштабных задач обучения и вывода моделей. Изменения включают переработанный стек Slurm-on-Kubernetes, механизмы автоматического восстановления узлов и улучшенные инструменты управления доступом.