Источник · Together AI Blog
media Together AI Blog · 25 д назад · 50 просмотров

Дистилляция GLM-5.3 Flash жертвует надёжностью ради снижения стоимости в 17 раз

Сравнение GLM-5.3 и её дистиллированной версии GLM-5.3 Flash на бенчмарке DeepSWE показывает, что дистилляция сохраняет базовые способности к программированию, значительно снижая стоимость генерации ответов. Полная модель достигает показателя pass@1 на уровне 69,0% при стоимости $3,99 за задачу, тогда как версия Flash набирает 63,4% всего за $0,24, что представляет собой снижение цены в 17 раз.

media Together AI Blog · 1 д назад · 11 просмотров

Together AI представляет канареечные развертывания для обновления моделей в продакшене без простоев

Together AI представила функцию канареечных развертываний (Canary rollouts), которая поэтапно переносит живой трафик с текущей модели на новый чекпоинт. Эта система автоматизирует механизм безопасности при замене моделей, выполняя проверки работоспособности и опциональные контрольные точки по метрикам перед переключением трафика, что позволяет автоматически приостанавливать процесс или откатывать изменения при ухудшении производительности.

media Together AI Blog · 7 д назад · 16 просмотров

Together представила стратегию перехода от закрытых к открытым моделям

Together предлагает предприятиям фреймворк для миграции с закрытых ИИ-моделей на открытые модели (OSM) с использованием управляемых сервисов, стремясь снизить сложность и ускорить внедрение. Процесс включает обнаружение подходящих моделей через бенчмарки, их оценку посредством воспроизведения трафика, адаптацию промптов или весов и расчёт ROI для обоснования перехода.

media Together AI Blog · 12 д назад Terminal-Bench 2 · 88.2% · 30 просмотров

Together AI расширяет возможности тонкой настройки с помощью экспертного LoRA, метрик в реальном времени и снижения цен

Together AI расширила свой сервис тонкой настройки для поддержки более широкого спектра моделей с открытым весом, включая GLM-5.3 и Kimi K2.7, а также представила отслеживание экспериментов в реальном времени и более точный контроль над процессом обучения.

media Together AI Blog · 13 д назад · 59 просмотров

Together AI оптимизирует GEMM ThunderKittens для NVIDIA Vera Rubin NVL72

Команда разработчиков ядер Together AI оптимизировала библиотеку ThunderKittens для использования новых функций платформы NVIDIA Vera Rubin NVL72, с особым акцентом на повышение производительности матричных умножений в форматах NVFP4 и FP8.

media Together AI Blog · 13 д назад · 17 просмотров

В кластерах GPU Together добавлены прерываемые узлы со скидкой 50%

Together AI анонсировала публичную предварительную версию прерываемых вычислений для Together GPU Clusters на Kubernetes, предлагая более дешёвый вариант для нагрузок, устойчивых к прерываниям. Прерываемые узлы используют неиспользуемые мощности NVIDIA accelerated и тарифицируются по фиксированной ставке 50% от цены on-demand.

media Together AI Blog · 14 д назад · 22 просмотра

Руководство по открытому стеку ИИ для агентной разработки ПО

В этой статье описывается MIGHT Stack (Model, Inference, Gateways, Harness, Tools) — модульная архитектура, позволяющая разработчикам использовать открытые модели для создания агентного программного обеспечения без необходимости глубоких знаний в области машинного обучения или выделенного оборудования.