Тема · Inference efficiency
lab OpenAI News · 10 д назад · 14 просмотров

GPT-5.6 повышает эффективность ИИ для моделей, вывода и агентных рабочих процессов

GPT-5.6 повышает эффективность искусственного интеллекта по нескольким направлениям, включая архитектуру моделей, процессы вывода и агентные рабочие процессы.

lab OpenAI News · 23 д назад · 9 просмотров

OpenAI предлагает скоринговую систему «Полезный интеллект за доллар» для оценки ценности ИИ

OpenAI описывает концепцию «Полезный интеллект за доллар», помогающую компаниям измерять экономическую ценность своих инвестиций в ИИ, выходящую за рамки простых метрик стоимости на токен. В статье утверждается, что успех следует оценивать по выполненной работе, надежности и масштабируемости, а не только по темпам внедрения.

lab OpenAI News · 10 д назад · 13 просмотров

OpenAI снижает цены на GPT-5.6 Luna и Terra, вводит режим Fast для Sol

OpenAI снизила стоимость своих моделей GPT-5.6 Luna и Terra, одновременно представив новый «режим Fast» для GPT-5.6 Sol для повышения производительности на каждый доллар при корпоративных рабочих нагрузках.

lab NVIDIA Research · 12 д назад · 8 просмотров

Кластеризованная кодовая книга для сжатия изображений на основе 2D Гауссиан

Исследователи представляют Cluster-Guided Vector Quantization (CGVQ), метод, разработанный для улучшения показателей rate-distortion в сжатии изображений на основе гауссовых примитивов. Подход разделяет параметры Гаусса на однородные группы перед квантованием, устраняя неэффективность, вызванную хранением большого количества параметров с плавающей запятой для каждого примитива.

media Latent Space · 9 д назад · 2 просмотра

OpenAI снижает цены на GPT-5.6 до 80% благодаря самосовершенствованию

OpenAI объявила о значительном снижении цен на свои модели GPT-5.6, обусловленном системными улучшениями эффективности и техниками рекурсивного самосовершенствования. Компания сообщает, что стоимость интеллекта уровня GPT-5.4 упала примерно в 13 раз за четыре месяца, при этом цены на GPT-5.6 Luna были снижены на 80%, а Terra — на 20%.

blog Simon Willison · 9 д назад · 2 просмотра

OpenAI снижает цену на GPT-5.6 Luna на 80% с использованием Sol для оптимизации вывода

OpenAI значительно снизила цены на семейство моделей GPT-5.6, внедрив масштабное снижение цены на GPT-5.6 Luna на 80% и сокращение на 20% для GPT-5.6 Terra. Эти изменения обеспечиваются за счет GPT-5.6 Sol, который оптимизирует прямой проход модели и производственные ядра для повышения эффективности.

lab Tencent Hunyuan (HF) · 17 д назад · 2 просмотра

Tencent открыла исходные коды многоязычных моделей перевода Hy-MT2 и бенчмарка IFMTBench

Tencent выпустила семейство «быстро думающих» многоязычных моделей перевода Hy-MT2, включающее размеры 1.8B, 7B и 30B-A3B (MoE), а также бенчмарк IFMTBench для оценки способности следовать инструкциям.

media Hugging Face Forums · только что Live

vLLM Launcher предоставляет рабочий стол для локального вывода LLM в Windows

Новый проект vLLM Launcher выпущен как приложение для рабочего стола Windows, предназначенное для управления локальным выводом больших языковых моделей через WSL2. Этот инструмент позволяет пользователям управлять несколькими бэкендами движков, включая vLLM, SGLang и llama.cpp, из единого графического интерфейса.

github llama.cpp · 6 ч назад · 4 просмотра

llama.cpp b10331 исправляет get_info сервера для корректного отчёта об изолированном рабочем каталоге

Проект llama.cpp выпустил сборку b10331, которая включает исправление для эндпоинта `get_info` сервера. Ранее, когда явный текущий рабочий каталог не был указан, функция ошибочно возвращалась к рабочему каталогу процесса сервера, даже если был настроен tools runtime.

github llama.cpp · 13 ч назад

llama.cpp b10330 объединяет rms_norm, mul и rope на CUDA

Проект llama.cpp выпустил версию b10330, внедряющую оптимизацию CUDA, которая объединяет операции rms_norm, умножения и RoPE в одно ядро. Это изменение сопровождается проверкой диапазонов памяти для объединённых операций и новыми тестовыми случаями для весов широковещательной передачи.

github llama.cpp · 14 ч назад · 4 просмотра

llama.cpp b10328 добавляет начальную изоляцию инструментов сервера через Docker

Проект llama.cpp выпустил сборку b10328, которая вводит первоначальную поддержку изоляции инструментов внутри компонента сервера с использованием Docker. Это обновление включает документацию и адаптацию кода для разделения песочниц ввода-вывода инструментов и переименование соответствующих флагов конфигурации.

github llama.cpp · 1 д назад · 2 просмотра

llama.cpp b10327 исправляет количество потоков/блоков в ядре копирования с квантованием

Проект llama.cpp выпустил версию b10327, которая включает исправление количества потоков и блоков при запуске ядра копирования с квантованием на CUDA. Это обновление устраняет проблему, выявленную в pull request #26731.

github llama.cpp · 1 д назад

llama.cpp b10321 исправляет NORM/RMS_NORM для частичных длин строк simdgroup

Проект llama.cpp выпустил версию b10321, которая включает критическое исправление операций GGML_OP_NORM и GGML_OP_RMS_NORM в Metal. Обновление устраняет проблему, при которой размер threadgroups, оставляющий частичную SIMD-группу, приводил к некорректным вычислениям среднего значения и дисперсии из-за потери частичных сумм.

github llama.cpp · 2 д назад · 1 просмотр

llama.cpp b10313 добавляет LRU-планировщик в сервер

Проект llama.cpp выпустил версию b10313, которая внедряет планировщик LRU (Least Recently Used) для его серверного компонента. Это обновление включает обработку слияния запросов и исправления для случаев потоковой передачи.

github llama.cpp · 2 д назад

Выпуск llama.cpp b10312 с исправлением сервера для загруженных моделей

Проект llama.cpp выпустил версию b10312, которая включает конкретное обновление компонента сервера. Ключевое изменение устраняет проблему, при которой загруженные модели вытеснялись из маршрутизатора.