Библиотека MLX выпустила версию 0.32.1, добавившую поддержку размерности головы 72 в реализации полного внимания Metal.
- Обновление позволяет использовать размерность головы 72 в полном внимании Metal через запрос на слияние #4330.
Библиотека MLX выпустила версию 0.32.1, добавившую поддержку размерности головы 72 в реализации полного внимания Metal.
Apple представила новую архитектуру для своих фундаментальных моделей третьего поколения (AFM3), которая использует «Pruning следования инструкциям» для значительного снижения количества активных параметров. Модель спроектирована так, чтобы активировать примерно 20% своих MLP слоёв, принимая решения маршрутизации один раз на промпт, а не на токен.
Apple в настоящее время ведёт переговоры со стартапом PrismML по поводу технологии сжатия моделей искусственного интеллекта для развёртывания на iPhone.
Библиотека MLX выпустила версию 0.32.0, которая устраняет конкретную ошибку в бэкенде Metal.
Исследователи представляют BaseRT, нативный runtime вывода для больших языковых моделей на базе Apple Silicon с использованием Metal, который демонстрирует самую высокую зафиксированную пропускную способность вывода на сегодняшний день. За счет использования специфичных для чипа слияний ядер и оптимизации с учетом единой памяти он преодолевает накладные расходы, присущие существующим фреймворкам, таким как llama.cpp и MLX.
Пользователи теперь могут конвертировать и запускать квантованные модели EXL3 на Mac с процессором Apple Silicon и объёмом памяти 64 ГБ и более. Проверки показывают, что модели, такие как MiniCPM5 и Qwen3.6-27B, достигают производительности, сравнимой с или немного ниже производительности при конвертации на картах RTX, при этом EXL3 обеспечивает более высокое качество квантования по сравнению с MLX.
Мы используем cookie для аналитики и улучшения сайта. Вы можете принять или отклонить аналитические cookie. Политика конфиденциальности