MLX 库发布了 0.32.1 版本,在其 Metal 全注意力机制实现中引入了对头维度 72 的支持。
- 该更新通过拉取请求 #4330 启用了在 Metal 全注意力机制中使用头维度 72。
MLX 库发布了 0.32.1 版本,在其 Metal 全注意力机制实现中引入了对头维度 72 的支持。
苹果为其第三代基础模型(AFM3)引入了一种新架构,利用“指令跟随剪枝”大幅减少活跃参数数量。该模型设计为每次提示仅进行一次路由决策,从而激活其 MLP 层的大约 20%,而非每个 token 一次。
苹果目前正在与初创公司PrismML就压缩人工智能模型以便在iPhone上部署的技术进行讨论。
MLX 库发布了 0.32.0 版本,解决了 Metal 后端中的一个特定错误。
研究人员展示了 BaseRT,这是一个针对 Apple Silicon 上的大语言模型的原生 Metal 推理运行时,实现了迄今为止报告的最高推理吞吐量。通过利用芯片特定的内核融合和统一内存感知优化,它克服了 llama.cpp 和 MLX 等现有框架中的开销。
在七种场景下,对感知约束的GPU分配器与FIFO调度器进行了基准测试,在相同硬件上实现了高达33个百分点的GPU利用率提升,以及高达105%的优先级加权输出增长。该系统将实时推理需求视为波动曲线而非静态预留,允许类批处理作业在低谷期填充容量,同时遵守严格约束,如连续的GPU块和非抢占式调度。