Pustaka MLX merilis versi 0.32.1, memperkenalkan dukungan untuk dimensi kepala 72 dalam implementasi perhatian penuh Metal-nya.
- Pembaruan ini memungkinkan penggunaan dimensi kepala 72 dalam perhatian penuh Metal melalui pull request #4330.
Pustaka MLX merilis versi 0.32.1, memperkenalkan dukungan untuk dimensi kepala 72 dalam implementasi perhatian penuh Metal-nya.
Apple telah memperkenalkan arsitektur baru untuk model fondasi generasi ketiganya (AFM3) yang memanfaatkan "Pruning Mengikuti Instruksi" untuk secara signifikan mengurangi jumlah parameter aktif. Model ini dirancang untuk mengaktifkan sekitar 20% dari lapisan MLP-nya dengan membuat keputusan routing sekali per prompt, bukan per token.
Apple saat ini sedang berdiskusi dengan startup PrismML mengenai teknologi yang mengompresi model kecerdasan buatan untuk penyebaran di iPhone.
Pustaka MLX merilis versi 0.32.0, yang mengatasi bug spesifik di backend Metal.
Para peneliti menyajikan BaseRT, runtime inferensi Metal asli untuk model bahasa besar di Apple Silicon yang mencapai throughput inferensi tertinggi yang pernah dilaporkan hingga saat ini. Dengan memanfaatkan fusi kernel spesifik chip dan optimasi yang sadar memori terpadu, BaseRT mengatasi overhead yang ditemukan dalam framework yang ada seperti llama.cpp dan MLX.
Sebuah alokator GPU yang sadar kendala diuji bandingkan dengan penjadwal FIFO di tujuh skenario, mencapai peningkatan utilisasi GPU hingga 33 poin persentase dan output berbobot prioritas hingga 105% lebih tinggi pada perangkat keras yang identik. Sistem ini memperlakukan permintaan inferensi waktu nyata sebagai kurva berfluktuasi daripada reservasi statis, memungkinkan pekerjaan seperti batch mengisi kapasitas selama titik terendah sambil menghormati kendala ketat seperti blok GPU yang kontigu dan non-preempsi.
Kami menggunakan cookie untuk mengukur lalu lintas dan meningkatkan situs. Anda dapat menerima atau menolak cookie analitik. Kebijakan privasi