MLX 라이브러리가 버전 0.32.1을 출시하여 Metal 풀 어텐션 구현 내에서 헤드 차원 72에 대한 지원을 도입했습니다.
- 이 업데이트는 풀 리퀘스트 #4330을 통해 Metal 풀 어텐션에서 헤드 차원 72의 사용을 가능하게 합니다.
MLX 라이브러리가 버전 0.32.1을 출시하여 Metal 풀 어텐션 구현 내에서 헤드 차원 72에 대한 지원을 도입했습니다.
Apple은 제3세대 파운데이션 모델(AFAM3)을 위한 새로운 아키텍처를 도입하여 "명령 따르기 가지치기"를 활용하여 활성 매개변수 수를 크게 줄였습니다. 이 모델은 토큰마다가 아닌 프롬프트당 한 번 라우팅 결정을 내림으로써 MLP 레이어의 약 20%를 활성화하도록 설계되었습니다.
Apple은 현재 iPhone에 배포하기 위해 인공지능 모델을 압축하는 기술에 대해 스타트업 PrismML과 논의 중이다.
MLX 라이브러리가 버전 0.32.0을 출시하여 Metal 백엔드의 특정 버그를 해결했습니다.
연구자들은 Apple Silicon의 대규모 언어 모델을 위한 네이티브 Metal 추론 런타임인 BaseRT를 발표했으며, 이는 지금까지 보고된 것 중 가장 높은 추론 처리량을 달성했습니다. 칩별 커널 융합과 통합 메모리 인식 최적화를 활용하여 llama.cpp 및 MLX와 같은 기존 프레임워크에서 발견되는 오버헤드를 극복합니다.
제약 조건 인식 GPU 할당기가 7가지 시나리오에서 FIFO 스케줄러와 벤치마킹되었으며, 동일한 하드웨어에서 GPU 활용도를 최대 33%p 높이고 우선순위 가중 출력을 최대 105% 개선했습니다. 이 시스템은 실시간 추론 수요를 정적 예약이 아닌 변동 곡선으로 처리하여, 연속 GPU 블록과 비선점성 같은 엄격한 제약을 준수하면서 저조기 동안 배치 유사 작업을 통해 용량을 채웁니다.