CUDA 구현이 업데이트되어 FlashAttention에 대해 전체 타일 스케줄링 전략을 우선시하도록 변경되었습니다. 이 변경은 프레임워크 내 어텐션 메커니즘의 실행 흐름을 최적화하는 것을 목표로 합니다.
CUDA는 FlashAttention의 전체 타일 스케줄링을 선호합니다
Eqx-zoo는 Hugging Face 모델의 검증된 Equinox 포트를 제공합니다
저자는 eqx-zoo를 구축했습니다. 이 라이브러리는 Hugging Face Hub 체크포인트를 평범한 Equinox 모듈로 직접 로드하고 각 모델을 transformers 라이브러리 대비 검증합니다. 현재 프로젝트는 생성을 위해 Llama, Qwen2, Qwen3, Qwen3-MoE를 지원하며, 임베딩을 위해 BERT, RoBERTa, XLM-RoBERTa를 지원합니다.
llama.cpp b11401 릴리스는 로깅을 수정하고 Windows에서 ANSI 색상 활성화
llama.cpp b11401 릴리스는 서버 라우터 모드에서 로깅 문제를 해결하고 Windows 콘솔에서 ANSI 색상 지원을 추가합니다. 이 업데이트는 자식 프로세스 로그가 상태 명령과 올바르게 분리되고 Windows 터미널에서 색상 출력이 제대로 렌더링되도록 보장합니다.
Aleph Alpha가 34억 6천만 개의 활성 파라미터를 가진 781억 개의 영어-독일어 MoE 모델인 Kolibri 출시
Aleph Alpha는 다국어 영어 및 독일어 작업을 위해 설계된 오픈 가중치 Mixture-of-Experts 언어 모델인 Kolibri-1을 출시했습니다. 이 모델은 총 781억 개의 파라미터를 가지고 있지만 토큰당 34억 6천만 개만 활성화되어 단일 B200, B300 또는 H200 GPU에서 실행할 수 있습니다.
llama.cpp b11390 CUDA MMQ 메모리 오류 수정
llama.cpp 프로젝트는 전문가 수가 마이크로 배치 크기보다 훨씬 클 때 발생하는 CUDA MMQ 메모리 오류를 수정한 버전 b11390을 출시했습니다.
llama.cpp b11382가 WebGPU fill/set_rows에 f16 지원 추가
llama.cpp 프로젝트는 WebGPU 백엔드에 대한 주요 업데이트를 포함하는 빌드 b11382를 출시했습니다. 이 릴리스는 WebGPU 구현 내에서 `fill` 및 `set_rows` 작업에 대해 16비트 부동 소수점(f16) 지원을 추가합니다.