Janas-LLM 은 GPU 가 없는 일반 Linux 기계에서 RAM 보다 큰 Mixture-of-Experts 모델을 SSD 에서 전문가를 스트리밍하여 실행하도록 설계된 새로운 C-based, GPL-3.0 inference engine 입니다.
개발자는 다양한 하드웨어 구성 전반에 걸쳐 성능을 조정하기 위해 커뮤니티 테스트를 요청하고 있으며, 특히 AMD CPUs, AVX-VNNI 가 없는 Intel 프로세서, 16 GB 이하의 메모리가 있는 시스템 및 SATA SSDs 를 대상으로 합니다. 제공된 스크립트는 engine 빌드, Qwen 모델 다운로드, bit-identical 산술 결과 검증, 유휴 기계에서 속도 측정 및 GitHub issues 를 통한 발견 보고를 자동화합니다.
이 노력은 개발자의 단일 테스트 기계보다 더 넓은 범위의 하드웨어 전반에 걸쳐 스레드, GPU 사용량 및 전문가 로딩 전략에 대한 engine 의 self-tuning capabilities 를 개선하는 것을 목표로 합니다.