주제 · Local inference
media MarkTechPost · 9시간 전

Perplexity, 온디바이스 PII 가이팅과 함께 맥에서 하이브리드 컴퓨팅 출시

Perplexity는 클라우드 프론티어 모델과 로컬 모델 간에 에이전틱 작업을 분할하고, 민감한 데이터를 처리하기 위해 온디바이스 프라이버시 게이트를 사용하는 맥용 하이브리드 컴퓨팅 기능을 출시했습니다. 이를 통해 사용자는 강력한 클라우드 추론을 활용하면서도 거래 문서나 고객 기록과 같은 개인 파일을 하드웨어에 엄격히 보관할 수 있습니다.

lab Hugging Face Blog · 1일 전 · 조회수 4회

Hugging Face가 207개의 WebGPU 커널과 브라우저 벤치마킹 도구를 출시

Hugging Face는 Hugging Face Hub에서 최적화된 WebGPU 커널을 로드하고 실행하기 위한 라이브러리인 @huggingface/kernels와 함께 초기 207개 커널 컬렉션을 출시했습니다. 이번 출시에는 사용자의 기기에서 성능과 정확성에 대한 증거를 크라우드소싱하는 브라우저 내 GPU 벤치마킹 스위트인 Fleet도 포함되어 있습니다.

github llama.cpp · 2일 전 · 조회수 9회

llama.cpp b10718이 specdec 및 멀티 토큰에 MOE 융합을 확장

llama.cpp 프로젝트는 CUDA 백엔드에 중요한 업데이트를 포함하는 버전 b10718을 출시했습니다. 가장 주목할 만한 변경은 Mixture of Experts (MOE) 융합을 스펜크티브 디코딩(specdec) 지원을 위해 확장하여, 이전 MOE glu 융합과 topk-router 융합이 한 번에 하나의 토큰만 처리하도록 제한되었던 문제를 해결한 것입니다.