Local inference
github llama.cpp · 17시간 전 · 조회수 9회

llama.cpp가 HunyuanOCR에 대한 DFlash 지원을 추가하고 드래프트 변환을 수정함

llama.cpp 프로젝트는 타겟 그래프에서 레이어 입력 텐서를 노출하여 HunyuanOCR 모델과 함께 DFlash 추측 디코딩에 대한 지원을 추가했습니다. 이 변경 사항으로 드래프트 모델이 잔류 스트림을 읽을 수 있게 되어, 비추측 실행과 비교할 때 약 0.5의 드래프트 수용률과 바이트 단위로 동일한 OCR 출력을 유지하며 이미지 요청을 성공적으로 실행할 수 있습니다.

lab Hugging Face Blog · 1일 전 · 조회수 11회

oMLX 크리에이터 Jun Kim이 MLX 커뮤니티 지원을 위해 Hugging Face에 합류

oMLX의 크리에이터이자 유지 관리자입니다. Jun Kim은 MLX 커뮤니티를 지원하기 위해 Hugging Face에 합류했습니다. 이 움직임은 사이드 프로젝트에서 완전히 유지되고 자금 지원되는 이니셔티브로 전환함으로써 오픈소스 프로젝트에 안정성과 더 빠른 개발을 제공하려는 목표입니다.

media Hugging Face Forums · 1일 전 · 조회수 11회

로컬 그리스어 사용을 위해 Llama-Krikri-8B-Instruct를 제거하는 워크플로우를 찾는 사용자

한 사용자가 ilsp/Llama-Krikri-8B-Instruct 체크포인트를 사용하여 로컬 배포용 무검열 그리스어 네이티브 대규모 언어 모델을 구축할 계획입니다. 제안된 계획은 Heretic(heretic-llm)을 사용하여 모델을 제거하고, GGUF Q4_K_M 형식으로 변환한 후 AMD Ryzen AI MAX+ 395 프로세서와 Vulkan을 탑재한 GMKtec EVO-X3에서 추론을 실행하는 것입니다.

github llama.cpp · 2일 전 · 조회수 12회

구성 가능한 텐서 데이터 표준편차 및 개선된 테스트 도구를 갖춘 llama.cpp b11081 릴리스

llama.cpp 프로젝트는 `test-llama-archs` 테스트 인프라에 여러 업데이트를 포함하는 빌드 b11081을 출시했습니다. 주요 변경 사항에는 텐서 데이터 표준편차를 구성 가능하게 만들고, 사용 예시를 확장하며, 아키텍처 정규식 패턴에 대한 지원을 추가하는 것이 포함됩니다.