llama.cpp b11120, Vulkan 내부 심볼을 숨겨 상태 파괴 문제 해결
llama.cpp 프로젝트는 Vulkan 백엔드에서 내부 심볼을 숨김으로써 중대한 버그를 수정한 버전 b11120을 출시했습니다. 이 변경은 내부 심볼이 내보내질 때 발생하던 중복 dlopen 상태 파괴 문제를 방지합니다.
llama.cpp 프로젝트는 Vulkan 백엔드에서 내부 심볼을 숨김으로써 중대한 버그를 수정한 버전 b11120을 출시했습니다. 이 변경은 내부 심볼이 내보내질 때 발생하던 중복 dlopen 상태 파괴 문제를 방지합니다.
연구원들은 CliffCompaction을 소개했습니다. 이는 제한된 컨텍스트 하에서 장기적 코딩 에이전트의 비용을 최대 50%까지 줄이기 위해 설계된 자동 압축 기술입니다. 이 방법은 Terminal-Bench에서 성능을 유지하거나 향상시키며, 재문장화 대신 잘라내기를 통해 압축된 정보를 정확하게 유지함으로써 KernelBench에서 최첨단 결과를 달성합니다.
연구원들은 수백만 개의 토큰을 처리하는 에이전트를 위해 설계된 자동 압축 기법인 CliffCompaction을 소개했으며, 이는 제한된 컨텍스트 하에서 비용을 최대 50%까지 절감합니다. 이 방법은 Terminal-Bench에서 성능을 유지하거나 향상시키며, 재표현이 아닌 잘라내기를 통해 정보를 정확하게 유지함으로써 KernelBench에서 최첨단 결과를 달성했습니다.
llama.cpp 프로젝트는 새로운 hex-dma 기능을 포함하는 빌드 b11118을 출시했으며, 이는 Hexagon Vector eXtended (HVX) FA 마스크 처리에 더 적합한 직접 매핑 DMA 캐시를 소개합니다.
Parallel은 AI 에이저 인프라에 OpenAI의 GPT-6 Astra를 통합하여 이전 모델 대비 연구 시간과 코드 비용을 각각 50% 절감했습니다. 회사는 새로운 모델이 고품질 출력을 유지하면서 복잡한 지식 작업을 훨씬 빠르게 완료할 수 있게 한다고 보고합니다.
llama.cpp 프로젝트는 Xe-LPG Plus, Xe2 및 Xe3 아키텍처의 split k 경로에 대한 Vulkan 기반 flash attention 최적화 커널을 도입한 빌드 b11111을 출시했습니다.
llama.cpp 프로젝트는 타겟 그래프에서 레이어 입력 텐서를 노출하여 HunyuanOCR 모델과 함께 DFlash 추측 디코딩에 대한 지원을 추가했습니다. 이 변경 사항으로 드래프트 모델이 잔류 스트림을 읽을 수 있게 되어, 비추측 실행과 비교할 때 약 0.5의 드래프트 수용률과 바이트 단위로 동일한 OCR 출력을 유지하며 이미지 요청을 성공적으로 실행할 수 있습니다.
llama.cpp 프로젝트는 llama-server 구성 요소가 동시에 여러 네트워크 주소에 바인딩할 수 있는 새로운 기능을 도입한 버전 b11104를 출시했습니다.
llama.cpp 프로젝트는 MiMo-V2.6 모델 변환 지원을 도입한 빌드 b11102를 출시했습니다.
llama.cpp 프로젝트가 llama 라이브러리에 대한 반복된 find_package 호출을 허용하는 빌드 시스템 수정 사항을 포함한 버전 b11101을 출시했습니다.
Hugging Face의 Transformers 라이브러리는 이제 기본 ggml 커널을 활용하여 llama.cpp에 가까운 성능을 제공하며 GGUF 양자화된 모델을 로드할 수 있게 되었습니다. 이 통합을 통해 개발자는 지원되는 하드웨어에서 표준 PyTorch 기반 API 내에서 양자화된 체크포인트를 직접 실행할 수 있습니다.
llama.cpp 프로젝트는 Muse Glimmer 모델의 특정 파싱 문제를 해결하는 빌드 b11100을 출시했습니다. 주요 변경 사항은 이 모델에 대한 도구 호출 실행 중 처음 마주한 파서 오류를 수정하는 것입니다.
llama.cpp 프로젝트가 버전 b11097을 출시했으며, 이는 A8 Q4_0 non-MoE dp4a 형식에 대한 OpenCL 이진 커널을 도입합니다.
Jen Wei는 다가오는 PyTorch Conference 발표를 위해 OLMo-core 내에서 AdamW, Muon 및 최신 Dion3 구현을 테스트하는 동안 학습률 데스 스피럴에 직면했습니다.
한 사용자가 ilsp/Llama-Krikri-8B-Instruct 체크포인트를 사용하여 로컬 배포용 무검열 그리스어 네이티브 대규모 언어 모델을 구축할 계획입니다. 제안된 계획은 Heretic(heretic-llm)을 사용하여 모델을 제거하고, GGUF Q4_K_M 형식으로 변환한 후 AMD Ryzen AI MAX+ 395 프로세서와 Vulkan을 탑재한 GMKtec EVO-X3에서 추론을 실행하는 것입니다.
Together AI는 현재 모델의 라이브 트래픽을 게이트된 단계로 새 체크포인트로 마이그레이션하는 기능인 Canary 롤아웃을 도입했습니다. 이 시스템은 트래픽 이동 전에 헬스 체크와 선택적 메트릭 게이트를 실행하여 모델 교체에 대한 안전 장치를 자동화하며, 성능이 저하될 경우 자동으로 일시 중지하고 되돌릴 수 있습니다.
연구자들은 에이전트 워크플로우의 다단계 과정을 최적화하기 위해 AgentRouter를 제안했습니다. 이는 매 작업마다 최상위 모델을 사용하는 대신 개별 궤적 단계를 적절한 모델 계층으로 라우팅하는 경량 분류기입니다. 이 시스템은 단일 에이전트 세션 내에서 하위 작업 복잡성이 다양함을 무시하는 기존 솔루션의 비효율성을 해결합니다.
llama.cpp b11095 릴리스는 HMX 최적화된 GATED_DELTA_NET (GDN) 구현을 도입하고 Hexagon 및 Flash Attention 커널에 대한 다양한 최적화를 제공합니다.
연구자들은 AgentRouter를 제안했는데, 이는 단일 최첨단 모델을 모든 작업에 사용하는 대신 개별 궤적 단계를 적절한 모델 계층으로 라우팅하여 다단계 에이전트 워크플로우를 최적화하는 경량 분류기입니다. 이 시스템은 더 작은 모델로도 충분히 처리할 수 있는 하위 작업에 추론 예산의 60-80%를 낭비하는 기업 시스템의 비효율성을 해결합니다.
llama.cpp 프로젝트가 버전 b11090을 출시했으며, 여기에는 sm_70 타일 컴파일 오류에 대한 수정이 포함되어 있습니다. 이 업데이트는 Volta 아키텍처와의 불일치를 해결하기 위해 5인자 load_ldmatrix 함수의 타일 모양을 일반화했습니다.