llama.cpp b10435이 jinja gather_string_parts의 이차 비용을 수정함
llama.cpp 프로젝트는 Jinja 템플릿 엔진 내의 성능 문제를 해결한 버전 b10435를 출시했습니다. 주요 변경 사항은 `gather_string_parts` 함수의 이차 시간 복잡도 버그를 수정하는 것입니다.
llama.cpp 프로젝트는 Jinja 템플릿 엔진 내의 성능 문제를 해결한 버전 b10435를 출시했습니다. 주요 변경 사항은 `gather_string_parts` 함수의 이차 시간 복잡도 버그를 수정하는 것입니다.
llama.cpp 프로젝트는 `reasoning_effort` 매개변수를 Jinja 템플릿으로 전달하는 지원을 추가한 빌드 b10434를 출시했습니다. 이 변경으로 OpenAI Chat Completions의 `reasoning_effort` 값이 저장되고 생성 동안 사용 가능해집니다.
llama.cpp 프로젝트는 ggml_ssm_scan 연산에서 재귀 상태(RS) 롤백 지원을 도입한 버전 b10431을 출시했습니다. 이 변경으로 CPU 및 CUDA 백엔드에서 Nemotron 모델의 RS 롤백이 가능해집니다.
llama.cpp 프로젝트는 llama_decode()가 실행되는 동안 /metrics 및 /slots 엔드포인트에 접근할 수 있도록 서버를 수정하는 버전 b10429을 출시했습니다.
llama.cpp 프로젝트가 버전 b10430을 출시하여 가상 통합 GPU(igpu) 장치에 대한 지원을 도입했습니다. 이 업데이트에는 코드베이스 내 개선된 주석도 포함되어 있습니다.
llama.cpp 프로젝트가 버전 b10427을 출시했으며, 여기에는 SYCL을 통한 Intel Arc GPU용 성능 최적화가 포함되어 있습니다. 이 업데이트는 q4_K 밀도 순방향 네트워크(FFN) 레이어 내에서 gate, up 및 GLU 연산의 융합을 구현합니다.
llama.cpp 프로젝트는 gated-delta-net 상태 쓰기백 복사를 융합하기 위한 SYCL 최적화의 포트를 포함하는 버전 b10425를 출시했습니다.
llama.cpp 프로젝트는 SYCL의 호스트-ToDevice 메모리 액세스를 개선하기 위해 호스트 고정 메모리에 대한 지원을 도입한 버전 b10418을 출시했습니다. 이 업데이트는 백엔드 구현 내의 스레드 안전성 문제를 해결합니다.
llama.cpp 프로젝트는 OpenVINO 백엔드에 상당한 업데이트를 병합했으며, 주로 Qwen3.5 모델 계열에 대한 지원을 활성화하고 여러 메모리 최적화 기법을 도입했습니다.
llama.cpp 프로젝트는 immutable 헤더로 인해 index.html 파일이 이전 빌드에 고정되어 있던 llama.app 웹사이트에서 캐싱 문제를 해결하는 빌드 b10416을 출시했습니다.
llama.cpp 프로젝트가 버전 b10413을 출시했으며, 이 버전은 초안 GGUF 모델 메타데이터에서 추론 사양 유형을 자동으로 감지하는 기능을 도입했습니다.
llama.cpp 프로젝트는 Metal 백엔드에 GGML_TYPE_TQ2_0 삼원 양자화 유형에 대한 지원을 도입하는 빌드 b10414를 출시했습니다. 이 업데이트에는 연속 텐서(cont) mul_mv 커널의 최적화도 포함되어 있습니다.
llama.cpp 프로젝트는 dflash 및 dspark 백엔드에 대한 백엔드 샘플링 지원을 도입한 버전 b10412를 출시했습니다. 이 업데이트는 또한 백엔드 샘플링 로직 내에서 0보다 큰 p_min 값을 허용하고 해당 보호 장치를 추가합니다.
llama.cpp 프로젝트는 SYCL 백엔드에 대한 코드 변경을 포함하는 버전 b10410을 출시했습니다. 이 업데이트는 GEMM non-oneDNN 경로에서 별도의 fp32 타입 승격을 제거하고 대신 자동 fp16 승격을 사용합니다.
llama.cpp 프로젝트는 Intel GPU용 DMMV Q3_K ESIMD 커널을 도입한 버전 b10408을 출시했습니다. 이 릴리스에는 새로운 Q4_K 및 Q6_K ESIMD 커널도 포함되어 있으며, ESIMD 제어를 컴파일 시점이 아닌 런타임에서 가능하도록 코드베이스를 리팩토링했습니다.
llama.cpp 프로젝트가 빌드 b10369를 출시하여 pocket-tts 텍스트 음성 변환 모델에 대한 지원을 도입했습니다. 이 업데이트에는 성능 최적화를 위해 GEMM과 col2im을 사용한 전치 컨볼루션의 새로운 구현이 포함되어 있습니다.
llama.cpp b10361 릴리스는 로딩 중 잘못된 파라미터 순서로 인해 LGAI-EXAONE 4.5 모델에서 슬라이딩 윈도우 어텐션(SWA)이 활성화되지 않는 치명적인 버그를 해결합니다.
llama.cpp 프로젝트는 주로 빌드 인프라를 대상으로 하는 버전 b10356을 출시했으며, ROCm 백엔드를 버전 7.2.1에서 7.14로 전환했습니다. 이 업데이트는 TheRock 빌드 시스템을 사용하는 첫 번째 프로덕션 릴리스인 ROCm 7.14와 일치하며, Linux와 Windows 모두에 대해 다중 아키텍처 휠을 사용하도록 CI 작업을 마이그레이션하는 것을 포함합니다.
llama.cpp 프로젝트는 버전 b10355를 출시하여 다중 출력 백엔드 샘플링 지원을 도입했습니다. 이 업데이트는 백엔드 샘플링과 토큰 추측을 결합하여 활성화하고, 시퀀스당 최대 출력 수를 선언하기 위한 숫자 컨텍스트 매개변수를 추가합니다.
llama.cpp 프로젝트는 CUDA 및 Metal 백엔드에서 ggml_roll 연산에 대한 중요한 버그를 해결하는 빌드 b10353을 출시했습니다. 이전에는 이러한 백엔드가 스트라이드 정보를 무시했기 때문에 치환된(연속되지 않은) 소스 텐서가 침묵한 잘못된 결과를 생성했습니다.