MCP Python SDK v1.30.0 HTTP 리디렉션 제한, 유휴 세션 만료 및 발급자 검증 추가
Model Context Protocol (MCP) Python SDK가 버전 1.30.0을 출시했습니다. 이는 1.x 계열의 유지 관리 업데이트로, 더 엄격한 보안 기본값과 새로운 구성 옵션을 도입합니다.
Model Context Protocol (MCP) Python SDK가 버전 1.30.0을 출시했습니다. 이는 1.x 계열의 유지 관리 업데이트로, 더 엄격한 보안 기본값과 새로운 구성 옵션을 도입합니다.
엔비디아는 머신러닝 플랫폼인 허깅페이스를 129억 달러 규모의 거래로 인수할 의도를 공식적으로 발표했습니다.
오픈 TTS 리더보드는 느린 아레나 기반 인간 선호도 점수에 의존하는 대신 객관적 지표를 사용하여 텍스트 음성 변환(TTS) 평가의 단편화와 표준화 부재를 해결하기 위해 출시되었습니다. 이 리더보드는 Qwen3 ASR과 WavLM 임베딩을 사용하여 모델의 가청성, 속도 및 화자 유사성을 평가합니다.
llama.cpp 프로젝트는 하이브리드 인덱스 메모리로의 마이그레이션 및 초기 Multi-Token Prediction (MTP) 기능을 포함하여 GLM-5.3-Flash (GLM5-Next) 모델 아키텍처에 대한 초기 지원을 추가했습니다.
llama.cpp 프로젝트는 Vulkan 최적화를 포함하는 빌드 b11266를 출시했으며, 이는 2-정렬된 경우 F32 A 행렬을 한 번에 두 요소씩 로드합니다. 이 변경은 부동소수점을 하나씩 로드하는 것이 비효율적인 Intel 하드웨어의 성능 문제를 해결하고, 원래 패치에서 누락된 `a_offset` 정렬 검증도 수정합니다.
llama.cpp b11265 릴리스에는 Vulkan 백엔드의 Mixture of Experts (MoE) 모델 처리에 대한 수정이 포함되어 있습니다. 이 업데이트는 `mat_mul_id`가 행렬 곱셈 타일을 선택하는 방식을 수정하여 디스패치 중 작업자가 대기 상태가 되는 성능 문제를 해결합니다.
H社는 데스크톱, 웹, 안드로이드 및 API 환경에서 클릭, 입력, 코드 작성, 도구 호출을 수행하도록 설계된 범용 컴퓨터 사용 비전-언어 모델 패밀리인 Holo4를 출시했습니다. 이번 출시에는 256K 컨텍스트 창을 지원하는 두 가지 모델 크기가 포함됩니다: Holo4 27B(밀집형)와 Holo4 35B-A3B(3B 활성 파라미터를 가진 전문가 혼합 모델).
IQuest는 에이전트 코딩, 추론 및 다단계 도구 사용을 위해 설계된 Mixture-of-Experts (MoE) 모델인 IQuest-Q1을 출시했습니다. 이 모델은 총 약 3200억 개의 매개변수를 포함하며, 토큰당 약 150억 개의 매개변수가 활성화됩니다. Hugging Face에서 사용할 수 있습니다.
llama.cpp 프로젝트가 빌드 b11238를 출시하며, 새로운 `ggml_pad_ext` 함수를 통해 통합된 왼쪽 패딩 구현을 도입했습니다. 이 변경은 Parakeet, LFM2-Audio, Granite Speech, Gemma 4와 같은 오디오 인코더에서 사용되었던 이전 방법들을 통합하여 Gemma 4에 대해 비트 단위 일치 임베딩을 보장하고 백엔드 지원을 단순화합니다.
llama.cpp 프로젝트는 ggml-cpu 백엔드에 대한 업데이트를 포함한 빌드 b11232를 출시했습니다. 이번 릴리스는 x86 아키텍처에서 벡터 배수가 아닌 헤드 차원에 대해 타일드 플래시 어텐션을 활성화하는 데 중점을 둡니다.
llama.cpp b11228 릴리스는 Metal 백엔드의 GGML_OP_PAD 연산에서 왼쪽 및 원형 패딩 지원을 도입하여 CPU, CUDA 및 Vulkan 구현과 일치시켰습니다. 이 변경은 순열된 소스의 오른쪽 패딩 문제를 수정하고 다양한 하드웨어 백엔드 간에 일관된 동작을 보장합니다.
llama.cpp b11224 릴리스는 KV 캐시와 같은 더 크고 스트라이드 있는 텐서의 슬라이스를 읽을 때 Vulkan 백엔드에서 행렬 곱셈 연산이 잘못된 계산 결과를 생성하는 문제를 해결합니다.
9월 27일, Claude Opus 5와 3B 모델인 Tetsu는 공개 저장소에서 측정해야 할 내용을 검증하지 못했음에도 초록색 또는 통과로 보고된 여섯 개의 별도 지속적 통합(CI) 검사를 식별했습니다. 해당 문제들은 오래된 다이제스트로 인해 유효한 재시작을 거부하는 배포 게이트부터 사소한 성능 차이까지 허용하는 허술한 임계값을 가진 타이밍 벤치마크에 이르기까지 다양했습니다.
llama.cpp 서버는 이제 Qwen3 및 Qwen3-VL과 같은 인과적 LLM 리랭커에 대해 RANK pooling batch splitting을 허용하여, 기존에 긴 문서 및 멀티모달 리랭킹을 깨뜨리던 제한 사항을 해결했습니다.
llama.cpp b11216 릴리스는 512보다 큰 블록 폭을 지원하는 SYCL 백엔드에서 Fast Walsh-Hadamard Transform (FWHT) 커널을 도입했습니다. 이전에는 더 큰 폭이 O(n^2) 복잡도를 가진 밀집 GEMM으로 폴백되었습니다; 이 변경은 이러한 크기에 대해 O(n log n) 성능을 가능하게 합니다.
llama.cpp 프로젝트가 버전 b11214를 출시했으며, 여기에는 HIP 백엔드에 대한 주요 업데이트가 포함되어 있습니다. 이 릴리스는 dkq > 256일 때 CDNA 아키텍처에서 fattn-mma 커널을 활성화하여 큰 배치 크기에 대한 성능 향상을 목표로 합니다.
llama.cpp 프로젝트는 Hexagon 백엔드에서 타일화된 Q4_0 및 Q8_0 GET_ROWS 연산에 대한 지원을 도입한 빌드 b11207을 출시했습니다. 이 업데이트에는 매크로, 레지스터 스플릴 및 DMA 파이프라인에 대한 수정과 함께 커널 선택 로직 개선 및 벡터화 재활성화가 포함됩니다.
llama.cpp 프로젝트가 CPU 백엔드에서 k-quants를 위한 타일화된 행렬 곱셈 구현을 도입한 버전 b11195를 출시했습니다. 이 변경은 양자화된 데이터를 256x256 int8 타일로 풀어서 마이크로커널을 사용하여 결과를 계산함으로써 대규모 행렬 연산의 성능을 향상시킵니다.
llama.cpp 프로젝트가 빌드 b111184를 출시하여 Metal 백엔드를 위한 새로운 Fast Walsh-Hadamard Transform (FWHT) 커널을 도입했으며, 이는 512보다 큰 블록 너비를 지원합니다. 이전에는 Metal FWHT 구현이 64에서 512 사이의 너비로 제한되었습니다.
llama.cpp 프로젝트는 MUSA (MTT S5000) 연산자 실패 및 빌드 문제에 대한 수정 버전을 출시했으며, 이는 PH1 아키텍처를 대상으로 합니다. 이 업데이트는 이 하드웨어에서 잘못된 결과나 타임아웃을 유발하던 중대한 버그를 해결합니다.