MCP Python SDK v1.30.0 限制 HTTP 重定向,增加空闲会话过期和颁发者验证
Model Context Protocol (MCP) Python SDK 发布了 1.30.0 版本,这是 1.x 系列的一个维护更新,引入了更严格的安全默认设置和新配置选项。
Model Context Protocol (MCP) Python SDK 发布了 1.30.0 版本,这是 1.x 系列的一个维护更新,引入了更严格的安全默认设置和新配置选项。
英伟达已正式宣布有意以129亿美元的价格收购机器学习平台Hugging Face。
llama.cpp 项目发布了版本 b11309,其中包含针对 Hexagon 后端的关键优化。此更新为 ALLREDUCE 操作添加了对安全 scatter 模式的支持,旨在提高 Qualcomm Snapdragon 设备上的性能和稳定性。
开放TTS排行榜已发布,旨在通过使用客观指标而非仅依赖缓慢的竞技场式人类偏好评分,解决语音合成(TTS)评估中的碎片化和缺乏标准化问题。它使用Qwen3 ASR和WavLM嵌入来评估模型的可懂度、速度和说话人相似度。
llama.cpp 项目已添加对 GLM-5.3-Flash (GLM5-Next) 模型架构的初步支持,包括迁移到混合索引内存以及早期的多令牌预测 (MTP) 功能。
llama.cpp 项目发布了构建版本 b11266,其中包含一项 Vulkan 优化:当数据满足 2 字节对齐时,每次加载两个元素的 F32 A 矩阵。此更改解决了 Intel 硬件上逐个加载浮点数效率低下的性能问题,并修正了原始补丁中缺失的 `a_offset` 对齐验证。
llama.cpp b11265 版本包含对 Vulkan 后端处理混合专家(MoE)模型的修复。该更新修正了 `mat_mul_id` 选择矩阵乘法图块的方式,解决了在分发期间工作线程空闲的性能问题。
H公司已发布Holo4,这是一套通用型计算机使用视觉语言模型系列,旨在跨桌面、网页、Android及API环境执行点击、输入、编写代码和调用工具等操作。此次发布包含两种模型尺寸:Holo4 27B(稠密模型)和Holo4 35B-A3B(混合专家模型,含30亿活跃参数),均支持256K上下文窗口。
IQuest发布了IQuest-Q1,这是一个专为智能体编程、推理和多步工具使用设计的混合专家(MoE)模型。 该模型包含约3200亿总参数,每个token激活约150亿参数。 它已在Hugging Face上提供。
llama.cpp 项目发布了构建版本 b11238,通过新增的 `ggml_pad_ext` 函数引入了统一的左侧填充实现。此更改整合了 Parakeet、LFM2-Audio、Granite Speech 和 Gemma 4 等音频编码器之前使用的方法,确保 Gemma 4 的嵌入向量位级一致,同时简化了后端支持。
llama.cpp 项目发布了构建版本 b11232,其中包括对 ggml-cpu 后端的更新。此次发布重点在于为 x86 架构上的非向量倍数头维度启用分块 flash attention。
llama.cpp b11228 版本在 Metal 后端的 GGML_OP_PAD 操作中引入了对左侧和循环填充的支持,使其与 CPU、CUDA 和 Vulkan 实现保持一致。此更改修复了置换源上的右侧填充问题,并确保在不同硬件后端之间行为一致。
llama.cpp b11224 版本解决了 Vulkan 后端中矩阵乘法操作读取较大、带步长的张量(如 KV 缓存)切片时计算结果不正确的问题。
9 月 27 日,Claude Opus 5 和 3B 模型 Tetsu 在其公共存储库中识别出六项独立的持续集成检查,这些检查尽管未能验证其本应测量的内容,却报告为绿色或显示通过。这些问题包括:由于摘要过时导致部署门拒绝有效重启,以及具有空洞阈值的时间基准测试接受了微不足道的性能差异。
llama.cpp 服务器现在允许对 Qwen3 和 Qwen3-VL 等因果 LLM 重排序器使用 RANK pooling batch splitting,解决了之前破坏长文档和多模态重排序的限制。
llama.cpp b11216 版本在 SYCL 后端中引入了支持大于 512 的块宽度的快速沃尔什-哈达玛变换 (FWHT) 内核。此前,更大的宽度会回退到具有 O(n^2) 复杂度的密集 GEMM;此更改使这些尺寸能够实现 O(n log n) 的性能。
llama.cpp 项目发布了版本 b11214,其中包含对 HIP 后端的重大更新。此版本在 dkq > 256 时在 CDNA 架构上启用了 fattn-mma 内核,专门针对大批量进行性能优化。
llama.cpp 项目发布了构建版本 b11207,引入了对 Hexagon 后端上 Q4_0 和 Q8_0 GET_ROWS 分块操作的支持。此更新还包括对宏、寄存器溢出和 DMA 管道的修复,以及内核选择逻辑的改进和重新启用的向量化。
llama.cpp 项目发布了版本 b11195,在 CPU 后端引入了针对 k-quants 的分块矩阵乘法实现。该更改将量化数据解包为 256x256 int8 分块,并使用微内核计算结果,以改善大型矩阵运算的性能。
llama.cpp 项目发布了构建版本 b11184,为 Metal 后端引入了支持大于 512 块宽度的新快速沃尔什-哈达玛变换 (FWHT) 内核。此前,Metal FWHT 实现仅限于 64 到 512 之间的宽度。